做外贸独立站的人,大多知道要写内容、做外链、优化关键词,但有一个基础环节经常被忽略:你的网站是否被 Google 正确抓取和收录。这个问题的答案,藏在两个不起眼的小文件里——robots.txt 和 sitemap.xml。网站改版时还会涉及 301 重定向和 404 处理,完整清单见外贸网站改版必做清单。抓取配置就绪后,内容更新频率和节奏可以参考外贸网站内容更新指南。
抓取配置之外,图片 alt 文本的 SEO 写法是站内优化的基础项。
robots.txt 是爬虫进入你网站时看到的第一个文件,告诉它”哪些页面可以抓,哪些不可以”;sitemap.xml 是一份完整的页面清单,相当于给爬虫一张地图。这两个文件配置错一处,轻则部分页面不被收录,重则整站从搜索结果里消失。在我们接触的外贸 SEO 服务案例中,相当一部分新客户网站都存在这两个文件的配置问题。

robots.txt:爬虫的”门卫”怎么当
robots.txt 的语法不复杂,但正因为简单,一个拼写错误就可能造成严重后果。2022 年,IETF 将这套规则正式标准化为 RFC 9309(Robots Exclusion Protocol),几个要点值得记住:
User-agent行声明规则适用于哪个爬虫,Allow和Disallow行声明路径的抓取权限;- 路径匹配是”最长匹配优先”,最具体的规则胜出;如果同一条路径既被 Allow 又被 Disallow,Allow 优先;
/robots.txt本身永远允许抓取;标准还规定文件至少应能被解析到 500 KiB,服务端 5xx 错误时爬虫必须默认”全站禁止抓取”。
一个典型的外贸 WordPress 站点,robots.txt 大致长这样:
User-agent: *
Allow: /
Disallow: /wp-admin/
Disallow: /wp-includes/
Disallow: /?s=
Sitemap: https://www.yourdomain.com/sitemap_index.xml
逐行解读:User-agent: * 表示适用于所有爬虫;Allow: / 默认放行全站;Disallow 行屏蔽了 WordPress 后台和站内搜索结果页——这些页面没有 SEO 价值,还容易造成重复内容。最后一行 Sitemap 声明不是协议必需项,但写在这里能帮爬虫更快发现你的 sitemap。
两个致命错误必须避免:一是写了 Disallow: /(注意末尾斜杠),等于告诉所有爬虫”全站不许抓”,网站会直接从搜索结果消失;二是屏蔽 CSS/JS 文件,Google 渲染页面时需要读取样式和脚本,屏蔽后它看到的可能是一个”裸”页面。Cloudflare 对 robots.txt 的科普文章也提醒:这个文件是给爬虫看的指引,不是安全机制,别指望靠它”保护”敏感页面。

sitemap.xml:页面清单怎么交
sitemap 的作用是主动告诉搜索引擎”我的网站有哪些重要页面”。协议标准由 sitemaps.org 维护,两个硬性上限必须知道:单个 sitemap 文件最多 50,000 个 URL,且压缩前不得超过 50MB(52,428,800 字节)。超出就要拆分为多个子 sitemap,再用 sitemap 索引文件汇总。
对 WordPress 外贸站来说,Rank Math 等 SEO 插件会自动生成 sitemap,但”自动”不等于”正确”,上线前要检查四点:
第一,重要页面都在里面。打开 yourdomain.com/sitemap_index.xml,确认产品页、服务页、博客文章都被包含;缺失的页面可能是被插件排除设置漏掉了。第二,没价值的页面别放进来。标签页、作者归档页、日期归档页、附件页通常没有独立价值,放进来只会稀释抓取预算,应在插件里排除。第三,提交到 Google Search Console。在”站点地图”栏目填入 sitemap 地址并提交,之后留意”错误”提示——”无法访问””格式错误”是两类最常见问题。
WordPress 外贸站实操:四步配完
如果你用的是 WordPress,按下面四步操作,十分钟内可以完成配置:
- 安装 Rank Math SEO 插件(免费版即可),在”站点地图”设置里开启 sitemap 功能,确认 Post 和 Page 两类内容被包含,勾掉不需要的归档类型;
- 在 Rank Math 的”常规设置”里编辑 robots.txt,按上面模板核对,确认没有误屏蔽整站的规则;
- 到 Google Search Console 验证站点并提交 sitemap_index.xml,同时建议在 Bing Webmaster Tools 里也提交一份;
- 提交后用 Search Console 的”网址检查”工具手动请求首页编入索引,并定期查看索引覆盖率报告。
配置完这两个文件,并不代表一劳永逸。Google 的抓取和收录还受内容质量、内链结构影响,相关细节可以看我们写过的为什么谷歌不收录我的外贸网站和谷歌搜索控制台入门:12 个必看数据,以及更底层的SEO 内链优化技巧。

常见问题
robots.txt 写错了会导致什么后果?
最常见的后果是整站或部分页面不被收录。如果写了 Disallow: /,Google 爬虫会认为你不想让它抓取任何页面,网站会在搜索结果中消失。修复后记得在 Search Console 请求重新抓取。
sitemap 提交后多久能被收录?
提交后 Google 通常几天内开始处理,但”处理”不等于”收录”,实际收录需要爬虫抓取页面内容后才会发生,新站通常以周为单位等待。用 Search Console 的索引覆盖率报告跟踪状态。
WordPress 需要手动创建 robots.txt 吗?
WordPress 会自动生成一个虚拟 robots.txt,但默认版本太简单。建议通过 Rank Math 等插件自定义规则,屏蔽 /wp-admin/、搜索结果页等无价值路径,并加上 Sitemap 声明。
一个网站可以有多个 sitemap 吗?
可以。sitemaps.org 协议支持 sitemap 索引文件,Rank Math 会自动生成 sitemap_index.xml,下面挂 post-sitemap.xml、page-sitemap.xml 等子文件。向 Search Console 提交索引文件地址即可。