你的robots.txt可能在阻止Google和AI爬虫收录
昨天讲了sitemap,今天说另一个更容易被忽略的坑:robots.txt写错一行,整个网站可能对Google和AI爬虫关闭。我检查了十几家大湾区光通信工厂的英文站,至少三家robots.txt配置有问题。
robots.txt不是技术人员随便写两行就行的文件。一行 Disallow: / 可以让你的整个网站对搜索引擎隐身。更麻烦的是,很多工厂网站根本不知道自己被屏蔽了。
上个月我集中检查了一批深圳、东莞、佛山光通信工厂的英文站。sitemap问题很常见,但robots.txt的问题更隐蔽——因为它不会让网站打不开,只是爬虫进不来。
整站屏蔽:Disallow: /
最极端的一种。robots.txt里直接写了 User-agent: * 和 Disallow: /。这等于告诉所有爬虫:整个网站不要爬。可能是开发时调试用的,上线后忘了改回来。
屏蔽了产品目录:Disallow: /products/
更常见。网站把 /products/ 或 /product-category/ 整个目录屏蔽了,理由是”这些页面不需要收录”。但海外客户恰恰是通过产品词找到你的——你把产品页屏蔽了,Google拿什么排名?
没屏蔽AI爬虫,也没明确允许
这是最微妙的问题。很多robots.txt只针对Googlebot写了规则,没有明确允许GPTBot、ClaudeBot、PerplexityBot这些AI爬虫。它们可能默认被部分规则挡住,也可能因为网站结构不清晰而无法正确理解你的内容。
很多工厂老板觉得:我的网站能打开就行,robots.txt是技术细节。但问题是——海外客户不是直接输入你的网址找你的。他们在Google搜 “MPO patch cord manufacturer”,在ChatGPT问 “who makes high density fiber patch panels”。如果爬虫进不来,这些搜索结果里就不会有你。
| 配置错误 | 后果 | 影响范围 |
|---|---|---|
| Disallow: / | 整站不被收录 | 所有搜索引擎 |
| Disallow: /products/ | 产品页不收录 | 产品词搜索流量归零 |
| 屏蔽Googlebot-Image | 图片搜索无流量 | Google Images |
| 未明确允许AI爬虫 | AI搜索无法引用你的内容 | ChatGPT/Perplexity/Gemini |
更麻烦的是:robots.txt的问题不像SSL过期那样有明显报错。网站正常打开,客户能访问,但Google Search Console里的”已抓取页面数”可能是0。你不主动查,根本不知道。
不需要很复杂。一个B2B工厂英文站的robots.txt,核心原则是:允许爬虫访问产品页和内容页,屏蔽后台和敏感页面。
基础结构
允许所有爬虫访问前台,但屏蔽 /wp-admin/、/cart/、/checkout/ 等后台和功能性页面。同时声明sitemap位置。
明确允许AI爬虫
GPTBot、ClaudeBot、PerplexityBot这些AI爬虫,应该被明确允许。因为你希望ChatGPT和Perplexity在回答”谁是XX产品供应商”时提到你。
不要屏蔽产品页
/products/、/product/、/blog/、/solutions/ 这些页面是你的核心获客资产,必须允许爬虫访问。
三步,10分钟搞定:
直接访问 /robots.txt
在浏览器输入你的域名 + /robots.txt,比如 example.com/robots.txt。看有没有 Disallow: / 或者屏蔽了 /products/。
用Google Search Console测试
在GSC里用”robots.txt测试工具”,输入你最重要的产品页URL,看是否被阻止。如果显示”已阻止”,就是配置问题。
检查GSC收录状态
看”网页索引报告”。如果已提交的页面大量显示”已抓取-未编入索引”或”被robots.txt阻止”,说明你的robots.txt有问题。
你的robots.txt,Google和AI爬虫能进吗?
把你的英文网站发给我,我帮你检查三个地方:
① robots.txt有没有屏蔽关键页面 ② sitemap是否正确提交 ③ AI爬虫是否被允许访问你的产品内容
📱 微信/电话:13612956178
