如果 AI 爬虫进不来,前面所有内容工作都白做。很多站点在 robots.txt 里无意中挡掉了主流 AI 爬虫,或者因为技术原因让爬虫拿到空白页。这一项不花钱,但经常是效果差异最大的。
第一件事:检查 robots.txt
部分建站模板自带屏蔽规则,把非搜索引擎爬虫全部拒之门外。需要显式允许以下 UA:
- GPTBot / OAI-SearchBot——OpenAI 的训练与检索爬虫
- ClaudeBot / anthropic-ai——Anthropic
- PerplexityBot——Perplexity
- Bytespider——字节系产品(含豆包)
- Google-Extended——Gemini
- Applebot-Extended——Apple Intelligence
同时确认 sitemap 已声明且可访问。
第二件事:确认爬虫拿到的是完整页面
用 curl 或搜索引擎的抓取模拟工具拿到原始 HTML,检查关键文字是不是在源码里。如果内容靠 JS 渲染、靠接口异步加载,AI 爬虫很可能什么都拿不到。常见解法包括服务端渲染、预渲染或提供静态降级页。
第三件事:补齐 llms.txt
在站点根目录放一份 /llms.txt,用 Markdown 写清楚:这个组织是谁、提供什么、核心页面链接在哪。它正在成为 GEO 站的标配——相当于给大模型一份站点说明书。
第四件事:性能与可达性
- 爬虫的抓取预算有限,加载超过数秒的页面容易被放弃
- 关键页面不要放在需要登录、需要验证码的路径下
- 移动端与桌面端返回内容必须一致,否则会得到不同的实体认知
- HTTPS 证书、重定向链路过长都会影响抓取优先级
怎么验证做了有没有用
看服务器访问日志里 AI 爬虫 UA 的出现频率与抓取页面数。从零到有、从少到多,是最直接的验证。同时结合 GEO效果监测与月度报告服务 看收录结果的同步变化。
常见问题
Q:开放 AI 爬虫会不会泄露数据?
A:爬虫只能拿到公网可访问的页面内容。如果某些页面本身不应该公开,应该用登录权限而不是靠屏蔽爬虫来保护。注意 UA 屏蔽也挡不住伪装爬虫,它不是安全手段。
Q:我们不希望内容被用于模型训练,只想被搜索引用,能做到吗?
A:部分引擎提供了区分入口(如训练用与检索用爬虫分开),可以只开放检索类爬虫。需要按引擎逐个配置,具体做法可参考「AI 引擎观察」栏目。



