DIRECT ANSWER

让 ChatGPT 有机会发现网页,重点是 OAI-SearchBot。

根据 OpenAI 的公开说明,OAI-SearchBot 用于支持 ChatGPT 的搜索产品;GPTBot 用于控制内容是否可能被用于训练基础模型;ChatGPT-User 则用于用户发起的页面访问。搜索展示和训练授权是两个独立选择。

robots.txt 只控制抓取许可。

允许 OAI-SearchBot 不会保证收录或引用;禁止 GPTBot 也不等于退出 ChatGPT Search。

USER-AGENT MAP

三个名称,三个不同用途。

User-Agent公开用途MOKA 的处理
OAI-SearchBot让网页有机会出现在 ChatGPT 搜索产品中允许抓取
GPTBot控制内容是否可能用于训练基础模型当前允许;训练政策可独立调整
ChatGPT-User用户请求 ChatGPT 访问网页时的按需访问保持公开页面可访问

MOKA TEST

测试了什么?

在 2026 年 8 月 16 日,我们分别使用三个 User-Agent 请求生产官网的 /robots.txt、首页 //sitemap.xml。这是一项未登录、只读的 HTTP 响应检查。

User-Agentrobots.txt首页sitemap
OAI-SearchBot200200200
GPTBot200200200
ChatGPT-User200200200

结果说明网站没有针对这些 User-Agent 返回 403、429 或 5xx,也没有在 robots.txt 中禁止它们。这项测试不验证请求是否来自 OpenAI 官方 IP。

LIMITATIONS

这项测试不能证明什么?

  • 不能证明 OpenAI 已真实抓取任何页面。
  • 不能证明页面已进入 ChatGPT Search 的任何索引或检索系统。
  • 不能证明答案会引用、提及或推荐 MOKA。
  • 不能替代防火墙、WAF、安全组与真实访问日志的核验。
  • 不能把一次测试结果当作长期状态;网络与平台规则会变化。

ACTION CHECKLIST

企业网站应按什么顺序检查?

  1. 确认公开页面、robots.txt 和 sitemap 对 OAI-SearchBot 可访问。
  2. 把搜索展示与训练授权分开决策,不要混用 GPTBot 与 OAI-SearchBot。
  3. 确保主要内容以可抓取文本存在,并通过内部链接和 sitemap 被发现。
  4. 核对 CDN、WAF 和服务器规则没有误拦 OpenAI 公布的搜索爬虫 IP。
  5. 发布后查看服务器日志,并持续复测状态码;没有抓取日志不等于一定被封锁。

SOURCES + METHOD

来源与复核

内部证据保留了测试日期、三个 User-Agent、三个 URL 与状态码。若官方说明或生产配置变化,本页结论应重新复核。