教学
为什么 ChatGPT 搜索不到你的公司网站

ChatGPT 答不出你的公司?逐一诊断五个常见原因:AI 爬虫被拦、内容无法引用、缺结构化数据、品牌信息不一致、网站缺外部印证,每项附自查方法。
ChatGPT 答不出你的公司,多数不是因为品牌太小,而是网站没有用 AI 读得懂的方式存在。以下五个原因由浅入深,每个都附自查方法,逐项检查就能找出症结。
原因一:AI 爬虫根本进不了你的网站
ChatGPT 的回答来自两个来源:模型的训练数据,以及回答当下的实时网页搜索。无论哪一个,前提都是 AI 爬虫能够抓取你的网站。
主流 AI 爬虫都有公开发布的 User-Agent 名称:GPTBot(OpenAI,模型训练用)、OAI-SearchBot(OpenAI,ChatGPT 搜索索引用)、ClaudeBot(Anthropic)、PerplexityBot、CCBot(Common Crawl)。robots.txt 屏蔽了它们,你的内容就进不了 AI 的视野。其中 OAI-SearchBot 是决定你能否出现在 ChatGPT 搜索结果里的关键:屏蔽 GPTBot 只是退出模型训练,屏蔽 OAI-SearchBot 才会让你从 ChatGPT 搜索中消失。
另外要注意 Google-Extended。它不是实际抓取网页的爬虫,而是 robots.txt 里的控制项,决定 Google 能否把你的内容用于 AI 训练,实际抓取仍然由 Googlebot 执行。
不少网站模板和安全插件会默认屏蔽来源不明的爬虫,网站管理员自己并不知情。另一个常见问题是没有 sitemap,爬虫找不到完整的页面清单。
自查方法:在浏览器打开“你的域名/robots.txt”,搜索上述爬虫名称,看有没有对应的 Disallow 规则。同时检查 User-agent: * 下面有没有 Disallow: / 这类全站屏蔽规则,没有单独列名的爬虫会套用这组默认规则。再打开“你的域名/sitemap.xml”,确认文件存在,而且列出了主要页面。
原因二:内容不是可引用的陈述句
AI 引擎回答问题时,抽取的是完整、自足的句子。可引用的陈述句是指不需要上下文,单独一句就能说明事实的句子。
“立即体验非凡服务”这类标语没有信息量,AI 无法引用。“ABC 公司是一家在香港提供云端会计系统的软件公司”这种句子,才具备被引用的条件。
自查方法:随机打开你网站的一个页面,逐句问自己:如果只摘出这一句,读者能否知道你是谁、做什么、服务哪里。如果每句都要靠上下文才看得懂,AI 也一样看不懂。
原因三:缺少结构化数据
结构化数据是以 JSON-LD 等格式写在网页源代码里的标准化标记,让机器准确理解页面内容。对中小企业网站来说,最基本的组合是 Organization(公司信息)、FAQPage(问答内容)、BreadcrumbList(页面层级)。
FAQPage 标记特别值得做:它把问答内容变成机器可以直接读取的结构,AI 引擎更容易抽取和引用。
自查方法:在你的网页上点右键选“查看网页源代码”,搜索 application/ld+json。找不到任何结果,就说明整个页面没有结构化数据。
原因四:品牌信息分散又不一致
AI 引擎会交叉比对多个来源,确认一家公司的基本信息。官网写“ABC 有限公司”,社交主页写“ABC Ltd”,商业目录又留着旧地址,AI 难以确定这些是同一家公司,宁可不答。
中英文名称并用的香港公司特别容易出现这个问题:两个名称在不同平台各自流通,却没有任何一个页面用完整句子把它们联系起来。
自查方法:把官网、社交主页、商业目录上的公司名称、地址、电话逐项抄出来,并排对照。官网“关于我们”页面,应该用一句完整的陈述句同时写明中英文名称和业务范围。
原因五:网站太新,缺乏外部印证
AI 引擎倾向于引用有其他来源印证的信息。一个刚上线、没有任何外部网站提及的网站,即使内容写得再好,AI 也缺乏信任它的依据。模型的训练数据另有知识截止时间,太新的网站可能根本没被纳入。
自查方法:在搜索引擎输入“site:你的域名”,看收录了多少个页面。再用 ChatGPT 的搜索功能或 Perplexity 直接问你的品牌名称,观察它引用了哪些来源。如果引用的全是第三方网站而没有你的官网,问题就出在收录和外部印证上。
常见问题
ChatGPT 的回答来自哪里?
来自模型训练数据与回答当下的实时网页搜索。网站如果没有被抓取或收录,两个来源都不会包含你的内容。
GPTBot 是什么?
GPTBot 是 OpenAI 用于模型训练的爬虫。OpenAI 还有 OAI-SearchBot(ChatGPT 搜索用)和 ChatGPT-User(用户实时查询用),三者在 robots.txt 中各自独立控制,屏蔽 GPTBot 不会让你退出 ChatGPT 搜索。
llms.txt 是什么?
llms.txt 是放在网站根目录的纯文本文件建议规范,用 Markdown 整理网站重点内容供大语言模型读取,与 robots.txt 互补而不是取代。
AEO 跟海关的 AEO 认证有关吗?
无关。这里的 AEO 指答案引擎优化(Answer Engine Optimization),与海关的认可经济营运商计划只是同名,内容完全不同。
修正之后多久会见效?
没有固定时间表。各家 AI 引擎更新数据的频率不同,建议修正后定期用同一个问题向各个工具提问验证。
先看清楚,再动手改
以上五项都可以手动自查,但逐页核对 robots 规则、结构化数据和内容格式相当费时。你可以用免费工具 AEO Auditor(ai.ud.hk/aeo-auditor)输入网址做一次 AI 可见度检测,先看清楚自己的网站在 AI 眼中是什么样子,再决定从哪一项改起。

