チュートリアル

ChatGPT が自社サイトを見つけられない理由

2026年9月18日
ChatGPT が自社サイトを見つけられない理由
ひと言で言うと

AI クローラーの遮断、引用できないコンテンツ、構造化データの欠如など、ChatGPT が自社サイトを見つけられない 5 つの原因と、それぞれの自己チェック方法を解説します。

ChatGPT が自社について質問に答えられないとき、その原因がブランドの小ささにあることはほとんどありません。多くの場合、ウェブサイトが AI 検索エンジンに読み取られ引用される形で存在していないだけです。以下の 5 つの原因は基本から応用の順に並べており、それぞれに自己チェックを付けているので、どこが詰まっているのかを特定できます。

原因 1:AI クローラーがサイトに到達できない

ChatGPT の回答は 2 つの情報源から作られます。モデルの学習データと、回答するその時点で実行するウェブ検索です。どちらも同じ前提に依存しています。AI クローラーが自社サイトを取得できることです。

主要な AI クローラーはいずれも、公式に文書化された User-Agent 名を使います。GPTBot(OpenAI、モデル学習用)、OAI-SearchBot(OpenAI、ChatGPT 検索のインデックス用)、ClaudeBot(Anthropic)、PerplexityBot、CCBot(Common Crawl)です。robots.txt でこれらをブロックしていると、コンテンツは AI の視界に入りません。ChatGPT の検索結果に表示されるかを決めるのは OAI-SearchBot です。GPTBot をブロックしてもモデル学習の対象から外れるだけで、ChatGPT 検索から消えるのは OAI-SearchBot をブロックした場合です。

Google-Extended については別に触れておきます。これはページを取得するクローラーではありません。Google がコンテンツを AI 学習に利用してよいかを決める robots.txt の制御トークンであり、実際のクロールは引き続き Googlebot が行います。

ウェブサイトのテンプレートやセキュリティプラグインの多くは、見慣れないクローラーを既定でブロックしており、サイト運営者はそれに気づいていません。もう一つよくある問題は sitemap がないことで、クローラーがページの全体像をつかめなくなります。

自己チェック:ブラウザで yourdomain.com/robots.txt を開き、上記のクローラー名を検索して、対応する Disallow のルールがないかを確認します。また、User-agent: * のグループに Disallow: / のようなサイト全体に及ぶルールが含まれていないかも確認してください。名前が明記されていないクローラーには、この既定のグループが適用されるからです。続いて yourdomain.com/sitemap.xml を開き、ファイルが存在し主要なページが列挙されていることを確認します。

原因 2:コンテンツに引用できる記述がない

AI エンジンが質問に答えるとき、抜き出すのは完結した自己完結型の文です。引用できる記述とは、前後の文脈に頼らず、それ自体で事実を説明している文のことです。

「今すぐ最高のサービスを体験してください」のようなキャッチコピーには情報がなく、AI は引用するものがありません。一方、「Example Trading Co. はクラウド会計システムを提供する香港のソフトウェア企業です」という文は、引用され得る書き方です。

自己チェック:自社サイトのページを適当に開き、一文ずつ問いかけてみてください。この一文だけを抜き出したとき、読者は自社が何者で、何をしていて、どこで事業を行っているかを理解できるでしょうか。前後の文がなければ意味が通らない文ばかりであれば、AI にも意味を取ることはできません。

原因 3:ページに構造化データがない

構造化データとは、ページのソース内に通常 JSON-LD で記述する標準化されたマークアップで、機械がページの内容を正確に理解できるようにするものです。中小企業のサイトで最低限そろえたいのは、Organization(会社情報)、FAQPage(質問と回答のコンテンツ)、BreadcrumbList(ページの階層)です。

特に追加する価値があるのは FAQPage のマークアップです。質問と回答のコンテンツを機械が直接読める構造に変えるため、AI エンジンが抜き出して引用しやすくなります。

自己チェック:ページを右クリックしてページのソースを表示し、application/ld+json を検索します。該当がなければ、そのページには構造化データが一切ありません。

原因 4:ブランド情報が分散し、表記が揃っていない

AI エンジンは、企業の基本情報を確認するために複数の情報源を照合します。自社サイトには「Example Trading Company Limited」、SNS のページには「Example Trading Co.」と書かれ、企業ディレクトリには旧住所が残っていれば、AI はそれらが同じ会社を指していると確信できず、答えを控えてしまいます。

中国語名と英語名を併用する香港の企業は、特にこの影響を受けやすいです。2 つの名称がプラットフォームごとに別々に流通し、それらを一つの完全な文で結び付けているページがどこにもないからです。

自己チェック:自社サイト、SNS のページ、企業ディレクトリに掲載されている会社名、住所、電話番号を書き出し、並べて比較してください。会社概要のページには、中国語名、英語名、事業内容を一つの完全な平叙文でまとめて記載しておくべきです。

原因 5:サイトが新しく、外部の裏付けがない

AI エンジンは、他の情報源が裏付けている情報を優先して引用します。公開したばかりで、言及している外部サイトが一つもないサイトは、コンテンツがどれほどよく書けていても AI が信頼する根拠を持てません。さらにモデルの学習データには締め切り時点があるため、ごく新しいサイトはまだ含まれていない可能性もあります。

自己チェック:検索エンジンに site:yourdomain.com と入力し、何ページがインデックスされているかを確認します。次に ChatGPT の検索機能や Perplexity に自社のブランド名について質問し、どの情報源を引用するかを見ます。引用元が第三者のサイトばかりで自社サイトが一度も出てこないなら、問題はインデックスと裏付けにあります。

よくある質問

ChatGPT の回答はどこから来るのですか?

モデルの学習データと、回答するその時点で実行するウェブ検索から来ます。サイトがクロールもインデックスもされていなければ、どちらの情報源にも自社のコンテンツは含まれません。

GPTBot とは何ですか?

GPTBot は OpenAI のモデル学習用クローラーです。OpenAI は OAI-SearchBot(ChatGPT 検索用)と ChatGPT-User(ユーザーによるリアルタイム閲覧用)も運用しており、この 3 つは robots.txt で個別に制御します。そのため GPTBot をブロックしても、ChatGPT 検索から外れることはありません。

llms.txt とは何ですか?

llms.txt は、ウェブサイトのルートディレクトリに置くプレーンテキストファイルの提案仕様です。サイトの主要コンテンツを Markdown で要約して大規模言語モデルに読ませるもので、robots.txt を置き換えるのではなく補完します。

AEO とは何を意味しますか。税関の AEO 制度と関係がありますか?

ここでいう AEO は Answer Engine Optimization の略で、AI エンジンに引用されやすいコンテンツにするための取り組みを指します。GEO(Generative Engine Optimization)と呼ばれることもあります。税関の Authorized Economic Operator 制度や、あるアパレル小売企業の株式ティッカーと略称が同じだけで、関係はありません。そのため実務者の多くは、単に「AI 可視性」と言い換えています。

改善してから効果が出るまで、どのくらいかかりますか?

決まった時間の目安はありません。AI エンジンはそれぞれ独自のタイミングでデータを更新するため、実務上は、改善した後に一定の間隔で各ツールに同じ質問を投げて確認するのが現実的です。

AI の目で自社サイトを見てみる

上記 5 つのチェックはすべて手作業でも行えますが、robots のルール、構造化データ、コンテンツの書き方をページごとに確認していくと、それなりの時間がかかります。無料の AEO Auditor(ai.ud.hk/aeo-auditor)は、URL を入力するだけで AI 可視性のチェックを実行します。自社サイトが AI にどう見えているかを先に把握しておけば、どこから手を付けるかの判断がずっと楽になります。

関連記事

あなたのサイトは AI でどれだけ見えていますか?

30 秒の無料診断で、スコアと改善提案をすぐに確認できます。

無料で診断する