構造化データは 引用の 必要条件では ありません。 この 調査の 競合引用分析で、 構造化データを 1つも 実装していない protea-inc.co.jpが 473引用を 得ています。 一方、 17種類の 型を 実装している queue-tech.jpは 374引用です。 「構造化データを 入れれば 引用される」と いう 説明を、 この 調査の 実測は 支持しません。 いちばん取り返しが つかないのは robots.txtです。 AIの クローラーを 止めている 状態は、 それ以降の 施策を すべて 無効に する。 しかも直すのに 要るのは 1行の 書き換えだけです。 効果と 手間が ここまで 釣り合わない 箇所は、 この 記事の 範囲では 他に 無い。 llms.txtが 効くかどうかを、 この 調査では 確かめられていません。 引用上位の 競合と して 実際に 取得した 比較記事12本の 各社を 調べた ところ、 llms.txtを 置いていたのは 4社で、 いずれも 引用数が 多かった。 ただし その 4社は 比較記事も 持っており、 どちらが 関わっているかを 分けられていません。 効くとも 効かないとも 書きません。 この 記事の 数字は、 この 調査と GMO NIKKOが 自分で 集めた データか、 仕様を 策定した団体と 検索エンジンの 公式ドキュメントから 取った ものだけです。
図1:クローラが 取得した ページを 解釈し、 引用元と して 選ぶまでの 基本ステップ。
拡大図1:クローラが取得したページを解釈し、引用元として選ぶまでの基本ステップ。
閉じる 出所:GMO AI検索ラボ 図2:意味を 明示する 記述は 「語彙・形式・型」の 三層で 成り 立つ。
拡大図2:意味を明示する記述は「語彙・形式・型」の三層で成り立つ。
閉じる 出所:GMO AI検索ラボ この 記事の 題にも 使っているが、 先に 断って おき、 Googleの 公式ドキュメントに 「テクニカルSEO」と いう 語は 無く、 これは 業界で 使われている 呼び方です。
図3:AI向けの 案内ファイルを 整備する 基本的な 流れ。
拡大図3:AI向けの案内ファイルを整備する基本的な流れ。
閉じる 出所:GMO AI検索ラボ Googleが 定めているのは 「技術的な 要件」で、 検索結果に 表示される ために ページが 満た すべき 最低限の 条件と して 3つ挙がっている (Google 検索セントラル 「Google 検索の 技術要件」、 2026年8月16日確認)。
番号 Googleが 書いている 要件 1 Googlebot が ブロックされていない こと 2 ページが 機能している こと。 Googleに HTTP 200 (success) ステータスコードが 返される 3 インデックス登録可能な コンテンツが ページに 含まれている こと
3つだけであり、 この 記事で 扱う 構造化データも llms.txtも、 ここには 入っていません。 要件を 満たすことと、 引用されやすく する ことは 別の 話だと いう 点を、 先に 押さえておいて ほしい。
では、 この 記事で 「テクニカルSEO」と 呼んでいるのは 何か。 機械が ページを 取得して、 中身を 読める 状態に する ことであり、 コンテンツSEOとの 線引きは 次のようになります。
テクニカルSEO コンテンツSEO 受け持つこと 機械が ページを 取得して 読める 状態に する 読み取られた 中身を、 答えと して 使える ものに する 直した ときに 変わる もの 機械から 見た 状態。 人が 見る 画面は 変わりません 人が 読む中身。 機械が 読み取る 内容も 変わります 効かなかった ときの 症状 検索結果には 出るが、 AIの 回答の 根拠に 使われない 取得は されているが、 答えと して 選ばれない この 記事での 扱い 3章から 7章で 扱う カテゴリー記事 「コンテンツSEOと E-E-A-T」へ渡す
横にスクロールできます
順番は、 技術が 先であり、 1.2で 書くとおり、 読めない ページは 中身の 良し悪しを 判定される 手前で 落ちる ためです。
ただし技術を 完璧に すれば 引用される、と いう 話では ありません。 4章で 示すとおり、 構造化データを 1つも 実装していない ページが 473引用を 得ている 実測が あり、 技術は 前提であって、 決め手では ありません。
AI検索は、 問いを 受け取ってから ウェブを 探し、 見つけた 文書を 根拠に して 答えの 文章を 組み立てる。 この 流れの 入り口に あるのは、 機械が ページを 取得して 中身を 読めるか どうかだと 考えられ、 読めなかった ページは、 内容の 良し悪しを 判定される 手前で 落ちます。
図4:発見・許可・重複整理の 三層で インデックス漏れを 防ぐ。
拡大図4:発見・許可・重複整理の三層でインデックス漏れを防ぐ。
閉じる 出所:GMO AI検索ラボ この 調査の プロンプト定点観測では、 2026年5月19日から 7月30日まで 100問を 毎日 6モデルへ 投げ、 総回答2万9,582件を 記録しています。 内訳は 5月が 試験運用の 7件、 6月が 1万2,435件、 7月が 1万7,140件であり、 この 観測で、 ChatGPT (検索 あり)は 回答の 98.8%に 出典を 付けていました。 Google AI Modeは 95.2%で、 1回答あたりの 出典数は 12.9件であり、 AI Modeは 1回の 回答で 13件近い ページを 根拠に 引いており、 この 枠に 入る 前段と して、 機械が 取得できる 状態に ある ことが 要ります。 テクニカルSEOが 後回しに されやすいのは、 直しても 画面の 見た 目が 変わらないからであり、 変わらないのは 人が 見る 画面だけで、 機械から 見た 状態は 変わっています。
ユーザーエージェント文字列とは、 ページを 取りに 来た プログラムが 「自分は 何者か」と 名乗る ために、 通信の たびに 送る 短い 文字列を 指します。 Googleの 公式ドキュメントに よれば、 Google-Extendedは robots.txt (=サイトの ルートに 置き、 どの URLへの アクセスを 許すかを クローラーに 伝える ファイル)の 中で 使う 製品トークンで、 HTTPリクエストで 名乗る 独自の ユーザーエージェント文字列を 持ちません。 収集は 既存の Googleの ユーザーエージェント文字列で 行われ、 Google-Extendedは 制御の ためだけに 使われる。 そして Google-Extendedを 拒否しても、 Google検索への 掲載には 影響せず、 ランキングの 要素にも 使われない (Googleの 一般的な クローラーの 一覧、 https://developers.google.com/search/docs/crawling-indexing/google-common-crawlers 、 2026年8月8日確認)。
図5:速度と 描画方 式を 整え、 本文を 確実に 読み取らせる 手順。
拡大図5:速度と描画方式を整え、本文を確実に読み取らせる手順。
閉じる 出所:GMO AI検索ラボ つまり、 検索結果に 出る ことと AIの 答えの 根拠に 使われる ことは、 別々に 許可・拒否が でき、 1つの 設定で まとめて 扱っていると、 意図しない 片落ちが 起きます。
観点 従来の 見方 AI検索も 含めた 見方 制御する 相手 検索用の クローラー1系統で 足りた 検索用・学習用・利用者の 操作で 来る 取得の 3系統が、 提供元ごとに 分かれている 制御の 場所 robots.txtと robotsメタタグ 上記に 加え、 提供元ごとの 製品トークン 見えなくなった ときの 症状 検索結果から 消える 検索結果には 出るが、 AIの 回答の 根拠に 使われなくなる。 気づきにくい 直した ときの 反映 再クロールを 待つ OpenAIは、 robots.txtの 更新が 検索側に 反映されるまで 約24時間と している 効果の 測り方 掲載順位と 表示回数 引用された 回数と、 引用され 続けている 日数
横にスクロールできます
この 記事は 次の 4項目を 順に 扱い、 上ほど、 閉じていた ときの 被害が 大きい。
項目 何を 確かめるか 扱う 節 AIの クローラーを 通しているか robots.txtに、 意図しない 拒否の 行が 入っていないか 3章 意味を 機械に 伝えているか 何の ページで、 誰が 書き、 いつ 公開したかを 構造化データで 明示しているか 4章 案内を 出しているか llms.txtを 置くかどうかを、 根拠を 持って 決められているか 5章 漏れていないか サイトマップ、 インデックスの 設定、 本文の 描画方 法に 事故が 無いか 6章と 7章
横にスクロールできます
1つ目が 閉じていると、 2つ目以降を 完璧に しても 意味が 無い。 逆に 2つ 目が 空でも、 4章で 示すとおり引用は 取れている 実測が あり、 手を 付ける 順番は、 この 非対称さで 決めるのが よい。
テクニカルSEOの 解説は、 推奨事項の 一覧に なりやすく、 そこで この 調査では、 実際に AIの 回答で 引用されている ページを 取得して 実装を 数えた。 出どころは、 AIO対策会社の 選定に 関する 17種の 問いを 5モデルへ 投げた GMO NIKKOの 競合引用分析であり、 期間は 2026年7月8日から 8月7日、 回答は 2,168件、 引用URLは 2万4,200行、 引用ドメインの ユニーク数は 1,737件です。 この 中から 引用回数の 多い ページを 取得し、 本文の 文字数、 見出しの 数、 表の 数、 JSON-LDで 実装されている 型を 数えた。 対象は 11ページで、 2026年8月7日に HTTPで 取得した。
ページ 本文文字数 h2 h3 表 JSON-LDの 型の 数 ドメイン単位の 引用数 white-link.com (LLMO会社比較) 32,068字 12 取得できず 39 7 上位25位に 入らず 確認できていない oproduct.ai (20選) 27,617字 15 79 5 4 330 ai-search.techsuite.co.jp (43選) 22,035字 13 44 3 9 390 plan-b.co.jp (18選) 21,983字 16 41 38 4 202 bakuri.co.jp (20選) 19,636字 16 42 25 4 442 protea-inc.co.jp (12選) 18,687字 9 30 13 0 473 cinc-j.co.jp (サービスページ) 16,753字 13 80 0 5 298 queue-tech.jp (7選) 16,219字 25 77 3 17 374 aspicjapan.org (18選) 16,602字 15 26 2 4 554 koukoku.jp/service/aio/ 2,742字 4 0 0 4 272 koukoku.jp/truemarketing/aio/20260602b/ 6,397字 11 取得できず 7 0 272
横にスクロールできます
引用数の 列は、 ページ単体ではなく ドメイン単位の 数であり、 koukoku.jpの 2行が 同じ 272なのは その ためであり、 white-link.comは 引用ドメイン上位25位の 一覧に 入っておらず、 ドメイン単位の 数を 持っていません。 推定して 埋める ことはしません。
最初に 見るべきは、 protea-inc.co.jpの 行であり、 JSON-LDの 型が 0で、 ドメイン単位の 引用数は 473です。 11ページの 中で、 aspicjapan.orgの 554に 次ぐ数であり、 同じ 表の queue-tech.jpは 17種類の 型を 実装しているが、 374です。 構造化データは、 AI検索で 引用される ための 必要条件では ありません。 GMO AI検索ラボの 定点観測範囲では、 これは 推測ではなく 実測です。
では 何が 共通しているか。 本文の 文字数であり、 11ページの うち、 koukoku.jpの 2ページを 除く 9ページは すべて 16,000字を 超えており、 h3見出しは、 取得できた 8ページで 26個から 80個 あり、 表は、 比較記事型の 8ページに 限れば 2個から 39個ある。 一方 koukoku.jp/service/aio/は 2,742字、 h2が 4本、 h3が 0本、 表が 0個です。
AIは 回答を 組み立てる とき、 ページ全体ではなく 必要な 断片だけを 抜き出していると 考えられます。 見出しと 表で 細かく 区切られている ほど、 抜き出せる 断片が 増え、 2,742字で h3が 0本の ページは、 抜き出せる 断片が そもそも 少ない。
引用回数の 多い 比較・おすすめ型の URL上位32件を 取得して 調べた 結果の うち、 5本を 挙げる。
引用数 記事 ドメイン 309 AIO対策会社おすすめ18選 aspicjapan.org 156 AIO対策に おすすめの 会社20選 bakuri.co.jp 124 LLMO・GEO・AIO対策会社おすすめ20選 oproduct.ai 115 AIO対策会社おすすめ比較7選 queue-tech.jp 60 AIO対策に 強い 会社12選 protea-inc.co.jp
横にスクロールできます
aspicjapan.orgは、 robots.txtが HTTPで 取得できずHTTP 404を 返す状態で ありながら、 引用数は 首位クラスです。 robots.txtが 無いことは 全許可と 同じ 扱いに なるので 拒否は されていないが、 AI向けの 案内を 丁寧に 整える ことが 引用の 前提だ、と いう 説明は この 1件で 成り立たなくなる。
クローラーの 名前は、うろ 覚えで 書くと 事故に なり、 名前が 1文字違うだけで、 robots.txtの 行は 何も 制御しません。 並べるのは 各社の 公式ドキュメントに 書かれている 表記だけで、 いずれも 2026年8月8日に 取得して 確認した。
クローラー名 提供元 何の ために 来るか 拒否した ときに 何が 起きるか GPTBot OpenAI 生成AIの 基盤モデルの 学習に 使いうる 内容を 集める 学習に 使われない ことを 示します。 検索側の 掲載可否とは 独立して 設定できる OAI-SearchBot OpenAI ChatGPTの 検索機能で、 サイトを 検索結果に 出すために 集める ChatGPTの 検索の 答えに サイトが 出なくなる ChatGPT-User OpenAI 利用者が ChatGPTや Custom GPTに 質問した ときに、 その場で ページを 見に 来る 利用者が 起点の ため、 robots.txtの 規則が 適用されない 場合が あると 公式に 書かれている ClaudeBot Anthropic 学習に 寄与しうる 内容を 集め、 モデルの 有用性と 安全性を 高める 以後の 素材が 学習用の データセットから 除かれる Claude-User Anthropic 利用者が Claudeに 質問した ときに、 その場で サイトへ アクセスする 問いに 応じた 取得が できなくなり、 検索での 露出が 下がりうる Claude-SearchBot Anthropic 検索結果の 品質を 上げる ために ウェブを 巡回し、 内容を 解析する 検索向けの 索引付けが 行われなくなり、 露出と 正確さが 下がりうる Google-Extended Google Gemini Appsと Vertex AIの 学習、 および Google検索の 索引から 根拠を 渡すグラウンディングの 対象に するかを 制御する Gemini側の 学習と グラウンディングの 対象から 外れる。 Google検索の 掲載と ランキングには 影響しません PerplexityBot Perplexity Perplexityの 検索結果に サイトを 出すために 集める。 学習には 使わないと 公式に 書かれています Perplexityの 検索結果に 出なくなる Perplexity-User Perplexity 利用者が Perplexityに 質問した ときに、 その場で ページを 見に 来る 利用者が 起点の ため、 robots.txtの 規則は 一般に 無視されると 公式に 書かれている
横にスクロールできます
出典は、 OpenAIが https://platform.openai.com/docs/bots 、 Anthropicが https://support.anthropic.com/en/articles/8896518-does-anthropic-crawl-data-from-the-web-and-how-can-site-owners-block-the-crawler 、 Googleが https://developers.google.com/search/docs/crawling-indexing/google-common-crawlers 、 Perplexityが https://docs.perplexity.ai/guides/bots です。
押さえて ほしいのは、 検索用と 学習用が 別の トークンに 分かれている 提供元が あると いう 点です。 OpenAIは、 OAI-SearchBotを 許可して 検索結果に 出しつつ、 GPTBotを 拒否して 学習には 使わせない 組み合わせが できると 書いています。
手順を 番号で 書き、 所要は 5分です。
ブラウザの アドレス欄に、 自社サイトの ドメインに 続けて /robots.txt と 入れて 開きます。 サブドメインごとに 別の ファイルに なるので、 www 付きと 無し、 blog. などを それぞれ確認する。 「ページが 見つかりません」と 出た 場合、 robots.txtは 存在せず、 全許可と 同じ 扱いに なります。 拒否は されていないので、 あわてなくて よい。 User-agent: で 始まる 行を 上から 拾い、 3.1節の 表に ある 名前が 含まれていないかを 見ます。 含まれていた 場合、 その下の Disallow: の 行が 何を 拒否しているかを 読みます。 User-agent: * の 下に Disallow: / の 1行だけが ある 場合、 サイト全体を 拒否しています。 これは 事故です。 すぐに 直します。 最後に Sitemap: の 行が あるかを 見ます。 無ければ 6章で 足します。 直した あとは、 Search Consoleの robots.txtレポートで Googleが 読んだ 内容を 確認する。 手元の ファイルを 直しても、 配信側の キャッシュで 古い 内容が 返り続ける ことがあります。 Googleの 公式ドキュメントは、 robots.txtの 主な 用途は サイトへの リクエストの 過負荷を 避ける ことであり、 ページを 検索結果から 除く ための 仕組みではないと 明記しています。 検索結果に 出したくない ページには、 noindexを 使うかパスワードで 保護する (robots.txt の 概要、 https://developers.google.com/search/docs/crawling-indexing/robots/intro 、 2026年8月8日確認)。
起きている 症状 原因に なりやすい 場所 robots.txtで 直るか AIの 回答の 根拠に 全く 使われない AIの クローラーを 拒否している 直ります。 該当の Disallow を 外します 検索結果には 出るが、 Geminiの 回答で 使われない Google-Extendedを 拒否している 直ります。 該当の 行を 見直します 検索結果に 出したくない ページが 出続ける Disallow に しています。 拒否すると クローラーが 中身を 読めず、 noindexにも 気づけない 直りません。 Disallow を 外したうえで noindexを 付ける JavaScriptで 描いた本文だけが 読まれない JavaScriptや CSSの ファイルを 拒否している 直ります。 ただし7章の 描画の 問題と 併発しやすい 利用者が AIに 直接URLを 渡すと 読まれてしまう 利用者起点の 取得は、 robots.txtの 規則が 適用されない 場合が ある 直らない 場合が あります。 認証を かけるなど別の 手段が 要ります
横にスクロールできます
GMO NIKKOの本体 サイトを 2026年8月に 点検した ときの robots.txtは 全4行で、 管理画面の 拒否と サイトマップの 1行だけであり、 3.1節の 名前は 1つも 書かれていませんでした。 ワイルドカードで 全許可なので、 拒否されている 状態では ありません。 書かれていない ことと、 拒否している ことは 違います。
llms.txtは、 AIが 推論する ときに サイトを 使いやすく する ための 情報を、 /llms.txt と いう ファイルに まとめて 置こうと いう 提案です。 提案者は Jeremy Howardで、 公開は 2024年9月3日であり、 提案の 本文自体が 「標準化しようと いう 提案」と いう 書き方を している (The /llms.txt file、 https://llmstxt.org/ 、 2026年8月8日確認)。 llms.txtは、 W3Cや IETFのような 標準化団体で 確定した 仕様では ありません。 robots.txtや sitemap.xmlと 同じ 棚に 並べて 説明される ことが 多いが、 置かれている 状態は 同じでは ありません。
もう 1つ 確認できた ことを 書いて おき、 OpenAI・Perplexity・Model Context Protocolの 各ドキュメントサイトは、 自分たちの ドキュメントの 索引と して /llms.txt を 公開している (2026年8月8日に 確認した)。 ただし これは 各社が 自社サイトで 配っていると いう 事実であって、 各社の クローラーが 他社サイトの llms.txtを 読んで 回答に 使うと いう 表明では ありません。 後者を 明示した 公式の 記述は 見つから なかった。
置く 場所と ファイルの 形だけを 書いて おきます。 ファイルは サイトの ルート、 つまり https://example.com/llms.txt に 置き、 中身は Markdownで 書きます。 提案が 必須と している 要素は、 サイトの 名前を 書く H1見出し1つだけであり、 書き方の 細部と、 そのまま 貼れる 雛形は、 別の 記事 「llms.txtの 書き方」で 扱います。 仕様の 定義と、 いまどこまで 使われているかは 別の 記事 「llms.txtとは」で 扱い、 この 記事は、 テクニカルSEO全体の 中で 置くべきか どうかを 判断する 材料までに と どめる。
ファイルまたは 仕組み 置く 場所 誰に 向けた ものか 何を 伝えるか 標準と しての 状態 robots.txt サイトの ルート 自動で 巡回する クローラー どの URLへの アクセスを 許すか 広く 実装されています。 Googleが 解釈の 仕様を 公開しています sitemap.xml ルート推奨 検索エンジンの クローラー サイトに どの URLが あるか、 いつ 更新したか sitemaps.orgの プロトコルと して 確立している llms.txt ルート、 または 任意の サブパス 大規模言語モデルと エージェント サイトの 要点と、 詳しく 読むべきページの 一覧 提案の 段階。 確定していません 構造化データ 各ページの HTMLの 中 検索エンジンと AI その ページが 何で、 誰が 書き、 いつ 公開したか schema.orgの 語彙と して 確立している
横にスクロールできます
llmstxt.org自身も、 robots.txtと llms.txtは 目的が 違うと 書いています。 robots.txtは アクセスの 可否を 伝える もので、 llms.txtは 利用者が 明示的に その 話題を 求めた ときに 使われる ことを 想定しており、 片方が あれば 片方が 要らない、と いう 関係では ありません。
この 調査の 競合引用分析で、 llms.txtの 設置状況も 調べており、 調べたのは 1,737件の 引用ドメイン全部ではなく、 引用上位の 競合と して 実際に 取得した 比較記事12本の 各社だけであり、 その 範囲で 設置していたのは 次の 4社で、 内容は いずれも 会社概要と 主要ページの リンク集でした。
ドメイン llms.txtの 設置 ドメイン単位の 引用数 比較記事を 持っているか geo-code.co.jp あり 485 持っている bakuri.co.jp あり 442 持っている (20選) ai-search.techsuite.co.jp あり 390 持っている (43選) queue-tech.jp あり 374 持っている (7選)
横にスクロールできます
4社とも 引用数は 多く、 ここまでが 観測できた ことです。
ここから 先が 観測できていない ことであり、 この 4社は 全員、 比較記事も 持っており、 引用数が 多い 理由が llms.txtに あるのか比較記事に あるのかを、 この データでは 分けられない。 統計の 言い方を すれば、 llms.txtの 設置と 比較記事の 保有が 交絡している 可能性が あり、 交絡した 状態の データから 因果は 読み取れない。
逆の 側も 見て おき、 2章で 挙げた aspicjapan.orgは、 robots.txtすら 取得できずHTTP 404を 返す状態で、 引用数は 554と 多く、 llms.txtの 整備を 引用の 前提と して 説明する ことは この 1件と 両立しません。
現時点で GMO AI検索ラボが 言える ことと 言えない ことを、はっきり分けて 置いて おきます。
項目 GMO AI検索ラボの 立場 根拠 llms.txtを 置くと 引用が 増えるか 言えない 設置4社と 非設置サイトを、 比較記事の 有無で 揃えた 観測を 持っていない llms.txtを 置かないと 引用されないか 言えません。 むしろ反例が あります aspicjapan.orgは robots.txtも 無い 状態で 引用数首位クラスである 主要な AI検索が 他社の llms.txtを 読むか 確認できていない 各社の 公式ドキュメントに 明示した 記述は 見つから なかった llms.txtが 標準と して 確定しているか 確定していない llmstxt.org自身が 標準化の 提案と 書いている
横にスクロールできます
したがって、 この 記事は llms.txtの 設置を 勧めもしないし、 やめろとも 言いません。 根拠を 持っていないためです。
費用の 側だけ 書いて おき、 llms.txtの 設置は、 最小形なら 1ファイル、 数十行で 済みます。 作る 手間は 小さい。 一方、 内容が 古くなったまま 放置されると、 サイトの 構成と 食い 違った 案内を 配る ことになります。 置くと 決めるなら、 更新の 担当と 頻度を 同時に 決める。 判断の 材料に なる 数字を 持ったら、 この 節を 書き換えて 更新日を 動かす。
サイトマップは、 サイトに どの URLが あるかを 機械に 渡すための ファイルと 言え、 基本の 仕組みなので 放置されやすく、 放置されると 静かに 壊れる。 Googleの 公式ドキュメントの 制限と 推奨を、 点検の 形に 直して 並べる。
点検項目 満た した 状態 出どころ 1ファイルの 大きさ 圧縮しない 状態で 50MB以下、 かつURLは 5万件以下。 超える 場合は 分割し、 分割した 各ファイルの 場所を 並べた 親の ファイルに まとめる。 この 親の ファイルを サイトマップインデックスと 呼びます Googleの サイトマップ作成ガイド 文字コード UTF-8で 保存されている 同上 置き場所 ルートに 置いてある。 Search Consoleから 送信しない 場合、 置かれた ディレクトリより 下の URLにしか 効きません 同上 URLの 書き方 相対パスではなく、 完全な 絶対URLで 書いてある 同上 更新の 停止 最新の 記事の URLが 入っている GMO AI検索ラボの 点検手順
横にスクロールできます
出典は サイトマップの 作成と 送信 (https://developers.google.com/search/docs/crawling-indexing/sitemaps/build-sitemap 、 2026年8月8日確認)です。 最新の 記事の URLが 載っていなければ、 生成の 仕組みが 止まっている 可能性が あります。
拾われない 原因は 1か所では ありません。 どこで 止まっているかを 切り分ける ために、 経路ごとに 分けて 並べる。
経路 何が 起きているか 確かめ方 直し方 robots.txtで 拒否している クローラーが そもそも 取得しない /robots.txt で 該当の パスを 探す 該当の Disallow を 外す noindexが 付いている 取得は されるが、 索引に 入らない ソースで robots の メタタグを 探します。 HTMLではなく 通信の 応答ヘッダーで 同じ 指示を 出す X-Robots-Tag も 見ます 意図しない ものであれば 外す canonicalが 別の URLを 指している 索引の 代表が 別の URLに なり、 この URLは 表に 出ない ソースで rel="canonical" の 値を 見る 他所を 指していれば 直す サイトマップに 入っていない 発見が 遅れる。 ただし内部リンクが あれば 見つかる ことは ある サイトマップで URLを 検索する 生成の 対象条件を 見直す どこからも リンクされていない 発見の 手が かりが 無い Search Consoleの リンクレポートを 見る 一覧ページや 関連記事から 張る
横にスクロールできます
noindexと canonicalは 設定した本人以外には 気づきにくい種類の 事故であり、 テンプレートの 一括 変更や、 検証環境の 設定を そのまま 本番へ 持ち込んだ ときに 起きます。 公開の たびに 全部を 確認するのは 現実的ではないので、 8章の 点検表に 入れてある。
確認に 使う 道具は 3つで、 いずれも 無料であり、 Search Consoleは、 URL検査・robots.txtレポート・サイトマップの 送信と 読み取り結果を 扱います。 リッチリザルトテストと schema.orgの バリデーターは、 構造化データの 検出と 語彙の 綴りを 確かめ、 ブラウザの 「ページの ソースを 表示」は、 サーバーが 返した 素の HTMLを 見せる。
Googleは、 JavaScriptを 使う ページを、 クロール・レンダリング・インデックスの 3段階で 処理すると 説明しています。 HTTPで 取得した 応答に 本文が 入っていない ページの 場合、 Googlebotは その ページを レンダリングの 待ち行列に 入れ、 順番が 回ってくるのは 数秒後の ことも あれば、 それより 長く かかる 場合も あります。 同じ ドキュメントは、 サーバー側での 描画や 事前描画は 今も 良い 考えだと 書いており、 これは 公式の 見解と 言えます。 理由の 1つが、 すべての ボットが JavaScriptを 実行できるわけではないと いう 点である (JavaScript SEO の 基本、 https://developers.google.com/search/docs/crawling-indexing/javascript/javascript-seo-basics 、 2026年8月8日確認)。
GMO AI検索ラボは、 この 問題が 実際に 起きている 例を 2件、 自分の 手で 確認しています。 1件目は、 GMO NIKKO本体の /truemarketing/aio/ の 記事一覧で、 HTTPで 取得した HTMLからは 記事への リンクを 1件も 抽出できなかった。 2件目は、 競合の 調査で 取得した plan-b.co.jp の ある 記事で、 HTTPで 取得した本文が 50字しか 入っていなかった。 どちらも ブラウザで 見れば 表示される。
確認は 2分で 済みます。
確かめたい ページを ブラウザで 開き、 右クリックして 「ページの ソースを 表示」を 選びます。 開発者ツールの 要素タブは JavaScriptの 実行後の 状態を 見せるので、 判定に 使えません。 開いた ソースの 中で、 本文に ある 特徴的な 一文を Ctrlキーと Fキーで 検索する。 見つかれば 素の HTMLに 本文が 入っています。 見つからなければ、 その本文は JavaScriptで 後から 差し込まれています。 見つから なかった 場合は、 Search Consoleの URL検査で 「クロール済みの ページを 表示」を 開き、 レンダリング後の HTMLに 本文が 入っているかを 見ます。 入っていれば Googleは 読めているが、 JavaScriptを 実行しない クローラーは 読めていません。 状態 素の HTML レンダリング後 何が 起きるか サーバー側で 描画している 本文が ある 本文が ある どの クローラーから も 読める クライアント側で 描画している 本文が 無い 本文が ある JavaScriptを 実行する クローラーだけが 読める。 実行まで 待ち時間が 入ります 描画に 失敗している 本文が 無い 本文が 無い どの クローラーから も 読めない。 順位も 引用も 付きません 一部だけ差し込んでいる 見出しだけある 本文も ある 断片と して 抜き出される 部分が 減る
横にスクロールできます
速度の 目安は、 Googleが 公開している Core Web Vitals (=読み込み・操作への 反応・ 表示の 安定の 3つを 測る、 Googleが 定めた 利用者体験の 指標)の しきい値を 使います。 良好と される 値は 次の とおりで、 いずれも 利用者の 読み込みの うち75パーセンタイルの 値で 判定し、 モバイルと デスクトップを 分けて 見ており、 75パーセンタイルとは 実際の 読み込みを 速い順に 並べた とき、 下から 数えて 75%の 位置に 来る 値を 指します。 平均ではなく、 遅い ほうの 4分の 1を 切り捨てた値で 見ると いう ことである (Web Vitals、 https://web.dev/articles/vitals 、 2026年8月8日確認)。
Largest Contentful Paint (LCP)は いちばん 大きい 要素が 表示されるまでの 時間で、 2.5秒以内が 良好と される。 Interaction to Next Paint (INP)は 操作してから 画面が 反応するまでの 時間で、 200ミリ秒以下が 良好と される。 Cumulative Layout Shift (CLS)は 読み込み中に 表示が 動く 量で、 0.1以下が 良好と される。 ここで 正直に 書き、 この 調査では、 表示速度と AI検索での 引用数の 関係を 測っていません。 上の 3つは Googleが 利用者の 体験の 指標と して 定めた もので、 AIの 回答に 引用されるか どうかの 指標では ありません。 速い ほど 引用される、と いう 関係を 示す実測を 持っていません。 それでも 速度を 扱うのは、 7.1節の 描画の 問題と 地続きだからであり、 本文を JavaScriptで 後から 差し込む 作りは、 LCPを 悪くしやすく、 同時に 素の 取得で 読めない 状態を 作り、 この 2つは 別の 症状に 見えて 原因が 同じことが 多い。
制作会社への 指示書と して そのまま 渡せる 形にし、 各項目は、 程度ではなく、は いか いいえで 答えられる 書き方に そろえてある。 並べ方の 根拠を 開示し、 上から 順に、 満たしていない ときの 被害が 大きい順と 考えられます。 被害の 大きさは、 その 項目が 閉じていた ときに 以降の 項目が 無意味に なるか どうかで 判定し、 着手の 手間は 順位に 入れていません。 4章の とおり構造化データは 無くても 引用が 取れている 実測が ある ため、 robots.txtより 下に 置いてある。
順 確認項目 満た した 状態 確認に 使う 道具 満たしていない ときに 何が 起きるか 1 robots.txtが サイト全体を 拒否していない User-agent: * の 下が Disallow: / の 1行だけ、と いう 状態に なっていない /robots.txt を 開く 全ての クローラーが 取得しません。 以降の 項目が 全て 無意味に なります 2 AIの クローラーを 意図せず 拒否していない 3.1節の 名前が Disallow の 対象に なっていません。 または 拒否が 意図した 判断です /robots.txt を 開く 検索結果には 出るが、 AIの 回答の 根拠に 使われない 3 公開する ページに noindexが 付いていない ソースと HTTPヘッダーに noindex が 無い ソース表示、 URL検査 索引に 入らず、 検索でも 引用でも 出ない 4 canonicalが 自分 自身を 指している rel="canonical" の 値が その ページ 自身の URLである ソース表示 別の URLが 代表と して 扱われる 5 素の HTMLに 本文が 入っている ソースを 開いて本文の 一文を 検索すると 見つかる ソース表示 JavaScriptを 実行しない クローラーから 読めない 6 サイトマップに 入っていて、 制限も 守っている その URLが 載っており、 50MB以下かつ5万URL以下、 UTF-8、 絶対URL サイトマップを 開く 発見が 遅れる。 制限を 超えると 途中から 読まれない 7 公開日と 更新日が ページに 見えている 記事の 冒頭または 末尾に、 どちらも 文字と して 出ている 記事を 開く いつの 情報かが 読者にも 機械にも 伝わらない 8 著者が 個人名で 書かれている 組織名ではなく、 個人の 氏名が 出ている 記事を 開く 誰が 書いたかが 伝わらない 9 記事の 型の 構造化データが 入り、 エラーが 0件である Article・BlogPosting・NewsArticleの いずれかが 検出され、 重大な エラーが 0件 リッチリザルトテスト 何の ページかが 機械に 伝わらない 10 構造化データの 内容が 本文に 見えている 書いた 問答・著者・ 日付が 本文にも 表示されている 記事を 開いて 突き合わせる Googleの ガイドライン違反に なり、 手動に よる 対策の 対象に なりうる
横にスクロールできます
点検表を 出す以上、 この 記事自身が どうなっているかを 書き、 この 調査が 2026年8月8日に 公開HTMLを 取得して 数えた 結果であり、 構造化データは 9つの 型が 実装されています。 BlogPosting、 FAQPage、 Person、 BreadcrumbList、 WebPage、 Organization、 WebSite、 ImageObject、 SpeakableSpecificationです。 項目8と 9は 満たしています。
満たしていない 項目も 書き、 項目7に ついて、 この 記事の 公開ページは 公開日と 更新日が どちらも 2026年7月28日で、 公開から 一度も 更新していない 状態でした。 日付は 出ているので 判定は 「はい」だが、 実態と しては 更新の 運用が 回っていません。 この 版で その 状態を 直し、 同じ 点検で、 GMO AI検索ラボの カテゴリー記事10本の うち2本は 著者が 組織名に なっており、 項目8を 満たしていなかった。 点検表は、 他社に 渡す前に 自分に 当てる ものです。
構造化データを 入れれば 引用されるようになるか なりません。 この 調査の 競合引用分析では、 構造化データを 1つも 実装していない protea-inc.co.jpが 473引用を 得ており、 17種類の 型を 実装している queue-tech.jpは 374引用でした。 対象は 2026年7月8日から 8月7日、 回答2,168件です。 構造化データは、 何の ページで 誰が 書いたかを 取り違えられなく する ための ものです。 取り違えを 減らす効果と、 引用される 回数を 増やす効果は 別で、 後者を この 調査では 測っていません。
llms.txtは 置くべきか この 調査では、 置くべきとも 置かないべきとも 言えません。 設置していた 4社 (geo-code.co.jp、 bakuri.co.jp、 ai-search.techsuite.co.jp、 queue-tech.jp)の 引用数が 多い ことは 観測したが、 この 4社は 全員が 比較記事も 持っており、 どちらが 関わっているかを 分けられていません。 また llms.txtは、 llmstxt.org自身が 標準化の 提案と 書いている 段階の もので、 確定した 標準ではない (2026年8月8日確認)。 置くと 決めるなら、 更新の 担当と 頻度を 同時に 決めて ほしい。
AIクローラーは 止めるべきか 止めるか どうかは、 検索用と 学習用を 分けて 決められる。 OpenAIは 公式に、 OAI-SearchBotを 許可して ChatGPTの 検索結果に 出しつつ、 GPTBotを 拒否して 学習には 使わせない 組み合わせが できると 書いている (2026年8月8日確認)。 Googleも、 Google-Extendedを 拒否しても Google検索への 掲載と ランキングには 影響しないと 明記しています。 まず 自社の robots.txtを 開いて、 いまどちらの 状態なのかを 確かめて ほしい。
用語 説明 テクニカルSEO サイトの 技術的な 作りを 整えて、 機械が ページを 取得し内容を 読み取れる 状態に する 取り組みを 指す 製品トークン robots.txtの 中でだけ 使う 名前で、 HTTPリクエストでは 名乗らない ものを 指します。 Google-Extendedが これに 当たります robots.txt サイトの ルートに 置き、 どの URLへの アクセスを 許すかを クローラーに 伝える ファイルを 指す noindex その ページを 検索結果に 出さないよう指示する 記述を 指します。 メタタグか HTTPヘッダーで 書きます canonical 内容が 同じ 複数の URLが ある とき、 どれを 代表と するかを 指定する 記述を 指す サイトマップ サイトに どの URLが あるかを 列挙して 機械に 渡すファイルを 指す schema.org ページの 意味を 機械が 読める 形で 示すための 共通の 語彙を 指す JSON-LD schema.orgの 語彙を JSONの 形で HTMLに 埋め込む記法を 指す llms.txt AIに 読ませたい 情報の 案内を Markdownで 書き、 サイトの ルートに 置こうと いう 提案、 および その ファイルを 指す レンダリング 取得した HTMLと JavaScriptを 実行して、 実際に 表示される 状態を 作る 処理を 指す Core Web Vitals 読み込み・操作への 反応・ 表示の 安定の 3つを 測る、 Googleが 定めた 利用者体験の 指標を 指す 引用 AIの 回答に、 根拠と なる 出典URLと して 挙がっている 状態を 指す
この 記事の 数字は、 次の 2つの この 調査側の 一次 データと、 末尾の 仕様側の 一次情報から 取っており、 原典に 無い 数字は 書いていません。 この ほかに 自社の 記事を 自分で 点検した 結果も 使っているが、 それは 一次 データとは 別に 書いた。
項目 内容 該当ファイル docs/research/ai-citation-gap-2026-08.md 元データ 回答ログ2,168行、 引用URL2万4,200行、 引用ドメインの ユニーク数1,737件 対象期間と 問い 2026年7月8日から 8月7日。 AIO対策会社の 選定に 関する 17種 対象モデル 5種 (Claude 433/AI Mode 435/Gemini 434/ChatGPT 434/AI Overview 432) 使った 数値 11ページの 構造と JSON-LDの 型、 ドメイン単位と ページ単位の 引用数、 llms.txt設置4社、 aspicjapan.orgの robots.txtが 404である こと 使わなかった もの ドメインレーティングと 引用数の 対応表。 AIO対策の カテゴリー記事に 譲った
項目 内容 保管場所 Google BigQuery gmo-nk-ai-search-lab.ai_query_output.query_answer 該当ファイル docs/research/prompt-observation-report-2026-07.md 対象期間と 範囲 2026年5月19日から 7月30日。 100問を 毎日、 本運用6モデルへ 投げた 総回答2万9,582件。 内訳は 5月が 試験運用の 7件、 6月が 1万2,435件、 7月が 1万7,140件 使った 数値 ChatGPT (検索 あり)の 出典率98.8%、 Google AI Modeの 出典率95.2%と 1回答あたり出典数12.9件
これは 一次 データの 一覧に 入れていません。 外部を 対象に 集めた 観測ではなく、 この 調査が 自分の 記事を 自分で 点検した 結果 だからであり、 それでも 数字を 使っているので、 何を どう 数えたかを ここに 書いて おきます。 2026年8月8日に、 この 調査の カテゴリー記事10本の 公開中の HTMLを 取得し、 本文文字数・ 見出し数・表の 数・JSON-LDの 型・ 公開日と 更新日・著者の 表記を 数えた。 記録は portal/src/data/article-audit.ts に ある。 この 点検から 使った 数字は、 この 記事の 公開ページに 9つの 型が 実装されている こと、 10本とも 公開日と 更新日が 同じである こと、 10本の うち2本の 著者が 組織名である ことの 3つです。 なお、 検索ボリューム1,100は 外部の キーワード調査ツールで 計測した値で、 portal/src/data/kw-sheet.ts の C7行に 記録してある。 この 調査が 自分で 測った 数字では ありません。
仕様に 関する 記述は、 schema.org、 Google検索セントラルの 開発者向けドキュメント (構造化データの 仕組み、 記事の 構造化データ、 一般的な クローラーの 一覧、 robots.txt の 概要、 サイトマップの 作成と 送信、 JavaScript SEO の 基本)、 OpenAI・Anthropic・Perplexityの 各公式クローラー説明、 llmstxt.org、 web.devから 取っています。 すべて 2026年8月8日に 取得して 確認し、 URLは、 その 記述を 使った 節の 本文に そのまま 書いて あり、 ここで 一覧に 写し直すと 原典と 二重管理に なる ため、 まとめ直していません。
1.1で 引いた 技術的な 要件3つだけは、 あとから 足した ものなので 日付が 違います。 出どころは Google 検索セントラル 「Google 検索の 技術要件」 (https://developers.google.com/search/docs/essentials/technical )で、 2026年8月16日に 確認した。 この ページに 「テクニカルSEO」と いう 語が 使われていないことも、 同じ 日に 確かめています。
llms.txtの 効果を 確かめられていません。 設置4社の 引用数が 多い ことは 観測したが、 4社とも 比較記事を 持っており、 どちらが 関わっているかを 分けられていません。 そも そも 設置の 有無を 調べたのは 引用ドメイン1,737件の 全部ではなく、 引用上位の 競合と して 取得した 比較記事12本の 各社だけです。 主要な AI検索が 他社の llms.txtを 読むか どうかも 確認できていません。 構造化データの 有無で 引用数が どう 変わるかを 測っていません。 4章で 示したのは 11ページの 実装と 引用数の 対応で、 入れる 前と 後を 比べた 観測では ありません。 11ページと いう 母数は 少ない。 しかも AIO対策会社の 選定と いう 1つの テーマに 限った 問いから 集めた ページです。 他の 業種で 同じ形に なるかは 分かりません。 表示速度と AI検索での 引用の 関係を 測っていません。 7章の Core Web Vitalsの しきい値は、 Googleが 利用者体験の 指標と して 定めた もので、 引用の 指標では ありません。 white-link.comの ドメイン単位の 引用数を 持っていません。 引用ドメイン上位25位の 一覧に 入っていないためです。 推定して 埋めていません。 仕様は 変わります。 この 記事の 仕様に 関する 記述は、 すべて 2026年8月8日 時点で 公式ドキュメントを 取得して 確認した ものです。 各社は 予告なく クローラーの 名前や 扱いを 変える。 項目 内容 発行 GMO AI検索ラボ 運営 GMO NIKKO 執筆担当者 (未定。 コラム管理表 portal/src/data/kw-sheet.ts の C7行の author が 「未割当」の ため。 公開前に 埋める) 監修者 (未定。 監修体制を 確認できていない ため 空欄とする。 公開前に 埋める) 初出 2026年8月8日 (この 版が 書き直しの 初稿) 最終更新 2026年8月17日 (メタ情報の 分量を 数え直し、 検索ボリュームが 外部の キーワード調査ツールの 推計である ことを 書き足した) 更新の 方 針 四半期。 仕様の 変更が 起点に なる ため、 定点観測の 月次とは 連動しません。 2章の 実装比較は、 引用の 集計を 取り直した ときに 更新する
公開前に 埋める 必要が ある 項目:執筆担当者の 氏名、 監修者の 氏名と 肩書き、 著者プロフィールページの URL、 ロゴ画像の URL。 いずれも 確認できていないため、 この 記事および下の JSON-LDでは 空欄にして あり、 推測で 埋めていません。
この 記事の 数字は、 GMO AI検索ラボが 自分で 集めた 実測であり、 母数と 期間は 「データの 出どころ」に 書いており、 数字は 毎月 測り直しているので、 引用する ときは 集計期間を 添えてください。