本文へスキップ

AI検索のためのテクニカルSEO|構造化データとllms.txt

AI検索やそのクローラ(=Webページを自動収集するプログラム)に自社サイトを正しく理解させるための技術基盤を、構造化データ・llms.txt・サイトマップ・インデックス性・表示速度の5点から整理します。良い文章を書く前段の「読み取られる土台」を固める実務ガイドです。

先に結論を3つ書く

  1. 構造化データは引用の必要条件ではありません。この調査の競合引用分析で、構造化データを1つも実装していないprotea-inc.co.jpが473引用を得ています。一方、17種類の型を実装しているqueue-tech.jpは374引用です。「構造化データを入れれば引用される」という説明を、この調査の実測は支持しません。
  2. いちばん取り返しがつかないのはrobots.txtです。AIのクローラーを止めている状態は、それ以降の施策をすべて無効にする。しかも直すのに要るのは1行の書き換えだけです。効果と手間がここまで釣り合わない箇所は、この記事の範囲では他に無い。
  3. llms.txtが効くかどうかを、この調査では確かめられていません。引用上位の競合として実際に取得した比較記事12本の各社を調べたところ、llms.txtを置いていたのは4社で、いずれも引用数が多かった。ただしその4社は比較記事も持っており、どちらが関わっているかを分けられていません。効くとも効かないとも書きません。

この記事の数字は、この調査とGMO NIKKOが自分で集めたデータか、仕様を策定した団体と検索エンジンの公式ドキュメントから取ったものだけです。

1クローラが取得したページを解釈し、引用元として選ぶまでの基本ステップ。

AIがページを理解するまでの流れ
AIがページを理解するまでの流れ

図1:クローラが取得したページを解釈し、引用元として選ぶまでの基本ステップ。

出所:GMO AI検索ラボ

なぜAI検索でテクニカルSEOが効くのか

2意味を明示する記述は「語彙・形式・型」の三層で成り立つ。

構造化データの構成要素
構造化データの構成要素

図2:意味を明示する記述は「語彙・形式・型」の三層で成り立つ。

出所:GMO AI検索ラボ

テクニカルSEOという語は、Googleの公式には無い

この記事の題にも使っているが、先に断っておき、Googleの公式ドキュメントに「テクニカルSEO」という語は無く、これは業界で使われている呼び方です。

3AI向けの案内ファイルを整備する基本的な流れ。

llms.txtを用意する手順
llms.txtを用意する手順

図3:AI向けの案内ファイルを整備する基本的な流れ。

出所:GMO AI検索ラボ

Googleが定めているのは「技術的な要件」で、検索結果に表示されるためにページが満たすべき最低限の条件として3つ挙がっている(Google 検索セントラル「Google 検索の技術要件」、2026年8月16日確認)。

番号Googleが書いている要件
1Googlebot がブロックされていないこと
2ページが機能していること。Googleに HTTP 200(success)ステータスコードが返される
3インデックス登録可能なコンテンツがページに含まれていること

3つだけであり、この記事で扱う構造化データもllms.txtも、ここには入っていません。要件を満たすことと、引用されやすくすることは別の話だという点を、先に押さえておいてほしい。

では、この記事で「テクニカルSEO」と呼んでいるのは何か。機械がページを取得して、中身を読める状態にすることであり、コンテンツSEOとの線引きは次のようになります。

テクニカルSEOコンテンツSEO
受け持つこと機械がページを取得して読める状態にする読み取られた中身を、答えとして使えるものにする
直したときに変わるもの機械から見た状態。人が見る画面は変わりません人が読む中身。機械が読み取る内容も変わります
効かなかったときの症状検索結果には出るが、AIの回答の根拠に使われない取得はされているが、答えとして選ばれない
この記事での扱い3章から7章で扱うカテゴリー記事「コンテンツSEOとE-E-A-T」へ渡す

横にスクロールできます

順番は、技術が先であり、1.2で書くとおり、読めないページは中身の良し悪しを判定される手前で落ちるためです。

ただし技術を完璧にすれば引用される、という話ではありません。4章で示すとおり、構造化データを1つも実装していないページが473引用を得ている実測があり、技術は前提であって、決め手ではありません。

読めないページは、内容が良くても候補に入らない

AI検索は、問いを受け取ってからウェブを探し、見つけた文書を根拠にして答えの文章を組み立てる。この流れの入り口にあるのは、機械がページを取得して中身を読めるかどうかだと考えられ、読めなかったページは、内容の良し悪しを判定される手前で落ちます。

4発見・許可・重複整理の三層でインデックス漏れを防ぐ。

確実に索引へ載せるための点検層
確実に索引へ載せるための点検層

図4:発見・許可・重複整理の三層でインデックス漏れを防ぐ。

出所:GMO AI検索ラボ

この調査のプロンプト定点観測では、2026年5月19日から7月30日まで100問を毎日6モデルへ投げ、総回答2万9,582件を記録しています。内訳は5月が試験運用の7件、6月が1万2,435件、7月が1万7,140件であり、この観測で、ChatGPT(検索あり)は回答の98.8%に出典を付けていました。Google AI Modeは95.2%で、1回答あたりの出典数は12.9件であり、AI Modeは1回の回答で13件近いページを根拠に引いており、この枠に入る前段として、機械が取得できる状態にあることが要ります。テクニカルSEOが後回しにされやすいのは、直しても画面の見た目が変わらないからであり、変わらないのは人が見る画面だけで、機械から見た状態は変わっています。

従来の検索エンジンとAIのクローラーでは、制御の単位が違う

ユーザーエージェント文字列とは、ページを取りに来たプログラムが「自分は何者か」と名乗るために、通信のたびに送る短い文字列を指します。Googleの公式ドキュメントによれば、Google-Extendedはrobots.txt(=サイトのルートに置き、どのURLへのアクセスを許すかをクローラーに伝えるファイル)の中で使う製品トークンで、HTTPリクエストで名乗る独自のユーザーエージェント文字列を持ちません。収集は既存のGoogleのユーザーエージェント文字列で行われ、Google-Extendedは制御のためだけに使われる。そしてGoogle-Extendedを拒否しても、Google検索への掲載には影響せず、ランキングの要素にも使われない(Googleの一般的なクローラーの一覧、https://developers.google.com/search/docs/crawling-indexing/google-common-crawlers 、2026年8月8日確認)。

5速度と描画方式を整え、本文を確実に読み取らせる手順。

取りこぼしを防ぐ表示設計の要点
取りこぼしを防ぐ表示設計の要点

図5:速度と描画方式を整え、本文を確実に読み取らせる手順。

出所:GMO AI検索ラボ

つまり、検索結果に出ることとAIの答えの根拠に使われることは、別々に許可・拒否ができ、1つの設定でまとめて扱っていると、意図しない片落ちが起きます。

観点従来の見方AI検索も含めた見方
制御する相手検索用のクローラー1系統で足りた検索用・学習用・利用者の操作で来る取得の3系統が、提供元ごとに分かれている
制御の場所robots.txtとrobotsメタタグ上記に加え、提供元ごとの製品トークン
見えなくなったときの症状検索結果から消える検索結果には出るが、AIの回答の根拠に使われなくなる。気づきにくい
直したときの反映再クロールを待つOpenAIは、robots.txtの更新が検索側に反映されるまで約24時間としている
効果の測り方掲載順位と表示回数引用された回数と、引用され続けている日数

横にスクロールできます

この記事で扱う4項目を先に並べる

この記事は次の4項目を順に扱い、上ほど、閉じていたときの被害が大きい。

項目何を確かめるか扱う
AIのクローラーを通しているかrobots.txtに、意図しない拒否の行が入っていないか3章
意味を機械に伝えているか何のページで、誰が書き、いつ公開したかを構造化データで明示しているか4章
案内を出しているかllms.txtを置くかどうかを、根拠を持って決められているか5章
漏れていないかサイトマップ、インデックスの設定、本文の描画方法に事故が無いか6章と7章

横にスクロールできます

1つ目が閉じていると、2つ目以降を完璧にしても意味が無い。逆に2つ目が空でも、4章で示すとおり引用は取れている実測があり、手を付ける順番は、この非対称さで決めるのがよい。

引用されているページは何を実装しているか。11ページを数えた

推奨事項を並べる前に、引用されている実物を数えた

テクニカルSEOの解説は、推奨事項の一覧になりやすく、そこでこの調査では、実際にAIの回答で引用されているページを取得して実装を数えた。出どころは、AIO対策会社の選定に関する17種の問いを5モデルへ投げたGMO NIKKOの競合引用分析であり、期間は2026年7月8日から8月7日、回答は2,168件、引用URLは2万4,200行、引用ドメインのユニーク数は1,737件です。この中から引用回数の多いページを取得し、本文の文字数、見出しの数、表の数、JSON-LDで実装されている型を数えた。対象は11ページで、2026年8月7日にHTTPで取得した。

ページ本文文字数h2h3JSON-LDの型のドメイン単位の引用数
white-link.com(LLMO会社比較)32,068字12取得できず397上位25位に入らず確認できていない
oproduct.ai(20選)27,617字157954330
ai-search.techsuite.co.jp(43選)22,035字134439390
plan-b.co.jp(18選)21,983字1641384202
bakuri.co.jp(20選)19,636字1642254442
protea-inc.co.jp(12選)18,687字930130473
cinc-j.co.jp(サービスページ)16,753字138005298
queue-tech.jp(7選)16,219字2577317374
aspicjapan.org(18選)16,602字152624554
koukoku.jp/service/aio/2,742字4004272
koukoku.jp/truemarketing/aio/20260602b/6,397字11取得できず70272

横にスクロールできます

引用数の列は、ページ単体ではなくドメイン単位の数であり、koukoku.jpの2行が同じ272なのはそのためであり、white-link.comは引用ドメイン上位25位の一覧に入っておらず、ドメイン単位の数を持っていません。推定して埋めることはしません。

構造化データを1つも持たないページが473引用を得ている

最初に見るべきは、protea-inc.co.jpの行であり、JSON-LDの型が0で、ドメイン単位の引用数は473です。11ページの中で、aspicjapan.orgの554に次ぐ数であり、同じ表のqueue-tech.jpは17種類の型を実装しているが、374です。構造化データは、AI検索で引用されるための必要条件ではありません。GMO AI検索ラボの定点観測範囲では、これは推測ではなく実測です。

では何が共通しているか。本文の文字数であり、11ページのうち、koukoku.jpの2ページを除く9ページはすべて16,000字を超えており、h3見出しは、取得できた8ページで26個から80個あり、表は、比較記事型の8ページに限れば2個から39個ある。一方koukoku.jp/service/aio/は2,742字、h2が4本、h3が0本、表が0個です。

AIは回答を組み立てるとき、ページ全体ではなく必要な断片だけを抜き出していると考えられます。見出しと表で細かく区切られているほど、抜き出せる断片が増え、2,742字でh3が0本のページは、抜き出せる断片がそもそも少ない。

ページ単位で数え直しても、同じ向きになる

引用回数の多い比較・おすすめ型のURL上位32件を取得して調べた結果のうち、5本を挙げる。

引用数記事ドメイン
309AIO対策会社おすすめ18選aspicjapan.org
156AIO対策におすすめの会社20選bakuri.co.jp
124LLMO・GEO・AIO対策会社おすすめ20選oproduct.ai
115AIO対策会社おすすめ比較7選queue-tech.jp
60AIO対策に強い会社12選protea-inc.co.jp

横にスクロールできます

aspicjapan.orgは、robots.txtがHTTPで取得できずHTTP 404を返す状態でありながら、引用数は首位クラスです。robots.txtが無いことは全許可と同じ扱いになるので拒否はされていないが、AI向けの案内を丁寧に整えることが引用の前提だ、という説明はこの1件で成り立たなくなる。

AIのクローラーを通しているか。robots.txtを1行ずつ確かめる

主なAIクローラーの名前を、公式の表記だけで並べる

クローラーの名前は、うろ覚えで書くと事故になり、名前が1文字違うだけで、robots.txtの行は何も制御しません。並べるのは各社の公式ドキュメントに書かれている表記だけで、いずれも2026年8月8日に取得して確認した。

クローラー名提供元何のために来るか拒否したときに何が起きるか
GPTBotOpenAI生成AIの基盤モデルの学習に使いうる内容を集める学習に使われないことを示します。検索側の掲載可否とは独立して設定できる
OAI-SearchBotOpenAIChatGPTの検索機能で、サイトを検索結果に出すために集めるChatGPTの検索の答えにサイトが出なくなる
ChatGPT-UserOpenAI利用者がChatGPTやCustom GPTに質問したときに、その場でページを見に来る利用者が起点のため、robots.txtの規則が適用されない場合があると公式に書かれている
ClaudeBotAnthropic学習に寄与しうる内容を集め、モデルの有用性と安全性を高める以後の素材が学習用のデータセットから除かれる
Claude-UserAnthropic利用者がClaudeに質問したときに、その場でサイトへアクセスする問いに応じた取得ができなくなり、検索での露出が下がりうる
Claude-SearchBotAnthropic検索結果の品質を上げるためにウェブを巡回し、内容を解析する検索向けの索引付けが行われなくなり、露出と正確さが下がりうる
Google-ExtendedGoogleGemini AppsとVertex AIの学習、およびGoogle検索の索引から根拠を渡すグラウンディングの対象にするかを制御するGemini側の学習とグラウンディングの対象から外れる。Google検索の掲載とランキングには影響しません
PerplexityBotPerplexityPerplexityの検索結果にサイトを出すために集める。学習には使わないと公式に書かれていますPerplexityの検索結果に出なくなる
Perplexity-UserPerplexity利用者がPerplexityに質問したときに、その場でページを見に来る利用者が起点のため、robots.txtの規則は一般に無視されると公式に書かれている

横にスクロールできます

出典は、OpenAIが https://platform.openai.com/docs/bots 、Anthropicが https://support.anthropic.com/en/articles/8896518-does-anthropic-crawl-data-from-the-web-and-how-can-site-owners-block-the-crawler 、Googleが https://developers.google.com/search/docs/crawling-indexing/google-common-crawlers 、Perplexityが https://docs.perplexity.ai/guides/bots です。

押さえてほしいのは、検索用と学習用が別のトークンに分かれている提供元があるという点です。OpenAIは、OAI-SearchBotを許可して検索結果に出しつつ、GPTBotを拒否して学習には使わせない組み合わせができると書いています。

自社のrobots.txtをその場で開いて確かめる

手順を番号で書き、所要は5分です。

  1. ブラウザのアドレス欄に、自社サイトのドメインに続けて /robots.txt と入れて開きます。サブドメインごとに別のファイルになるので、www 付きと無し、blog. などをそれぞれ確認する。
  2. 「ページが見つかりません」と出た場合、robots.txtは存在せず、全許可と同じ扱いになります。拒否はされていないので、あわてなくてよい。
  3. User-agent: で始まる行を上から拾い、3.1節の表にある名前が含まれていないかを見ます。含まれていた場合、その下の Disallow: の行が何を拒否しているかを読みます。
  4. User-agent: * の下に Disallow: / の1行だけがある場合、サイト全体を拒否しています。これは事故です。すぐに直します。
  5. 最後に Sitemap: の行があるかを見ます。無ければ6章で足します。直したあとは、Search Consoleのrobots.txtレポートでGoogleが読んだ内容を確認する。手元のファイルを直しても、配信側のキャッシュで古い内容が返り続けることがあります。

robots.txtで解決しない事故と、解決する事故を分ける

Googleの公式ドキュメントは、robots.txtの主な用途はサイトへのリクエストの過負荷を避けることであり、ページを検索結果から除くための仕組みではないと明記しています。検索結果に出したくないページには、noindexを使うかパスワードで保護する(robots.txt の概要、https://developers.google.com/search/docs/crawling-indexing/robots/intro 、2026年8月8日確認)。

起きている症状原因になりやすい場所robots.txtで直るか
AIの回答の根拠に全く使われないAIのクローラーを拒否している直ります。該当の Disallow を外します
検索結果には出るが、Geminiの回答で使われないGoogle-Extendedを拒否している直ります。該当の行を見直します
検索結果に出したくないページが出続けるDisallow にしています。拒否するとクローラーが中身を読めず、noindexにも気づけない直りません。Disallow を外したうえでnoindexを付ける
JavaScriptで描いた本文だけが読まれないJavaScriptやCSSのファイルを拒否している直ります。ただし7章の描画の問題と併発しやすい
利用者がAIに直接URLを渡すと読まれてしまう利用者起点の取得は、robots.txtの規則が適用されない場合がある直らない場合があります。認証をかけるなど別の手段が要ります

横にスクロールできます

GMO NIKKOの本体サイトを2026年8月に点検したときのrobots.txtは全4行で、管理画面の拒否とサイトマップの1行だけであり、3.1節の名前は1つも書かれていませんでした。ワイルドカードで全許可なので、拒否されている状態ではありません。書かれていないことと、拒否していることは違います。

llms.txtは置くべきか。位置づけと、確かめられていないことを分ける

llms.txtは提案であって、確定した標準ではありません

llms.txtは、AIが推論するときにサイトを使いやすくするための情報を、/llms.txt というファイルにまとめて置こうという提案です。提案者はJeremy Howardで、公開は2024年9月3日であり、提案の本文自体が「標準化しようという提案」という書き方をしている(The /llms.txt file、https://llmstxt.org/ 、2026年8月8日確認)。llms.txtは、W3CやIETFのような標準化団体で確定した仕様ではありません。robots.txtやsitemap.xmlと同じ棚に並べて説明されることが多いが、置かれている状態は同じではありません。

もう1つ確認できたことを書いておき、OpenAI・Perplexity・Model Context Protocolの各ドキュメントサイトは、自分たちのドキュメントの索引として /llms.txt を公開している(2026年8月8日に確認した)。ただしこれは各社が自社サイトで配っているという事実であって、各社のクローラーが他社サイトのllms.txtを読んで回答に使うという表明ではありません。後者を明示した公式の記述は見つからなかった。

置く場所とファイルの形だけを書いておきます。ファイルはサイトのルート、つまり https://example.com/llms.txt に置き、中身はMarkdownで書きます。提案が必須としている要素は、サイトの名前を書くH1見出し1つだけであり、書き方の細部と、そのまま貼れる雛形は、別の記事「llms.txtの書き方」で扱います。仕様の定義と、いまどこまで使われているかは別の記事「llms.txtとは」で扱い、この記事は、テクニカルSEO全体の中で置くべきかどうかを判断する材料までにどめる。

robots.txt・sitemap.xml・構造化データとの役割の違いを押さえる

ファイルまたは仕組み置く場所誰に向けたものか何を伝えるか標準としての状態
robots.txtサイトのルート自動で巡回するクローラーどのURLへのアクセスを許すか広く実装されています。Googleが解釈の仕様を公開しています
sitemap.xmlルート推奨検索エンジンのクローラーサイトにどのURLがあるか、いつ更新したかsitemaps.orgのプロトコルとして確立している
llms.txtルート、または任意のサブパス大規模言語モデルとエージェントサイトの要点と、詳しく読むべきページの一覧提案の段階。確定していません
構造化データ各ページのHTMLの検索エンジンとAIそのページが何で、誰が書き、いつ公開したかschema.orgの語彙として確立している

横にスクロールできます

llmstxt.org自身も、robots.txtとllms.txtは目的が違うと書いています。robots.txtはアクセスの可否を伝えるもので、llms.txtは利用者が明示的にその話題を求めたときに使われることを想定しており、片方があれば片方が要らない、という関係ではありません。

効くかどうかを、GMO AI検索ラボは確かめられていない

この調査の競合引用分析で、llms.txtの設置状況も調べており、調べたのは1,737件の引用ドメイン全部ではなく、引用上位の競合として実際に取得した比較記事12本の各社だけであり、その範囲で設置していたのは次の4社で、内容はいずれも会社概要と主要ページのリンク集でした。

ドメインllms.txtの設置ドメイン単位の引用数比較記事を持っているか
geo-code.co.jpあり485持っている
bakuri.co.jpあり442持っている(20選)
ai-search.techsuite.co.jpあり390持っている(43選)
queue-tech.jpあり374持っている(7選)

横にスクロールできます

4社とも引用数は多く、ここまでが観測できたことです。

ここから先が観測できていないことであり、この4社は全員、比較記事も持っており、引用数が多い理由がllms.txtにあるのか比較記事にあるのかを、このデータでは分けられない。統計の言い方をすれば、llms.txtの設置と比較記事の保有が交絡している可能性があり、交絡した状態のデータから因果は読み取れない。

逆の側も見ておき、2章で挙げたaspicjapan.orgは、robots.txtすら取得できずHTTP 404を返す状態で、引用数は554と多く、llms.txtの整備を引用の前提として説明することはこの1件と両立しません。

現時点でGMO AI検索ラボが言えることと言えないことを、はっきり分けて置いておきます。

項目GMO AI検索ラボの立場根拠
llms.txtを置くと引用が増えるか言えない設置4社と非設置サイトを、比較記事の有無で揃えた観測を持っていない
llms.txtを置かないと引用されないか言えません。むしろ反例がありますaspicjapan.orgはrobots.txtも無い状態で引用数首位クラスである
主要なAI検索が他社のllms.txtを読むか確認できていない各社の公式ドキュメントに明示した記述は見つからなかった
llms.txtが標準として確定しているか確定していないllmstxt.org自身が標準化の提案と書いている

横にスクロールできます

したがって、この記事はllms.txtの設置を勧めもしないし、やめろとも言いません。根拠を持っていないためです。

費用の側だけ書いておき、llms.txtの設置は、最小形なら1ファイル、数十行で済みます。作る手間は小さい。一方、内容が古くなったまま放置されると、サイトの構成と食い違った案内を配ることになります。置くと決めるなら、更新の担当と頻度を同時に決める。判断の材料になる数字を持ったら、この節を書き換えて更新日を動かす。

サイトマップとインデックス性で拾わせる

サイトマップを点検項目に分けて確かめる

サイトマップは、サイトにどのURLがあるかを機械に渡すためのファイルと言え、基本の仕組みなので放置されやすく、放置されると静かに壊れる。Googleの公式ドキュメントの制限と推奨を、点検の形に直して並べる。

点検項目満たした状態出どころ
1ファイルの大きさ圧縮しない状態で50MB以下、かつURLは5万件以下。超える場合は分割し、分割した各ファイルの場所を並べた親のファイルにまとめる。この親のファイルをサイトマップインデックスと呼びますGoogleのサイトマップ作成ガイド
文字コードUTF-8で保存されている同上
置き場所ルートに置いてある。Search Consoleから送信しない場合、置かれたディレクトリより下のURLにしか効きません同上
URLの書き方相対パスではなく、完全な絶対URLで書いてある同上
更新の停止最新の記事のURLが入っているGMO AI検索ラボの点検手順

横にスクロールできます

出典はサイトマップの作成と送信(https://developers.google.com/search/docs/crawling-indexing/sitemaps/build-sitemap 、2026年8月8日確認)です。最新の記事のURLが載っていなければ、生成の仕組みが止まっている可能性があります。

ページが拾われなくなる経路を、5つに分けて切り分ける

拾われない原因は1か所ではありません。どこで止まっているかを切り分けるために、経路ごとに分けて並べる。

経路何が起きているか確かめ方直し方
robots.txtで拒否しているクローラーがそもそも取得しない/robots.txt で該当のパスを探す該当の Disallow を外す
noindexが付いている取得はされるが、索引に入らないソースで robots のメタタグを探します。HTMLではなく通信の応答ヘッダーで同じ指示を出す X-Robots-Tag も見ます意図しないものであれば外す
canonicalが別のURLを指している索引の代表が別のURLになり、このURLは表に出ないソースで rel="canonical" の値を見る他所を指していれば直す
サイトマップに入っていない発見が遅れる。ただし内部リンクがあれば見つかることはあるサイトマップでURLを検索する生成の対象条件を見直す
どこからもリンクされていない発見の手がかりが無いSearch Consoleのリンクレポートを見る一覧ページや関連記事から張る

横にスクロールできます

noindexとcanonicalは設定した本人以外には気づきにくい種類の事故であり、テンプレートの一括変更や、検証環境の設定をそのまま本番へ持ち込んだときに起きます。公開のたびに全部を確認するのは現実的ではないので、8章の点検表に入れてある。

確認に使う道具は3つで、いずれも無料であり、Search Consoleは、URL検査・robots.txtレポート・サイトマップの送信と読み取り結果を扱います。リッチリザルトテストとschema.orgのバリデーターは、構造化データの検出と語彙の綴りを確かめ、ブラウザの「ページのソースを表示」は、サーバーが返した素のHTMLを見せる。

表示速度とレンダリングでAIの読み漏れを防ぐ

JavaScriptで後から差し込む本文は、読まれない場合がある

Googleは、JavaScriptを使うページを、クロール・レンダリング・インデックスの3段階で処理すると説明しています。HTTPで取得した応答に本文が入っていないページの場合、Googlebotはそのページをレンダリングの待ち行列に入れ、順番が回ってくるのは数秒後のこともあれば、それより長くかかる場合もあります。同じドキュメントは、サーバー側での描画や事前描画は今も良い考えだと書いており、これは公式の見解と言えます。理由の1つが、すべてのボットがJavaScriptを実行できるわけではないという点である(JavaScript SEO の基本、https://developers.google.com/search/docs/crawling-indexing/javascript/javascript-seo-basics 、2026年8月8日確認)。

GMO AI検索ラボは、この問題が実際に起きている例を2件、自分の手で確認しています。1件目は、GMO NIKKO本体の /truemarketing/aio/ の記事一覧で、HTTPで取得したHTMLからは記事へのリンクを1件も抽出できなかった。2件目は、競合の調査で取得した plan-b.co.jp のある記事で、HTTPで取得した本文が50字しか入っていなかった。どちらもブラウザで見れば表示される。

素のHTMLに本文が入っているかを、その場で確かめる

確認は2分で済みます。

  1. 確かめたいページをブラウザで開き、右クリックして「ページのソースを表示」を選びます。開発者ツールの要素タブはJavaScriptの実行後の状態を見せるので、判定に使えません。
  2. 開いたソースの中で、本文にある特徴的な一文をCtrlキーとFキーで検索する。
  3. 見つかれば素のHTMLに本文が入っています。見つからなければ、その本文はJavaScriptで後から差し込まれています。
  4. 見つからなかった場合は、Search ConsoleのURL検査で「クロール済みのページを表示」を開き、レンダリング後のHTMLに本文が入っているかを見ます。入っていればGoogleは読めているが、JavaScriptを実行しないクローラーは読めていません。
状態素のHTMLレンダリング後何が起きるか
サーバー側で描画している本文がある本文があるどのクローラーから読める
クライアント側で描画している本文が無い本文があるJavaScriptを実行するクローラーだけが読める。実行まで待ち時間が入ります
描画に失敗している本文が無い本文が無いどのクローラーから読めない。順位も引用も付きません
一部だけ差し込んでいる見出しだけある本文もある断片として抜き出される部分が減る

横にスクロールできます

速度の目安を置き、この調査が測っていないことも書く

速度の目安は、Googleが公開しているCore Web Vitals(=読み込み・操作への反応・表示の安定の3つを測る、Googleが定めた利用者体験の指標)のしきい値を使います。良好とされる値は次のとおりで、いずれも利用者の読み込みのうち75パーセンタイルの値で判定し、モバイルとデスクトップを分けて見ており、75パーセンタイルとは実際の読み込みを速い順に並べたとき、下から数えて75%の位置に来る値を指します。平均ではなく、遅いほうの4分の1を切り捨てた値で見るということである(Web Vitals、https://web.dev/articles/vitals 、2026年8月8日確認)。

  • Largest Contentful Paint(LCP)はいちばん大きい要素が表示されるまでの時間で、2.5秒以内が良好とされる。
  • Interaction to Next Paint(INP)は操作してから画面が反応するまでの時間で、200ミリ秒以下が良好とされる。
  • Cumulative Layout Shift(CLS)は読み込み中に表示が動く量で、0.1以下が良好とされる。

ここで正直に書き、この調査では、表示速度とAI検索での引用数の関係を測っていません。上の3つはGoogleが利用者の体験の指標として定めたもので、AIの回答に引用されるかどうかの指標ではありません。速いほど引用される、という関係を示す実測を持っていません。それでも速度を扱うのは、7.1節の描画の問題と地続きだからであり、本文をJavaScriptで後から差し込む作りは、LCPを悪くしやすく、同時に素の取得で読めない状態を作り、この2つは別の症状に見えて原因が同じことが多い。

公開前の点検表。満たしたかどうかで判定できる形にする

10項目を、はいかいいえで判定する

制作会社への指示書としてそのまま渡せる形にし、各項目は、程度ではなく、はいかいいえで答えられる書き方にそろえてある。並べ方の根拠を開示し、上から順に、満たしていないときの被害が大きい順と考えられます。被害の大きさは、その項目が閉じていたときに以降の項目が無意味になるかどうかで判定し、着手の手間は順位に入れていません。4章のとおり構造化データは無くても引用が取れている実測があるため、robots.txtより下に置いてある。

確認項目満たした状態確認に使う道具満たしていないときに何が起きるか
1robots.txtがサイト全体を拒否していないUser-agent: * の下が Disallow: / の1行だけ、という状態になっていない/robots.txt を開く全てのクローラーが取得しません。以降の項目が全て無意味になります
2AIのクローラーを意図せず拒否していない3.1節の名前が Disallow の対象になっていません。または拒否が意図した判断です/robots.txt を開く検索結果には出るが、AIの回答の根拠に使われない
3公開するページにnoindexが付いていないソースとHTTPヘッダーに noindex が無いソース表示、URL検査索引に入らず、検索でも引用でも出ない
4canonicalが自分自身を指しているrel="canonical" の値がそのページ自身のURLであるソース表示別のURLが代表として扱われる
5素のHTMLに本文が入っているソースを開いて本文の一文を検索すると見つかるソース表示JavaScriptを実行しないクローラーから読めない
6サイトマップに入っていて、制限も守っているそのURLが載っており、50MB以下かつ5万URL以下、UTF-8、絶対URLサイトマップを開く発見が遅れる。制限を超えると途中から読まれない
7公開日と更新日がページに見えている記事の冒頭または末尾に、どちらも文字として出ている記事を開くいつの情報かが読者にも機械にも伝わらない
8著者が個人名で書かれている組織名ではなく、個人の氏名が出ている記事を開く誰が書いたかが伝わらない
9記事の型の構造化データが入り、エラーが0件であるArticle・BlogPosting・NewsArticleのいずれかが検出され、重大なエラーが0件リッチリザルトテスト何のページかが機械に伝わらない
10構造化データの内容が本文に見えている書いた問答・著者・日付が本文にも表示されている記事を開いて突き合わせるGoogleのガイドライン違反になり、手動による対策の対象になりうる

横にスクロールできます

この記事自身の状態を書いておく

点検表を出す以上、この記事自身がどうなっているかを書き、この調査が2026年8月8日に公開HTMLを取得して数えた結果であり、構造化データは9つの型が実装されています。BlogPosting、FAQPage、Person、BreadcrumbList、WebPage、Organization、WebSite、ImageObject、SpeakableSpecificationです。項目8と9は満たしています。

満たしていない項目も書き、項目7について、この記事の公開ページは公開日と更新日がどちらも2026年7月28日で、公開から一度も更新していない状態でした。日付は出ているので判定は「はい」だが、実態としては更新の運用が回っていません。この版でその状態を直し、同じ点検で、GMO AI検索ラボのカテゴリー記事10本のうち2本は著者が組織名になっており、項目8を満たしていなかった。点検表は、他社に渡す前に自分に当てるものです。

よくある質問

構造化データを入れれば引用されるようになるか

なりません。この調査の競合引用分析では、構造化データを1つも実装していないprotea-inc.co.jpが473引用を得ており、17種類の型を実装しているqueue-tech.jpは374引用でした。対象は2026年7月8日から8月7日、回答2,168件です。構造化データは、何のページで誰が書いたかを取り違えられなくするためのものです。取り違えを減らす効果と、引用される回数を増やす効果は別で、後者をこの調査では測っていません。

llms.txtは置くべきか

この調査では、置くべきとも置かないべきとも言えません。設置していた4社(geo-code.co.jp、bakuri.co.jp、ai-search.techsuite.co.jp、queue-tech.jp)の引用数が多いことは観測したが、この4社は全員が比較記事も持っており、どちらが関わっているかを分けられていません。またllms.txtは、llmstxt.org自身が標準化の提案と書いている段階のもので、確定した標準ではない(2026年8月8日確認)。置くと決めるなら、更新の担当と頻度を同時に決めてほしい。

AIクローラーは止めるべきか

止めるかどうかは、検索用と学習用を分けて決められる。OpenAIは公式に、OAI-SearchBotを許可してChatGPTの検索結果に出しつつ、GPTBotを拒否して学習には使わせない組み合わせができると書いている(2026年8月8日確認)。Googleも、Google-Extendedを拒否してもGoogle検索への掲載とランキングには影響しないと明記しています。まず自社のrobots.txtを開いて、いまどちらの状態なのかを確かめてほしい。

用語集

用語説明
テクニカルSEOサイトの技術的な作りを整えて、機械がページを取得し内容を読み取れる状態にする取り組みを指す
製品トークンrobots.txtの中でだけ使う名前で、HTTPリクエストでは名乗らないものを指します。Google-Extendedがこれに当たります
robots.txtサイトのルートに置き、どのURLへのアクセスを許すかをクローラーに伝えるファイルを指す
noindexそのページを検索結果に出さないよう指示する記述を指します。メタタグかHTTPヘッダーで書きます
canonical内容が同じ複数のURLがあるとき、どれを代表とするかを指定する記述を指す
サイトマップサイトにどのURLがあるかを列挙して機械に渡すファイルを指す
schema.orgページの意味を機械が読める形で示すための共通の語彙を指す
JSON-LDschema.orgの語彙をJSONの形でHTMLに埋め込む記法を指す
llms.txtAIに読ませたい情報の案内をMarkdownで書き、サイトのルートに置こうという提案、およびそのファイルを指す
レンダリング取得したHTMLとJavaScriptを実行して、実際に表示される状態を作る処理を指す
Core Web Vitals読み込み・操作への反応・表示の安定の3つを測る、Googleが定めた利用者体験の指標を指す
引用AIの回答に、根拠となる出典URLとして挙がっている状態を指す

データの出どころ

この記事の数字は、次の2つのこの調査側の一次データと、末尾の仕様側の一次情報から取っており、原典に無い数字は書いていません。このほかに自社の記事を自分で点検した結果も使っているが、それは一次データとは別に書いた。

一次データ1。GMO NIKKO 競合引用分析(2026年8月)

項目内容
該当ファイルdocs/research/ai-citation-gap-2026-08.md
元データ回答ログ2,168行、引用URL2万4,200行、引用ドメインのユニーク数1,737件
対象期間と問い2026年7月8日から8月7日。AIO対策会社の選定に関する17種
対象モデル5種(Claude 433/AI Mode 435/Gemini 434/ChatGPT 434/AI Overview 432)
使った数値11ページの構造とJSON-LDの型、ドメイン単位とページ単位の引用数、llms.txt設置4社、aspicjapan.orgのrobots.txtが404であること
使わなかったものドメインレーティングと引用数の対応表。AIO対策のカテゴリー記事に譲った

一次データ2。GMO AI検索ラボ プロンプト定点観測

項目内容
保管場所Google BigQuery gmo-nk-ai-search-lab.ai_query_output.query_answer
該当ファイルdocs/research/prompt-observation-report-2026-07.md
対象期間と範囲2026年5月19日から7月30日。100問を毎日、本運用6モデルへ投げた総回答2万9,582件。内訳は5月が試験運用の7件、6月が1万2,435件、7月が1万7,140件
使った数値ChatGPT(検索あり)の出典率98.8%、Google AI Modeの出典率95.2%と1回答あたり出典数12.9件

一次データではないもの。この調査自身の記事10本の点検

これは一次データの一覧に入れていません。外部を対象に集めた観測ではなく、この調査が自分の記事を自分で点検した結果だからであり、それでも数字を使っているので、何をどう数えたかをここに書いておきます。2026年8月8日に、この調査のカテゴリー記事10本の公開中のHTMLを取得し、本文文字数・見出し数・表の数・JSON-LDの型・公開日と更新日・著者の表記を数えた。記録は portal/src/data/article-audit.ts にある。この点検から使った数字は、この記事の公開ページに9つの型が実装されていること、10本とも公開日と更新日が同じであること、10本のうち2本の著者が組織名であることの3つです。なお、検索ボリューム1,100は外部のキーワード調査ツールで計測した値で、portal/src/data/kw-sheet.ts のC7行に記録してある。この調査が自分で測った数字ではありません。

仕様側の一次情報

仕様に関する記述は、schema.org、Google検索セントラルの開発者向けドキュメント(構造化データの仕組み、記事の構造化データ、一般的なクローラーの一覧、robots.txt の概要、サイトマップの作成と送信、JavaScript SEO の基本)、OpenAI・Anthropic・Perplexityの各公式クローラー説明、llmstxt.org、web.devから取っています。すべて2026年8月8日に取得して確認し、URLは、その記述を使った節の本文にそのまま書いてあり、ここで一覧に写し直すと原典と二重管理になるため、まとめ直していません。

1.1で引いた技術的な要件3つだけは、あとから足したものなので日付が違います。出どころはGoogle 検索セントラル「Google 検索の技術要件」(https://developers.google.com/search/docs/essentials/technical )で、2026年8月16日に確認した。このページに「テクニカルSEO」という語が使われていないことも、同じ日に確かめています。

確認できていないこと

  • llms.txtの効果を確かめられていません。設置4社の引用数が多いことは観測したが、4社とも比較記事を持っており、どちらが関わっているかを分けられていません。そもそも設置の有無を調べたのは引用ドメイン1,737件の全部ではなく、引用上位の競合として取得した比較記事12本の各社だけです。主要なAI検索が他社のllms.txtを読むかどうかも確認できていません。
  • 構造化データの有無で引用数がどう変わるかを測っていません。4章で示したのは11ページの実装と引用数の対応で、入れる前と後を比べた観測ではありません。
  • 11ページという母数は少ない。しかもAIO対策会社の選定という1つのテーマに限った問いから集めたページです。他の業種で同じ形になるかは分かりません。
  • 表示速度とAI検索での引用の関係を測っていません。7章のCore Web Vitalsのしきい値は、Googleが利用者体験の指標として定めたもので、引用の指標ではありません。
  • white-link.comのドメイン単位の引用数を持っていません。引用ドメイン上位25位の一覧に入っていないためです。推定して埋めていません。
  • 仕様は変わります。この記事の仕様に関する記述は、すべて2026年8月8日時点で公式ドキュメントを取得して確認したものです。各社は予告なくクローラーの名前や扱いを変える。

著者と更新履歴

項目内容
発行GMO AI検索ラボ
運営GMO NIKKO
執筆担当者(未定。コラム管理表 portal/src/data/kw-sheet.ts のC7行の author が「未割当」のため。公開前に埋める)
監修者(未定。監修体制を確認できていないため空欄とする。公開前に埋める)
初出2026年8月8日(この版が書き直しの初稿)
最終更新2026年8月17日(メタ情報の分量を数え直し、検索ボリュームが外部のキーワード調査ツールの推計であることを書き足した)
更新の四半期。仕様の変更が起点になるため、定点観測の月次とは連動しません。2章の実装比較は、引用の集計を取り直したときに更新する

公開前に埋める必要がある項目:執筆担当者の氏名、監修者の氏名と肩書き、著者プロフィールページのURL、ロゴ画像のURL。いずれも確認できていないため、この記事および下のJSON-LDでは空欄にしてあり、推測で埋めていません。

まとめ

この記事の数字は、GMO AI検索ラボが自分で集めた実測であり、母数と期間は「データの出どころ」に書いており、数字は毎月測り直しているので、引用するときは集計期間を添えてください。

関連する出典

この記事の根拠にした一次情報(=発表元がみずから出している資料)です。

  1. Google 検索セントラル(クロール・インデックス・構造化データの公式ガイド)(新しいタブで開く)https://developers.google.com/search
  2. schema.org(構造化データの語彙の公式サイト)(新しいタブで開く)https://schema.org
  3. llms.txt(提案仕様の公式サイト)(新しいタブで開く)https://llmstxt.org
  4. web.dev(Core Web Vitals など表示性能の公式資料)(新しいタブで開く)https://web.dev/vitals

この記事に出てくる用語

構造化データ
ページの意味を機械可読にする印づけ。schema.org の語彙をJSON-LDで書き、AIや検索の理解・引用を助けます。
schema.org
構造化データの共通語彙。Article・FAQ・Breadcrumb・Organizationなど数百の型で、ページの意味を機械可読にします。
llms.txt
サイトルートに置き、LLM(=大規模言語モデル、生成AIの頭脳)サイトの要点と主要ページを案内する提案仕様。robots.txt が「入っていいか」を示すのに対し、llms.txt は「ここを読め」と案内します。まだ提案段階で普及は限定的。
robots.txt
サイト直下に置き、クローラーに取得してよい範囲を伝える取り決めファイル。強制力はなく準拠は任意。
クローラー(クロール)
リンクをたどってページを次々に取得して回る巡回プログラム(クローラー)と、その巡回作業(クロール)。

執筆者紹介

上席研究員

中村 仁紀

「GMO AI最適化ブースト」のAIO/GEOコンサルタント 兼 GMO AI検索ラボ 上席研究員。生成AIに引用・推奨されるためのウェブサイトの最適化を支援します。

プロフィールを見る
READ MORE

このテーマの記事を読む

RELATED

CONTACT US

お問い合わせ

調査・取材・共同研究のご相談を承ります。

FOLLOW US

最新情報をチェック

新着のレポートと研究員コラムをお知らせします。

調査レポート日本のAI検索 実態レポート 第1回:通信キャリア編