llms.txt (えるえる えむえすてきすと)は、 ウェブサイトの ルート (=ドメイン直下の 最上位。 例 https://example.com/llms.txt)に 一枚置く プレーンテキストの ファイルで、 LLM (Large Language Model=大量の 文章で 学習した 生成AIの 中核モデル。 ChatGPTや Claudeの 頭脳に あたる) へ 向けて、 サイトの 概要・重要ページ・補足文書への リンクを Markdown (= 「#」で 見出し、 「-」で リストを 表す軽量な 記述書式)で 整理して 伝える ための 提案仕様です。 2024年9月に、 機械学習の 実務家と して 知られる Jeremy Howard (ジェレミー・ハワード)が 提唱しました。 名前は robots.txt や sitemap.xml と いった、 サイトの ルートに 決まった 名前で 置く 慣行に なぞらえて 付けられています。
背景には、 LLMが 抱える 構造的な 制約が あります。 LLMは コンテキストウィンドウ (=一度に 読み込める 文章量の 上限。 人間で いう 短期記憶の 容量に あたる)が 限られ、 多くの ウェブサイトを 丸ごと 読み込むことができません。 加えて 実際の HTML (=ウェブページを 構成する 元の コード)には、 ナビゲーション、 広告、 JavaScript (=ページを 動かすプログラム)が 混在し、 本文だけを 正確に 抜き出すのは 難しく 誤りも 生じやすいです。 llms.txt は、 この 「読み取りづらさ」を サイト側が あらかじめ整理して 解消し、 AIが 要点へ 最短で 到達できるように する 発想の 仕組みです。 人間が 図書館で 司書に 「この 分野の 要点は どの 棚か」を 尋ねるように、 AIに 対して サイト側が 案内役を 務める、と 捉えると 理解しやすいです。
公式仕様 (llmstxt.org)は、 この 案内を 「Markdownと いう、 人間も LLMも 読める 書式」で 書く ことを 選んでいます。 XML (=タグで 構造を 厳密に 表す機械 向けの 書式)のような 古典的な 構造化フォーマットではなく Markdownを 採る 理由は、 多くの llms.txt が 最終的に LLMや AIエージェント (=人の 代わりに 手順を 実行する 自律的な AI)に 読まれる 前提だからです。 同時に、 決まった 順序と 要素を 持つため、 パーサー (=機械的に 解析する プログラム)や 正規表現でも 安定して 処理できるよう 設計されています。
llms.txt は sitemap.xml (=検索エンジン向けの 全ページ 一覧)とも robots.txt とも 役割が 異なります。 sitemap は 「人間向けページの 全リスト」、 llms.txt は 「LLM向けに 厳選した 要約と 入口」。 片方が 他方の 代わりには なりません。
AI検索 (=生成AIが 検索結果を 要約して 答える 方式。 Googleの AI Overviewsや Perplexityなど)では、 AIが サイト本文を 正確に 読み取れるか どうかが、 引用・ 参照されるかを 左右します。 本文が 構造的に 整理されていないと、 AIが 要点を 取り違えたり、 そも そも 参照候補から 外れたりします。 llms.txt は、 サイト運営者が 「AIに 何を、どの 順で 読ませたいか」を 明示できる 数少ない 手段の ひとつであり、 AIO (AI Optimization=AIに 引用されやすく する 最適化。 当ラボの 群Aの 主題)の 文脈で 先行的に 注目されています。
とりわけ効果が 見込まれるのは 「推論時 (インファレンス)」の 利用、 すなわち利用者が AIに 特定の トピックを 質問し、 AIが その場で 外部情報を 参照して 答えを 組み立てる 場面です。 公式も、 llms.txt は 主に 学習データへの 取り込み (=モデルを 鍛える ための 一括吸収)ではなく、 利用者が 質問した 瞬間の 参照に 役立つと 説明しています。 たとえば 開発者が コーディング用の AIに 「この ライブラリの 使い方を 教えて」と 尋ねた とき、 その ライブラリの ドキュメントが llms.txt で 整理されていれば、 AIは 要点に 素早く 到達できます。
ただし位置づけには 冷静さが 要ります。 llms.txt は あくまで 「案内状」であって 「命令」では ありません。 AI側が それを 読みに 来る 保証も、 内容を 優先する 保証も、 現時点では 規格と して 定められていません。 robots.txt が 「クロール (=自動巡回)して よいか」の 可否を 伝える 確立した 標準であるのに 対し、 llms.txt は 「読むなら ここが 要点」と 案内する 任意の 提案であり、 両者は 目的も 強制力も 別物です。 過度な 期待は 禁物ですが、 対応する ツールが 増えれば 先行者利益を 得られる 余地は ある、と いう 位置づけが 実態に 近いです。
公式仕様は、 Markdownで 次の 順に 並べる ことを 定めています。 順序と 要素が 固定されている ため、 機械的な 解析にも 耐えます。
H1見出し (= 「# サイト名」の 形の 最上位見出し) :プロジェクトまたは サイトの 名前。 唯一の 必須項目で、 これだけは 省略できません。 ブロック引用 (= 「>」で 始まる 引用ブロック) :サイトを 理解するのに 必要な 要点を 短く まとめた 概要。 以降を 読み解く 前提情報を 凝縮して 置きます。 見出しを 含まない 任意の セクション:文章やリストで、 ファイルの 読み方や 補足情報を 説明します。 ここには 見出し (H2など)を 置かない 決まりに なっています。 H2見出し (= 「## セクション名」の 第二階層見出し)で 区切られた 「ファイル一覧」 :詳細情報の ある URLを、リンクと 短い 説明の リストで 列挙します。 ゼロ個でも 複数でも 構いません。 「Optional (任意)」と いう 名の H2セクション:省略しても 本質が 損なわれない 二次的なリンク群を 置く 特別な 区画。 処理側が 「余裕が あれば 読む」 対象と して 扱えます。 あわせて 公式は、 AIに 読ませたい ページごとに、 同じ URLの 末尾へ 「.md」を 付けた クリーンな Markdown版 (例 /docs/guide.html に 対し /docs/guide.html.md)を 用意する ことも 推奨しています。 ファイル名の ない URLには index.html.md を 付けます。 これに より AIは、 装飾や スクリプトを 取り除いた本文だけを 確実に 取得できます。 リファレンス実装である FastHTML (=Python向けの ウェブ開発フレームワーク)は、 llms.txt を 展開して 複数の Markdown文書へ まとめ、 Claudeのような 大きな 文脈を 扱う LLMに 適した XML構造で 提供する、と いった 応用例も 示しています。
robots.txt と llms.txt の 役割の 違い。 可否の 指示 対 案内、と いう 対比が 要点。 項目 robots.txt llms.txt 主な 目的 クローラーの 立ち入り可否の 指示 LLMへの 要点・重要ページの 案内 伝える こと 「入って いいか /だめか」 「読むなら ここが 要点」 書式 独自の 指示行 (Disallow等) Markdown (人間も AIも 読める) 標準化の 度合い 広く 合意された 事実上の 標準 提案段階・採用は 限定的 主に 効く 場面 クロール時 (巡回の 可否) 推論時 (利用者が 質問した 瞬間の 参照) 強制力 慣行と して 広く 尊重される 読む保証・優先保証は ない
横にスクロールできます
提唱者らが 関わる FastHTML は、 自社ドキュメントで llms.txt と .md 版ページの 両方を 実装し、 リファレンス実装と して 公開しています。 開発者向けドキュメントサイトや 一部の SaaS (=クラウド型で 提供される ソフトウェア)で 採用例が 増えつつある 一方、 一般的な 企業サイトや メディアでの 導入は まだ 少数です。 この 「採用が 限定的」と いう 事実こそ、 現時点の llms.txt を 語るうえで 最も 重要な 前提に なります。
主に 「推論時」に 効く :利用者が AIに 特定トピックを 質問し、 AIが その場で 参照する 場面での 活用が 想定されています (学習データへの 一括 取り込みが 主目的では ありません)。 robots.txt を 補完しうる :許可した 内容に 文脈を 添える 形で 共存できると 公式は 説明します。 置き換えではなく 併存の 関係に あります。 構造化データ (=schema.org等の 機械 可読タグ) への 参照も 置け、 AIが 情報の 解釈を 深める 助けに なりえます。 sitemap.xml の 代わりには ならない :sitemap は 人間向けページの 全リストで、 AI向けの 整理版本文や 外部リンクを 含まないため、 目的が 異なります。 採用が 限定的である ことは 弱点であると 同時に、 先行の 機会でもあります。 多くの サイトが まだ 設置していない 今の うちに、 公式仕様どおりに 整えて 置いておけば、 対応する AIツールや エージェントが 増えた ときに 相対的な 優位を 取りやすいです。 ただし それは 「対応が 広がる」と いう 将来の 前提に 賭ける 投資であり、 確実な リターンが 約束されているわけではない ——この 点を 踏まえたうえで、 低コストで 用意できる 範囲から 始めるのが 堅実な 向き合い方に なります。
最大の 誤解は 「llms.txt を 置けば 必ず AIに 読まれ、 引用が 増える」と いう ものです。 これは 事実では ありません。 主要AI事業者が 公式に 対応を 表明した 確立標準ではなく、 読みに 来る 保証も、 内容を 優先する 保証も ありません。 過度な 期待は 禁物です。
第二の 注意点は robots.txt との 混同です。 llms.txt に クロール禁止のような 「アクセス制御」の 力は ありません。 立ち入りを 止めたいなら robots.txt や WAF (=不正アクセスを 遮断する 防御装置)で 行い、 llms.txt は 「案内」の 役割に 徹します。 両者を 取り違えると、 止めたい ものが 止まらない 事故に つながります。
第三に、 内容の 正確さと 最新性を 保つ責任は サイト側に あります。 llms.txt に 古い 情報や 誤った 要点を 書けば、 それを 読んだ AIが 誤って 要約する 遠因に なりえます。 設置して 放置ではなく、本体 サイトの 更新に 合わせて 保守する 前提で 扱います。
まず費用対効果を 見極める :提案段階の 仕様である 事実を 踏まえ、 「対応AIが 増えた ときに 先行者利益を 取りに 行く」投資と して 位置づけます。 義務では ありません。 サイトの 核と なる 要点を 棚卸しする :会社概要・主要サービス・ 信頼性の 根拠 (実績・出典)など、 AIに 最初に 伝えたい 情報を 選びます。 公式仕様 (llmstxt.org) どおりに Markdownで 書く :H1の サイト名 (必須)、 要約の ブロック引用、 補足セクション、 H2区切りの ファイル一覧、 Optional区画の 順を 守ります。 重要ページに .md 版を 用意する (可能なら) :装飾や スクリプトを 除いた本文を AIが 確実に 取得できるようにします。 ルートに /llms.txt と して 設置し、 リンク 切れや 文字化けが ないか 確認します。 相対リンクではなく 解決可能な URLを 書きます。 本体 サイトの 更新に 合わせて 保守する :情報が 古びないよう、 要点と リンクを 定期的に 見直します。 効果を 過信せず観測する :AI検索での 引用・言及の 変化を サーバーログ (=アクセス記録)や AI由来の 流入で 継続的に 測り、 投資判断を 見直します。 llms.txt を 置けば AIに 必ず 引用されますか。 いいえ。 llms.txt は 提案段階の 仕様で、 主要AI事業者が 公式に 読み取りを 保証してはいません。 置いても 読まれる 保証・優先される 保証は なく、 「引用が 確実に 増える」 ものでは ありません。 将来性を 見込んだ 任意の 先行投資と 理解してください。
robots.txt が あれば llms.txt は 不要ですか。 目的が 別なので 代替には なりません。 robots.txt は 「クロールして よいか」と いう 可否を 伝える 標準、 llms.txt は 「読むなら ここが 要点」と 案内する 提案です。 アクセスを 止めたいなら robots.txt、 要点を 案内したいなら llms.txt と 使い分けます。 両者は 共存できます。
どんな サイトが 導入する 価値が ありますか。 情報量が 多く 構造が 複雑な サイト、 とりわけ開発者向けドキュメントや 製品リファレンスで 効果が 見込まれています。 AIが 本文を 取り 違えやすい サイトほど、 要点を 先回りで 整理する 価値が 相対的に 高くなります。
sitemap.xml が あれば 十分では。 役割が 違います。 sitemap は 人間向けページの 全リストで、 AI向けの 整理版本文や 外部リンクは 含みません。 llms.txt は 「LLM向けに 厳選した 要約と 入口」であり、 両者は 補完関係に あります。