GLOSSARY
AIボットの 3分類
AI関連の
AIボットの 3分類とは 何か
AI検索の
この
なぜ重要か (AI検索での 位置づけ)
AI検索の
3分類の 一覧 (機能・robots.txt・AI検索での 意味)
| 分類 | 機能 | robots.txtの | AI検索での | 代表ボット |
|---|---|---|---|---|
| 学習・収集系 | モデル訓練用/第三者提供用の | 尊重する | 訓練・素材の | GPTBot / ClaudeBot / Bytespider / Diffbot / Timpibot / ImagesiftBot |
| 回答・検索系 | AIの | 尊重する | 成果に | OAI-SearchBot / PerplexityBot / YouBot |
| user-triggered フェッチャー | ユーザー指示で | 必ずしも | ユーザー個別の | ChatGPT-User / Perplexity-User / Diffbot-User |
横にスクロールできます
代表ボット一覧 (所有者・種別・robots尊重)
| ボット | 所有者 | 分類 | robots尊重 | 一言メモ |
|---|---|---|---|---|
| GPTBot | OpenAI | 学習・収集系 | 尊重 | ChatGPTの |
| OAI-SearchBot | OpenAI | 回答・検索系 | 尊重 | ChatGPTの |
| ChatGPT-User | OpenAI | user-triggered | 必ずしも | ユーザー指示で |
| ClaudeBot | Anthropic | 学習・収集系 | 尊重 | Claudeの |
| PerplexityBot | Perplexity | 回答・検索系 | 尊重 | 回答の |
| Perplexity-User | Perplexity | user-triggered | 必ずしも | ユーザー質問時の |
| Bytespider | ByteDance | 学習・収集系 | 尊重が | アクセス量が |
| YouBot | You.com | 回答・検索系寄り | 尊重 | 検索・回答インデックスの |
| Diffbot | Diffbot | 学習・収集系 | 尊重 | Webを |
| Timpibot | Timpi | 学習・収集系 | 検証方 | 分散型インデックス。 |
| ImagesiftBot | Hive | 学習・収集系 | 尊重 | 公開画像を |
横にスクロールできます
この
仕組み (UAと robots.txtに よる 見分け方)
- UAで
当たりを 付ける :アクセスログの UA文字列に 含まれる ボット名 (GPTBot / OAI-SearchBot / ClaudeBot / PerplexityBot 等)で、 所有者と 分類の 見当を つけます。 - 分類で
robots.txtの 効き方を 読む:学習・収集系と 回答・検索系は 尊重する 前提。 user-triggeredフェッチャーは 必ずしも 尊重しないと 理解します。 - IPレンジ・逆引きで
裏を 取る :主要ボットは 所有者が 公式IPレンジを 機械可読ファイル (bots.json / searchbot.json 等)で 公開しています。 UA名の 一致に 加え、 アクセス元IPが 公式範囲か (または 逆引きが 公式ドメインに 解決するか)で 本物を 確かめ、 詐称を 排除します。 - 成果は
分類で 分けて 測る :学習・収集系の 量は 成果では ありません。 回答・検索系の 露出や 実際の 回答出典を、 学習系と 混ぜずに 集計します。
具体例・ データ
- 学習・収集系の
例:GPTBot (OpenAIの 訓練収集)、 ClaudeBot (Anthropicの 訓練収集)、 Bytespider (ByteDanceの 訓練収集・量が 突出しやすい)、 Diffbot/Timpibot/ImagesiftBot (第三者提供・分散型・画像収集)。 - 回答・検索系の
例:OAI-SearchBot (ChatGPTの 検索表示候補の 索引化)、 PerplexityBot (回答出典の 索引化)、 YouBot (You.comの 検索・回答インデックス)。 - user-triggeredフェッチャーの
例:ChatGPT-User、 Perplexity-User、 Diffbot-User (いずれも ユーザー指示で その 場取得。 robots.txtの 一般ルールを 必ずしも 尊重しない)。 - 詐称対策の
実例:主要各社は IPレンジ (例 searchbot.json、 bots.json)を 公開しており、 UA照合+IP照合の 二段で 本物を 確認するのが 実務の 定石。
よく ある 誤解・ 注意点
実務での 扱い方
- ログを
3分類で 仕分ける :まずアクセスログの ボットを、 学習・収集系/回答・検索系/user-triggeredフェッチャーの 3つに 分けて 集計します。 合算しません。 - 方
針を 分類ごとに 決める :学習・収集系は 「訓練利用を 許すか 拒否するか」、 回答・検索系は 「露出を 取りに 行くか保護を 優先するか」を、 それぞれ別に 判断します。 - robots.txtを
分類の 理解に 沿って 書く :拒否したい 学習系・回答系は UAごとに `Disallow` を 明記します。 user-triggeredフェッチャーは robots.txtだけでは 止まらない 前提で 設計します。 - IPで
裏を 取る :重要な 遮断・許可は、 UA名でなく 公式IPレンジ照合・逆引きで 詐称を 排除してから 決めます。 - 成果は
回答系で 測る :AI検索の 可視化は、 学習系の 量ではなく、 回答・検索系の 露出と 実際の 回答出典の モニタリングで 評価します。
よく ある 質問 (FAQ)
なぜ 「名前」でなく 「機能」で 分類するのですか?
同じ
「クロールされた ≠引用された」とは どういう 意味ですか?
ボットに
UAが 本物か どうかは、 どう 確かめますか?
UA名は
無名の ボットまで 把握する 必要が ありますか?
あります。
user-triggeredフェッチャーは、 なぜrobots.txtで 止まらない ことがあるのですか?
ユーザー本人が
関連する出典
この記事の根拠にした一次情報(=発表元がみずから出している資料)です。
関連用語
AIクローラー
えーあいくろーらー生成AI各社がWebページを自動取得するボットの総称。学習・収集系と回答・検索系に大別されます。
ClaudeBot
くろーどぼっとAnthropic(対話型AI「Claude」を開発する企業)がモデル訓練用データを集めるために公開する学習・収集系クローラー。
Bytespider
ばいとすぱいだーByteDance(TikTokを運営する中国企業)が、AIモデル訓練用に大規模なデータを集める学習・収集系クローラー。アクセス量が非常に多いです。
PerplexityBot
ぱーぷれきしてぃぼっとPerplexity(出典付きで回答するAI検索エンジンを運営する企業)が、回答の出典として表示する候補をインデックスするための検索系クローラー。
robots.txt
ろぼっつてきすとサイト直下に置き、クローラーに取得してよい範囲を伝える取り決めファイル。強制力はなく準拠は任意。
ユーザーエージェント
ゆーざーえーじぇんとHTTPリクエストでソフトが自己申告する名前。ブラウザとボットの見分けに使うが、詐称も可能。
AI検索
エーアイけんさく生成AIを使って答えを導く検索の総称。
OAI-SearchBot
おーえーあいさーちぼっとOpenAIの回答・検索系クローラー。ChatGPTの検索機能で参照先(出典)を表示するために使います。学習用GPTBotとは目的が別で、AI検索の可視性ではここが最重要。ここに取得・索引されることが「ChatGPTの回答に載る」に最も近いです。
GPTBot
じーぴーてぃーぼっとOpenAIが公開・運用する学習・収集系クローラー。将来のモデル訓練データにするために公開Webを巡回します。ChatGPT検索の回答表示用OAI-SearchBotや、ユーザー起点取得のChatGPT-Userとは目的が別。
Timpibot
てぃんぴぼっとTimpi(ティンピ=独立したノード運営者が分散して検索インデックスを作る分散型プロジェクト)のクローラー。集めたインデックスはLLMの訓練にも使われ得る学習・収集系。
