ImagesiftBotは、 Hiveの 製品ImageSiftの ために 公開Webを 巡回する 収集ボットです。 Hiveは、 画像・動画・テキストの 内容理解、 AI生成コンテンツの 検出、 人物・物体・シーンの 検出、 検索、 生成と いった 一連の AIモデルを 提供する 企業で、 ImageSiftは その 「Webインテリジェンス」側の 製品群に あたります。 ImageSift公式の 説明では、 ImageSiftBotは 「Webインテリジェンス製品群を 支える ために、 公開されている 画像を インターネットから 収集する (scrape publicly available images)」 クローラーだと 明記されています。 つまり 狙いは 主に 公開画像と その 周辺情報の 収集で、 集めた データは Hive/ImageSiftの 解析・検索・製品提供に 用いられます。
サイト側から 見ると、 ImagesiftBotの アクセスは UA文字列に 「ImagesiftBot」を 含む形で 届きます。 ImageSift公式が 示すUAは `Mozilla/5.0 (compatible; ImagesiftBot; +imagesift.com)` で、 末尾に 説明先ドメインを 添える 形式です (表記は 文中で 「ImageSiftBot」と 大文字混じりで 書かれる こともありますが、 UAの 製品トークンは 「ImagesiftBot」です)。 第三者観測では、 ImagesiftBotの 巡回は “watchlist (監視リスト) 型”——顧客が 監視対象に 指定した ページ (価格・商品一覧・ お知らせなど)に、 1時間 おきから 週次まで 様々な 頻度で 繰り返しアクセスし、 リスト外の サイトには 一切来ない こともある ——と 説明されます。 この 点は、 サイト全体を 無差別に 舐める 大量巡回とは 性質が 異なります。
ImagesiftBotは、 テキスト主体の AI検索最適化の 議論では 見落と されがちですが、 画像を 持つサイト (EC〈電子商取引〉・メディア・ 不動産・求人など)に とっては 無視できない 収集経路です。 ただし、 ここでも 「取得された =AIの 回答に 引用された」では ありません。 ImagesiftBotは 学習・収集系で、 集めた 画像や ページは Hive/ImageSiftの 解析・検索・製品に 使われる 素材であって、 特定の 対話型AIの 回答画面に 自社が 出典と して 並ぶこととは 別系統です。 当ラボが 引用計測で 学習・収集系と 回答・検索系を 分けているのは、 画像収集ボットの アクセス量を 「AI検索での 成果」と 読み違えないためでもあります。
信頼性フラグ:ImagesiftBotの 「所有者=Hive」 「公開画像の 収集」と いう 用途は ImageSift公式 (imagesift.com/about)が 一次情報です。 一方、 巡回スケジュール (watchlist型・頻度)などの 挙動は 第三者観測 (Dark Visitors/現 Known Agents)に 基づく ため、 時期や 実装で 変わり得ます。 用途は 公式で、 挙動は 観測、 と 切り分けて 理解してください。
画像収集系。 取得は 製品の 素材に なるだけで、 AIの 回答引用とは 別系統。 項目 内容 所有者 Hive (画像・動画・テキストを 解析する AIモデルを 提供する 米企業)。 製品名=ImageSift 3分類での 位置 学習・収集系 (公開画像を 中心に 収集し、 製品・解析に 供給) 主目的 Webインテリジェンス製品群の ための 公開画像の 収集 UAの 例 `Mozilla/5.0 (compatible; ImagesiftBot; +imagesift.com)` (製品トークン=ImagesiftBot) robots.txtの 尊重 尊重する 前提 (許可・拒否を 制御できる) AI検索での 意味 Hive/ImageSiftの 解析・製品の 素材に なり得る。 回答引用の 証拠ではない
robots.txtで 拒否するなら、 `User-agent: ImagesiftBot` の 行に 続けて `Disallow: /` を 書けば サイト全体を 対象に できます。 画像ディレクトリだけ 守りたい 場合は、 `/` を 対象パス (例:`/images/`)に 置き換えます。 画像を 持つサイトでは、 「テキストは 学習させて よいが 画像は 収集を 拒否したい」と いった 部 分的な 方 針を 取る ことも あり、 その 場合は パス単位で 細かく 制御します。 ただしrobots.txtは 紳士協定で あり強制力は ないため、 確実に 止めたい 画像資産が あるなら、 ファイアウォールや WAF (=Webアプリを 守る 防御層)での IP・レート遮断や、 画像への アクセス制御を 併用します。
所有者・ 用途:ImagesiftBotは Hiveの 製品ImageSiftの クローラーで、 公開画像を Webから 収集します (ImageSift公式の 記述)。 公式UAの 例:`Mozilla/5.0 (compatible; ImagesiftBot; +imagesift.com)`。 UAの 製品トークンは 「ImagesiftBot」。 robots.txtでの 拒否例:`User-agent: ImagesiftBot` の 行に `Disallow: /` を 続けると サイト全体を 拒否できます (画像だけなら 対象パスを 指定)。 観測される 挙動:顧客の 監視リストに ある ページ (価格・商品・ お知らせ等)に 繰り返しアクセスし、 リスト外には 来ない こともあります (第三者観測)。 ImagesiftBotを 理解するには、 運営元Hiveの 事業を 押さえるのが 近道です。 Hiveは、 画像・動画・音声・テキストと いった 「非構造データ (=表形式に 整っていない 生の コンテンツ)」を 機械に 理解させる AIモデルを、 API (=外部 プログラムから 呼び出せる 窓口)と して 企業に 提供する 会社です。 代表的な 用途が コンテンツモデレーション (=投稿画像・動画から 暴力・成人向け・違反コンテンツを 自動検出し、 プラットフォームの 安全を 守る)で、 SNSや マーケットプレイスの 裏側で 広く 使われています。 ImageSiftは、 その Hiveが 公開Web上の 画像を 対象に 提供する 「Webインテリジェンス (=Web上の 公開情報を 解析して 知見を 得る)」 製品群で、 逆画像検索 (=ある 画像が Webの どこに 出ているかを 探す)などを 支えます。 ImagesiftBotは、 この 製品群の ために 公開画像を 収集する 足回りに あたります。
この 背景から 分かるのは、 ImagesiftBotの 収集対象が 「テキストより 画像に 寄っている」 ことです。 テキスト主体の AI検索最適化では、 GPTBotや ClaudeBotのような 本文収集ボットに 注目が 集まりがちですが、 画像を 主資産と する サイト——ECの 商品写真、 報道機関の 写真、 不動産の 物件画像、 クリエイターの 作品——に とっては、 ImagesiftBotのような 画像収集ボットこそが 「自社の 画像が Webインテリジェンスや 逆画像検索の 対象に なる」経路に なります。 画像の 権利や 無断利用を 気に する サイトほど、 この ボットの 存在を 把握しておく 実益が 大きいと 言えます。
もう 1つ押さえて おきたいのは、 逆画像検索と いう 技術が もたらす 「見つけられる 側」の 影響です。 逆画像検索は、 ある 画像を 手が かりに、 それが 公開Webの どこに ・どんな 文脈で 使われているかを 探し出す仕組みです。 ImageSiftのような サービスが これを 提供すると、 たとえば 自社が 公開した 商品画像や 作品が、 無断転載や 偽サイトで どう 使われているかを 追える 一方で、 逆に 自社の 画像 その ものが 第三者の 解析対象と して 広く 参照可能に なります。 これは 一長 一短で、 ブランド保護 (=偽物・転載の 発見)に 役立つ 側面と、 望まない 場面で 自社画像が 引き当てられる 側面の 両方が あります。 ImagesiftBotの 許可・拒否を 判断する ときは、 単に サーバー負荷だけでなく、 「自社の 画像が 逆画像検索の 網に 載って よいか」と いう 視点も 併せて 検討する 価値が あります。
画像資産を 持つサイトでは、 テキスト収集系と 別に 画像収集系を 評価する 必要が あります。 観点 ImagesiftBot 本文収集系 (GPTBot / ClaudeBot 等) 主な 収集対象 公開画像を 中心に 収集 ページ本文 (テキスト)が 中心 所有者の 事業 Hive (画像・動画等を 理解する AIモデル提供) 自社の 対話型AIの モデル訓練 巡回の 型 顧客の 監視リスト中心の 反復アクセス (観測) 広範な 一括巡回に なりやすい 守り方の 勘所 画像ディレクトリ単位の 制御・ホットリンク防止 本文ページ単位の 許可・拒否
横にスクロールできます
誤解1 「ImagesiftBotに 画像を 取得された =AIの 回答に 自社画像が 引用された」。 誤りです。 ImagesiftBotは 学習・収集系で、 集めた 画像は Hive/ImageSiftの 解析・製品の 素材に なるだけです。 回答での 引用可視化とは 別物です。
誤解2 「UAが 『ImagesiftBot』なら本物」。 誤りです。 UAは 詐称可能で、 画像の 大量取得など 負荷が 問題に なる 場合は、 UA名だけで 判断せずアクセス元IP・挙動の 実測で 裏を 取ってから 遮断・許可を 決めてください。
方 針を 決める :自社の 公開画像が、 Hive/ImageSiftの 製品・解析に 取り込まれる ことを 許容するか、 拒否するかを 判断します。 画像資産の 価値が 高い サイトほど 慎重に 判断します。 robots.txtを 整える :拒否するなら `User-agent: ImagesiftBot` に `Disallow: /` を 書きます。 画像だけ守るなら 画像ディレクトリを 対象パスに 指定します。 ログで UAを 集計する :ImagesiftBotの 来訪を、 回答・検索系ボットと 混ぜず 「学習・収集系 (画像収集)」と して 分けて 数えます。 IP・挙動で 裏を 取る :画像の 大量取得や 不審な 頻度が あれば、 UA名でなく アクセス元IPと 挙動を 実測して 詐称や 過剰取得を 見極めます。 確実に 守りたい 画像は 多層防御:robots.txtに 加え、 WAF・ホットリンク防止 (=外部からの 直接読み込みの 遮断)などを 併用します。 補足と して、 画像を 主資産と する サイトでは、 ImagesiftBot単体を 追うより 「画像収集系ボット全体」を 1つの カテゴリと して 監視する 運用が 効きます。 ImagesiftBotの ほかにも、 検索エンジンの 画像用クローラーや、 生成AIの 学習用に 画像を 集める ボットなど、 画像を 狙う アクセスは 複数の 主体から 来ます。 これらを アクセスログで 束ねて 可視化し、 (1) どの 画像ディレクトリに、 (2) どの 頻度で、 (3) どの 主体から 取得が 来ているかを 定点観測すると、 権利上・帯域上の リスクが 高い ディレクトリを 特定でき、 robots.txtや ホットリンク防止を どこに 厚く 掛けるべきかの 判断が つきます。 ImagesiftBotは その中の 一銘柄であり、 「取得された 画像が AIの 回答に 出た 証拠には ならない」と いう 原則を 保ちつつ、 画像資産の 保護方 針 その ものを 設計し直すきっかけと して 扱うのが 実務的です。
ImagesiftBotは 何を 集める ボットですか? Hiveの 製品ImageSiftの ために、 公開されている 画像を 中心に Webから 収集する クローラーです。 集めた データは Hive/ImageSiftの Webインテリジェンス製品群や 解析に 使われます。
ImagesiftBotを ブロックすると、 AI検索から 自社画像が 消えますか? 各AI検索エンジンの 回答露出とは 別系統なので、 直接は 関係しません。 ブロックは 「自社の 公開画像を Hive/ImageSiftの 製品に 使わせない」意思 表示に なりますが、 対話型AIの 回答での 引用可視化は それぞれの AI側で 決まります。
テキストは 許可して 画像だけ拒否できますか? できます。 robots.txtで `User-agent: ImagesiftBot` に 対し、 画像ディレクトリ (例 `/images/`)だけを `Disallow` に 指定すれば、 テキストページは 許可しつつ画像収集だけを 拒否する 方 針が 取れます。
UAが 「ImagesiftBot」なら本物ですか? とは 限りません。 UAは 詐称可能です。 画像の 大量取得など 負荷が 問題に なる 場合は、 UA名だけで 判断せず、 アクセス元IPと 挙動の 実測で 裏を 取ってください。
ImagesiftBotに 画像を 集められると、 自分の 画像が 生成AIに “学習”されますか? 直ちに そう 断定は できません。 ImagesiftBotは Hive/ImageSiftの Webインテリジェンス製品 (逆画像検索など)の ための 収集であり、 公開されている 用途は そこに あります。 生成AIの 学習に 使われるかは 別問題で、 公式の 用途記述の 範囲で 理解し、 気になる 場合は robots.txtや アクセス制御で 収集自体を 拒否するのが 確実です。