今月の発見 2026-08-26

robots.txtに書いても、AIの15%は守っていない

結論:robots.txtは「お願い」であって「鍵」ではない

AIに自社サイトを読ませたくないとき、あるいは読ませたいとき、まず触るのがrobots.txtです。ところが2026年に入って、そこに書いた内容が実際には守られていないケースが、大規模なデータで明らかになりました。

robots.txtは、サイト側の意思表示です。技術的にアクセスを遮断する仕組みではありません。この当たり前の事実が、AIクローラーの世界では従来の検索エンジン以上に効いてきています。

3,906社のデータで、約15%がすり抜けていた

TollBit社が2026年上半期のデータとして公表した数字です。パブリッシャー3,906社・40のスクレイピングベンダーを対象にした集計で、AIフェッチャーのリクエストの約15%が、robots.txtでdisallowされているURLに到達していました。[1]

内訳を見ると、すり抜けの度合いはクローラーによって大きく違います。

クローラー 状況
ChatGPT-User
Bytespider
Youbot
欧州でこれらをブロックしているサイトの約半数で、disallowページへ到達
Claude-Userdisallow到達率は欧州9%/北米26%
Perplexity-User同13%/26%

興味深いのは、これが「悪質なクローラーが規約を破っている」という話ではないことです。各社は公式ドキュメントで、そうなることを最初から明記しています。

OpenAIは、ChatGPT-Userについて「ユーザー起点のリクエストであるため、robots.txtのルールが適用されない場合がある」と書いています。[2] Perplexityも、Perplexity-Userについて「一般にrobots.txtを無視する」と明記しています。[3]

つまり、「学習のために巡回するクローラー」と「ユーザーが今まさに質問したから取りに行くクローラー」は別物として扱われているということです。後者は、人間がブラウザでページを開くのに近い扱いになります。

それでも、robots.txtが決定的に効く設定が1つある

ここまで読むと「robots.txtは意味がないのか」と思われるかもしれませんが、そうではありません。OpenAI自身が「これを拒否したらChatGPT検索の回答に出ない」と明言している設定が1つあります。

それが OAI-SearchBot です。[2]

UA 役割 拒否するとどうなるか
GPTBot学習用学習に使われなくなる
OAI-SearchBotChatGPT検索の表示用ChatGPT検索の回答に表示されなくなる
ChatGPT-Userユーザー起点の取得robots.txtが適用されない場合がある

「AIに学習されたくない」という理由で User-agent: *Disallow: / を書いたり、AI系クローラーをまとめて拒否したりすると、意図せずChatGPT検索から消えることになります。この3つは独立に設定できるので、目的に応じて分けて書く必要があります。

robots.txtを「自分で書くファイル」でなくする動きも出てきた

さらに2026年8月、前提そのものが動きました。CloudflareがBot Preference Syncという機能を発表しています。管理画面でSearch/Agent/Trainingの3カテゴリを設定すると、その内容がrobots.txtの先頭に自動で挿入されるという仕組みです。2026年8月24日の週から全プランへ展開されています。[4]

同社は2026年7月にも方針を変えており、クロール回数に対する課金から、AIの回答に引用・掲載されたことに対する補償へと軸足を移しました。あわせて2026年9月15日以降、新規ドメインの広告掲載ページではtraining/agentクローラーをデフォルトでブロックすると announced されています。[5]

これが意味するのは、これから先、robots.txtの中身がそのサイトの運営者の意思を表しているとは限らなくなるということです。CDNを前段に置いている企業サイト——特に大企業や金融機関——では、この食い違いが起きやすくなります。

IPアドレスで判定するのも、もう安全ではない

「robots.txtが効かないなら、WAFでIPアドレスを見て遮断すればいい」と考えるかもしれません。ところがこちらにも落とし穴があります。

2026年8月17日、AppleがApplebotの公開IPアドレスを2,400から7,056へ、告知なく増やしました(+4,656、21のCIDRを追加)。しかもApple自身の逆引きサンプルが公開IPファイルに含まれていないことから、公開されているリストが網羅的ではないことも明らかになっています。[6]

従来の12プレフィックスで運用していたWAFやボット管理は、この時点で約3分の1しかカバーできていなかったことになります。

IPリストを直接書き込む運用は、告知なしの変更で簡単に壊れます。UAと逆引き・前方確認を組み合わせるか、CDN側の検証済みボット判定を使うほうが安全です。

実務として、どう扱えばいいか

当社では、サイトの技術監査でこの領域を2つの軸に分けて記録するようにしています。

見るもの 言えること
軸A:意思表示robots.txtに何を書いているか「拒否する意思があるか」までは言える
軸B:実効遮断AIクローラーのUAで実際に403などが返るか「実際に遮断できているか」が分かる

この2つを混ぜて「robots.txtにDisallowと書いてあるから遮断できている」と結論しないこと。逆に「記載がないからAIに読まれている」とも言えないこと。どちらも、確かめるには実際にアクセスして見るしかありません。

あわせて、robots.txtに書かれているUAの顔ぶれを見ると、そのサイトがいつAI対応を考えたかが推測できます。GPTBotCCBot しか書かれていないサイトは、2023年から更新が止まっている可能性が高い。2026年に入ってからも Amzn-SearchBot(Amazon Rufus/Alexa用)や Google-GeminiNotebook(NotebookLM)といった新しいクローラーが登場しています。[7][8]

まとめ

  • robots.txtは意思表示であって、技術的な遮断ではない。3,906社のデータではAIフェッチャーの約15%がdisallow済みURLに到達していた
  • ただし OAI-SearchBot の拒否だけは決定的。拒否するとChatGPT検索の回答に出なくなるとOpenAIが明言している
  • Cloudflareの新機能により、robots.txtがCDN側から自動生成される構成が増える。中身=運営者の意思とは限らなくなる
  • IPアドレスによるボット判定は、告知なしの大幅変更で壊れる(Applebotは1日で+194%)
  • 「書いてあること」と「実際に起きていること」は、分けて確かめる

出典
[1] TollBit 2026年上半期データ(パブリッシャー3,906社・40スクレイピングベンダー)PPC Land(2026年8月14日)
[2] OpenAI 公式ドキュメント「Bots」(2026年8月25日確認)
[3] Perplexity 公式ドキュメント「PerplexityBot」(同)
[4] Cloudflare「Say it once: introducing Bot Preference Sync」(2026年8月21日)
[5] Cloudflare「Making AI search smarter」(2026年7月1日)
[6] PPC Land「Apple adds 4,656 IP addresses to Applebot crawler in one update」(2026年8月17日)
[7] PPC Land「PatronView blocks Amazon's AI crawler」(2026年8月7日)
[8] Google Crawling documentation changelog(2026年7月16日、NotebookLMのUAを Google-GeminiNotebook へ変更)

監修:Gov Sync株式会社 AI検索最適化サービス担当 水野 明日香/最終更新日:2026年8月26日

robots.txtの記述だけでなく、実際にAIクローラーが到達できているかまで確認する技術監査を行っています。