基礎解説 2026-08-20

その変化、本当に施策の成果ですか? ― AI検索の数字は放っておいても動く

結論:何もしなくても数字は動く。だから比較対象が要る

AI検索対策を始めて1か月。レポートに「先月より露出が改善しました」と書いてある。それは本当に施策の成果でしょうか。

AIの回答は、こちらが何も手を加えなくても日によって変わります。モデルが更新されることもあれば、競合がニュースに出ることもある。「動いた」ことと「施策が効いた」ことは、まったく別の話です。両者を区別する仕組みを持たないレポートは、数字が並んでいても成果の証明にはなりません。

どれくらい勝手に動くのか

2026年に公開された3つの調査が、それぞれ別の角度からこの不安定さを測っています。

①引用元は毎日入れ替わる。サンクトガレン大学の研究チーム(査読前のプレプリント)が、4つのAI検索エンジンを45〜46日間にわたり毎日観測しました。連続する2日間で引用元がどれだけ一致するかを見ると、業種別で平均0.34〜0.42。つまり毎日およそ65%の情報源が入れ替わっています。ブランド名の一致度はもう少し高く0.45〜0.59でした。[1]

②同じ質問を50回投げても、返るブランドは半分程度しか重ならない。Conductor社は10業種×4エンジンで同一プロンプトを50回ずつ実行し、任意の2回の間でブランドがどれだけ重なるかを測りました。業種別では保険62%、銀行47%、クラウド36%。質問の意図別では比較検討が63%と最も安定し、購入意図が40%と最も不安定でした。[2]

③まったく同じリストが2回出ることはほぼない。SparkToroが600人の協力者を通じて延べ2,961回の実測を行った調査では、同じブランドの顔ぶれ(組み合わせ)が2回出る確率は100回に1回未満。順序まで一致するとなると1,000回に1回程度、という結果でした。[3]

なお、この3つの数字は測っているものが違うため直接は比較できません(①は日をまたいだ一致度、②は同日同一プロンプトの重複率、③は完全一致の確率)。共通して言えるのは、AI検索の可視性は静止画ではなく動画だ、ということです。

「1回聞いてみた」では何も言えない

前述のサンクトガレン大学の研究は、では何回測ればよいのかにも踏み込んでいます。同日に同じ質問を繰り返した10回分のデータから、測定回数ごとの誤差を算出したものです。

測定回数 標準誤差 95%信頼区間の幅(±)
1回0.3700.724
3回0.1880.369
5回0.1230.241
7回0.0810.158
9回0.0410.081

1回だけの測定は、論文の言葉を借りれば「本質的に情報を持たない」水準です。研究チームの推奨は1つの質問につき1日あたり最低7回、引用元の網羅性まで見るなら8回。さらに日ごとのブレが大きいため、2〜4週間の移動平均で判断することを勧めています。[1]

なお、この標準誤差は最大10回の測定から抜き出して計算したもので、論文自身が「実際の値はこれより大きくなる」と注記しています。必要な回数はむしろ増える方向、と読むのが妥当です。

「AIに聞いてスクリーンショットを撮りました」という報告は、この表でいえば一番上の行です。以前のコラムでも1回の観測では何も証明できないと書きましたが、今回はその「では何回なら足りるのか」に数字で答えが出た形です。

対照群を置く ― 当社がやっていること

回数を増やせばブレは小さくなります。しかしそれだけでは「モデル側が動いたのか、施策が効いたのか」は区別できません。何回測っても、モデルの更新で全体が底上げされたなら、自社の数字も一緒に上がります。

そこで当社の診断では、施策を打っていない質問群を、施策対象の質問とまったく同じ条件で毎月回しています。医薬品の試験でいう対照群にあたるもので、実務では「コントロール質問群」と呼んでいます。

  • コントロールが動かず、施策対象だけが動いた → 本物の変化と判定できる
  • コントロールも一緒に動いた → モデル更新か市場全体の変化。自社施策の成果ではない

運用上のポイントが3つあります。

1. 試行回数は施策対象と同じにする。コントロールだけ回数を減らすと信頼区間が広くなりすぎて「動いたかどうか」自体を判定できず、対照の意味がなくなります。

2. 架空のブランド名を対照に使わない。存在しない社名は言及率が常にほぼ0%で、ばらつきがありません。「動かないこと」しか起きない対照は、動いたかどうかを測る物差しとして機能しません。対照は実在する質問である必要があります。

3. 判定は目で見ずに計算する。前月と当月の「率」をそれぞれ眺めて比べるのではなく、2つの率の「差」について信頼区間を出し、それが0をまたぐかどうかで判定します。率どうしの区間が重なっているかで有意性を判断するのは統計的に誤りで、実際に起きた改善を「変化なし」と報告してしまいます。当社も以前この誤ったルールを使っており、2026年8月に改めました。

レポートを受け取る側のチェックリスト

  1. その数字は何回測った結果か。1回や2回ではないか
  2. 対照群にあたる質問があるか。なければ「モデルが変わっただけ」の可能性を排除できていない
  3. 変化について「統計的に有意ではありません」と書かれた月があるか。毎月きれいに改善しているレポートは、むしろ疑わしい
  4. 測定の経路モード質問の設計が、先月と同じか

まとめ

AI検索の可視性は、放っておいても毎日動きます。だからこそ、変化を報告するだけのレポートには意味がありません。変化の原因を切り分ける設計が入っているかどうかが、成果測定と体験談を分ける境目です。

数字が上がった月に「効きました」と言うのは簡単です。難しいのは、上がった月に「これはモデル更新の影響で、施策の効果とは言えません」と書くことのほうだと考えています。


出典
[1] Julius Schulte, Malte Bleeker, Philipp Kaufmann(サンクトガレン大学)「Don't Measure Once: Measuring Visibility in AI Search (GEO)」arXiv:2604.07585(2026年4月8日投稿)。査読前のプレプリントである点にご留意ください。またサンプルは最大10回の測定からの再抽出のため、論文自身が標準誤差は下限値だと注記しています
[2] AI Brand Recommendation Study: Why Intent Type Predicts AI Output Consistency ― Conductor(2026年7月17日更新。70プロンプト×4エンジン×50回=14,000回のAPI実行)。業種別の数値は業種全体の集計値で、意図別の内訳ではありません
[3] Rand Fishkin 「AIs are highly inconsistent when recommending brands or products」― SparkToro(2026年1月27日、600名・延べ2,961回。人手による実測で、著者自身が専門の研究者ではないと明記)
・コントロール質問群の設計と判定ルールは、当社の診断実施ルールによります

監修:Gov Sync株式会社 AI検索最適化サービス担当 水野 明日香/最終更新日:2026年8月20日

対照群を置いた、変化の原因まで切り分けられるAI検索診断を行っています。