AIに同じ質問を2回投げると、1回目には自社の名前が出て、2回目には出ないことがあります。それなら、1回だけ試して「載った」「載らない」と判断してよいのでしょうか。この疑問に、データで答えようとした論文があります。2026年4月に公開された「Don’t Measure Once: Measuring Visibility in AI Search (GEO)」です。
スイスのザンクト・ガレン大学の研究者たちが、4つのAI検索サービスに同じ質問を毎日投げ続け、45日間の変化を記録しました。さらに、同じ質問を短時間に最大10回繰り返し、回答がどれだけ揺れるかも測っています。この記事では、原文を通読したうえで、何を測り、何が分かり、どこまで言えるのかを整理します。数値は論文の表から拾い、私が計算した値には「概算」と付けました。
合同会社謙虚は、3つのドメインを並行して運用し、何を変えると数字が動くかを測り続けています。この論文を読む理由は、AI検索での見え方を測るとき、1回の結果をどこまで信じてよいかという、測定の土台を確かめておきたいからです。
結論:3行で言うと
- 同じ質問でも、AI検索に出てくる出典や企業名は、日ごとにも、同じ日の再実行(24時間以内)でも大きく入れ替わりました(出典の重なりは平均で約3〜4割)
- 著者らは、AI検索での見え方を「載る・載らない」の1点ではなく、何回に1回載るかという分布として捉えるよう提案しています
- 目安として、同じ質問を1日に7〜8回以上、数週間続けて測ることを推奨しています。ただし、根拠はスイスの4分野、各8問という小さな範囲の実験です
この記事は、論文の主張と、私の読み取りを分けて書きます。実務への当てはめは、後半の「中小企業の視点」でまとめました。
この論文の基本情報
| 項目 | 内容 |
|---|---|
| 原題 | Don’t Measure Once: Measuring Visibility in AI Search (GEO) |
| 著者 | Julius Schulte、Malte Bleeker、Philipp Kaufmann(3人。所属はザンクト・ガレン大学。第1著者にはAurora Intelligenceの所属も併記) |
| 公開日 | 2026年4月8日(arXiv初版) |
| arXiv番号 | 2604.07585(分野は情報検索) |
| 掲載・採択状況 | arXivのプレプリント。コメント欄は「19ページ、図7、表17。コメント歓迎」で、学会や雑誌への採択の記載は見当たりません |
| 種類 | 実測データにもとづく測定方法の提案(実証研究) |
| データとコード | GitHubで公開(付録Lに記載。同時再実行のデータと解析スクリプトを含む) |
論文はこちらで読めます。arXiv(2604.07585)、DOI。
この論文が答えた問い
AI検索での「見え方」は、1回の測定で代表できるほど安定しているのか。安定していないなら、何回、何日測ればよいのか。
従来の検索なら、ある言葉で検索して自社が3位に出れば、その日の状況はおおむね分かりました。AI検索は、回答を確率的に作ります。同じ質問でも、実行のたびに引用する出典や挙げる企業名が変わり得ます。GoogleのSearch Consoleのような、提供元の公式な測定ツールも、この論文の時点で用意されていません。そこで著者らは、見え方の「頻度」に加えて「安定性」を、もう1つの物差しとして加えました。
用語の整理
- 可視性(visibility): 生成された回答の中に、ブランド名や出典がどのくらいの頻度・目立ち方で現れるか
- キャンペーン: 論文が使う分野の呼び名。通信、不動産売却、スポーツ用品、家電・PCの4つ
- 出典: 回答に添えられた参照元のページ(ドメイン)
- ブランド: 回答の本文に出てくる企業や商品ブランドの名前
Jaccardとは何か:重なりの度合いを表す数字
この論文の数字は、ほぼすべてJaccard(ジャッカード)係数で表されています。読み解く鍵なので、先に説明します。
Jaccardは、2つの集まりが、どれだけ重なっているかを0から1で表した数字です。計算は「両方に入っているものの数」÷「どちらかに入っているものの数」です。
たとえば、1回目の回答が出典4件(a、b、c、d)、2回目の回答が出典4件(c、d、e、f)だったとします。両方にあるのはcとdの2件です。どちらかにあるものは、aからfまでの6件です。Jaccardは2÷6で、約0.33になります。まったく同じなら1、1件も重ならなければ0です。
論文は0.35という値を、「出典の約35%が重なり、約65%が入れ替わる」と読んでいます。厳密には「2つの回答に出た出典を全部並べたうち、両方に出たものが約35%」という意味です。入れ替わりの割合を正確に表す数字ではなく、目安として受け取るのがよいでしょう。
論文はもう1つ、RBO(順位付き重なり)という指標も使っています。Jaccardは順番を見ません。RBOは、上位に出た項目ほど重く数えます。この記事では、主にJaccardの数字を使います。
どうやって調べたのか
| 項目 | 設定 |
|---|---|
| 対象のAI検索 | ChatGPT、Gemini、Google AI Mode、Perplexityの4つ |
| 分野 | 通信、不動産売却、スポーツ用品(ランニングシューズ)、家電・PC(ノートパソコン)の4分野 |
| 質問 | 1分野につき8問、計32問。検索数の多いキーワードからGoogleの「他の人はこちらも質問」を使って作成。質問文はドイツ語 |
| 実行場所 | スイス国内のサーバー(スイスのIPアドレス) |
| データ1:日ごとの記録 | 2026年1月24日〜3月20日の45〜46日間、毎日実行 |
| データ2:同時の再実行 | 3月21〜25日に、同じ質問を最大10回ずつ実行。比べるのは24時間以内の組だけ |
| 指標 | 出典の重なり、ブランドの重なり(どちらもJaccardとRBO)、出典の偏り(Gini係数) |
ブランドの検出は、分野ごとに作った名簿(32〜51ブランド)と回答文を、文字列で照合する方法です。名簿の検出率が70%を超えた分野だけを、ブランドの分析に使っています。不動産売却は検出率が53.6%で、ブランド分析から外れました。税金や投資に関する一般的な質問がいくつかあり、AIが特定の企業名を挙げずに答えたためです。
データ1は「日をまたいだ変化」を、データ2は「同じ日の中の揺れ」を見るための設計です。日をまたぐ変化には、AIの更新や検索インデックスの変化が混ざります。同時の再実行なら、そうした外部の変化を取り除いて、AI自身のばらつきを測れます。
結果
日ごとの変化:出典の重なりは約3〜4割
連続する2日の回答を比べたJaccardの平均です(論文の表2・表3)。出典は4分野で4,044組、ブランドは3分野で2,924組を集計しています。
| 分野 | 出典のJaccard | ブランドのJaccard |
|---|---|---|
| 家電・PC | 0.336 | 0.557 |
| 不動産売却 | 0.378 | 分析対象外 |
| スポーツ用品 | 0.355 | 0.453 |
| 通信 | 0.423 | 0.589 |
- 出典の重なりは0.34〜0.42で、翌日には出典の多くが入れ替わっていました
- ブランド名は0.45〜0.59で、出典よりは安定しています。それでも、半分近くは入れ替わる水準です
- 順位まで見るRBOは、出典で0.21〜0.26、ブランドで0.19〜0.30でした。集合が入れ替わるだけでなく、並び順も変わっています
- 出典は少数のドメインに集中していました。偏りを表すGini係数の平均は0.715(0が完全に均等、1が1件に集中)で、Google AI Modeが0.782と最も高く、Perplexityが0.671と最も低い値でした
同じ日に繰り返した場合:24時間以内でも同じくらい揺れる
同じ質問を、24時間以内に繰り返した組同士の平均です(表4・表5)。出典は、引用が1件以上あった回答だけを比べています。
| 分野 | 出典のJaccard(組数) | ブランドのJaccard(組数) |
|---|---|---|
| 家電・PC | 0.327(830組) | 0.477(1,235組) |
| 不動産売却 | 0.391(805組) | 分析対象外 |
| スポーツ用品 | 0.321(886組) | 0.327(1,027組) |
| 通信 | 0.434(888組) | 0.463(1,233組) |
- 出典の重なりは0.32〜0.43で、日ごとの結果と同じ水準でした。著者らは、揺れの大部分がAIの確率的な生成そのものに由来すると解釈しています
- 従来の検索なら、同じ質問を短い間隔で投げてもほぼ同じ結果が返るはずです。AI検索では、24時間以内に繰り返しても、その前提が成り立ちませんでした
- サービス別の出典の重なり(表6)は、ChatGPTが0.233、Perplexityが0.282、Google AI Modeが0.318、Geminiが0.505でした
- 質問ごとの差も大きく、重なりが0.8を超える質問もあれば、0.2を下回る質問もありました。具体的な商品を尋ねる質問のほうが、一般的な質問より安定する傾向です
- ChatGPTでは、回答の57.8%(同時再実行のデータ)で引用が1件も取れませんでした。論文はこれを、ChatGPTが特定の質問でしかウェブ検索を使わないためと説明しています
何回、何日測ればよいか
著者らは、10回分のデータから回数を減らして抽出し直し(各2,000回)、ブランド1つずつの検出率がどれだけ定まるかを調べました。10回の平均を「本当の値」に見立てています。表の標準誤差は、推定値のぶれの大きさです(付録Jの表16)。
| 1日の実行回数 | 標準誤差 | 95%信頼区間の幅(±) |
|---|---|---|
| 1回 | 0.370 | 0.724 |
| 3回 | 0.188 | 0.369 |
| 5回 | 0.123 | 0.241 |
| 7回 | 0.081 | 0.158 |
| 8回 | 0.062 | 0.121 |
| 9回 | 0.041 | 0.081 |
- 1回だけの測定は、ほとんど情報を持ちません。本当の検出率が50%でも、推定値は大きく振れます
- 標準誤差が0.10を下回るのは、ブランドの検出率で7回、出典のカバー率で8回です。著者らはここから、ブランドの監視は1質問1日あたり7回以上、出典まで見るなら8回以上を推奨しています
- 日数については、ブランド別の検出率の標準誤差が、10日で0.107、14日で0.080、21日で0.053、28日で0.033でした。2〜4週間の移動平均を勧めています(付録Kの表17)
- 質問の数は、1〜2問では質問固有の癖を拾うだけなので、多様な質問を幅広く用意するよう勧めています
論文自身が書いている限界
- 収集方法のむら。ChatGPTのデータに、画像配信用の無関係なドメインが混入していました(引用の5.8%)。方法の混在を避けるため、期間を1月24日〜3月20日に絞り、このドメインを除外しています
- スイス限定。データはスイスのサーバーから集めており、IPアドレスや言語設定が結果に影響し得ます。他の地域や言語に一般化できるとは限りません
- 同時再実行の収集日が広がった。サービスによって収集が複数の日にまたがったため、24時間以内の組だけを比べています
- ChatGPTの引用ゼロ。57.8%の回答で引用が取れなかったため、出典の分析では、引用ゼロの回答を全サービスから除いています
- ブランド検出の粗さ。名簿との文字列照合なので、略称や言い換えを見逃し、ブランド名の一部にあたる一般語を誤って拾う場合もあります
- 推奨回数の前提。付録Jは、推奨回数が「検出確率が中間的なブランド」を想定したものと述べています。また、10回から抽出し直す方法の性質上、9回時点の誤差は実際より小さめに出る、と論文自身が書いています
- 今後の課題。他の言語や市場での確認と、施策によって「載る確率」を持続的に動かせるかの検証は、これからの研究として残されています
原文を読んで気づいた点
ここからは、論文に書かれていない点です。
- 日本語での検証はありません。質問はドイツ語で、実行地はスイスです。日本語や日本国内での揺れの大きさは、この論文から分かりません
- 範囲が小さい研究です。4分野、各8問の計32問と、限られた質問数で得た数字です。質問の種類が違えば、重なりの値も変わり得ます。論文自身も、質問ごとの差が大きいことを示しています
- 評価は機械集計です。出典の抽出とブランドの検出は自動処理で、人の目による正解確認は書かれていません
- 実サービスとの差。データは画面操作による収集です。サービス側のモデルの版は固定されておらず、論文も今後の研究では収集方法とモデル版を固定すべきだと述べています
- 査読を経ていません。arXivのプレプリントで、コメント欄にも学会・雑誌への採択の記載がありません。第1著者はAurora Intelligenceにも所属し、付録には同社のデータ出力から作った処理済みデータを使ったと書かれています。利害関係についての記述は、私が読んだ範囲では見つかりませんでした
- 2つのデータの比較には条件差があります。「日ごとの重なりと同じ水準だから、揺れの大半は同日内のばらつき」という論文の推論は、条件の違う2つのデータの平均値を並べたものです。日ごとの側は、片方の引用が空の組を0点で数え、同時再実行の側は、引用ゼロの回答を除いています(付録C、第5節)。集計の条件が違います。ブランドでは、日ごとが0.45〜0.59、同日内が0.33〜0.48で、同日内のほうが低めでした
- RBOの値は低めに出る設計です。付録Eによると、使われた計算式は打ち切り版で、たとえば5件が完全一致してもRBOは約0.41にとどまります。RBOがJaccardより低いことの一部は、この設計に由来します
- Geminiの日数が少ない。表1では、Geminiの収集日は22〜26日で、他の3サービス(38〜44日)より少なめです。「連続する日」の比較で、抜けた日をどう扱ったかは書かれていません
- 記述の細かな食い違い。付録Jが結論の節を「第5節」と呼んでいる(実際の結論は第7節)、ChatGPTが検索を抑える質問を「定義を尋ねる質問」(第5節)と「特定の質問」(第6節)と書き分けている、抽出したブランド別の系列数が1,216本と1,259本の2通りある、といった点です。結論には影響しない範囲ですが、原文どおりに引用するときは注意が必要です
この論文から、言えること・言えないこと
| 言えること(論文の設定で確認された) | 言えないこと(論文では確認されていない) |
|---|---|
| 同じ質問でも、出典・ブランドは日ごと、同日内でも大きく入れ替わった | 日本語や日本国内で、同じ大きさの揺れが起きること |
| 1回だけの測定は、見え方の推定として大きくぶれる | 7〜8回が、あらゆる質問・業種で足りること |
| 質問ごとの差が大きく、1〜2問では分野全体を代表しにくい | 自社のページを直すと、載る確率が上がること |
| ブランド名の重なりは、多くの分野で、出典の重なりよりやや高かった(Geminiと、スポーツ用品の同日内は例外) | ブランド名を追えば、出典を追わなくてよいこと |
| サービスによって、揺れの大きさが違った(ChatGPTは出典の重なりが低い) | その差が、今のサービスの仕様でも続くこと |
中小企業の視点で、どう受け取るか
ここからは論文の主張とは別の、私の読み取りです。
1回の検索結果で、成果を判断しない
「先月は載っていたのに、今月は載っていない」。この観察は、1回の測定であれば、揺れの範囲に収まる可能性があります。この論文の数字では、同じ質問を24時間以内に繰り返しても、出典の重なりは3〜4割でした。1回の結果だけで施策の成否を決めるのは避けたいところです。
「載った回数」で記録する
論文の提案は、見え方を「10回中何回載ったか」のような頻度で捉える方法です。1つの質問を複数回試し、自社名が出た回数を数えます。日を変えて同じ測定を繰り返し、2〜4週間の平均で傾向を見ます。自社ブログでは、この測り方の実践をAI検索で自社ブランドが出るかを確かめる方法としてまとめています。
質問は1つに絞らず、数を用意する
質問ごとの差が大きいという結果から、1つの質問の結果を、自社全体の見え方として扱わないほうが安全です。お客様が実際に使いそうな質問を、言い回しを変えて複数用意します。
回数は「出発点」として使う
7〜8回という数字は、スイスの32問から出た目安です。日本語や自社の業界で同じになるかは、確かめられていません。まずは自社の質問で数回繰り返し、結果が毎回ほぼ同じか、大きく揺れるかを見てください。大きく揺れるなら、回数と日数を増やします。
よくある質問
AI検索の結果は、なぜ毎回変わるのですか
論文は、AIの回答生成と、その裏側の検索・出典選びに確率的な要素があるためと説明しています。同時の再実行でも揺れが残ったことから、日を変えたことだけが原因ではないと読んでいます。ただし、内部の仕組みまでは調べていません。
7〜8回測れば、順位付けまでできますか
論文自身の説明では、7回の測定は「80%と20%のような大きな差」を見分けるには足りる精度です。似た水準のブランド同士の細かい順位付けには足りないと書かれています。
ChatGPTの回答の57.8%で、ウェブ検索が動かなかったのですか
論文が数えているのは、引用が1件も取れなかった回答の割合です。その理由を、論文はChatGPTが特定の質問でしかウェブ検索を使わないためと説明しています。検索が動いたかどうかを直接確認した値ではありません。また、この値は同時再実行のデータでの数字です。
まとめ:今日できる1つのこと
お客様が使いそうな質問を1つ選び、AI検索に5回続けて投げて、自社名が何回出たかをメモしてください。翌日にもう一度、同じ質問で5回試します。2日分の回数を並べるだけで、1回の結果がどれだけ当てにならないかを、自社の数字で確かめられます。
この論文は、LLMO論文の一覧の一本です。ほかの論文の解説も、順次公開しています。
この記事に書いたことを、そのまま御社のページに
生成AIに引用されるページを、お話しいただくだけでお作りします。お時間をいただくのは初回15分のヒアリングだけです。まず1ページ、無料でお作りします。
OKが出るまで、何度でも直します。事実が違う、言い回しが硬い、この話は入れないでほしい。どれも遠慮なくおっしゃってください。何度お直ししても、追加の料金はいただきません。
これまでに127社にご利用いただきました。毎月ご依頼いただいている方の6割以上が、月10ページを選ばれています。料金はページに掲載しています。
ページを増やしても問い合わせが来ないなら、原因はページの外にあります。その場合は、下の入口からご相談ください。
自社のマーケティング課題を根本から解決しませんか?
ウェブサイトから要素を引き算し、訪れた人が迷わず次の一歩に進む形へ組み直す。初回60分のオンラインで御社のサイトを一緒に読み、どこから直すべきかをお伝えします。手順をまとめた無料の診断と解説動画もご用意しています。
初回は無料・60分・オンライン完結・その場で契約のお願いはいたしません

