AI検索での見え方を測るサービスやレポートでは、「御社は回答の40%で引用されています」のような数字が出てきます。けれども、その数字は、どんな質問を何問、どんな比率で投げたかによって決まります。
この点を正面から整理したのが、2026年9月にarXivで公開された今回の論文です。
著者は1人で、以前このシリーズで解説したGEOのサーベイ論文と同じ著者です。
今回の論文は新しい実験をしていません。既存の研究の整理と、公開済みの集計値を使った計算で主張を組み立てた、批判的な文献サーベイ(主張が中心の整理)です。
この記事では原文を通読し、言えることの範囲をはみ出さないように要点をまとめます。私が計算した値には「概算」と付けました。
合同会社謙虚は、3つのドメインを並行して運用し、何を変えると数字が動くかを測り続けています。この論文を読む理由は、計測の数字を受け取ったとき、それが「どの質問の集まりについての数字か」を問い返す物差しを持っておきたいからです。
結論:3行で言うと
- 著者は、AIでの見え方のスコアはどんな質問を、どの重みで集めたかで決まる「回答市場」についての数字であり、実際の利用者の需要と一致するとは限らない、と主張しています
- 公開済みの集計値を組み直すと、質問群の比率を変えただけで、AI Overviewsが表示される割合が39.66%にも70.54%にもなりました。各質問群の中の値は同じままです。架空の例では、重みを変えると2つのサービスの優劣が逆転しました
- 論文は、スコアの前提を記録して公開するための7つの手順と4つの判断を提案しています。ただし、その手順が実務で役立つかは、まだ検証されていないと論文自身が書いています
この記事は、論文の主張と、私の読み取りを分けて書きます。実務への当てはめは、後半の「中小企業の視点」でまとめました。
この論文の基本情報
| 項目 | 内容 |
|---|---|
| 原題 | Measuring GEO Visibility: Prompt Corpora Define the Answer Market(副題は、妥当性・部分識別・出典の貢献についての批判的サーベイ) |
| 著者 | Olivier Martinez(1人。所属の欄は無く、記載はフランスの大学のドメインのメールアドレスだけです。AI検索の計測サービス企業との関係や、利益相反の申告は書かれていません) |
| 公開日 | 2026年9月6日(arXiv初版)。確認した版も初版です |
| arXiv番号 | 2609.06811(主分野は情報検索。言語処理にも登録) |
| 掲載・採択状況 | arXivのプレプリント。コメント欄は「16ページ、表9。44本の文献を扱う批判的サーベイと方法論の分析。読書記録・集計データ・再計算コードを同梱」で、学会や雑誌への採択の記載は見当たりません |
| 種類 | 批判的な文献サーベイと方法論の分析。新しい実験やデータ収集は無いと、論文の冒頭に明記されています |
| データとコード | arXivの付属ファイルで公開(文献ごとの読書記録、書き写した集計値、再計算用のプログラム) |
論文はこちらで読めます。arXiv(2609.06811)、DOI。
この論文が答えた問い
AIでの見え方のスコアは、そもそも何を測った数字なのか。質問の集め方と数え方を変えると、その数字はどこまで動くのか。
論文は、「ある出典が回答の40%で引用された」と言うだけでは足りないと述べます。自由な質問への回答なのか、その出典の名前を入れた質問なのか、比較を求める質問なのか。
どのサービスで、いつ、どんな重みで集計したのか。これらが、スコアが何を指すかを決めるからです。
著者はここで、質問(プロンプト)が3つの役割を同時に担うと指摘します。1つ目は、評価する場面を選ぶこと。
2つ目は、AIの動きそのもの(検索をするか、どんな検索語に書き換えるか、どの文書を拾うか)を変えること。3つ目は、採点をAIに任せる場合に、採点用の指示が「2つ目の質問」として加わることです。
同じ回答でも、採点の指示が変われば点数が変わり得ます。
どうやって調べたのか
論文は、2026年8月31日時点で集めた44本の文献を、3つの研究の流れと結びつけて整理しました。測定したいものを本当に測れているかを問う「妥当性」の研究、アンケート調査で誤差の出どころを整理する「総調査誤差」の考え方、そして情報検索の評価の研究です。
文献は網羅的に集めたものではなく、2人で独立に選別する作業もしていないと、論文自身が書いています。
そのうえで、質問が測定の中で果たす働きを、次の5つに分けました。
| 質問の働き | 中に含まれる判断 | スコアの読み方への影響 |
|---|---|---|
| 課題を決める | 定義を問うか、選択か、理由か、一覧か | AIに求める動きと、成功の基準が変わる |
| 場面を選ぶ | どの需要・言語・人・分野を含めるか | スコアが何について有効かの範囲が決まる |
| 需要を言葉にする | 言い回し、形式、例、細かさ | 言い方に左右される度合い |
| やりとりの条件をつける | それまでの会話、候補、前提の知識 | AIが使える情報と、会話の流れ |
| 採点しやすい形にする | 出典の明記、長さ、形式の指定 | 回答そのものと、採点のしやすさ |
論文は、この5つは互いに独立した変数ではないと断っています。たとえば「出典を示して」と頼むと、検索の中身も、回答も、引用の数え方の分母も、同時に変わり得ます。
主張を具体的に示すため、論文は2つの計算を載せています。1つは、情報検索の国際学会SIGIR 2026で発表されたグロスマンらの研究が公開した集計値を、重みだけ変えて組み直した計算です。
もう1つは、数字をすべて仮に置いた架空の例です。どちらも、新しく集めたデータは使っていません。
結果
結果1:質問群の比率を変えただけで、表示率は39.66%から70.54%まで動いた
元になったグロスマンらの研究は、11,500件の検索でGoogleのAI Overviewsが表示されるかを調べ、全体で65.6%と報告しています(2025年12月7〜8日、米国ニュージャージー州ニューアークのスマートフォン環境の設定)。論文はそのうち、表示率が最も低い群と最も高い群を意図的に選び、実在の利用者の検索から取った群と合わせて3つの群で計算しました。
| 質問群(件数) | 公開された表示率 | 重みA(通販の質問を重く) | 重みB(説明を求める質問を重く) |
|---|---|---|---|
| 実在の利用者の検索から取った質問(5,000件) | 51.5% | 20% | 20% |
| 通販サイトの商品に関する質問(500件) | 17.4% | 60% | 20% |
| 込み入った説明を求める質問(1,000件) | 94.6% | 20% | 60% |
| 合計した表示率 | – | 39.66% | 70.54% |
- 各質問群の中の表示率は同じままで、合計は30.88ポイント違いました
- この3群を件数どおりの比率(5,000:500:1,000)で混ぜると55.5%で、11,500件全体の65.6%とは別の値です
- 論文は、両端の群をわざと選んだので、30.88ポイントという差の大きさは「よくある揺れ」の目安にならない、と注意しています
- この計算は、AI Overviewsが表示されるかどうかについての数字です。特定の会社やブランドがどれだけ出たかの数字とは別物です
論文はさらに、表示された回答の中で名前が出る割合を「仮に40%」と置いた計算も示しています。すると、質問1件あたりで名前が出る割合は、重みAで15.864%、重みBで28.216%になりました。
中身の40%は同じでも、質問の比率だけで結果が約1.8倍(28.216÷15.864の概算)違うということです。また、分母を「全質問」から「AI Overviewsが表示された質問」に替えるだけで、割合は重みAで約2.52倍、重みBで約1.42倍になります。
同じ研究の中の、疑問文の形の質問(86.2%)と、それを語句だけに書き換えた版(76.5%)の組も使われています。半々に混ぜると81.35%で、言い方の比率もまた、スコアを動かす別の軸になります。
なお、付属の再計算プログラムを手元で動かしたところ、39.66%、70.54%、55.51%が再現されました。
結果2:架空の例では、重みを変えると優劣が逆転した
次の数字は、論文が仮に置いたもので、実験結果ではありません。
| 場面 | サービスA | サービスB |
|---|---|---|
| 名前を出さずに探す質問(発見) | 0.30 | 0.50 |
| 名前を出して確かめる質問(確認) | 0.90 | 0.60 |
| 発見の重み20%のときの合計 | 0.78 | 0.58 |
| 発見の重み80%のときの合計 | 0.42 | 0.52 |
- 発見の重みが60%を境に、AとBの順位が入れ替わります。2つのサービスの得意な場面が交差しているためです
- Aがすべての場面でBを上回っていれば、重みをどう変えても逆転は起きない、と論文は明記しています。逆転は「起こり得る」ことの例です
- 重みを20〜80%の範囲で動かすと、Aは0.42〜0.78、Bは0.52〜0.58になります。同じ重みでそろえて比べた差は-0.10〜0.20です。2つの幅を別々に引き算すると-0.16〜0.26と、必要以上に広く見えてしまいます
結果3:名前を入れた質問と、入れない質問は、別の課題になる
論文は、112の製品について、名前を入れた質問と、名前を入れずに探す質問を2つのAIで比べたプレプリントを紹介しています。
名前を入れた場合は336回中334回と317回で製品名が出ましたが、名前なしで探す場合は784回中26回と65回でした。
割合にすると概算で、99.4%と94.3%に対して、3.3%と8.3%です(334÷336などで私が計算)。この研究は別の記事で解説しています。
論文はこの差を、言い回しの違いの効果とは読んでいません。名前を示すかどうかで課題そのものが変わっているためで、市場の推定にも使わず、あくまで例として扱っています。
結果4:引用されたことと、回答に効いたことは別に測る
論文は、引用が表示されたことだけでは、その出典が回答の中身に貢献したとは言えないと述べます。そこで、AIに渡す文書の組を固定し、ある出典を入れた場合と外した場合で回答を比べる方法を定義しました。
採点の仕組みは両方で同じにします。
実際のAI検索では、競合の出典も同時に変わります。論文は、自社の見え方が2つの日付の間で下がったとき、少なくとも4つの原因が混ざり得ると整理しています。
自社の施策、競合の施策、AI側の仕組みの変化、質問の集まりの変化です。これに言い回しや採点の変化も加わります。
日付を比べるだけでは、これらを切り分けられないというのが論文の立場です。
論文の提案:7つの手順と4つの判断
論文は、スコアを出すときの判断を4つにまとめました。
- 何を、どう作って測ったのかを明記する(対象、単位、質問、実行環境、採点方法、分母)
- どの場面を含め、どんな重みを付けたのかの根拠を示す。重みが決めきれないときは、許容できる重みの範囲でスコアの幅を出す
- 出典が「効いた」と言う前に、何を操作して比べるのかを定める
- 比べるときは同じ重みにそろえ、結論が何に左右されるかを見せる
これを7つの作業手順に落とし、回答の状態の記録の仕方も示しています。たとえば、取得に失敗した回や技術的なエラーは、「ブランドが出なかった」と数えず、欠測として別に残します。
拒否や空の回答も、それぞれの状態として記録します。
論文自身が書いている限界
- 文献の選び方は選択的で、英語の文献が中心です。関連研究をどれだけ取りこぼしたかは分からないと書いています
- 一部の文献は、要旨や冒頭の数ページだけを読んで使っており、その範囲を付録の表で明示しています
- 見え方に関する研究のいくつかはプレプリントで、限られた範囲の例として扱っています。言葉づかいが似ていても、独立した再現が積み重なったことにはならない、としています
- グロスマンらの集計値は丸めた値で、個別の記録を再分析していないため、信頼区間は出せません
- 表示や言及や引用は、読者の注意・信頼・購入を直接測るものではありません
- 提案した枠組みの実務での有用性は未検証で、GEOの施策が効くことを示したものでもない、と結論で述べています
原文を読んで気づいた点
- 新しい実測はありません。数字はすべて、他の研究の公開値の組み直しか、架空の例です。数字の大きさそのものより、「重みで数字が動く仕組み」を示した論文として読むのが妥当です
- 著者は、以前解説したGEOのサーベイと同じ1人の著者で、どちらもarXivのプレプリントです。査読を経たかは確認できませんでした
- 所属の欄は無く、計測サービス企業の自社報告という記載も、利益相反の申告もありません。一方で、出発点になった「質問の集まりに関する資料」や、公開していない準備段階の文書があると書かれており、その出どころは説明されていません
- 執筆・翻訳・ファイル作成にAIの支援を使ったこと、内容の責任は著者にあることが明記されています
- 計算に使ったデータは、米国・スマートフォン環境・2日間の集計値です。日本語や日本の検索についての記述は、原文にありませんでした
- 数式が多く、部分識別(データと仮定から、答えを1点でなく幅で絞る考え方)など統計の専門用語が中心です。この記事では、実務に関係する部分に絞って紹介しました
この論文から、言えること・言えないこと
| 言えること(論文の計算と整理の範囲) | 言えないこと |
|---|---|
| 質問群の比率を変えるだけで、合計のスコアは大きく動き得る | 実際の利用者の質問の比率が、どうなっているか |
| 得意な場面が交差する2つのサービスでは、重み次第で優劣が逆転し得る | 実在のサービス同士で、順位が逆転していること |
| 名前を入れた質問と入れない質問は、別の課題として分けて測るべき | 日本語の質問でも、同じ大きさの差が出ること |
| 引用の表示と、回答への貢献は、別の物差しが要る | ある施策が、AI検索での見え方や売上を上げること |
| 分母(全質問か、表示された回答か)を替えるだけで割合は変わる(この例では約1.4〜2.5倍) | 提案した記録の手順が、計測の精度を実際に上げること |
中小企業の視点で、どう受け取るか
ここからは論文の主張とは別の、私の読み取りです。
計測の数字を受け取ったら、まず質問の一覧を見せてもらう
「引用率40%」を見たら、質問の件数、名前入りの質問の割合、サービス、日時、分母をたずねます。名前入りの質問が多ければ、数字は高く出やすくなります。
数字の良し悪しを判断するのは、その後です。
名前入りの質問と、名前なしの質問は、別々に記録する
中小企業にとって大事なのは、たいてい「まだ自社を知らない人が、名前を出さずに探したときに出るか」です。名前入りの質問の好成績は、それとは別の力を示しています。
2つを1つの数字に混ぜないほうが、打ち手を選びやすくなります。
前月と比べるときは、質問の集まりを固定する
論文は、固定の質問セットと、入れ替える質問セットを分けて扱うよう勧めています。質問を入れ替えた月は、上がった・下がったを施策の結果とは読まず、別の欄に分けて記録するのが安全です。
質問を固定しても、AI側の変更や競合の動きは残るので、固定した月の上下も施策の結果と決めつけないでください。
数を増やす前に、何の数かを決める
同じ質問を繰り返す揺れについては、引用割合の不確かさを扱った論文が、必要な質問数の目安を示していました。
今回の論文が問うのは、その手前の「どの質問の集まりを測るか」です。論文は、観測の数を増やしても、偏った選び方は必ずしも埋め合わせられないとする研究を引いています。
よくある質問
「回答市場」とは何ですか。AI検索の見え方の計測で、なぜ問題になるのですか
論文の言う回答市場は、計測のために集めた質問と、その重みで決まる「回答の機会」の集まりです。スコアはこの回答市場の中での見え方を表すので、質問の選び方が変われば、測っている対象そのものが変わります。
論文は、この回答市場が実際の利用者の需要を表すとは限らない、と繰り返し注意しています。
質問を増やせば、GEOの見え方のスコアは正確になりますか
揺れによる誤差は、数を増やすと小さくなります。4サービス45日間の追跡が勧めた繰り返し測定も、この誤差への対策です。
一方で、どんな場面の質問を、どの比率で含めるかという偏りは、数を増やしても残ります。論文は、ある層の質問がまったく集まらない場合、追加の仮定を置かずに他の層の重みを調整しても、その層のふるまいは推定できないと述べています。
回答市場の論文は、AI検索の計測サービスを使うなと言っているのですか
言っていません。論文の結論は、スコアが「どの回答の機会について」「どんな条件で比べられるか」を明記すれば、スコアに意味を持たせられる、というものです。
質問・重み・分母・採点方法が示されていれば、その数字は判断の材料になります。
まとめ:今日できる1つのこと
AI検索での自社の見え方を測っているなら(あるいは、受け取っているレポートがあるなら)、使っている質問を「名前を入れない質問」「名前を入れた質問」「比較の質問」の3つに分け、それぞれの件数を書き出してください。
そのうえで、スコアを3つ別々に記録し、合計の数字を出すときは、どの比率で混ぜたかを横に書き添えます。数字そのものより先に、その数字がどの質問の集まりから出たかを残すことが、次の判断を助けます。
この論文は、LLMO論文の一覧の一本です。ほかの論文の解説も、順次公開しています。
この記事に書いたことを、そのまま御社のページに
生成AIに引用されるページを、お話しいただくだけでお作りします。お時間をいただくのは初回15分のヒアリングだけです。まず1ページ、無料でお作りします。
OKが出るまで、何度でも直します。事実が違う、言い回しが硬い、この話は入れないでほしい。どれも遠慮なくおっしゃってください。何度お直ししても、追加の料金はいただきません。
これまでに127社にご利用いただきました。毎月ご依頼いただいている方の6割以上が、月10ページを選ばれています。料金はページに掲載しています。
ページを増やしても問い合わせが来ないなら、原因はページの外にあります。その場合は、下の入口からご相談ください。
自社のマーケティング課題を根本から解決しませんか?
ウェブサイトから要素を引き算し、訪れた人が迷わず次の一歩に進む形へ組み直す。初回60分のオンラインで御社のサイトを一緒に読み、どこから直すべきかをお伝えします。手順をまとめた無料の診断と解説動画もご用意しています。
初回は無料・60分・オンライン完結・その場で契約のお願いはいたしません


