「AIの回答で、うちのサイトの引用割合は12%、競合は8%だった」。こうした報告を受けたら、その4ポイントの差は本物だと考えてよいのでしょうか。
AI検索は、同じ質問にも毎回少しずつ違う答えを返します。1回の測定で出した数字が、たまたまの揺れなのか実力の差なのかを、統計の考え方で見分けようとした論文があります。
2026年3月に公開された「Quantifying Uncertainty in AI Visibility」です。
著者は、AI検索での見え方を計測・検証するサービスを提供する企業に所属しています。同社は、信頼区間つきの計測を売りにしています。
この記事では原文(本文と付録)を通読し、何が分かり、どこまで言えるのかを整理します。数値は論文の表と本文から拾い、私が計算した値には「概算」と付けました。
合同会社謙虚は、3つのドメインを並行して運用し、何を変えると数字が動くかを測り続けています。この論文を読む理由は、「AIに引用される割合が上がった」と言うときに、その差が測定の揺れより大きいかを判断する物差しを、自分たちで持っておきたいからです。
結論:3行で言うと
- 同じ200問を3つのAI検索に9日間投げ続けると、同じ質問への2回の回答で引用元の重なり(両方に出た数÷どちらかに出た数)は、中央値で0.29〜0.50にとどまりました
- 1回の測定で出した引用割合には、95%信頼区間(本当の値がおそらく入る範囲)でSearchGPTでは多くのドメインで3〜6ポイント、GeminiとPerplexityでも上位ドメインは3〜5ポイント程度の幅があり、5〜7ポイント未満の差は、多くが「引き分け」と区別できない水準でした
- 著者は、引用割合を幅つきで報告すべきだと主張し、幅を5ポイント以内に収めるには、サービスによって約40問から150問以上が要るという目安を示しています
ただし、著者の所属企業はこの結論と同じ方向の事業を営んでおり、論文は査読前のプレプリントです。この2点は後で扱います。
この論文の基本情報
| 項目 | 内容 |
|---|---|
| 原題 | Quantifying Uncertainty in AI Visibility: A Statistical Framework for Generative Search Measurement |
| 著者 | Ronald Sielinski(1人。所属は、AI検索での見え方の測定・検証サービスを提供する企業) |
| 公開日 | 2026年3月9日(arXiv初版)。確認した版は2026年8月26日の第3版 |
| arXiv番号 | 2603.08924(主分野は応用統計。AIと情報検索にも登録) |
| 掲載・採択状況 | arXivのプレプリント。コメント欄は「39ページ、図13」と、所属企業の記事一覧へのリンクだけで、学会や学術誌への採択の記載は見当たりません |
| 種類 | 実測データにもとづく測定方法の提案(実証研究) |
| 実験データとコード | 公開先の記載は、原文に見当たりません |
論文はこちらで読めます。arXiv(2603.08924)、DOI。
この論文が答えた問い
AI検索で測った「引用割合」は、1回の測定でどこまで信じてよいのか。ドメイン同士の差を語るには、何問の質問を集めればよいのか。
著者によれば、測定の現場では質問をまとめて1回投げ、その結果の引用割合を実力の値として扱い、施策の効果もその1回同士で比べることが多いといいます。
著者は、数字が揺れる原因を2つに分けて考えます。1つ目はAI側の揺れです。
AI検索は回答を確率的に作るので、同じ質問でも引用元が変わります。2つ目は測定の誤差です。
AIがまったく揺れなかったとしても、200問という限られた質問から出した割合には、偶然のずれが残ります。論文は、両方を数字で示そうとしました。
この記事で使う言葉
- 引用割合: 集めた回答の引用すべてのうち、あるドメインが占める割合
- 出現率: 集めた回答のうち、あるドメインを1回以上引用した回答の割合。1つの回答で何度引用されても1回と数えます
- 信頼区間: 「本当の値は、おそらくこの範囲にある」という幅。95%信頼区間は、同じ測り方を何度も繰り返したとき、およそ20回に19回は本当の値を含むように作った幅です
- ブートストラップ: 手元の200件の回答から、重複を許して200件を引き直し、引用割合を計算し直す作業を繰り返す方法。論文は1,000回繰り返し、その振れ幅から信頼区間を作っています
どうやって調べたのか
| 項目 | 設定 |
|---|---|
| 対象のAI検索 | Perplexity、SearchGPT(OpenAIの検索機能。論文の呼び名のまま)、Gemini の3つ |
| 分野 | 鳥の餌台、成人向けマルチビタミン、ランニング用品の3つ。いずれもブランド名を含まない一般的な質問 |
| 質問 | 1分野200問。ChatGPTに、長所と短所、人気の選択肢、価格に見合う価値、専門家のおすすめなど10種類の切り口から作らせたもの。重複は残してあり、重複率は7.5〜24.0%(表1) |
| データ1:毎日の測定 | 2026年2月3〜11日の9日間、同じ200問を1日1回ずつ投げる |
| データ2:10分おきの測定 | ランニング用品だけ、10分おきに約4時間、25回投げる(図3の注記では2026年3月4日)。ページが書き換わる時間を与えず、AI側の揺れだけを見るため |
| 集計の単位 | 引用されたURLを、ドメイン単位にまとめて数える |
| 集めた引用の数 | 毎日の測定で374,052件、10分おきの測定で379,276件(重複を除いた後) |
| ページ内容の確認 | 引用されたページの本文から、文章の指紋のような値(ハッシュ値)を毎回記録し、ページが書き換わったかどうかを見分ける |
1回答に付く引用の数はサービスで6倍ほど違うため(表2、次章の表)、論文は件数のままでは比べず、割合で比べています。
結果
同じ質問でも、引用元は毎回入れ替わる
同じ質問への回答を9日分集め、2回ずつの組を作って、引用ドメインの重なりを比べました(表4)。重なりの指標はJaccard(ジャッカード)係数で、「両方に出たドメインの数」を「どちらかに出たドメインの数」で割った値です。
1なら完全に一致、0なら共通なしです。
| サービス | 1回答の引用数(中央値) | 重なり(中央値) | 引用元が完全に一致した組 | 共通が1つもない組 |
|---|---|---|---|---|
| Gemini | 36〜40件 | 0.29〜0.31 | 0.01〜0.10% | 0.35〜1.62% |
| SearchGPT | 5〜7件 | 0.33〜0.40 | 5.34〜8.02% | 6.08〜8.93% |
| Perplexity | 19〜22件 | 0.50 | 3.25〜4.65% | 1.05〜2.40% |
幅は3分野での最小〜最大です。比べた組は、1行あたり6,084〜7,164組でした。
- 重なりは、1回答の引用数とほとんど関係がありませんでした。引用が多い回答ほど入れ替わりやすい、という傾向は見られず、サービスごとにほぼ一定の水準(Geminiで約0.30、SearchGPTで約0.40、Perplexityで約0.50)に落ち着いています(図2)
- SearchGPTは、ほぼ同じ回答を返す回と、まるで違う回答を返す回が混ざる傾向でした。成人向けマルチビタミンでは、9日間すべてで引用数がまったく同じだったドメインが9つあります
- 引用は上位のごく一部に集まり、下位に長い裾が続く形(べき乗則)でした。この形は9日間ほぼ変わらず、変わるのは個々のドメインの位置です
先に解説した4サービス45日間の追跡でも、同じ質問への出典の重なりは約3〜4割でした。
揺れの大きさは、おおむね一致しています。ただし、45日間の追跡ではGeminiの重なりが0.505と最も高く、この論文では約0.30と最も低い値でした。
言語(ドイツ語と英語)や集め方が違うので、「どのサービスが安定か」は条件で入れ替わると受け取るのが安全です。
1回の測定の引用割合は、思ったより幅を持つ
1日目の200問の回答から、ブートストラップで95%信頼区間を作りました(図10)。
- SearchGPTでは、よく引用されるドメインの大半で、区間の幅が3〜6ポイントありました。GeminiとPerplexityは狭めですが、上位のドメインほど幅は広く、Geminiのマルチビタミンで上位のドメインは引用割合6.0%に対して幅3.2ポイント、Perplexityのランニング用品で上位のドメインは13.4%に対して幅4.7ポイントでした
- 論文冒頭の例では、SearchGPTのランニング用品で、あるレビューサイトが約9.5%、ランニング専門誌のサイトが約6.0%でした。一見3.5ポイントの差ですが、信頼区間は前者が約5.5〜12.5%、後者が約4.0〜8.0%で、後者の区間は前者の区間にすっぽり収まります。この差は、測定の揺れの範囲内です
- 著者によれば、見かけの差が5〜7ポイント未満のドメイン同士では、このように区間が重なるのが普通でした
- 1回の測定が大きく外れる例もありました。Geminiの鳥の餌台で、ある自然系メディアは1日目に3.2%(区間は2.4〜4.2%)でしたが、9日間の平均は0.5%です。1日目だけを見た人は、このサイトを上位の常連と判断してしまいます
SearchGPTのマルチビタミンで首位のドメインは、9日間で9.2%から16.0%まで動きました。10分おきの約4時間でも、首位ドメインの引用割合はGeminiで5.3〜7.7%、SearchGPTで9.4〜12.5%の間を行き来しています。
何問あれば、幅を5ポイント以内に収められるか
質問の数を増やすと、信頼区間はどう狭まるかを調べました(図11)。目標は、引用割合で幅5ポイント、出現率で幅15ポイントです。
よく引用されるドメインのうち、最も幅の広いものが目標に届いた時点を読んでいます。
| 指標(目標の幅) | Geminiでは | Perplexityでは | SearchGPTでは |
|---|---|---|---|
| 引用割合(5ポイント) | 約40〜50問(鳥の餌台は約30問) | 約90〜100問 | 150問以上。鳥の餌台は200問でも届かず |
| 出現率(15ポイント) | 約140〜150問 | 約100〜140問 | 約60〜80問 |
- 必要な問数は、サービスと指標で大きく違いました。出現率でSearchGPTが最も少なく済むのは、1回答の引用が少ないと「出たか出ないか」が早く定まるためだと論文は説明しています
- SearchGPTでは、質問を足していく途中で幅がいったん狭まり、また広がる動きがありました。著者は、質問の並び順によって引用の傾向がずれるためと見ています
- このため著者は、「幅が狭くなったところで打ち切る」やり方は危ないと述べ、問数は測る前に決めておくよう勧めています
順位は、上位だけでなく全体で入れ替わる
毎日の測定で、よく引用されるドメインの順位表が、日によってどれだけ同じ並びかも調べました。使ったのは、上位の入れ替わりを重く数える順位相関(2つの順位表がどれだけ同じ並びかを表す数字。
1なら完全に同じ)です。著者は0.9以上を「安定」の目安にしています(表6)。
- 最も落ち着いていたGeminiのランニング用品でも、連続する2日の比較8組のうち安定は7組でした
- Geminiの鳥の餌台とマルチビタミンは、連続する2日では0.8を上回っていても、1日目と9日目を比べると0.689と0.726まで下がりました。1日ごとの小さなずれが、9日間で積み重なっていたことになります
- SearchGPTは、3分野のうち2分野で、区間が広すぎて安定かどうかを判定できる組が1つもありませんでした
ページの中身は、ほとんど変わっていなかった
引用割合の揺れは、引用されたページが書き換わったせいかもしれません。論文はこの可能性を、先に述べたハッシュ値で確かめました。
9日間を通して、上位ドメインのページは大半が変わっていませんでした(図13)。毎回値が変わったページもありますが、著者は広告枠など本文以外の変化の可能性を挙げていますが、本当の書き換えとの区別はしていません。
結論は、揺れの大部分はAI側の引用の選び方から来ている、というものです。
論文自身が書いている限界
- 分野は3つだけです。企業向けの話題、特定のサイトを探す質問、動きの速いニュースには、一般化できるか分かっていません
- 質問はChatGPTに作らせたものです。作ったAIの癖が、質問の偏りとして入り込んでいる可能性があります。実際の利用者の質問記録を使うことが、今後の課題に挙がっています
- Geminiは、利用回数の制限のため10分おきの測定から外した、と書かれています
- ページ内容の確認は、取得できたページに限られます。アクセスを拒否されたページ、動画、PDFは対象外です
- 観測期間は約9日間です。季節の変化や、サービスの大きな更新の影響は含まれていません
- たまにしか引用されないドメインの扱い、必要な問数の厳密な計算式、「安定」の基準の決め方は、今後の研究に回されています
原文を読んで気づいた点
ここからは、論文に書かれていない点です。
- 著者の所属企業は、AI検索での見え方を計測・検証するサービスの提供元です。「繰り返しの測定と幅の計算が要る」という結論は、その事業を後押しする方向です。利益相反の記述は、私が読んだ範囲では見当たりませんでした。自社報告として読む必要があります
- 査読を経ていません。arXivのプレプリントで、コメント欄にも採択の記載がありません
- 日本語での検証はありません。付録の質問例は英語で、測定した地域や言語設定の記載も見当たりません
- 画面で見る回答と同じとは限りません。引用は、PerplexityとSearchGPTでは開発者向けの接続口(API)の返す項目から取り出したと書かれています。Geminiについても、限界の節に「APIの利用回数の制限」とあり、API経由です。モデルの版や設定は書かれていません
- 引用の抽出は機械処理です。人の目で正しさを確かめた記述は見当たりません。データとコードの公開先も書かれていないので、第三者が数字を計算し直すことは難しい状態です
- 原文の中に、食い違いがあります。限界の節ではGeminiを10分おきの測定から外したとありますが、表3と図3にはGeminiの10分おきの結果(25回分)が載っています。SearchGPTの区間の幅は、第2.2節では「5〜7ポイントが普通」、第5.6節では「3〜6ポイント」です。SearchGPTの必要問数も、第5.7節の「150問以上」に対し、第7.3節は「現実的な予算ではどの問数でも届かない」としています
- 同じ著者は、この論文の続編として、10分野・各125問で順位の安定性を調べた論文(arXiv:2607.10341)を公開しています
この論文から、言えること・言えないこと
| 言えること(論文の設定で確認された) | 言えないこと(論文では確認されていない) |
|---|---|
| 同じ質問でも、引用ドメインは毎回入れ替わり、重なりは中央値で0.29〜0.50だった | 日本語の質問や日本国内で、同じ大きさの揺れが起きること |
| 200問で1回測った引用割合には、SearchGPTでは3〜6ポイント、ほかの2つでも上位ドメインは3〜5ポイント程度の幅がある | 40〜150問という目安が、どの業種・どの質問にも当てはまること |
| 5〜7ポイント未満の差は、多くが揺れと区別できなかった | ページを直すと、引用割合がどれだけ上がるか |
| 揺れは、ページの書き換えよりもAI側の選び方から来ていた | 画面で使う実際のサービスでも、同じ幅になること |
| 連続する日では小さなずれでも、9日間で順位は大きく動くことがある | どのサービスが最も安定しているか(別の研究ではGeminiとPerplexityの順番が逆だった) |
中小企業の視点で、どう受け取るか
ここからは論文の主張とは別の、私の読み取りです。
「引用割合が3ポイント上がった」と聞いたら、まず幅を尋ねる
ツールやレポートでAI検索での見え方の数字を見たら、「何問で、何回測ったか」「幅はどのくらいか」を確かめてください。論文の例では、SearchGPTで8%から11%へ3ポイント上がっても、典型的な区間の幅の内側に収まり、施策の効果とは言えないとされています。
「何問」と「何回」は、別々に考える
この論文が扱うのは、何種類の質問を集めるかという「問数」です。4サービス45日間の追跡が扱ったのは、同じ質問を何回繰り返すかという「回数」でした。
前者は分野全体の引用割合を、後者は1つの質問で自社が出る頻度を定めるための目安です。2つの論文は、測る対象が違うだけで、「1回で決めない」という点では同じ方向を向いています。
施策の前と後は、同じ条件で測る
著者は、書き換えで見え方が上がったとする研究にも、施策の前と後の両方に幅を付けるよう求めています。GEOの原論文も、その対象に名前が挙がっています。
自社で試すなら、同じ質問の組を、施策の前と後で同じ問数だけ測り、比べるのは幅同士にします。問数は、測り始める前に決めておきます。
測定サービスの論文であることを、割り引いて読む
「繰り返し測りましょう」という結論は、測定サービスを売る側に都合のよい結論でもあります。揺れの大きさは大学の研究とも一致するので、骨格は信頼してよいと私は考えます。
一方で「何問必要か」の数字は、英語の3分野での実測です。自社の質問で小さく測り、揺れの大きさを確かめるのが先です。
よくある質問
AI検索の引用割合は、1回の測定では当てにならないのですか
この論文の測定では、200問を1回投げて出した引用割合に、SearchGPTでは3〜6ポイント、GeminiとPerplexityでも上位ドメインで3〜5ポイント程度の幅がありました。
論文は、揺れを上回るほど大きな差か、施策の前後で繰り返し測って確かめた差だけが、揺れと区別できるとしています。数ポイントの差や、前月との小さな上下は、揺れの範囲に収まる可能性があります。
AI検索の引用割合を測るには、何問の質問が必要ですか
論文の目安では、引用割合の幅を5ポイント以内に収めるのに、Geminiで約40〜50問、Perplexityで約100問、SearchGPTで150問以上でした。英語の3分野での数字なので、そのまま自社に当てはめるより、自社の質問で揺れを見てから問数を決めるのがよいと考えます。
まとめ:今日できる1つのこと
手元にあるAI検索での見え方の数字を1つ選び、「何問で、何回測ったか」と「幅が示されているか」を書き出してください。分からなければ、次の報告から幅つきで出してもらうよう依頼します。
自分で測っている場合は、同じ質問の組を別の日にもう一度測り、2回の差を見るところから始められます。
この論文は、LLMO論文の一覧の一本です。ほかの論文の解説も、順次公開しています。
この記事に書いたことを、そのまま御社のページに
生成AIに引用されるページを、お話しいただくだけでお作りします。お時間をいただくのは初回15分のヒアリングだけです。まず1ページ、無料でお作りします。
OKが出るまで、何度でも直します。事実が違う、言い回しが硬い、この話は入れないでほしい。どれも遠慮なくおっしゃってください。何度お直ししても、追加の料金はいただきません。
これまでに127社にご利用いただきました。毎月ご依頼いただいている方の6割以上が、月10ページを選ばれています。料金はページに掲載しています。
ページを増やしても問い合わせが来ないなら、原因はページの外にあります。その場合は、下の入口からご相談ください。
自社のマーケティング課題を根本から解決しませんか?
ウェブサイトから要素を引き算し、訪れた人が迷わず次の一歩に進む形へ組み直す。初回60分のオンラインで御社のサイトを一緒に読み、どこから直すべきかをお伝えします。手順をまとめた無料の診断と解説動画もご用意しています。
初回は無料・60分・オンライン完結・その場で契約のお願いはいたしません


