MENU
  • 料金
  • 会社案内
  • コンサル
  • お問い合わせ
  • 無料で1ページ頼む
AIO・LLMO・GEO対策の記事制作
合同会社謙虚
  • 料金
  • 会社案内
  • コンサル
  • お問い合わせ
  • 無料で1ページ頼む
  • 料金
  • 会社案内
  • コンサル
  • お問い合わせ
  • 無料で1ページ頼む
合同会社謙虚
  • 料金
  • 会社案内
  • コンサル
  • お問い合わせ
  • 無料で1ページ頼む
  1. ホーム
  2. LLMO
  3. LLMO論文
  4. 【LLMO論文解説】AI検索の引用割合は1回の測定で決められない:信頼区間と必要な質問数|測定企業の自社研究(プレプリント2026)

【LLMO論文解説】AI検索の引用割合は1回の測定で決められない:信頼区間と必要な質問数|測定企業の自社研究(プレプリント2026)

2026 9/30
2026年9月24日2026年9月30日
中野輝規
AI検索の引用割合は1回の測定で決められない:信頼区間と必要な質問数

「AIの回答で、うちのサイトの引用割合は12%、競合は8%だった」。こうした報告を受けたら、その4ポイントの差は本物だと考えてよいのでしょうか。

AI検索は、同じ質問にも毎回少しずつ違う答えを返します。1回の測定で出した数字が、たまたまの揺れなのか実力の差なのかを、統計の考え方で見分けようとした論文があります。

2026年3月に公開された「Quantifying Uncertainty in AI Visibility」です。

著者は、AI検索での見え方を計測・検証するサービスを提供する企業に所属しています。同社は、信頼区間つきの計測を売りにしています。

この記事では原文(本文と付録)を通読し、何が分かり、どこまで言えるのかを整理します。数値は論文の表と本文から拾い、私が計算した値には「概算」と付けました。

合同会社謙虚は、3つのドメインを並行して運用し、何を変えると数字が動くかを測り続けています。この論文を読む理由は、「AIに引用される割合が上がった」と言うときに、その差が測定の揺れより大きいかを判断する物差しを、自分たちで持っておきたいからです。

目次

結論:3行で言うと

  • 同じ200問を3つのAI検索に9日間投げ続けると、同じ質問への2回の回答で引用元の重なり(両方に出た数÷どちらかに出た数)は、中央値で0.29〜0.50にとどまりました
  • 1回の測定で出した引用割合には、95%信頼区間(本当の値がおそらく入る範囲)でSearchGPTでは多くのドメインで3〜6ポイント、GeminiとPerplexityでも上位ドメインは3〜5ポイント程度の幅があり、5〜7ポイント未満の差は、多くが「引き分け」と区別できない水準でした
  • 著者は、引用割合を幅つきで報告すべきだと主張し、幅を5ポイント以内に収めるには、サービスによって約40問から150問以上が要るという目安を示しています

ただし、著者の所属企業はこの結論と同じ方向の事業を営んでおり、論文は査読前のプレプリントです。この2点は後で扱います。

この論文の基本情報

項目 内容
原題 Quantifying Uncertainty in AI Visibility: A Statistical Framework for Generative Search Measurement
著者 Ronald Sielinski(1人。所属は、AI検索での見え方の測定・検証サービスを提供する企業)
公開日 2026年3月9日(arXiv初版)。確認した版は2026年8月26日の第3版
arXiv番号 2603.08924(主分野は応用統計。AIと情報検索にも登録)
掲載・採択状況 arXivのプレプリント。コメント欄は「39ページ、図13」と、所属企業の記事一覧へのリンクだけで、学会や学術誌への採択の記載は見当たりません
種類 実測データにもとづく測定方法の提案(実証研究)
実験データとコード 公開先の記載は、原文に見当たりません

論文はこちらで読めます。arXiv(2603.08924)、DOI。

この論文が答えた問い

AI検索で測った「引用割合」は、1回の測定でどこまで信じてよいのか。ドメイン同士の差を語るには、何問の質問を集めればよいのか。

著者によれば、測定の現場では質問をまとめて1回投げ、その結果の引用割合を実力の値として扱い、施策の効果もその1回同士で比べることが多いといいます。

著者は、数字が揺れる原因を2つに分けて考えます。1つ目はAI側の揺れです。

AI検索は回答を確率的に作るので、同じ質問でも引用元が変わります。2つ目は測定の誤差です。

AIがまったく揺れなかったとしても、200問という限られた質問から出した割合には、偶然のずれが残ります。論文は、両方を数字で示そうとしました。

この記事で使う言葉

  • 引用割合: 集めた回答の引用すべてのうち、あるドメインが占める割合
  • 出現率: 集めた回答のうち、あるドメインを1回以上引用した回答の割合。1つの回答で何度引用されても1回と数えます
  • 信頼区間: 「本当の値は、おそらくこの範囲にある」という幅。95%信頼区間は、同じ測り方を何度も繰り返したとき、およそ20回に19回は本当の値を含むように作った幅です
  • ブートストラップ: 手元の200件の回答から、重複を許して200件を引き直し、引用割合を計算し直す作業を繰り返す方法。論文は1,000回繰り返し、その振れ幅から信頼区間を作っています

どうやって調べたのか

項目 設定
対象のAI検索 Perplexity、SearchGPT(OpenAIの検索機能。論文の呼び名のまま)、Gemini の3つ
分野 鳥の餌台、成人向けマルチビタミン、ランニング用品の3つ。いずれもブランド名を含まない一般的な質問
質問 1分野200問。ChatGPTに、長所と短所、人気の選択肢、価格に見合う価値、専門家のおすすめなど10種類の切り口から作らせたもの。重複は残してあり、重複率は7.5〜24.0%(表1)
データ1:毎日の測定 2026年2月3〜11日の9日間、同じ200問を1日1回ずつ投げる
データ2:10分おきの測定 ランニング用品だけ、10分おきに約4時間、25回投げる(図3の注記では2026年3月4日)。ページが書き換わる時間を与えず、AI側の揺れだけを見るため
集計の単位 引用されたURLを、ドメイン単位にまとめて数える
集めた引用の数 毎日の測定で374,052件、10分おきの測定で379,276件(重複を除いた後)
ページ内容の確認 引用されたページの本文から、文章の指紋のような値(ハッシュ値)を毎回記録し、ページが書き換わったかどうかを見分ける

1回答に付く引用の数はサービスで6倍ほど違うため(表2、次章の表)、論文は件数のままでは比べず、割合で比べています。

結果

同じ質問でも、引用元は毎回入れ替わる

同じ質問への回答を9日分集め、2回ずつの組を作って、引用ドメインの重なりを比べました(表4)。重なりの指標はJaccard(ジャッカード)係数で、「両方に出たドメインの数」を「どちらかに出たドメインの数」で割った値です。

1なら完全に一致、0なら共通なしです。

サービス 1回答の引用数(中央値) 重なり(中央値) 引用元が完全に一致した組 共通が1つもない組
Gemini 36〜40件 0.29〜0.31 0.01〜0.10% 0.35〜1.62%
SearchGPT 5〜7件 0.33〜0.40 5.34〜8.02% 6.08〜8.93%
Perplexity 19〜22件 0.50 3.25〜4.65% 1.05〜2.40%

幅は3分野での最小〜最大です。比べた組は、1行あたり6,084〜7,164組でした。

  • 重なりは、1回答の引用数とほとんど関係がありませんでした。引用が多い回答ほど入れ替わりやすい、という傾向は見られず、サービスごとにほぼ一定の水準(Geminiで約0.30、SearchGPTで約0.40、Perplexityで約0.50)に落ち着いています(図2)
  • SearchGPTは、ほぼ同じ回答を返す回と、まるで違う回答を返す回が混ざる傾向でした。成人向けマルチビタミンでは、9日間すべてで引用数がまったく同じだったドメインが9つあります
  • 引用は上位のごく一部に集まり、下位に長い裾が続く形(べき乗則)でした。この形は9日間ほぼ変わらず、変わるのは個々のドメインの位置です

先に解説した4サービス45日間の追跡でも、同じ質問への出典の重なりは約3〜4割でした。

揺れの大きさは、おおむね一致しています。ただし、45日間の追跡ではGeminiの重なりが0.505と最も高く、この論文では約0.30と最も低い値でした。

言語(ドイツ語と英語)や集め方が違うので、「どのサービスが安定か」は条件で入れ替わると受け取るのが安全です。

1回の測定の引用割合は、思ったより幅を持つ

1日目の200問の回答から、ブートストラップで95%信頼区間を作りました(図10)。

  • SearchGPTでは、よく引用されるドメインの大半で、区間の幅が3〜6ポイントありました。GeminiとPerplexityは狭めですが、上位のドメインほど幅は広く、Geminiのマルチビタミンで上位のドメインは引用割合6.0%に対して幅3.2ポイント、Perplexityのランニング用品で上位のドメインは13.4%に対して幅4.7ポイントでした
  • 論文冒頭の例では、SearchGPTのランニング用品で、あるレビューサイトが約9.5%、ランニング専門誌のサイトが約6.0%でした。一見3.5ポイントの差ですが、信頼区間は前者が約5.5〜12.5%、後者が約4.0〜8.0%で、後者の区間は前者の区間にすっぽり収まります。この差は、測定の揺れの範囲内です
  • 著者によれば、見かけの差が5〜7ポイント未満のドメイン同士では、このように区間が重なるのが普通でした
  • 1回の測定が大きく外れる例もありました。Geminiの鳥の餌台で、ある自然系メディアは1日目に3.2%(区間は2.4〜4.2%)でしたが、9日間の平均は0.5%です。1日目だけを見た人は、このサイトを上位の常連と判断してしまいます

SearchGPTのマルチビタミンで首位のドメインは、9日間で9.2%から16.0%まで動きました。10分おきの約4時間でも、首位ドメインの引用割合はGeminiで5.3〜7.7%、SearchGPTで9.4〜12.5%の間を行き来しています。

何問あれば、幅を5ポイント以内に収められるか

質問の数を増やすと、信頼区間はどう狭まるかを調べました(図11)。目標は、引用割合で幅5ポイント、出現率で幅15ポイントです。

よく引用されるドメインのうち、最も幅の広いものが目標に届いた時点を読んでいます。

指標(目標の幅) Geminiでは Perplexityでは SearchGPTでは
引用割合(5ポイント) 約40〜50問(鳥の餌台は約30問) 約90〜100問 150問以上。鳥の餌台は200問でも届かず
出現率(15ポイント) 約140〜150問 約100〜140問 約60〜80問
  • 必要な問数は、サービスと指標で大きく違いました。出現率でSearchGPTが最も少なく済むのは、1回答の引用が少ないと「出たか出ないか」が早く定まるためだと論文は説明しています
  • SearchGPTでは、質問を足していく途中で幅がいったん狭まり、また広がる動きがありました。著者は、質問の並び順によって引用の傾向がずれるためと見ています
  • このため著者は、「幅が狭くなったところで打ち切る」やり方は危ないと述べ、問数は測る前に決めておくよう勧めています

順位は、上位だけでなく全体で入れ替わる

毎日の測定で、よく引用されるドメインの順位表が、日によってどれだけ同じ並びかも調べました。使ったのは、上位の入れ替わりを重く数える順位相関(2つの順位表がどれだけ同じ並びかを表す数字。

1なら完全に同じ)です。著者は0.9以上を「安定」の目安にしています(表6)。

  • 最も落ち着いていたGeminiのランニング用品でも、連続する2日の比較8組のうち安定は7組でした
  • Geminiの鳥の餌台とマルチビタミンは、連続する2日では0.8を上回っていても、1日目と9日目を比べると0.689と0.726まで下がりました。1日ごとの小さなずれが、9日間で積み重なっていたことになります
  • SearchGPTは、3分野のうち2分野で、区間が広すぎて安定かどうかを判定できる組が1つもありませんでした

ページの中身は、ほとんど変わっていなかった

引用割合の揺れは、引用されたページが書き換わったせいかもしれません。論文はこの可能性を、先に述べたハッシュ値で確かめました。

9日間を通して、上位ドメインのページは大半が変わっていませんでした(図13)。毎回値が変わったページもありますが、著者は広告枠など本文以外の変化の可能性を挙げていますが、本当の書き換えとの区別はしていません。

結論は、揺れの大部分はAI側の引用の選び方から来ている、というものです。

論文自身が書いている限界

  • 分野は3つだけです。企業向けの話題、特定のサイトを探す質問、動きの速いニュースには、一般化できるか分かっていません
  • 質問はChatGPTに作らせたものです。作ったAIの癖が、質問の偏りとして入り込んでいる可能性があります。実際の利用者の質問記録を使うことが、今後の課題に挙がっています
  • Geminiは、利用回数の制限のため10分おきの測定から外した、と書かれています
  • ページ内容の確認は、取得できたページに限られます。アクセスを拒否されたページ、動画、PDFは対象外です
  • 観測期間は約9日間です。季節の変化や、サービスの大きな更新の影響は含まれていません
  • たまにしか引用されないドメインの扱い、必要な問数の厳密な計算式、「安定」の基準の決め方は、今後の研究に回されています

原文を読んで気づいた点

ここからは、論文に書かれていない点です。

  • 著者の所属企業は、AI検索での見え方を計測・検証するサービスの提供元です。「繰り返しの測定と幅の計算が要る」という結論は、その事業を後押しする方向です。利益相反の記述は、私が読んだ範囲では見当たりませんでした。自社報告として読む必要があります
  • 査読を経ていません。arXivのプレプリントで、コメント欄にも採択の記載がありません
  • 日本語での検証はありません。付録の質問例は英語で、測定した地域や言語設定の記載も見当たりません
  • 画面で見る回答と同じとは限りません。引用は、PerplexityとSearchGPTでは開発者向けの接続口(API)の返す項目から取り出したと書かれています。Geminiについても、限界の節に「APIの利用回数の制限」とあり、API経由です。モデルの版や設定は書かれていません
  • 引用の抽出は機械処理です。人の目で正しさを確かめた記述は見当たりません。データとコードの公開先も書かれていないので、第三者が数字を計算し直すことは難しい状態です
  • 原文の中に、食い違いがあります。限界の節ではGeminiを10分おきの測定から外したとありますが、表3と図3にはGeminiの10分おきの結果(25回分)が載っています。SearchGPTの区間の幅は、第2.2節では「5〜7ポイントが普通」、第5.6節では「3〜6ポイント」です。SearchGPTの必要問数も、第5.7節の「150問以上」に対し、第7.3節は「現実的な予算ではどの問数でも届かない」としています
  • 同じ著者は、この論文の続編として、10分野・各125問で順位の安定性を調べた論文(arXiv:2607.10341)を公開しています

この論文から、言えること・言えないこと

言えること(論文の設定で確認された) 言えないこと(論文では確認されていない)
同じ質問でも、引用ドメインは毎回入れ替わり、重なりは中央値で0.29〜0.50だった 日本語の質問や日本国内で、同じ大きさの揺れが起きること
200問で1回測った引用割合には、SearchGPTでは3〜6ポイント、ほかの2つでも上位ドメインは3〜5ポイント程度の幅がある 40〜150問という目安が、どの業種・どの質問にも当てはまること
5〜7ポイント未満の差は、多くが揺れと区別できなかった ページを直すと、引用割合がどれだけ上がるか
揺れは、ページの書き換えよりもAI側の選び方から来ていた 画面で使う実際のサービスでも、同じ幅になること
連続する日では小さなずれでも、9日間で順位は大きく動くことがある どのサービスが最も安定しているか(別の研究ではGeminiとPerplexityの順番が逆だった)

中小企業の視点で、どう受け取るか

ここからは論文の主張とは別の、私の読み取りです。

「引用割合が3ポイント上がった」と聞いたら、まず幅を尋ねる

ツールやレポートでAI検索での見え方の数字を見たら、「何問で、何回測ったか」「幅はどのくらいか」を確かめてください。論文の例では、SearchGPTで8%から11%へ3ポイント上がっても、典型的な区間の幅の内側に収まり、施策の効果とは言えないとされています。

「何問」と「何回」は、別々に考える

この論文が扱うのは、何種類の質問を集めるかという「問数」です。4サービス45日間の追跡が扱ったのは、同じ質問を何回繰り返すかという「回数」でした。

前者は分野全体の引用割合を、後者は1つの質問で自社が出る頻度を定めるための目安です。2つの論文は、測る対象が違うだけで、「1回で決めない」という点では同じ方向を向いています。

施策の前と後は、同じ条件で測る

著者は、書き換えで見え方が上がったとする研究にも、施策の前と後の両方に幅を付けるよう求めています。GEOの原論文も、その対象に名前が挙がっています。

自社で試すなら、同じ質問の組を、施策の前と後で同じ問数だけ測り、比べるのは幅同士にします。問数は、測り始める前に決めておきます。

測定サービスの論文であることを、割り引いて読む

「繰り返し測りましょう」という結論は、測定サービスを売る側に都合のよい結論でもあります。揺れの大きさは大学の研究とも一致するので、骨格は信頼してよいと私は考えます。

一方で「何問必要か」の数字は、英語の3分野での実測です。自社の質問で小さく測り、揺れの大きさを確かめるのが先です。

よくある質問

AI検索の引用割合は、1回の測定では当てにならないのですか

この論文の測定では、200問を1回投げて出した引用割合に、SearchGPTでは3〜6ポイント、GeminiとPerplexityでも上位ドメインで3〜5ポイント程度の幅がありました。

論文は、揺れを上回るほど大きな差か、施策の前後で繰り返し測って確かめた差だけが、揺れと区別できるとしています。数ポイントの差や、前月との小さな上下は、揺れの範囲に収まる可能性があります。

AI検索の引用割合を測るには、何問の質問が必要ですか

論文の目安では、引用割合の幅を5ポイント以内に収めるのに、Geminiで約40〜50問、Perplexityで約100問、SearchGPTで150問以上でした。英語の3分野での数字なので、そのまま自社に当てはめるより、自社の質問で揺れを見てから問数を決めるのがよいと考えます。

まとめ:今日できる1つのこと

手元にあるAI検索での見え方の数字を1つ選び、「何問で、何回測ったか」と「幅が示されているか」を書き出してください。分からなければ、次の報告から幅つきで出してもらうよう依頼します。

自分で測っている場合は、同じ質問の組を別の日にもう一度測り、2回の差を見るところから始められます。

この論文は、LLMO論文の一覧の一本です。ほかの論文の解説も、順次公開しています。

この記事に書いたことを、そのまま御社のページに

生成AIに引用されるページを、お話しいただくだけでお作りします。お時間をいただくのは初回15分のヒアリングだけです。まず1ページ、無料でお作りします。

OKが出るまで、何度でも直します。事実が違う、言い回しが硬い、この話は入れないでほしい。どれも遠慮なくおっしゃってください。何度お直ししても、追加の料金はいただきません。

これまでに127社にご利用いただきました。毎月ご依頼いただいている方の6割以上が、月10ページを選ばれています。料金はページに掲載しています。

まず1ページ、無料で作らせてください

ページを増やしても問い合わせが来ないなら、原因はページの外にあります。その場合は、下の入口からご相談ください。

自社のマーケティング課題を根本から解決しませんか?

ウェブサイトから要素を引き算し、訪れた人が迷わず次の一歩に進む形へ組み直す。初回60分のオンラインで御社のサイトを一緒に読み、どこから直すべきかをお伝えします。手順をまとめた無料の診断と解説動画もご用意しています。

まず動画で詳しく見る(約30分)
無料診断を受ける

初回は無料・60分・オンライン完結・その場で契約のお願いはいたしません

LLMO論文
SEO対策 生成AI
よかったらシェアしてね!
  • URLをコピーしました!
  • 【LLMO論文解説】AIに引用されたページを16の観点で採点した「GEO-16」を原文から読む|相関と利益相反の注意点(プレプリント)
  • 【LLMO論文解説】AI検索に社名が出る割合は知名度で73%・44%・11%|5つのAIで102ブランドを測った計測企業の自社報告(プレプリント)

この記事を書いた人

中野輝規のアバター 中野輝規

合同会社謙虚 代表社員。20代から、売る言葉だけを仕事にしてきました。電話営業で受話器を握っていた時代から、数千社のWEB集客に関わったいままで。詳しいプロフィールはこちら

この著者の記事一覧へ

関連記事

  • 文書に仕込んだ指示でAIの順位づけは乗っ取られるか
    【LLMO論文解説】文書に仕込んだ指示でAIの順位づけは乗っ取られるか|8モデル・3方式で試した「順位づけの盲点」(EMNLP 2025)
  • 悪意あるGEO攻撃を無害化する二段防御「GEO Defender」
    【LLMO論文解説】悪意あるGEO攻撃を無害化する二段防御「GEO Defender」|攻撃成功率を50%から6%に低減(プレプリント)
  • 汚染された根拠が混ざるとAIの事実確認はどこまで崩れるか
    【LLMO論文解説】汚染された根拠が混ざるとAIの事実確認はどこまで崩れるか「GPE」|638件・4方式で比較(プレプリント)
  • AI検索の引用は、半分近くが出典で裏づけられていなかった
    【LLMO論文解説】AI検索の引用は、半分近くが出典で裏づけられていなかった|GEO登場前の初期監査(Findings of EMNLP 2023)
  • 東京のホテルでAIが引用するサイトは質問の言い方と言語で変わる
    【LLMO論文解説】東京のホテルでAIが引用するサイトは質問の言い方と言語で変わる|OTAと日本語・英語の比較(HFE 2026)
  • AIに競合を出し抜かせる「選好操作攻撃」
    【LLMO論文解説】AIに競合を出し抜かせる「選好操作攻撃」|全員が攻撃すると損をする囚人のジレンマ(ICLR 2025)
  • AI検索は第三者の媒体を選びやすいのか、Googleと4つのAIを比べた実験を原文から読む
    【LLMO論文解説】AI検索は第三者の媒体を選びやすいのか、Googleと複数のAIを比べた実験を原文から読む|獲得メディアの偏りと限界(プレプリント)
  • AI回答での露出が売上に効いたかを測る統計の枠組み
    【LLMO論文解説】AI回答での露出が売上に効いたかを測る統計の枠組み|広告の効果測定手法を生成AI向けに拡張(プレプリント)
最近の投稿
  • 温泉の集客は宿泊客と日帰り客の線引きで決まる 掲示ルールに沿うページの作り方
  • デザイナーの集客は作品集だけでは届かない 発注担当が社内で通せるサイトの作り方
  • 屋根の集客は見えない屋根を見せる会社が選ばれる 点検商法と疑われないサイトの作り方
  • 遺品整理の集客は遺族の迷いに先回りして決まる 広告頼みから指名へ移るサイトの作り方
  • 看板の集客は検索した先で決まる 見た人を来店につなぐ受け皿の作り方
最近のコメント
  • ホテルの集客は公式サイトで迷わせないことから 予約サイト頼みを抜ける直し方 に 温泉の集客は宿泊客と日帰り客の線引きで決まる 掲示ルールに沿うページの作り方 - 合同会社謙虚 より
  • 外壁塗装の集客は急がせない会社が選ばれる 下請けを抜けて直接の依頼を増やすホームページの作り方 に 屋根の集客は見えない屋根を見せる会社が選ばれる 点検商法と疑われないサイトの作り方 - 合同会社謙虚 より
  • 不用品回収の集客は料金の見せ方で決まる 当日の追加請求を疑われない業者のサイトの作り方 に 遺品整理の集客は遺族の迷いに先回りして決まる 広告頼みから指名へ移るサイトの作り方 - 合同会社謙虚 より
  • 外壁塗装の集客は急がせない会社が選ばれる 下請けを抜けて直接の依頼を増やすホームページの作り方 に 看板の集客は検索した先で決まる 見た人を来店につなぐ受け皿の作り方 - 合同会社謙虚 より
  • 【LLMO論文解説】回答が似ていても出典は重ならない|BaiduとGoogleのAI要約を英語と中国語の500問で監査(EMNLP 2026ワークショップ) に 【LLMO論文解説】海外のGEO・LLMO・AIO論文101本の一覧|原論文から最新研究まで、テーマ別に整理(随時更新) - 合同会社謙虚 より
  • 記事制作(KCW)
  • 売れるサイトはみな謙虚
  • サービス一覧
  • サイトの無料診断
  • 合同会社謙虚とは
  • 代表プロフィール
  • ブログ
  • お問い合わせ
  • プライバシーポリシー
  • 特定商取引法に基づく表記

© 合同会社謙虚

目次