AI検索で、自社や競合のサイトがどのくらい引用されているか。これを測るサービスやレポートが増えました。
ただ、質問を何問投げて集計すれば、その順位表を信じてよいのかは、測る側ごとにばらばらです。この点に正面から取り組んだのが、2026年7月にarXivで公開された、今回の論文です。
著者は1人で、所属はAI検索での見え方を計測・検証するサービスを提供する企業です。つまり、計測を仕事にしている会社の自社報告です。
この記事では原文を通読し、「何件集めれば十分か」を決める方法と、その数字がどんな条件で出たものかを整理します。数値は論文の表から拾い、私が計算した値には「概算」と付けました。
合同会社謙虚は、3つのドメインを並行して運用し、何を変えると数字が動くかを測り続けています。この論文を読む理由は、AI検索の計測レポートを受け取ったとき、その順位がどこまで信じられるかを判断する物差しを持っておきたいからです。
結論:3行で言うと
- 著者は、「何件の回答を集めれば十分か」を事前の固定の数で決めるのは無理があると主張しています。この論文のデータでは、十分と判定された時点が33件目から94件目まで広がり、125件でも届かない組が3つありました
- 代わりに提案したのが、順位の並びが落ち着いたかと、たまたまではなく引用されているサイト同士の差が測定のぶれより大きいかの2つを同時に確かめる止め方です
- 2つがそろっても、上位10サイトのうち平均2つは、125件まで集めた最終結果と入れ替わっていました。順位表の上のほうは信じやすく、中ほどの細かい上下は誤差の範囲にとどまる、というのが論文の見立てです
この記事は、論文の主張と、私の読み取りを分けて書きます。実務への当てはめは、後半の「中小企業の視点」でまとめました。
この論文の基本情報
| 項目 | 内容 |
|---|---|
| 原題 | From Stochastic to Stable: Rank Stability and Structural Sufficiency in AI Visibility Measurement |
| 著者 | Ronald Sielinski(1人。所属はAI検索での見え方を計測・検証するサービスを提供する企業) |
| 公開日 | 2026年7月11日(arXiv初版)。確認した版は2026年8月26日の第2版で、本文は初版と同じ内容でした |
| arXiv番号 | 2607.10341(分野は応用統計。情報検索とAIにも登録) |
| 掲載・採択状況 | arXivのプレプリント。コメント欄は「31ページ、図11」と所属企業の記事ページへの案内で、学会や雑誌への採択の記載は見当たりません |
| 種類 | 実測データにもとづく、測定方法の提案 |
| データとコード | 公開先の記載は見当たりません |
論文はこちらで読めます。arXiv(2607.10341)。
論文が土台にしている著者の前作はarXiv(2603.08924)で、前作の解説記事もあります。
この論文が答えた問い
AI検索で「どのサイトが多く引用されているか」の順位表を作るとき、データを何件集めた時点で、その順位を判断に使ってよいと言えるのか。
AI検索は、同じ質問でも実行のたびに引用する出典が変わります。論文は前作の結果として、同じ質問を繰り返したときの出典の重なり(ジャッカード係数。
0が重なりなし、1が完全一致)が、Geminiで約0.30、SearchGPTで約0.40、Perplexityで約0.50だったと紹介しています。
揺れがあるなら、1回で決めずに数を集めることになります。同じ問題を別の角度から調べた4サービス45日間の追跡の論文は、同じ質問を1日7〜8回繰り返すよう勧めていました。
この論文が問うのは、その先の「順位表を作るなら、どこで集めるのを止めてよいか」です。
どうやって調べたのか
| 項目 | 設定 |
|---|---|
| 対象のAI検索 | Gemini、SearchGPT(ChatGPTの検索機能。論文の呼び方のまま)、Perplexityの3つ |
| 分野 | 10分野(マラソン用シューズ、なりすまし被害の対策、煙感知器、健康的な食事の宅配、コラーゲン、ミルクキャンディ、角膜の検査機器、手作りのマグカップ、変わった旅行先、手作りチリの材料) |
| 質問 | 1分野125問。20種類の質問の型(長所と短所、人気の選択肢、専門家のおすすめ、機能の比較など)から無作為に選んだ型を指定して、ChatGPTに作らせたもの。1問につき1回ずつ投げています |
| 集計の単位 | 引用されたページを、サイトのドメイン単位にまとめて数える |
| 主な指標 | 引用シェア(そのドメインの引用数を、全引用数で割った割合)と、その順位 |
| 組み合わせ | 3サービス×10分野=30組。組ごとに、1件目から125件目まで集めながら判定を繰り返す |
ここで押さえておきたいのは、この論文の「件数」が別々の質問の数だということです。同じ質問を何回も繰り返した回数とは、単位が違います。
また、SearchGPTでは引用が1件も付かない回答があり、件数は「引用が付いた回答の数」で数えています。なりすまし対策の分野では、125問のうち引用付きの回答は104件で、約17%が引用なしでした。
「十分」を決める2つの条件
論文の止め方は、次の2つが両方そろった時点で「集めるのを止めてよい」と判定します。どちらも数式で定義されていますが、ここでは意味だけを書きます。
- 順位の安定:少し前の時点の順位表と、いまの順位表がどれだけ同じ並びかを、0から1の数(順位相関)で追います。上位のサイトの入れ替わりほど重く数えます。この数が「上がり続けている段階」を抜けて「平らになった」と統計的に判定でき、平らな区間が15件以上続いたら合格です
- 構造的な十分さ:「たまたま1回出ただけではない」と言えるドメイン(論文の呼び方で、確立したドメイン)を選びます。そのドメイン同士の引用シェアの差の大きさ(信号)と、1つずつのシェアの測定のぶれ幅の平均(雑音)を比べます。信号が雑音と同じか上回ったら合格です。論文は、この比をSN比(信号と雑音の比)と呼んでいます
測定のぶれ幅は、手元のデータから質問を選び直して何度も計算し直し、値がどれだけ動くかで見積もっています(ブートストラップ法。
この論文では1,000回)。「たまたまではない」かどうかも、このぶれ幅がゼロをまたぐかどうかで決めます。
結果
「0.95に届いたら安定」と決め打ちすると、判定が出ない組が残った
比較のために論文は、順位相関が0.95以上なら安定とみなす、よくある決め方も試しています(表3)。
| 判定の方法 | 30組のうち合格した数 | 合格した時点(平均) |
|---|---|---|
| 0.95に一度でも届いた | 30 | 19.9件目 |
| 0.95以上が15件続いた | 19 | 69.2件目 |
| 伸びが止まって平らになった(論文の方法) | 30 | 40.0件目(範囲は33〜75件目) |
- 0.95には早く届きますが、すぐに下回ることがあり、一度届いただけでは当てになりませんでした
- 「15件続く」を求めると、11組は125件まで集めても合格しませんでした。論文は、引用の密度が低い組では、並びが落ち着いていても相関が0.95まで上がりきらないと説明しています
- 両方の方法で合格した19組のうち18組で、論文の方法のほうが早く合格しています
2つの条件がそろった時点は、サービスと分野でばらばらだった
2つの条件がそろった時点を、サービスごとにまとめます(表1、表6)。
| サービス | 1回答あたりの引用数 | そろった組 | そろった時点(中央値) | 範囲 |
|---|---|---|---|---|
| Gemini | 19.9〜50.1 | 10組中10組 | 42件目 | 33〜75件目 |
| Perplexity | 14.5〜42.2 | 10組中10組 | 51件目 | 34〜94件目 |
| SearchGPT | 4.2〜6.3 | 10組中7組 | 37件目(7組の中央値) | 33〜61件目 |
- 30組中27組が、125件以内で2つの条件をそろえました。そろわなかった3組は、すべてSearchGPTです(なりすまし対策、旅行先、チリの材料)。125件時点のSN比は0.74〜0.90で、合格ラインの1に届いていません
- 論文は結論で、この論文のデータでは94件未満のどの件数を決めていても、そろった27組すべてを合格させることはできなかったと書いています
- 11組では、順位が先に安定し、差の大きさの条件を待つ形になりました。Perplexityのマグカップでは、順位の安定が34件目、十分さが81件目で、47件分の差がありました
- どのサービスが早いかは、分野によって入れ替わりました。論文は、サービスの名前より、1回答あたりの引用数と、同じ回答の中での引用の偏りが、必要な件数を左右すると読んでいます
上位は見分けやすく、中ほどは見分けにくい
125件まで集めた時点で、各ドメインの順位が「どの範囲に収まりそうか」の幅も計算しています(表5、30組をまとめた値)。
- 各組の上位10ドメインでは、順位の幅は中央値で5位分でした。10位分を超えるものが18.7%あります
- 確立したドメイン全体(1,693)では中央値69.1位分、観測された全ドメイン(7,067)では131.0位分でした
止めた時点の順位表は、最終結果とどれだけ一致したか
論文は、止めた時点の順位表と、125件まで集めた順位表を比べる検証もしています(表7)。一致の度合いは、先ほどと同じ重み付きの順位相関(1が完全一致)です。
| 止めた時点 | 対象 | 最終結果との一致(中央値) | 最も低い値 |
|---|---|---|---|
| 順位の安定だけで止めた場合 | 30組 | 0.823 | 0.364 |
| 2つの条件がそろった時点で止めた場合 | 27組 | 0.844 | 0.717 |
- 順位の安定だけで止めると、SearchGPTのなりすまし対策では一致が0.364まで下がりました。この組は、2つの条件の方法では合格しなかった組です
- 十分さの条件で止める時点が遅れた11組は、すべて一致が上がりました。上がり幅の大きい例は、Perplexityの旅行先(0.842から0.978)です。ほかの多くは小さな改善でした
- 2つの条件で止めた27組でも、上位10ドメインの顔ぶれの一致は中央値で80%でした。論文はこれを、平均して2つが最終結果と入れ替わっている、と読んでいます
- 合格ラインを1から1.2に上げる試算では、一致の中央値が0.89に上がり、そろう時点の中央値は43件目から53件目に遅れました
論文自身が書いている限界
- 範囲が限られる。10分野、3サービス、1回の収集期間のデータです。具体的な件数が、ほかのサービスや分野、時期にも当てはまるかは確かめていない、と論文自身が書いています
- 質問の作り方に左右される。判定できるのは「用意した質問の集まりを十分に測れたか」までです。その質問が、ブランドにとって大事な質問を代表しているかは、分析する人が決めることだと述べています
- 測っている間にAIが変わる場合は扱えない。収集期間中に引用の傾向が変わらない前提です。途中でモデルや検索の仕組みが更新されると、その変化とふだんの揺れを区別できません
- 絞り込むと件数が足りなくなる。質問の型や地域で絞って分析すると、使える件数が減り、判定も絞った単位ごとにやり直す必要があります
- サービスをまとめる場合の注意。引用数はサービス間で6倍以上違うため、引用数をそのまま足すと、引用の多いサービスの結果に引っぱられます。サービスごとに判定し、すべてがそろってから全体の結果とするよう勧めています
- 検証は同じデータの中での比較。止めた時点のデータは最終結果の一部なので、独立に測り直した結果との比較ではありません。独立の繰り返し収集での検証は今後の課題とされています
原文を読んで気づいた点
ここからは、論文に書かれていない点です。
- 計測サービス企業の自社報告です。著者の所属企業は、AI検索での見え方を、ぶれ幅(信頼区間)つきで計測することを売りにしています。論文の結論(1回や固定の件数では足りない、ぶれ幅を示すべき)は、その事業の考え方と重なります。利害関係の申告は、私が読んだ範囲では見つかりませんでした
- 査読を経ていません。arXivのプレプリントで、コメント欄にも採択の記載はありません
- 日本語での検証はありません。質問の言語は明記されていませんが、分野名や例はすべて英語です。収集した時期や地域も書かれていません
- 「125件」は125問です。1問1回ずつ投げているので、同じ質問を繰り返したときの揺れと、質問が違うことによる差が、同じぶれ幅の中に混ざっています
- 結果の言い方に強弱の差があります。方法の節では「一致する順位表だけを受け入れ、一致の低いものだけを退けた」と書いています。表7を見ると、合格しなかったSearchGPTのチリの材料は、順位の安定の時点で0.818でした。これは合格した組のいくつか(0.717など)より高い値です。検証の節の「退けた組に最も低い一致が含まれる」という書き方のほうが、表と合っています
- 細かな食い違い。合格ラインを動かす試算で、本文は「0.75付近より下では一致が上がらない」、図の説明は「0.8付近より下」と書いています。結論には影響しない範囲です
- 前作の数字と、別の論文の数字の向きが違います。この論文が引く前作では、出典の重なりはGeminiが最も低く(約0.30)、Perplexityが最も高い値(約0.50)でした。4サービス45日間の追跡の論文では、Geminiが0.505と最も高く、Perplexityは0.282でした。言語、国、時期、対象のサービスが違うので、どちらかが誤りとは言えません。サービスごとの揺れやすさは、条件で変わると受け取るのが安全です
この論文から、言えること・言えないこと
| 言えること(論文の設定で確認された) | 言えないこと(論文では確認されていない) |
|---|---|
| 十分と判定された時点は、組によって33件目から94件目まで広がった | 94問集めれば、どの業種・どのサービスでも足りること |
| 「0.95に届いたら安定」と決め打ちすると、30組中11組が合格しなかった | 日本語の質問でも、同じ件数で落ち着くこと |
| 上位10ドメインの順位の幅は、中央値で5位分あった | 自社の順位が1つ上がったら、それが本当の改善であること |
| 順位の安定だけで止めると、最終結果との一致が大きく下がる組があった | 止めた時点の順位表が、別の日に測り直しても同じになること |
| 引用の少ないSearchGPTでは、125件でも十分に届かない組があった | 現在のChatGPTの検索で、同じ傾向が続くこと |
中小企業の視点で、どう受け取るか
ここからは論文の主張とは別の、私の読み取りです。
計測レポートは、まず「何問・何件・どのサービス」を確かめる
AI検索の順位や引用シェアのレポートを受け取ったら、質問の数、引用が付いた回答の数、どのサービスの数字かを最初に確かめます。
この論文の設定では、順位の安定が判定されるまでに、最も早い組でも33件かかっていました。数件から十数件の質問で作った順位表は、傾向を見る参考程度に置いておくのが無難です。
順位の上下は、上位と中ほどで重みを変えて読む
上位のサイトの並びは比較的はっきり出ますが、中ほどの順位は、測り直すだけで大きく動き得ます。自社が中ほどにいる場合、「先月18位、今月14位」のような動きは、誤差の範囲かもしれないと考えておきます。
サービスごとに、必要な数が違う前提で測る
1回答あたりの引用数は、この論文の設定でSearchGPTが4〜6件、Geminiが20〜50件でした。同じ問数で複数のサービスを並べると、サービスによって情報の量が違います。
引用が付かない回答が出るサービスでは、その分を見込んで多めに質問を用意します。論文は、引用付きの回答を100件集めたいとき、引用が付く割合が約83%なら、約121問を投げる計算を示しています。
自社1社を追うなら、別の測り方と組み合わせる
この論文の方法は、分野全体の「どのサイトが上位か」を比べるためのものです。自社の名前が出るかどうかを追いたい場合は、同じ質問を繰り返して「何回に1回出るか」を数える、4サービス45日間の追跡の論文の測り方のほうが目的に合います。
よくある質問
AI検索の引用順位は、何問測れば十分ですか(この論文の33〜94件の読み方)
論文の答えは「決まった数はない」です。3サービス・10分野(英語と見られる質問、1分野125問、1問1回)で、ドメインの引用シェアの順位を対象にしたとき、2つの条件がそろったのは33件目から94件目でした。
サービス別の中央値は、Geminiが42件目、SearchGPTが37件目、Perplexityが51件目です。SearchGPTの3組は125件でも届きませんでした。
この件数を、そのまま自社の計測に当てはめるのは避けてください。
4サービス45日間の追跡で勧められた7〜8回と、この論文の33〜94件は矛盾しますか
私の読み取りでは、矛盾しません。7回はブランドが出る割合、8回は出典のカバー率を定めるための、同じ質問を1日に繰り返す回数です。
33〜94件は、別々の質問を集めて、分野全体のサイトの順位表を作るための件数です。数えている単位も、決めたい数字も違います。
「1回では決められない」「必要な数は条件で変わる」という点では、2つの論文は同じ方向を向いています。
順位の安定と構造的な十分さの2条件は、自社の計測でも使えますか
考え方は使えます。「順位表が前回とほぼ同じ並びになったか」と「たまたまではなく引用されているサイト同士の差が、測り直しのぶれより大きいか」の2つを確かめる、という点です。
論文と同じ判定を正確に再現するには、統計の計算が必要で、論文にはコードの公開先の記載がありません。計測を外部に頼む場合は、ぶれ幅つきで報告してもらえるかを確認するのが現実的です。
まとめ:今日できる1つのこと
手元にあるAI検索の計測結果を1つ開き、「質問の数」「引用が付いた回答の数」「対象のサービス」の3つを書き出してください。
数が分からなければ、計測した人に聞きます。この3つが分かれば、その順位表をどこまで信じてよいかを、この論文の数字と並べて考えられます。
この論文は、LLMO論文の一覧の一本です。ほかの論文の解説も、順次公開しています。
この記事に書いたことを、そのまま御社のページに
生成AIに引用されるページを、お話しいただくだけでお作りします。お時間をいただくのは初回15分のヒアリングだけです。まず1ページ、無料でお作りします。
OKが出るまで、何度でも直します。事実が違う、言い回しが硬い、この話は入れないでほしい。どれも遠慮なくおっしゃってください。何度お直ししても、追加の料金はいただきません。
これまでに127社にご利用いただきました。毎月ご依頼いただいている方の6割以上が、月10ページを選ばれています。料金はページに掲載しています。
ページを増やしても問い合わせが来ないなら、原因はページの外にあります。その場合は、下の入口からご相談ください。
自社のマーケティング課題を根本から解決しませんか?
ウェブサイトから要素を引き算し、訪れた人が迷わず次の一歩に進む形へ組み直す。初回60分のオンラインで御社のサイトを一緒に読み、どこから直すべきかをお伝えします。手順をまとめた無料の診断と解説動画もご用意しています。
初回は無料・60分・オンライン完結・その場で契約のお願いはいたしません


