「このページはAIに引用されやすいか」を点数で示すツールの多くは、AIに実際に質問せず、ページの文章だけを見て採点します。2026年9月にarXivで公開された論文は、その点数がどこまでを測れているのかを、実際に動いているAI検索の引用を観測して確かめました。
調べ方は、15個の質問をChatGPT、Microsoft Copilot、Google、Perplexityの4つで観測し、引用されたURLを比べるというものです(4つすべてで観測できたのは10問です)。この記事は原文20ページを付録まで読み、数値を原文の表と本文から拾って整理します。
合同会社謙虚は、3つのドメインを並行して運用し、何を変えると数字が動くかを測り続けています。1つのAI検索での見え方を「AI検索全体での見え方」と読んでよいのか、その線引きを原文で確かめるために、この論文を読みました。
結論:3行で言うと
- 同じ質問でも、4つのAI検索が引用したURLはほとんど重なりませんでした。重なりの指標は平均0.0079(1が完全一致)で、AI検索の組の84.9%は共通のURLが0件でした
- 観測されたURL528件のうち96.4%(509件)は、1つのAI検索にしか出ていません。1つだけを見た場合に拾えたのは、4つを合わせた引用先の11.4〜42.6%でした
- 論文は、AIに質問せずに出す点数が測るのは「ページの質」や「質問との合い方」までで、実際のAI検索に拾われるかどうかは別の量として報告すべきと論じています
観測は1日分、英語の質問15個で、記録には著者の所属企業の計測の仕組みが使われています。規模の小ささと利益相反を前提に読む必要があります。
この論文の基本情報
| 項目 | 内容 |
|---|---|
| 題名(原題) | Scoring With the Engine: Retrieval Exposure, Cross-Engine Divergence, and the Limits of Engine-Agnostic GEO Scores |
| 著者 | ベンジャミン・タネンバウム(1人)。AI検索での見え方を測り、改善するソフトウェアを開発する企業の創業者 |
| 公開日 | 2026年9月19日(arXiv初版) |
| arXiv番号 | 2609.22655(分類は情報検索) |
| 掲載・採択状況 | arXivのプレプリント。コメント欄に学会・論文誌の名前はなく、査読前の段階と判断しました |
| 種類 | 企業の創業者が、自社の計測の仕組みで集めた記録を分析した観察研究(20ページ、図6、表6) |
| 実験データとコード | 集計済みの表と図を作り直すコードを、arXivの投稿ファイル一式に同梱。引用の記録そのものは非公開 |
| 利益相反の申告 | あり。論文は「直接の商業的な利益相反がある」と明記 |
論文はこちらで読めます。arXiv(2609.22655)、DOI(10.48550/arXiv.2609.22655)。
arXivのコメント欄には、先に公開された別の著者の論文(arXiv:2609.07559)を踏まえて補うものだと書かれています。その論文はAIに質問せずページを採点する指標の検証で解説しました。
同じ欄には、著者自身の先行論文4本(arXiv:2607.18904、2607.22392、2608.02556、2609.09878)の測定の計画を引き継ぐ、とも書かれています。
この論文が答えた問い
質問を固定したとき、実際に動いているAI検索どうしは、似た引用先を出すのか。
論文は、ページが引用される確率を2つの掛け算に分けます。
1つめは「露出」で、そのページがAIの回答づくりの材料に入るかどうかです。2つめは「選択」で、材料に入ったうえで引用されるかどうかを指します。
先行論文(2609.07559)の実験は、候補のページをあらかじめAIに渡していました。論文はこの設計を、2つめの「選択」を切り分けるには正しいが、1つめの「露出」は確かめられない設計だと位置づけています。
そこで今回は、検索の起動から取得、並べ替えまでを各社のAI検索に任せ、最後に表示された引用だけを比べました。
どのAI検索も似た引用先を出すなら、ページの点数は見え方全体の代わりに使えます。違うなら、どのAI検索かが結果の大きな部分を占めることになります。
どうやって調べたのか
| 項目 | 内容 |
|---|---|
| 対象 | ChatGPT、Microsoft Copilot、Google、Perplexityの4つ(実際に提供されているサービス) |
| 質問 | 英語の商用の質問15個。分野は「AI検索での見え方を測るソフトウェア」で、著者の所属企業が社内で使う質問集 |
| 地域の設定 | 米国 |
| 主な観測日 | 2026年6月6日(AI検索どうしの比較)。日をまたぐ比較は6月5日と6日 |
| 記録した項目 | 質問、AI検索の名前、引用されたページの題名、URL、引用の位置、日付、ドメイン |
| 主な指標 | Jaccard係数(2つの引用先の集まりの共通部分を、両方を合わせた全体で割った値。0は共通なし、1は完全一致) |
記録は6月4日から6日までの1,435行です。ただし4日と5日の記録は完全に同じ内容で、論文は、キャッシュ、記録の使い回し、本当に同じ出力のいずれもあり得るとして、4日から5日への変化を時間の比較に使いませんでした。
URLは文字列が完全に同じ場合だけ「同じ」と数えています。補助として、ドメイン単位の重なり、上位5件・10件に絞った重なり、引用の位置が上のものほど重く数える重なりも計算しました。
もう1つの工夫が、偶然の重なりとの比較です。
4つのAI検索が出したURLを質問ごとに1つの袋に集め、各AI検索が同じ件数だけ無作為に引いた場合の重なりを計算し、実測と比べました。引用の件数がAI検索ごとに違うことだけで重なりが小さく見えていないかを確かめるためです。
数値の幅(95%の区間)は、質問を単位に1万回引き直す方法で出しています。指標はURLの集合の一致を数えるものだけで、人の判定やAIの採点は出てきません。
結果
4つのAI検索の引用先は、ほとんど重ならなかった
6月6日の観測の内訳です(論文の表1と表3)。
| AI検索 | 引用の観測数 | 観測できた質問 | 重複を除いたURL | ドメイン | 1問あたりのURL |
|---|---|---|---|---|---|
| ChatGPT | 231 | 13 | 201 | 155 | 17.8 |
| Copilot | 63 | 14 | 62 | 52 | 4.5 |
| 145 | 12 | 136 | 95 | 12.1 | |
| Perplexity | 150 | 15 | 148 | 105 | 10.0 |
| 全体 | 589 | 15 | 528 | 356 | – |
同じ質問について2つのAI検索を比べた組は73組ありました。URLの重なりは平均0.0079(95%の区間は0.0037〜0.0132)、中央値は0です。
組ごとの値は次のとおりです(論文の表2)。
| AI検索の組 | 比べた質問数 | URLの重なり | ドメインの重なり | 共通URLが0件の割合 |
|---|---|---|---|---|
| ChatGPTとCopilot | 12 | 0.0029 | 0.0176 | 91.7% |
| ChatGPTとGoogle | 11 | 0.0000 | 0.0154 | 100.0% |
| ChatGPTとPerplexity | 13 | 0.0055 | 0.0167 | 84.6% |
| CopilotとGoogle | 11 | 0.0120 | 0.0260 | 81.8% |
| CopilotとPerplexity | 14 | 0.0102 | 0.0393 | 85.7% |
| GoogleとPerplexity | 12 | 0.0165 | 0.0418 | 66.7% |
- 73組のうち84.9%は、共通のURLが1件もありませんでした。いちばん重なった組(GoogleとPerplexity)でも0.0165です
- ドメイン単位に緩めても平均0.0265で、60.3%の組は共通のドメインが0件でした
- 重複を除いたURL528件のうち、1つのAI検索にしか出なかったのは509件(96.4%)です。2つに出たのは19件で、4つすべてに出たURLはありません(509+19=528なので、3つに出たURLも0件という計算になります)
- ドメインでは356件のうち317件(89.0%)が1つのAI検索だけに出ていて、4つすべてに出たドメインは1件でした
96.4%の分母は、引用の観測589件ではなく、15問を通して重複を除いたURL528件です。
上位5件に絞っても、共通のURLは0件だった
「主要な引用先は共通で、違うのは下位だけ」という見方も、論文は確かめています。4つすべてで観測できた10問(60組)に絞った結果です(論文の表5)。
- URLの重なりは平均0.0072、共通URLが0件の組は86.7%
- 上位10件に絞った重なりは0.0066、位置が上のものを重く数えた重なりは0.0027
- 上位5件に絞ると、60組すべてで重なりは0
- 件数の少ない側の引用先が、多い側にどれだけ含まれるかを見た値も0.021
偶然の重なりと比べても、5.7%にとどまった
4つが出したURLの袋から無作為に引いた場合、重なりの見込みは平均0.1272でした。実測の0.0072は、その5.7%です。
共通URLが0件になる確率も、無作為なら平均12.3%のところ、実測は86.7%でした。論文は、引用の件数の違いだけではこの小ささを説明できないと述べています。
論文はこの比較について、AI検索が無作為に引用先を選ぶと仮定したものではないとも断っています。
1つのAI検索だけを見ても、4つ合わせた引用先の半分に届かない
同じ10問で、4つを合わせたURLは1問あたり平均43.4件でした。1つのAI検索がそのうち何割を出していたかが次の表です(論文の表4)。
| AI検索 | 1問あたりのURL | 4つ合わせたURLに占める割合 | 自分だけが出したURLの割合 |
|---|---|---|---|
| ChatGPT | 18.8 | 42.6% | 99.2% |
| 10.7 | 24.3% | 94.5% | |
| Perplexity | 10.0 | 23.6% | 95.0% |
| Copilot | 4.7 | 11.4% | 92.1% |
論文は、この割合は引用先の広さを表す数字で、利用者の数や流入の大きさを表すものではないと注記しています。
同じAI検索でも、翌日の引用先との重なりは0.33だった
6月5日と6日を比べると、同じAI検索・同じ質問の41組で、入れ替わりの指標(1からJaccard係数を引いた値)は平均67.0%(95%の区間は61.1〜72.2%)でした。
Jaccard係数に直すと0.33です。Googleは5日の記録がなく、この比較から外れています。
AI検索ごとでは、ChatGPTが82.6%、Copilotが76.6%、Perplexityが45.5%です。
それでも、同じAI検索の翌日の引用先どうしの重なり(0.330)は、同じ日の別のAI検索との重なり(0.0079)の約42倍ありました。論文は、この観測の範囲では日による違いよりAI検索による違いのほうが大きい、と読んでいます。
論文自身が書いている限界
- 質問は15個で、分野は「AI検索での見え方を測るソフトウェア」だけです。論文は、販売会社や比較ページが多く出やすい特殊な分野だと認め、旅行、健康、買い物、地域の検索、ニュースなどにそのまま広げるべきではないと書いています
- 見ているのは最後に表示された引用で、AI検索が裏で使った検索語、候補のページ、並べ替えの点数は観測していません。重なりの小ささがどの段階で生じたかは特定できない、と論文は述べています
- URLの完全一致は厳しい基準です。転載や翻訳など、中身が同じで別のURLになっているページは別物として数えられます
- 引用の位置の意味はサービスごとに違う可能性があり、順位を使った分析は補助の扱いです
- 5日から6日への変化は、AI検索の側の変化か記録の仕組みの変化か区別がつかず、「1日あたりの変動」の推定値として使うべきではないとしています
- ページを書き換えて露出の変化を測る実験はしていません。特定の施策で露出が増えるとは示せない、と明記しています
- 著者は計測ソフトウェアの企業の創業者で、記録も同社の仕組みで集めています。引用の記録の全体は非公開で、第三者による再現が必要だと論文自身が書いています
原文を読んで気づいた点
- 査読前のプレプリントです。arXivのコメント欄に学会や論文誌の記載はありません
- 日本語での検証はありません。質問は英語、地域の設定は米国です。日本語の質問で同じ値になるかは、この論文からは分かりません
- 15個の質問の文面が掲載されていません。取得の方法、ログインの有無、モデルやモードの種類、Googleのどの画面の引用なのかも書かれていない状態です。論文の付録は、ほかの研究にこれらの報告を勧めています
- 同じ日に同じ質問を繰り返したときのぶれは測られていません。AI検索どうしの違いに、回ごとのぶれがどれだけ混じっているかは分けられない設計です。論文も、1日に複数回の実行を今後の課題に挙げています
- 4つすべてで観測できたのは15問のうち10問でした。ChatGPTで2問、Googleで3問、Copilotで1問が欠けていますが、欠けた理由の説明は見当たりません
- 本文は、4つ合わせたURL(平均43.4件)がいちばん多い1つ(平均18.8件)の2.43倍だと書いています。平均どうしを割ると43.4÷18.8で約2.31倍(私の計算による概算)になり、2.43は質問ごとの比を平均した値とみられます
- 題名は「取得での露出」をうたいますが、観測されたのは表示された引用です。露出そのものは測られていない点を、論文も限界として認めています
- 質問の分野は、著者の所属企業が扱う商品の分野そのものです。また「複数のAI検索を実際に観測すべき」という結論は、計測サービスを提供する側の利益と同じ方向を向いています
この論文から、言えること・言えないこと
| 言えること(論文の設定で確認された) | 言えないこと(論文では確認されていない) |
|---|---|
| 英語の15問・1日の観測では、4つのAI検索が引用したURLの重なりは平均0.0079だった | ほかの分野や日本語の質問でも、同じくらい重ならないこと |
| 観測されたURLの96.4%は、1つのAI検索にしか出なかった | 重ならない原因が、検索・取得・並べ替え・引用のどの段階にあるか |
| 上位5件に絞っても、10問・60組で共通のURLは0件だった | 中身が同じで別のURLになっているページを含めても重ならないこと |
| 1つのAI検索が出したのは、4つ合わせた引用先の11.4〜42.6%だった | その割合が、利用者の数や流入の大きさを表すこと |
| 5日から6日にかけて、同じAI検索の引用先の入れ替わりの指標は平均67.0%だった | AI検索の引用先が毎日67%入れ替わること |
| AIに質問せずに出す点数だけでは、実際のAI検索に拾われるかは決まらないと論じた | ページの採点に意味がないこと、特定の施策で露出が増えること |
論文は、先行論文の結果を否定していないと繰り返し書いています。
採点が測る量と、実際のAI検索の観測が測る量は別物なので、分けて報告しようという提案です。この「段階ごとに分けて測る」考え方は、GEO研究45本を整理したサーベイとも重なります。
中小企業の視点で、どう受け取るか
ここからは論文の主張とは別の、私の読み取りです。
「AIに出た」は、どのAI検索で、いつの話かを添える
この観測では、あるAI検索に引用されたURLのほとんどが、ほかの3つには出ていませんでした。自社の確認結果を記録するときも、AI検索の名前、日付、質問の文面を一緒に残すと、後から比べられます。
採点ツールの点数と、実際の引用の観測は別の欄に書く
点数はページの出来を見る目安、引用の観測は実際に拾われたかの記録です。同じ表にまとめる場合も、列を分けておくほうが、どちらが動いたのかを読み違えにくくなります。
1回の確認で判断しない
同じAI検索でも、翌日には引用先の多くが入れ替わっていました。出た・出ないを1回で決めず、日を変えて何度か確かめるほうが安全です。
数字の大きさは割り引いて読む
重なりがほぼ0という値は、英語・1分野・15問・1日のものです。日本語の地域の商売の質問で同じ値になるとは考えず、「AI検索ごとに引用先は違いうる」という方向だけを受け取るのが妥当だと考えます。
よくある質問
AIに質問せずページを採点する指標(GEOスコア)は、この論文で否定されたのですか
否定されていません。
論文は、そうした点数はページの質や質問との合い方の目安として使えると書いています。問題にしているのは、その点数を「AI検索に引用される確率」と読み替えることです。
4つのAI検索で引用URLが重ならないという結果は、日本語の質問にも当てはまりますか
この論文からは分かりません。
質問は英語の15個、地域の設定は米国で、日本語での検証は報告されていない段階です。論文自身も、言語や分野を広げた再調査を今後の課題に挙げています。
AI検索の引用先の確認は、ChatGPTだけを見れば足りますか
この観測では、ChatGPTが出したURLは4つ合わせた引用先の42.6%で、4つの中では最も広い範囲でした。
それでも半分に届いておらず、論文は「どのAI検索を見るかは標本の選び方の1つで、指標の説明に明記すべき」としています。4つすべてを見る必要があるとまでは、論文も述べていません。
まとめ:今日できる1つのこと
お客様に聞かれそうな質問を1つ決め、同じ文面を2つ以上のAI検索に入れて、引用されたURLを書き出してください。AI検索の名前と日付を添えて残すと、次に確かめたときの比較の土台になります。
この論文は、LLMO論文の一覧の一本です。ほかの論文の解説も、順次公開しています。
この記事に書いたことを、そのまま御社のページに
生成AIに引用されるページを、お話しいただくだけでお作りします。お時間をいただくのは初回15分のヒアリングだけです。まず1ページ、無料でお作りします。
OKが出るまで、何度でも直します。事実が違う、言い回しが硬い、この話は入れないでほしい。どれも遠慮なくおっしゃってください。何度お直ししても、追加の料金はいただきません。
これまでに127社にご利用いただきました。毎月ご依頼いただいている方の6割以上が、月10ページを選ばれています。料金はページに掲載しています。
ページを増やしても問い合わせが来ないなら、原因はページの外にあります。その場合は、下の入口からご相談ください。
自社のマーケティング課題を根本から解決しませんか?
ウェブサイトから要素を引き算し、訪れた人が迷わず次の一歩に進む形へ組み直す。初回60分のオンラインで御社のサイトを一緒に読み、どこから直すべきかをお伝えします。手順をまとめた無料の診断と解説動画もご用意しています。
初回は無料・60分・オンライン完結・その場で契約のお願いはいたしません


