ChatGPTやGoogleのAI Overviewsに自社のページが引用される、という話をするとき、たいてい「検索の上位に載るページが、そのまま引用される」と考えがちです。ところが、その前提を実際に確かめた研究は、まだ少数です。2025年10月にarXivで公開され、2026年に国際学会ACLのFindingsに採択された論文「Characterizing Web Search in The Age of Generative AI」は、この前提を大規模なデータで調べています。
この記事は、その論文を原文から読み、要点を整理します。研究チームは、4,706問の質問を、通常のGoogle検索と5種類の生成AI検索に同じように投げ、出典の数・種類・重なり、話題の広さ、時間がたったときの安定性を比べました。サーベイ論文の解説記事でこの論文の数字を紹介しているため、原文と照らし合わせた結果も書きます。
合同会社謙虚は、3つのドメインを並行して運用し、何を変えると数字が動くかを測り続けています。この論文は、「AIに引用されるかどうか」を測るとき、同じ質問を何度も測る必要があることを、数字で示している点が参考になります。
結論:3行で言うと
- GoogleのAI Overviewsが引用したドメインの53%は、通常のGoogle検索の上位10件に入っておらず、27%は上位100件にもありませんでした。AIの引用元は、検索順位の延長線上にあるとは限りません
- 同じ質問を2か月あけて調べると、AI Overviewsに出るページの重なり(質問ごとの出典リンクの集合の類似度の平均)は18%で、通常のGoogle検索は45%でした。引用は、通常の順位より入れ替わりやすいことが分かりました
- 「はい・いいえ」で答える質問209問では、同じ質問を5分後や24時間後に聞き直すと、答えの向きが9〜28%の質問で変わりました。ただし、これは英語の質問を、米国とドイツの2か所から調べた結果です
なお、話題の網羅度は、生成AI検索と通常の検索でほぼ同水準でした。差が大きかったのは、どのページから情報を集めるかと、結果の安定さです。
この論文の基本情報
| 項目 | 内容 |
|---|---|
| 題名(原題) | Characterizing Web Search in The Age of Generative AI |
| 著者 | Elisabeth Kirsten、Jost Grosse Perdekamp、Qinyuan Wu、Mihir Upadhyay、Krishna P. Gummadi、Muhammad Bilal Zafar(6人) |
| 所属 | ボーフム・ルール大学、マックス・プランク・ソフトウェアシステム研究所、UAルール信頼データ科学セキュリティ研究センター |
| 公開日 | 2025年10月13日(v1)。2026年5月31日に改訂版(v2) |
| arXiv番号 | 2510.11560(分野はcs.IR、情報検索) |
| 掲載・採択状況 | Findings of the Association for Computational Linguistics: ACL 2026、10827〜10848ページ、米国サンディエゴ開催。ACL Anthologyに登録されています |
| 種類 | 実験による比較調査。大学・研究機関の研究で、企業の自社報告ではありません |
| 実験データ・コード | GitHubの「aisoc-lab/generative-search-eval」で公開 |
論文はこちらで読めます。arXiv(2510.11560)、ACL Anthology(2026.findings-acl.526)、DOI。
掲載状況は、ACL Anthologyの登録ページで確認しました。arXivのコメント欄には採択の記載が無いため、こちらを根拠にしています。v1は4つ、v2は5つの生成AI検索を比べており、この記事の数字はv2の原文から拾っています。
この論文が答えた問い
生成AIによる検索は、従来のGoogle検索と、どの点で違うのか。
従来の検索は、10件ほどのページを順位順に並べて返します。生成AI検索は、ウェブから関連ページを集め、1つの文章にまとめて答えます。論文はこの違いを3つの軸で整理しました。1つ目は、AIが自分の知識で答えるか、外部のページに頼るか。2つ目は、参照する出典の広さ。3つ目は、文章を作る過程がもつ揺らぎです。
これまでの評価は、正確さや誤情報の有無が中心でした。論文は、出典の選び方と、答えの安定さも測るべきだと考えています。
どうやって調べたのか
まず質問です。7つのデータセットから、合計4,706問を集めました(原文の付録の表5)。
| データセット | 質問数 | 中身 |
|---|---|---|
| WildChat | 1,750 | ChatGPTに実際に投げられた質問から、「何」「なぜ」などで始まるものを抽出 |
| MS Marco | 1,000 | Bingの実際の検索語からの無作為抽出 |
| Regulatory Actions | 649 | 2025年の米国の大統領令58件について、GPT-4oが作った質問 |
| Science | 453 | AI分野の45テーマについて、Googleの「他の人はこちらも質問」から集めた質問 |
| Products | 422 | Amazonで検索の多かった商品100件を、「レビュー」「買う価値は」などの型に当てはめた質問 |
| AllSides | 332 | 政治の論点37件と、それに関連する質問 |
| Trends | 100 | 2025年9月15日のGoogleトレンド上位100件(当日に検索) |
比べた検索は6つです。
- 通常のGoogle検索(論文ではOrganicと呼びます)。上位100件を取得し、主な分析は上位10件で行いました
- GoogleのAI Overviews(AIO)
- Gemini 2.5 Flashに、Google検索を使わせたもの
- PerplexityのSonar。必ず検索してから答えます
- GPT-4o Search。必ず検索してから答えます
- GPT-4oに検索を道具として持たせたもの(GPT-Tool)。検索するかどうかをAIが決めます
条件は次のとおりです。質問はすべて英語で、2025年9月に、米国とドイツの2か所(仮想マシンで場所を固定、ログアウト状態)から投げました。本文の結果は、米国分です。ドイツ分は付録にあり、論文は、わずかな違いしか見られなかったと述べています。AI Overviewsは、米国で質問の81%、ドイツで65%に表示されました。他の生成AIには、AI Overviewsが出た質問だけを投げています。生成AIの温度(答えのばらつきを決める設定)は、変えられるものはゼロにしました。
話題の広さは、LLooMという、AIが文章から話題を取り出して数える手法で測っています。答えの向きの判定にも、AI(GPT-5.2)を使いました。人が採点したのではなく、AIによる自動採点です。
結果
1. 参照する出典の数は、サービスで大きく違う
1つの質問あたりの出典リンクの数(全データセットの中央値)は、通常の検索が10件、AI Overviewsが9件、GPT-Searchが4件、GPT-Toolが0件でした。
AI Overviewsは、質問によって数を変えます。10パーセンタイル(少ない側の10%)で0.6件、90パーセンタイル(多い側の10%)で17件でした。「今後AIが代わる仕事は」のような広い質問では30件を超え、「韓国の首都は」のような事実の質問では2件以下でした。
各国の首都を尋ねる249問では、全サービスの正解率が99.5〜100%でした。AI Overviewsだけが1問、ジョージア(国)の首都を、米国の州の州都と取り違えています。GPT-Toolは、1回も検索せずに全問正解しました。
| サービス | 首都の質問で検索した割合 | 1問あたりの平均URL数 | 正解率 |
|---|---|---|---|
| GPT-Tool | 0% | 0 | 100% |
| GPT-Search | 98% | 5.2 | 100% |
| Gemini | 100% | 4.47 | 100% |
| Sonar | 100% | 8.66 | 100% |
| AI Overviews | (記載なし) | 5.83 | 99.5% |
多くのサービスは、AIの知識だけで答えられる質問でも検索していました。一方、検索しないGPT-Toolは、最新の話題に弱さを見せました。トレンド100問では、有名人の死去について、GPT-Toolが亡くなった方を存命と答えた例が挙げられています。話題の網羅度は、GPT-Searchが72%、通常の検索が67%、Geminiが66%、GPT-Toolが51%でした。
2. 出典は、通常の検索の上位とは違う
AI Overviewsが引用したページ(URL)のうち、通常のGoogle検索の上位10件と重なるのは50%未満で、上位100件まで広げても60%未満でした。ドメイン(サイト名の単位)で見ると、AI Overviewsが参照したドメインは、平均で53%が上位10件になく、27%が上位100件にもありませんでした。GeminiとGPT-Searchは、重なりがさらに低く、GPT-Toolはほぼゼロでした。
引用元が人気サイトに偏るわけでもありません。世界で最も訪問の多い上位100万サイトに入るドメインの割合は、通常の検索が89%、AI Overviewsが85%、GPT-Searchが86%、Sonarが84%、Geminiが83%、GPT-Toolが81%でした。
出典の種類も違います。GPT系は、企業の公式サイトと百科事典への偏りが大きく、SNSや掲示板の割合は低めでした。通常の検索では、SNSや掲示板が最大35%を占めるデータセットがあります。
3. 話題の広さは、通常の検索と近い
取り出した話題のうち、各サービスがカバーした割合は、GPT-Toolの0.71からGeminiの0.78までで、通常の検索も0.78でした。通常の検索は、上位5件までで高いカバー率に届きます。話題の一致は、生成AIと通常の検索の間で60〜68%でした。広さは同じでも、選ぶ話題は少し違います。
質問が曖昧なときは、通常の検索が有利でした。話題の一致が低い側の10%の質問では、通常の検索は67%、AI Overviewsは55%、GPT-Toolは48%でした。
4. 出典は2か月で入れ替わり、答えの向きも揺れる
2025年7〜8月と9月に、同じ質問を繰り返しました(Sonarは9月から追加したため、この比較に入っていません)。1つの質問について、出典リンクの集まりがどれだけ重なるかを見ると、通常のGoogle検索は45%、AI Overviewsは18%でした。話題の網羅度は、2回ともほぼ同じ水準でした。出典が入れ替わっても、まとめた文章の話題は近いままでした。
次に、答えの向きの安定性です。WildChatから、答えが「はい」「いいえ」「どちらとも言えない」のどれかになる質問209問を選びました。同じ質問を、最初、5分後、24時間後の3回投げて、答えの向きが変わった質問の割合を、下の表にまとめます(原文の表4)。
| サービス | 温度ゼロ 5分後 | 温度ゼロ 24時間後 | 標準温度 5分後 | 標準温度 24時間後 |
|---|---|---|---|---|
| GPT-Tool | 9% | 10% | 18% | 18% |
| GPT-Search | 16% | 17% | 15% | 22% |
| Gemini | 15% | 15% | 20% | 20% |
| AI Overviews | 17% | 16% | 11% | 17% |
| Sonar | 27% | 28% | 27% | 24% |
本文の記述では、GPT-SearchとAI Overviewsは温度を指定できません。したがって、表の「温度ゼロ」の列で本当に温度をゼロにできたのは、GPT-Tool、Gemini、Sonarの3つと読めます。この3つでも、質問の9〜28%で答えの向きが変わっています。文章の言葉づかいの重なりも低く、温度ゼロの条件で、繰り返した2回の重なり(類似度)が0.27〜0.63でした。
さらに、通常の検索の上位10件にも、同じ基準で向きを判定しました。生成AIの答えは、55%が「はい」、19%が「いいえ」、26%が「どちらとも言えない」でした。一方、通常の検索は、上位10件のすべてが同じ向きになった質問が16%です。通常の検索は、意見の割れをそのまま並べます。生成AIは、割れている状況を1つの答えにまとめ、その答えが時間とともに変わり得ます。
サーベイ記事がこの論文について書いた数字(2か月間の重なり18%と45%、53%と27%、9〜28%)は、原文と一致しました。
論文自身が書いている限界
論文は、次の限界を挙げています。
- 質問の種類が、一般・商品・政治・科学に限られています。複数回のやりとりを重ねる検索は、対象外としています
- 質問はすべて英語で、調べた国は2つだけです
- 通常の検索は、上位10件のタイトル・URL・要約文だけを分析しました。ページ本文までは読んでいません
- 調べた期間が短く、検索サービスは更新され続けています。個人化やインフラの違いによるばらつきを、完全には取り除けていません
- 調べたのは、外から使える閉じたサービスだけです。1つの質問につき出力は1回で、温度ゼロは、設定できるサービスだけです
- 話題の分析はAI(LLooM)に頼っています。AI自身の偏りや知識の不足が、結果に入る可能性があります。人による確認は、規模の都合で見送られています
加えて、この記事を書くために原文を読んで気づいた点があります。
- 日本語での検証は報告されていません。質問はすべて英語で、ドイツの分も、ドイツ語ではなく、ドイツの場所から英語で調べたものです
- 米国とドイツの2か国のみです。日本の場所から調べた結果は含まれていません。AI Overviewsの表示率も、米国81%、ドイツ65%と国で違いました
- 他の生成AIには、AI Overviewsが出た質問だけを投げています。論文は、全質問で確かめても傾向は同じだったと書いていますが、AI Overviewsが出にくい質問のサービスの挙動は、主な結果に入っていません
- 答えの向きの実験は、209問で、質問は「はい・いいえ」型に絞っています。4,706問すべてで揺れを測ったわけではありません
- 採点は自動です。答えの向きはGPT-5.2、話題はLLooMが判定しており、人の目による採点はありません
- 実験は、2025年7〜9月時点の特定のモデルで行われました。いまのサービスと同じ挙動とは限りません
- 査読の有無は、Findings of ACL 2026に採択された論文なので、学会の審査を経ています。ただしFindingsは、ACL本会議とは別の枠での採択です
- この論文は、自社サイトが出典に選ばれやすくなる方法を調べていません。何をすればAIに引用されるかは、対象外です
この論文から、言えること・言えないこと
| 言えること(論文の設定で確認された) | 言えないこと(論文では確認されていない) |
|---|---|
| AI Overviewsの引用元の多くは、通常のGoogle検索の上位10件の外にあった | 上位10件に入っていなくても、AIに引用されやすくなる方法があること |
| AI Overviewsの出典は、2か月で通常の検索より大きく入れ替わった | 日本語の質問や、日本の場所から調べたときも同じ割合になること |
| 答えの向きは、温度ゼロでも、5分後・24時間後に9〜28%の質問で変わった | ビジネスの質問や、日本語の質問でも同じ割合で変わること |
| 話題の網羅度は、通常の検索と生成AIでほぼ同じだった | AIの答えが、通常の検索より正確、あるいは役に立つこと |
| サービスごとに、参照する出典の数と種類が違った | いまのChatGPTやGeminiが、2025年の実験と同じ動きをすること |
中小企業の視点で、どう受け取るか
ここからは論文の主張とは別の、私の読み取りです。
1. 検索順位が高いことと、AIに引用されることは、別の指標として測る。この論文では、AI Overviewsの引用元の半数以上が、通常の検索の上位10件に入っていませんでした。自社の順位表だけで、AIの中での見え方は判断できないと読めます。順位とAIでの見え方は、別々に記録する必要があります。
2. AIでの見え方は、1回の確認で判断しない。同じ質問でも、2か月で出典の重なりは18%でした。「今日ChatGPTに聞いたら出た(出なかった)」という1回の確認は、あまり当てにならないと考えるほうが安全です。何度か、時期をあけて確かめる必要があります。
3. AIの答えの向きが変わることを、前提にする。自社のサービスについて、AIが「おすすめできる」と答える日と、「一概には言えない」と答える日があり得ます。論文は、答えの向きが変わる割合を9〜28%と報告しましたが、日本語での割合は分かっていません。自社が扱う質問で試して、傾向をつかむ価値があります。
4. 話題を広く、正確に書くことは、引き続き土台になる。生成AIは、通常の検索と近い話題の広さで答えていました。引用される出典が入れ替わっても、話題としては近いところに落ち着きます。特定の1ページを狙うより、質問に答える情報をサイト全体で整えるほうが、この結果とは相性がよいと私は読みました。ただし、これは論文が検証したことではありません。
よくある質問
検索で上位のページを作れば、AIにも引用されますか
この論文からは、そうとは言い切れません。AI Overviewsが参照したドメインの53%が、通常の検索の上位10件にありませんでした。順位が高いことは、引用の確率を上げるかもしれませんが、この論文は、その関係を調べていません。
ChatGPTで自社が出るかを調べるとき、何回確認すればよいですか
論文は回数の目安を示していません。ただし、同じ質問を5分後や24時間後に聞き直すだけで、答えの向きが変わる質問がありました。1回の結果で判断せず、複数回、日をあけて記録するのが確実です。
日本語の質問でも、同じ結果になりますか
現時点では分かりません。論文の質問はすべて英語で、調べた場所は米国とドイツです。日本語での検証は報告されていないため、日本のAI検索でも同じ割合になるかどうかは、別の調査を待つ必要があります。
まとめ:今日できる1つのこと
自社に関係の深い質問を3つ決めて、AIに聞いた結果を、日付と一緒に記録してください。引用された出典と、答えの向き(おすすめか、条件付きか)を残します。1週間後に同じ質問で聞き直し、どれだけ入れ替わったかを比べると、自社の「AIでの見え方」が、どのくらい安定しているかの目安になります。
この論文は、LLMO論文の一覧の一本です。ほかの論文の解説も、順次公開しています。
この記事に書いたことを、そのまま御社のページに
生成AIに引用されるページを、お話しいただくだけでお作りします。お時間をいただくのは初回15分のヒアリングだけです。まず1ページ、無料でお作りします。
OKが出るまで、何度でも直します。事実が違う、言い回しが硬い、この話は入れないでほしい。どれも遠慮なくおっしゃってください。何度お直ししても、追加の料金はいただきません。
これまでに127社にご利用いただきました。毎月ご依頼いただいている方の6割以上が、月10ページを選ばれています。料金はページに掲載しています。
ページを増やしても問い合わせが来ないなら、原因はページの外にあります。その場合は、下の入口からご相談ください。
自社のマーケティング課題を根本から解決しませんか?
ウェブサイトから要素を引き算し、訪れた人が迷わず次の一歩に進む形へ組み直す。初回60分のオンラインで御社のサイトを一緒に読み、どこから直すべきかをお伝えします。手順をまとめた無料の診断と解説動画もご用意しています。
初回は無料・60分・オンライン完結・その場で契約のお願いはいたしません

