MENU
  • HOME
  • お問い合わせ
  • 集客オプション
売れるサイトは、みな謙虚。お客様を主役にするWEB集客コンサルティング
合同会社謙虚
  • HOME
  • お問い合わせ
  • 集客オプション
  • HOME
  • お問い合わせ
  • 集客オプション
合同会社謙虚
  • HOME
  • お問い合わせ
  • 集客オプション
  1. ホーム
  2. LLMO
  3. LLMO論文
  4. 【LLMO論文解説】AI Overviewsの出典は検索上位と別物か|4,706問で見た重なりと不安定さ(Findings of ACL 2026)

【LLMO論文解説】AI Overviewsの出典は検索上位と別物か|4,706問で見た重なりと不安定さ(Findings of ACL 2026)

2026 9/22
AI Overviewsの出典は検索上位と別物か

ChatGPTやGoogleのAI Overviewsに自社のページが引用される、という話をするとき、たいてい「検索の上位に載るページが、そのまま引用される」と考えがちです。ところが、その前提を実際に確かめた研究は、まだ少数です。2025年10月にarXivで公開され、2026年に国際学会ACLのFindingsに採択された論文「Characterizing Web Search in The Age of Generative AI」は、この前提を大規模なデータで調べています。

この記事は、その論文を原文から読み、要点を整理します。研究チームは、4,706問の質問を、通常のGoogle検索と5種類の生成AI検索に同じように投げ、出典の数・種類・重なり、話題の広さ、時間がたったときの安定性を比べました。サーベイ論文の解説記事でこの論文の数字を紹介しているため、原文と照らし合わせた結果も書きます。

合同会社謙虚は、3つのドメインを並行して運用し、何を変えると数字が動くかを測り続けています。この論文は、「AIに引用されるかどうか」を測るとき、同じ質問を何度も測る必要があることを、数字で示している点が参考になります。

目次

結論:3行で言うと

  • GoogleのAI Overviewsが引用したドメインの53%は、通常のGoogle検索の上位10件に入っておらず、27%は上位100件にもありませんでした。AIの引用元は、検索順位の延長線上にあるとは限りません
  • 同じ質問を2か月あけて調べると、AI Overviewsに出るページの重なり(質問ごとの出典リンクの集合の類似度の平均)は18%で、通常のGoogle検索は45%でした。引用は、通常の順位より入れ替わりやすいことが分かりました
  • 「はい・いいえ」で答える質問209問では、同じ質問を5分後や24時間後に聞き直すと、答えの向きが9〜28%の質問で変わりました。ただし、これは英語の質問を、米国とドイツの2か所から調べた結果です

なお、話題の網羅度は、生成AI検索と通常の検索でほぼ同水準でした。差が大きかったのは、どのページから情報を集めるかと、結果の安定さです。

この論文の基本情報

項目 内容
題名(原題) Characterizing Web Search in The Age of Generative AI
著者 Elisabeth Kirsten、Jost Grosse Perdekamp、Qinyuan Wu、Mihir Upadhyay、Krishna P. Gummadi、Muhammad Bilal Zafar(6人)
所属 ボーフム・ルール大学、マックス・プランク・ソフトウェアシステム研究所、UAルール信頼データ科学セキュリティ研究センター
公開日 2025年10月13日(v1)。2026年5月31日に改訂版(v2)
arXiv番号 2510.11560(分野はcs.IR、情報検索)
掲載・採択状況 Findings of the Association for Computational Linguistics: ACL 2026、10827〜10848ページ、米国サンディエゴ開催。ACL Anthologyに登録されています
種類 実験による比較調査。大学・研究機関の研究で、企業の自社報告ではありません
実験データ・コード GitHubの「aisoc-lab/generative-search-eval」で公開

論文はこちらで読めます。arXiv(2510.11560)、ACL Anthology(2026.findings-acl.526)、DOI。

掲載状況は、ACL Anthologyの登録ページで確認しました。arXivのコメント欄には採択の記載が無いため、こちらを根拠にしています。v1は4つ、v2は5つの生成AI検索を比べており、この記事の数字はv2の原文から拾っています。

この論文が答えた問い

生成AIによる検索は、従来のGoogle検索と、どの点で違うのか。

従来の検索は、10件ほどのページを順位順に並べて返します。生成AI検索は、ウェブから関連ページを集め、1つの文章にまとめて答えます。論文はこの違いを3つの軸で整理しました。1つ目は、AIが自分の知識で答えるか、外部のページに頼るか。2つ目は、参照する出典の広さ。3つ目は、文章を作る過程がもつ揺らぎです。

これまでの評価は、正確さや誤情報の有無が中心でした。論文は、出典の選び方と、答えの安定さも測るべきだと考えています。

どうやって調べたのか

まず質問です。7つのデータセットから、合計4,706問を集めました(原文の付録の表5)。

データセット 質問数 中身
WildChat 1,750 ChatGPTに実際に投げられた質問から、「何」「なぜ」などで始まるものを抽出
MS Marco 1,000 Bingの実際の検索語からの無作為抽出
Regulatory Actions 649 2025年の米国の大統領令58件について、GPT-4oが作った質問
Science 453 AI分野の45テーマについて、Googleの「他の人はこちらも質問」から集めた質問
Products 422 Amazonで検索の多かった商品100件を、「レビュー」「買う価値は」などの型に当てはめた質問
AllSides 332 政治の論点37件と、それに関連する質問
Trends 100 2025年9月15日のGoogleトレンド上位100件(当日に検索)

比べた検索は6つです。

  • 通常のGoogle検索(論文ではOrganicと呼びます)。上位100件を取得し、主な分析は上位10件で行いました
  • GoogleのAI Overviews(AIO)
  • Gemini 2.5 Flashに、Google検索を使わせたもの
  • PerplexityのSonar。必ず検索してから答えます
  • GPT-4o Search。必ず検索してから答えます
  • GPT-4oに検索を道具として持たせたもの(GPT-Tool)。検索するかどうかをAIが決めます

条件は次のとおりです。質問はすべて英語で、2025年9月に、米国とドイツの2か所(仮想マシンで場所を固定、ログアウト状態)から投げました。本文の結果は、米国分です。ドイツ分は付録にあり、論文は、わずかな違いしか見られなかったと述べています。AI Overviewsは、米国で質問の81%、ドイツで65%に表示されました。他の生成AIには、AI Overviewsが出た質問だけを投げています。生成AIの温度(答えのばらつきを決める設定)は、変えられるものはゼロにしました。

話題の広さは、LLooMという、AIが文章から話題を取り出して数える手法で測っています。答えの向きの判定にも、AI(GPT-5.2)を使いました。人が採点したのではなく、AIによる自動採点です。

結果

1. 参照する出典の数は、サービスで大きく違う

1つの質問あたりの出典リンクの数(全データセットの中央値)は、通常の検索が10件、AI Overviewsが9件、GPT-Searchが4件、GPT-Toolが0件でした。

AI Overviewsは、質問によって数を変えます。10パーセンタイル(少ない側の10%)で0.6件、90パーセンタイル(多い側の10%)で17件でした。「今後AIが代わる仕事は」のような広い質問では30件を超え、「韓国の首都は」のような事実の質問では2件以下でした。

各国の首都を尋ねる249問では、全サービスの正解率が99.5〜100%でした。AI Overviewsだけが1問、ジョージア(国)の首都を、米国の州の州都と取り違えています。GPT-Toolは、1回も検索せずに全問正解しました。

サービス 首都の質問で検索した割合 1問あたりの平均URL数 正解率
GPT-Tool 0% 0 100%
GPT-Search 98% 5.2 100%
Gemini 100% 4.47 100%
Sonar 100% 8.66 100%
AI Overviews (記載なし) 5.83 99.5%

多くのサービスは、AIの知識だけで答えられる質問でも検索していました。一方、検索しないGPT-Toolは、最新の話題に弱さを見せました。トレンド100問では、有名人の死去について、GPT-Toolが亡くなった方を存命と答えた例が挙げられています。話題の網羅度は、GPT-Searchが72%、通常の検索が67%、Geminiが66%、GPT-Toolが51%でした。

2. 出典は、通常の検索の上位とは違う

AI Overviewsが引用したページ(URL)のうち、通常のGoogle検索の上位10件と重なるのは50%未満で、上位100件まで広げても60%未満でした。ドメイン(サイト名の単位)で見ると、AI Overviewsが参照したドメインは、平均で53%が上位10件になく、27%が上位100件にもありませんでした。GeminiとGPT-Searchは、重なりがさらに低く、GPT-Toolはほぼゼロでした。

引用元が人気サイトに偏るわけでもありません。世界で最も訪問の多い上位100万サイトに入るドメインの割合は、通常の検索が89%、AI Overviewsが85%、GPT-Searchが86%、Sonarが84%、Geminiが83%、GPT-Toolが81%でした。

出典の種類も違います。GPT系は、企業の公式サイトと百科事典への偏りが大きく、SNSや掲示板の割合は低めでした。通常の検索では、SNSや掲示板が最大35%を占めるデータセットがあります。

3. 話題の広さは、通常の検索と近い

取り出した話題のうち、各サービスがカバーした割合は、GPT-Toolの0.71からGeminiの0.78までで、通常の検索も0.78でした。通常の検索は、上位5件までで高いカバー率に届きます。話題の一致は、生成AIと通常の検索の間で60〜68%でした。広さは同じでも、選ぶ話題は少し違います。

質問が曖昧なときは、通常の検索が有利でした。話題の一致が低い側の10%の質問では、通常の検索は67%、AI Overviewsは55%、GPT-Toolは48%でした。

4. 出典は2か月で入れ替わり、答えの向きも揺れる

2025年7〜8月と9月に、同じ質問を繰り返しました(Sonarは9月から追加したため、この比較に入っていません)。1つの質問について、出典リンクの集まりがどれだけ重なるかを見ると、通常のGoogle検索は45%、AI Overviewsは18%でした。話題の網羅度は、2回ともほぼ同じ水準でした。出典が入れ替わっても、まとめた文章の話題は近いままでした。

次に、答えの向きの安定性です。WildChatから、答えが「はい」「いいえ」「どちらとも言えない」のどれかになる質問209問を選びました。同じ質問を、最初、5分後、24時間後の3回投げて、答えの向きが変わった質問の割合を、下の表にまとめます(原文の表4)。

サービス 温度ゼロ 5分後 温度ゼロ 24時間後 標準温度 5分後 標準温度 24時間後
GPT-Tool 9% 10% 18% 18%
GPT-Search 16% 17% 15% 22%
Gemini 15% 15% 20% 20%
AI Overviews 17% 16% 11% 17%
Sonar 27% 28% 27% 24%

本文の記述では、GPT-SearchとAI Overviewsは温度を指定できません。したがって、表の「温度ゼロ」の列で本当に温度をゼロにできたのは、GPT-Tool、Gemini、Sonarの3つと読めます。この3つでも、質問の9〜28%で答えの向きが変わっています。文章の言葉づかいの重なりも低く、温度ゼロの条件で、繰り返した2回の重なり(類似度)が0.27〜0.63でした。

さらに、通常の検索の上位10件にも、同じ基準で向きを判定しました。生成AIの答えは、55%が「はい」、19%が「いいえ」、26%が「どちらとも言えない」でした。一方、通常の検索は、上位10件のすべてが同じ向きになった質問が16%です。通常の検索は、意見の割れをそのまま並べます。生成AIは、割れている状況を1つの答えにまとめ、その答えが時間とともに変わり得ます。

サーベイ記事がこの論文について書いた数字(2か月間の重なり18%と45%、53%と27%、9〜28%)は、原文と一致しました。

論文自身が書いている限界

論文は、次の限界を挙げています。

  • 質問の種類が、一般・商品・政治・科学に限られています。複数回のやりとりを重ねる検索は、対象外としています
  • 質問はすべて英語で、調べた国は2つだけです
  • 通常の検索は、上位10件のタイトル・URL・要約文だけを分析しました。ページ本文までは読んでいません
  • 調べた期間が短く、検索サービスは更新され続けています。個人化やインフラの違いによるばらつきを、完全には取り除けていません
  • 調べたのは、外から使える閉じたサービスだけです。1つの質問につき出力は1回で、温度ゼロは、設定できるサービスだけです
  • 話題の分析はAI(LLooM)に頼っています。AI自身の偏りや知識の不足が、結果に入る可能性があります。人による確認は、規模の都合で見送られています

加えて、この記事を書くために原文を読んで気づいた点があります。

  • 日本語での検証は報告されていません。質問はすべて英語で、ドイツの分も、ドイツ語ではなく、ドイツの場所から英語で調べたものです
  • 米国とドイツの2か国のみです。日本の場所から調べた結果は含まれていません。AI Overviewsの表示率も、米国81%、ドイツ65%と国で違いました
  • 他の生成AIには、AI Overviewsが出た質問だけを投げています。論文は、全質問で確かめても傾向は同じだったと書いていますが、AI Overviewsが出にくい質問のサービスの挙動は、主な結果に入っていません
  • 答えの向きの実験は、209問で、質問は「はい・いいえ」型に絞っています。4,706問すべてで揺れを測ったわけではありません
  • 採点は自動です。答えの向きはGPT-5.2、話題はLLooMが判定しており、人の目による採点はありません
  • 実験は、2025年7〜9月時点の特定のモデルで行われました。いまのサービスと同じ挙動とは限りません
  • 査読の有無は、Findings of ACL 2026に採択された論文なので、学会の審査を経ています。ただしFindingsは、ACL本会議とは別の枠での採択です
  • この論文は、自社サイトが出典に選ばれやすくなる方法を調べていません。何をすればAIに引用されるかは、対象外です

この論文から、言えること・言えないこと

言えること(論文の設定で確認された) 言えないこと(論文では確認されていない)
AI Overviewsの引用元の多くは、通常のGoogle検索の上位10件の外にあった 上位10件に入っていなくても、AIに引用されやすくなる方法があること
AI Overviewsの出典は、2か月で通常の検索より大きく入れ替わった 日本語の質問や、日本の場所から調べたときも同じ割合になること
答えの向きは、温度ゼロでも、5分後・24時間後に9〜28%の質問で変わった ビジネスの質問や、日本語の質問でも同じ割合で変わること
話題の網羅度は、通常の検索と生成AIでほぼ同じだった AIの答えが、通常の検索より正確、あるいは役に立つこと
サービスごとに、参照する出典の数と種類が違った いまのChatGPTやGeminiが、2025年の実験と同じ動きをすること

中小企業の視点で、どう受け取るか

ここからは論文の主張とは別の、私の読み取りです。

1. 検索順位が高いことと、AIに引用されることは、別の指標として測る。この論文では、AI Overviewsの引用元の半数以上が、通常の検索の上位10件に入っていませんでした。自社の順位表だけで、AIの中での見え方は判断できないと読めます。順位とAIでの見え方は、別々に記録する必要があります。

2. AIでの見え方は、1回の確認で判断しない。同じ質問でも、2か月で出典の重なりは18%でした。「今日ChatGPTに聞いたら出た(出なかった)」という1回の確認は、あまり当てにならないと考えるほうが安全です。何度か、時期をあけて確かめる必要があります。

3. AIの答えの向きが変わることを、前提にする。自社のサービスについて、AIが「おすすめできる」と答える日と、「一概には言えない」と答える日があり得ます。論文は、答えの向きが変わる割合を9〜28%と報告しましたが、日本語での割合は分かっていません。自社が扱う質問で試して、傾向をつかむ価値があります。

4. 話題を広く、正確に書くことは、引き続き土台になる。生成AIは、通常の検索と近い話題の広さで答えていました。引用される出典が入れ替わっても、話題としては近いところに落ち着きます。特定の1ページを狙うより、質問に答える情報をサイト全体で整えるほうが、この結果とは相性がよいと私は読みました。ただし、これは論文が検証したことではありません。

よくある質問

検索で上位のページを作れば、AIにも引用されますか

この論文からは、そうとは言い切れません。AI Overviewsが参照したドメインの53%が、通常の検索の上位10件にありませんでした。順位が高いことは、引用の確率を上げるかもしれませんが、この論文は、その関係を調べていません。

ChatGPTで自社が出るかを調べるとき、何回確認すればよいですか

論文は回数の目安を示していません。ただし、同じ質問を5分後や24時間後に聞き直すだけで、答えの向きが変わる質問がありました。1回の結果で判断せず、複数回、日をあけて記録するのが確実です。

日本語の質問でも、同じ結果になりますか

現時点では分かりません。論文の質問はすべて英語で、調べた場所は米国とドイツです。日本語での検証は報告されていないため、日本のAI検索でも同じ割合になるかどうかは、別の調査を待つ必要があります。

まとめ:今日できる1つのこと

自社に関係の深い質問を3つ決めて、AIに聞いた結果を、日付と一緒に記録してください。引用された出典と、答えの向き(おすすめか、条件付きか)を残します。1週間後に同じ質問で聞き直し、どれだけ入れ替わったかを比べると、自社の「AIでの見え方」が、どのくらい安定しているかの目安になります。

この論文は、LLMO論文の一覧の一本です。ほかの論文の解説も、順次公開しています。

この記事に書いたことを、そのまま御社のページに

生成AIに引用されるページを、お話しいただくだけでお作りします。お時間をいただくのは初回15分のヒアリングだけです。まず1ページ、無料でお作りします。

OKが出るまで、何度でも直します。事実が違う、言い回しが硬い、この話は入れないでほしい。どれも遠慮なくおっしゃってください。何度お直ししても、追加の料金はいただきません。

これまでに127社にご利用いただきました。毎月ご依頼いただいている方の6割以上が、月10ページを選ばれています。料金はページに掲載しています。

まず1ページ、無料で作らせてください

ページを増やしても問い合わせが来ないなら、原因はページの外にあります。その場合は、下の入口からご相談ください。

自社のマーケティング課題を根本から解決しませんか?

ウェブサイトから要素を引き算し、訪れた人が迷わず次の一歩に進む形へ組み直す。初回60分のオンラインで御社のサイトを一緒に読み、どこから直すべきかをお伝えします。手順をまとめた無料の診断と解説動画もご用意しています。

まず動画で詳しく見る(約30分)
無料診断を受ける

初回は無料・60分・オンライン完結・その場で契約のお願いはいたしません

LLMO論文
SEO対策 生成AI
よかったらシェアしてね!
  • URLをコピーしました!
  • 【LLMO論文解説】GoogleのAI Overviewsは、どんな検索で出て、出典どおりに書いているのか|55,393件を40日間追った実測調査(プレプリント・査読中)

この記事を書いた人

中野輝規のアバター 中野輝規

合同会社謙虚 代表社員。20代から、売る言葉だけを仕事にしてきました。電話営業で受話器を握っていた時代から、数千社のWEB集客に関わったいままで。詳しいプロフィールはこちら

この著者の記事一覧へ

関連記事

  • 通常のGoogle・AI Overviews・Geminiは
    【LLMO論文解説】通常のGoogle・AI Overviews・Geminiは、引用する出典がほとんど重ならない|1万1,500問で比べた実測(SIGIR 2026)
  • 本文だけ書き換えると検索で不利になる?構造情報まで測った実験
    【LLMO論文解説】本文だけ書き換えると検索で不利になる?構造情報まで測った実験|SAGEO Arena(KDD 2026)
  • 東京のホテルでAIが引用するサイトは質問の言い方と言語で変わ
    【LLMO論文解説】東京のホテルでAIが引用するサイトは質問の言い方と言語で変わる|OTAと日本語・英語の比較(HFE 2026)
  • 名前を出せば99.4%知っているのに、カテゴリの質問では3.
    【LLMO論文解説】名前を出せば99.4%知っているのに、カテゴリの質問では3.32%|Product Hunt 112社の調査(プレプリント)
  • GEO論文を読み解く
    【LLMO論文解説】GEO原論文|出典・引用・統計を足すとAIの回答に載りやすくなった実験(KDD 2024)
  • AI検索は第三者の媒体を選びやすいのか、Googleと4つの
    【LLMO論文解説】AI検索は第三者の媒体を選びやすいのか、Googleと複数のAIを比べた実験を原文から読む|獲得メディアの偏りと限界(プレプリント)
  • GoogleのAI Overviewsは、どんな検索で出て、
    【LLMO論文解説】GoogleのAI Overviewsは、どんな検索で出て、出典どおりに書いているのか|55,393件を40日間追った実測調査(プレプリント・査読中)
  • AI検索で「引用された」と「回答に使われた」は別物
    【LLMO論文解説】AI検索で「引用された」と「回答に使われた」は別物|選択と吸収を分けて測る枠組み(プレプリント)
最近の投稿
  • 【LLMO論文解説】AI Overviewsの出典は検索上位と別物か|4,706問で見た重なりと不安定さ(Findings of ACL 2026)
  • 【LLMO論文解説】GoogleのAI Overviewsは、どんな検索で出て、出典どおりに書いているのか|55,393件を40日間追った実測調査(プレプリント・査読中)
  • 【LLMO論文解説】通常のGoogle・AI Overviews・Geminiは、引用する出典がほとんど重ならない|1万1,500問で比べた実測(SIGIR 2026)
  • 【LLMO論文解説】AIが2つのページから先に引用する方を選ぶ条件を25万2千回の実験で調べた論文を原文から読む|関連性・位置・価格・日付(SIGIR 2026)
  • 【LLMO論文解説】AI検索で「引用された」と「回答に使われた」は別物|選択と吸収を分けて測る枠組み(プレプリント)
最近のコメント
  • 【LLMO論文解説】AIが2つのページから先に引用する方を選ぶ条件を25万2千回の実験で調べた論文を原文から読む|関連性・位置・価格・日付(SIGIR 2026) に 【LLMO論文解説】海外のGEO・LLMO論文92本の一覧|原論文から最新研究まで、テーマ別に整理(随時更新) - 合同会社謙虚 より
  • 【LLMO論文解説】GEO研究45本の批判的サーベイ|「効く」と「効かない」の境目を整理した論文(2026年7月) に 【LLMO論文解説】AI Overviewsの出典は検索上位と別物か|4,706問で見た重なりと不安定さ(Findings of ACL 2026) - 合同会社謙虚 より
  • 【LLMO論文解説】海外のGEO・LLMO論文92本の一覧|原論文から最新研究まで、テーマ別に整理(随時更新) に 【LLMO論文解説】AI Overviewsの出典は検索上位と別物か|4,706問で見た重なりと不安定さ(Findings of ACL 2026) - 合同会社謙虚 より
  • GEO対策の効果測定はなぜ難しいのか:中小企業が追うべきKPIとタイムライン に 【LLMO論文解説】GoogleのAI Overviewsは、どんな検索で出て、出典どおりに書いているのか|55,393件を40日間追った実測調査(プレプリント・査読中) - 合同会社謙虚 より
  • 【LLMO論文解説】GEO研究45本の批判的サーベイ|「効く」と「効かない」の境目を整理した論文(2026年7月) に 【LLMO論文解説】GoogleのAI Overviewsは、どんな検索で出て、出典どおりに書いているのか|55,393件を40日間追った実測調査(プレプリント・査読中) - 合同会社謙虚 より
  • HOME
  • 合同会社謙虚とは
  • 集客オプション
  • ブログ
  • お問い合わせ
  • プライバシーポリシー
  • 特定商取引法に基づく表記

© 合同会社謙虚

目次