AI検索の回答には、出典のリンクが並びます。リンクがいくつも並んでいると、いろいろな情報源を公平に読んだうえでまとめた答えに見えます。
では、AIは並べた出典を、実際にどのくらいずつ使っているのでしょうか。
この問いを1万1,000問の実測で調べたのが、2026年3月に公開された「Answer Bubbles: Information Exposure in AI-Mediated Search」です。
イリノイ大学アーバナ・シャンペーン校の研究者4人が、AIが引用する出典、回答の口調、出典から要約への写し方の3つを比べました。
題名の「回答の泡(アンサーバブル)」は、同じ質問でも、使うサービスによって利用者が触れる情報の中身が変わり、しかも利用者からはその違いが見えにくい状態を指す、論文が作った言葉です。
合同会社謙虚は、3つのドメインを並行して運用し、何を変えると数字が動くかを測り続けています。AIの回答に出典として載ったあと、自社の内容がどれだけ要約に使われるのかは、載るかどうかと同じくらい大事な問題なので、この論文を原文から読みました。
結論:3行で言うと
- 検索機能つきのGPT(論文の呼び名はSearch GPT)が引用するサイトの顔ぶれは、Google検索やAI Overviewsとの重なりが上位100ドメインで24〜25%にとどまりました。AI OverviewsとGoogle検索の重なりは68%でした
- AIの要約は、出典を均等には使っていませんでした。AI Overviewsでは、SNS・掲示板の出典は引用されても要約への反映が22.1ポイント少なく、否定的な論調の出典も13.8ポイント少ない結果でした。Wikipediaは多く引用され、要約でも多く使われていました
- 検索を使うと、回答から「おそらく」「かもしれない」といったためらいの言葉が減りました。同じモデルで検索を足すと40%減、別のモデルで動くAI Overviewsとの比較では60%減で、言い切る言葉は比較的残りました
ただし、調べたのは英語の質問だけで、1つの地点・1つの時期の測定です。要約への反映の測り方には、論文自身が認める弱点もあります。
この点は後の章で整理します。
この論文の基本情報
| 項目 | 内容 |
|---|---|
| 原題 | Answer Bubbles: Information Exposure in AI-Mediated Search |
| 著者 | Michelle Huang、Agam Goyal、Koustuv Saha、Eshwar Chandrasekharan(4人。イリノイ大学アーバナ・シャンペーン校。先頭の2人は同等の貢献) |
| 公開日 | 初版は2026年3月17日。確認した版は2026年8月28日の第2版 |
| arXiv番号 | 2603.16138(分野は情報検索) |
| 掲載・採択状況 | プレプリント(EMNLP 2026と記載、採択は未確認)。arXivのコメント欄とコードの公開ページに「EMNLP 2026」(自然言語処理の国際会議)とあります。ACL Anthology(この分野の論文集の公式サイト)には、2026年9月25日時点でEMNLP 2026の論文集がまだ載っておらず、採択の確認と、本会議か併設の論文集かの区別はできませんでした |
| 種類 | 実際のサービスの出力を集めて比べた実証研究(大学の研究グループ) |
| 実験データ・コード | コードはコードの公開ページ(論文に記載) |
論文はこちらで読めます。arXiv(2603.16138)。
この論文が答えた問い
同じ質問を、検索機能のないAI、検索機能つきのAI、AI Overviews、通常のGoogle検索に投げたとき、利用者が受け取る情報は、出典・言葉づかい・出典の使われ方の3点でどう違うのか。
論文が背景に挙げるのは、米国の民間調査機関による2025年の報告です。AI Overviewsが表示された検索では、通常の検索結果のリンクがクリックされる割合がおよそ半分になり、要約の中の出典リンクがクリックされたのは訪問の1%だった、という内容です。
利用者が元のページを開かなくなるなら、AIが何を選び、どう言い換えたかが、そのまま利用者の受け取る情報になります。
出典の重なりを測った研究は、これまでにもありました。当サイトでも、通常のGoogle・AI Overviews・Geminiの出典を比べた論文や、Google検索と生成AIの出典を比べた論文を解説しています。
この論文が新しく加えたのは、その先の段階です。出典として並んだページの内容が、要約の文章にどれだけ写されているかを、出典1件ごとに測っています。
どうやって調べたのか
| 項目 | 設定 |
|---|---|
| 質問 | Google検索に実際に入力された英語の質問を集めた公開データセット(Natural Questions、2018年ごろ収集)から5万問を抜き出し、11分野に分類。各分野1,000問ずつ、計1万1,000問 |
| 検索なしのAI | GPT-4o-miniに、検索を使わせずに答えさせる |
| 検索つきのAI | 同じGPT-4o-miniに、開発者向けの接続口(API)経由でウェブ検索の機能を使わせる(Search GPT)。一般向けのChatGPTの画面で検索した結果と同じとは限りません |
| AI Overviews・通常の検索 | 検索結果を取得する外部サービスで、米国イリノイ州アーバナの固定地点から検索し、AI Overviewsと1ページ目の検索結果を記録 |
| 追加の確認 | Perplexityの検索機能とGrokの組み合わせでも同じ手順を行い、付録で報告 |
| AIの設定 | GPT-4o-miniは温度0(毎回ほぼ同じ答えになる設定) |
分野の分類はAIが行い、著者2人が無作為に選んだ120問を手で分類して、AIの分類と90.00%・90.83%一致することを確かめています。
要約への写され方は、次の3段階で測っています。
- AIの回答を、これ以上分けられない事実の単位(例:「万里の長城の最もよく知られた区間は、明の時代に造られた」)に分ける。分けるのはAIで、分野ごとに100問、計1,100問ずつを対象にしました
- 出典のページ本文を取得し、約100語ずつに区切る
- 区切った本文が、回答の各単位を裏づけるかを、文の含意を判定するAIで確率として出す
ここから、「出典ごとの使われ方がどれだけ偏っているか(数値が大きいほど偏り)」と、「出典の中身のうち要約に反映された割合」を計算しています。さらに、出典の長さ・論調・種類ごとに、平均より多く使われたか少なく使われたかを、ポイント差で示しています。
結果
引用する出典の顔ぶれは、サービスで違う
論文の付録の表A2と本文から拾います。割合は、引用されたドメイン全体に占める比率です。
| 項目 | 検索つきのAI(GPT) | AI Overviews | 通常の検索 |
|---|---|---|---|
| 出典が1件以上ある質問 | 97.0% | 57.8% | 99.8% |
| 1問あたりの出典数(平均) | 3.2 | 4.0 | 9.3 |
| 百科事典・参考資料 | 27.3% | 10.3% | 11.0% |
| ニュース・報道 | 7.2% | 2.4% | 1.7% |
| 行政・公的機関 | 7.0% | 8.5% | 7.9% |
| SNS・掲示板 | 0.1% | 8.5% | 13.4% |
| Wikipediaを引用した質問の割合 | 49% | 28% | 81% |
- AI Overviewsが出たのは、質問の57.8%でした。分野で差が大きく、ビジネス84%・歴史81%・教育74%に対し、スポーツ34%・技術32%・旅行32%でした
- よく引用される上位100ドメインの重なりは、AI Overviewsと通常の検索で68%、検索つきのAIと他の2つで24〜25%でした。検索つきのAIは、百科事典や報道を多く使い、SNS・掲示板をほぼ使っていません
- 付録のPerplexityも、SNS・掲示板の引用は0.0%で、Google側との重なりは35〜38%でした
「この論文が答えた問い」の節で紹介した2本の記事は「出典がほとんど重ならない」と報告しています。この論文の68%と食い違って見えますが、測り方が違います。
2本の記事の数字は、1問ごとのURLやドメインの重なりの平均です。この論文の数字は、全質問を通してよく引用される上位100ドメインの一覧同士の重なりです。
一覧は重なっても、1問ごとに選ばれるページは違いうる、と読むのが自然です。
検索を使うと、ためらいの言葉が減る
本文の表1から拾います。数字は、回答の全単語のうち、その種類の言葉が占める割合です。
| 項目 | 検索なしのAI(GPT) | 検索つきのAI(GPT) | AI Overviews |
|---|---|---|---|
| 回答の語数(平均) | 87 | 140 | 83 |
| ためらいの言葉(「おそらく」など) | 0.025 | 0.015(40%減) | 0.010(60%減) |
| 考えを示す言葉全般 | 0.087 | 0.067(23%減) | 0.044(49%減) |
| 前向きな感情の言葉 | 0.045 | 0.044 | 0.025(44%減) |
| 丁寧さ(0〜1の推定値) | 0.52 | 0.45 | 0.41 |
減少率は、検索なしのAIと比べた相対的な減り方で、論文本文が示している値です。
- 言い切りの言葉は、ためらいの言葉ほど減りませんでした。言い切りの言葉をためらいの言葉で割った比は、検索なしの0.39から、検索つきのAIとAI Overviewsではどちらも0.49に上がっています
- AI Overviewsは短く、平易で、そっけない文体でした。1文の長さは平均11.4語で、検索つきのAIの18.0語より短くなっています
- 検索つきのAIとAI Overviewsの口調の差は分野で違い、技術と旅行で最も大きく、教育・歴史・ビジネスでは、ためらいや考えを示す言葉の差はほぼありませんでした
引用された出典が、要約で均等に使われるとは限らない
本文の表2・表3から拾います。「差」は、その種類の出典が要約に反映された割合と、同じ回答で引用された出典の平均との差で、単位はポイントです。
プラスは多めに使われ、マイナスは少なめに使われたことを示します。
| 出典の種類 | 検索つきのAI(GPT) | AI Overviews |
|---|---|---|
| 短い出典(200語未満) | -13.4 | -17.7 |
| 長い出典(800語超) | +3.9 | +4.6 |
| 否定的な論調の出典 | -3.7(有意差なし) | -13.8 |
| SNS・掲示板 | 算出なし(表では「–」) | -22.1 |
| Wikipedia | +2.6 | +5.4 |
| 行政の出典 | -4.2 | -3.5 |
| 出典一覧の1番目 | +1.5 | +3.2 |
| 主観の強い出典 | -2.3 | -3.2 |
- AI Overviewsは出典を多く並べる一方で、1件ごとの使い方は薄めでした。この比較に使った問では平均5.0件を引用し(検索つきのAIは2.7件)、出典の中身が要約に反映された割合は0.447で、検索つきのAIの0.500を下回りました。両方で指標を算出できた338問だけで比べても、0.500対0.440で差は残っています
- 論文はこれを「引用と要約のずれ」と呼んでいます。SNS・掲示板を出典に並べることで幅広く読んだように見えるものの、要約の中身は百科事典的な文章に寄っている、という指摘です
- 因果や言い切りの言葉を多く含む出典は多めに使われ、主観の強い出典は少なめでした。論文は、事実を抜き出しやすい断定的な説明文が好まれていると解釈しています
- Perplexityでも、短い出典と否定的な出典(-10.1ポイント)は少なめ、Wikipediaは+9.6ポイントで多めでした
論文自身が書いている限界
- 1つの時点、1つの地点での測定です。サービスは頻繁に更新され、AI Overviewsの出方は地域・言語・利用者で変わります
- 質問は2018年ごろに集められた情報探し型の質問集です。分野の分け方も粗く、科学の中に生物・物理・医療がまとまっています
- 事実の単位への分割と含意の判定はAIが行い、今回あらためて人手での確認はしていません。有料記事などで本文を取得できなかった出典もあります
- 出典ごとの反映を「区切った本文のうち最も裏づけの強い箇所」で測っているため、長いページほど有利になる仕組みが入っています。一部の問(分野ごとに最大30問を抜き出したもの)で平均値に置き換えると、短い出典の不利は検索つきのAIで-14.8から+1.8へ、AI Overviewsで-21.7から-1.1へと、ほぼ消えました。論文は、長さの偏りの一部は計算方法によるものだと認めています
- 利用者の受け止め方や行動は測っていません。結果は相関で、原因は特定できません。AI Overviewsの中身(モデルの版や取得の仕組み)は外から見えません
原文を読んで気づいた点
- 日本語での検証はありません。質問はすべて英語で、測定地点も米国です
- 「検索つきのAI」は、開発者向けの接続口から小型のモデルに検索させたものです。一般の利用者がChatGPTの画面で目にする回答と同じとは限りません
- 評価はすべて自動の計算とAIの判定です。人が読んで偏りを確かめた評価は含まれていません
- AI Overviewsの出典数は、本文の一か所で平均7.0件、付録の表A2で平均4.0件、要約の分析では平均5.0件と、箇所で値が違います。この記事では表A2の値を使い、要約の分析の説明ではその分析の値を使いました
- 掲載先は著者の記載どおりEMNLP 2026としていますが、論文集での確認はまだです
この論文から、言えること・言えないこと
| 言えること(論文の設定で確認された) | 言えないこと(論文では確認されていない) |
|---|---|
| 検索つきのAIは、Google側と、よく引用するサイトの顔ぶれが大きく違った | 1問ごとに、どのページが選ばれるかの重なり |
| AI Overviewsでは、SNS・掲示板や否定的な論調の出典が、引用されても要約に使われにくかった | 否定的な内容を書くと、AIに出にくくなること(因果は未検証) |
| 検索を使うと、ためらいの言葉が減り、言い切りの比率が上がった(同じモデルでの比較は40%減) | 利用者がそれで回答を信じやすくなること |
| 短い出典は要約で少なめに使われた | ページを長くすれば要約で多く使われること(計算方法で大きく変わる) |
| 同じ傾向が、付録のPerplexityでも大筋で見られた | 日本語の質問や、日本からの検索でも同じになること |
中小企業の視点で、どう受け取るか
ここからは論文の主張とは別の、私の読み取りです。
- 「出典に載った」と「内容が伝わった」を分けて確かめる。自社ページがAIの出典に並んでいても、要約の文章に自社の説明が入っているとは限りません。AIの回答を見るときは、リンクの有無に加えて、要約の文に自社の記述が使われているかを読むのがよいと考えます
- 事実を1文ずつ取り出せる書き方にする。論文では、因果や言い切りの言葉を含む説明文が多めに使われていました。「なぜそうなるのか」「どういう条件でそうなるのか」を、1文で言い切れる形で書いておくと、要約に写されやすい方向に働く可能性があります
- ページを長くすること自体を目的にしない。長いページが有利に見えた結果は、計算方法を変えるとほぼ消えました。長さを足すより、要点を正確に書くことを優先するのが安全です
- AIの言い切りを、そのまま自社の判断に使わない。検索を使ったAIは、ためらいの言葉を減らして答えていました。論文は、元の情報が裏づける以上に言い切った口調になっている可能性を指摘しています。自社の業界の情報をAIで調べたときは、出典を開いて条件や留保を確かめる習慣が役に立ちます
よくある質問
「回答の泡(アンサーバブル)」は、フィルターバブルと同じ意味ですか
似ていますが、指しているものが違います。フィルターバブルは、個人の好みに合わせて表示が絞られる現象です。
論文の「回答の泡」は、個人向けの調整を測ったものではなく、サービスごとに出典の選び方や言い換え方が違うことで、同じ質問でも受け取る情報が変わる状態を指しています。
論文も、個人向けの調整や政治的な偏りは測っていないと明記しています。
AI Overviewsは、SNSや掲示板の情報を使わないのですか
引用はしています。AI Overviewsの出典の8.5%はSNS・掲示板でした。
そのうえで、同じ回答の中のほかの出典と比べると、要約に反映された割合が22.1ポイント低い、というのが論文の結果です。引用の一覧に並ぶことと、要約の中身に使われることの間に差がある、と読むのが正確です。
AI検索で自社の情報が要約に使われやすくするには、ページを長くすればよいですか
この論文からは、そうは言えません。長いページが多めに使われた結果は、測り方を平均値に変えると、ほぼ消えました。
論文自身も、長さの偏りの一部は計算方法によると認めています。長さより、事実と根拠を1文ずつはっきり書くことに力を使うほうが、論文の他の結果とも合っています。
まとめ:今日できる1つのこと
自社の主力の商品やサービスについて、お客様がしそうな質問を1つ、AI検索に入れてみてください。回答の出典に自社ページがあれば、要約の文章を読み、自社ページに書いた説明がどの文に使われているかを確かめます。
使われていなければ、そのページの要点が1文で言い切れる形になっているかを見直すところから始められます。
この論文は、LLMO論文の一覧の一本です。ほかの論文の解説も、順次公開しています。
この記事に書いたことを、そのまま御社のページに
生成AIに引用されるページを、お話しいただくだけでお作りします。お時間をいただくのは初回15分のヒアリングだけです。まず1ページ、無料でお作りします。
OKが出るまで、何度でも直します。事実が違う、言い回しが硬い、この話は入れないでほしい。どれも遠慮なくおっしゃってください。何度お直ししても、追加の料金はいただきません。
これまでに127社にご利用いただきました。毎月ご依頼いただいている方の6割以上が、月10ページを選ばれています。料金はページに掲載しています。
ページを増やしても問い合わせが来ないなら、原因はページの外にあります。その場合は、下の入口からご相談ください。
自社のマーケティング課題を根本から解決しませんか?
ウェブサイトから要素を引き算し、訪れた人が迷わず次の一歩に進む形へ組み直す。初回60分のオンラインで御社のサイトを一緒に読み、どこから直すべきかをお伝えします。手順をまとめた無料の診断と解説動画もご用意しています。
初回は無料・60分・オンライン完結・その場で契約のお願いはいたしません


