同じ質問を、英語と中国語で検索したら、AI要約はどのサイトを出典として表示するのか。この問いを、BaiduとGoogleの検索画面で数えた論文が、2026年9月にarXivで公開されました。
イタリアのミラノ工科大学の研究者5人による「Auditing Source Exposure in Baidu and Google AI Search」です。検索の研究でよく使われる英語の質問集から500問を選び、機械翻訳した中国語の質問と組にして、約2,000件の検索画面を記録しています。
この記事では、原文を付録まで読み、AI要約が出る割合、出典の偏り、出典の重なり、回答の意味の近さを、論文の表と図の値で整理します。
合同会社謙虚は、3つのドメインを並行して運用し、何を変えると数字が動くかを測り続けています。AIの回答が似ていても、出典に選ばれるサイトは別に決まるのかを確かめておくために、この論文を読みました。
結論:3行で言うと
- AI要約が表示された割合は、Googleが中国語97.6%・英語97.0%、Baiduが中国語82.0%・英語4.0%でした。同じ検索サービスでも、質問の言語で表示のされ方が大きく変わりました
- Baiduの中国語のAI要約では、出典の表示が一部のサイトに強く集中していました。偏りを表す係数はBaidu中国語0.895、Google中国語0.500で、Baiduの出典の上位10件はすべて百度自身のサービスでした
- 回答の意味の近さは中央値で0.701〜0.813でしたが、出典のドメインの重なりは0.008〜0.034でした。論文は、回答の中身と、出典の表示のされ方は別の次元で測るべきだと結論づけています
調べたのは英語と中国語だけで、日本語は検証の対象外です。収集はイタリアのミラノから、2026年6〜7月の約3週間に行われた一時点の記録です。
この論文の基本情報
| 項目 | 内容 |
|---|---|
| 題名(原題) | Auditing Source Exposure in Baidu and Google AI Search |
| 著者 | Yibo Li、Enci Guan、Yuedan Cai、Geng Liu、Francesco Pierri(5人。全員がイタリアのミラノ工科大学) |
| 公開日 | 2026年9月21日(確認した版はv1) |
| arXiv番号 | 2609.24407(分類は情報検索) |
| 掲載・採択状況 | arXivのコメント欄に「Accepted at WAC @ EMNLP 2026」と記載。自然言語処理の国際会議EMNLP 2026に併設されるワークショップへの採択と読めます。本会議とは別枠の発表で、論文集への掲載は未確認です |
| 種類 | 実際の検索画面を自動で集めて数えた監査(観察研究)。本文8ページ(全12ページ、付録を含む) |
| 実験データとコード | 公開先の記載は、原文に見当たりませんでした |
論文はこちらで読めます。arXiv(2609.24407)。
ワークショップの略称「WAC」は、同じ会議に併設される「ウェブ・アズ・コーパス(ウェブを言語の資料として扱う研究)」の第13回ワークショップを指すと見られます。ただし、略称の対応は私が照合したもので、正式名称は論文の外で確かめた情報です。
この論文が答えた問い
同じ情報を求める質問を、英語と中国語で、BaiduとGoogleに出したとき、AI要約はどのくらい表示され、どのサイトが出典として目に入り、その偏りと重なりはどう違うのか。
論文は、問いを3つに分けています。1つ目はAI要約が表示される頻度、2つ目は中国語のAI要約で表示される出典の顔ぶれと集中の度合い、3つ目は設定の間での出典の重なりと回答の意味の近さです。
背景として論文が挙げるのは、これまでの監査がGoogleなど英語中心のサービスに偏っていた点です。中国語の検索で、AI要約がどの出典を表示しているかは、比較的わずかしか調べられていない、と論文は述べています。
当サイトでは、近い主題の論文を2本解説しています。違いを先に整理します。
- 健康の質問でGoogleとBaiduのAI要約を比べた論文の解説は、健康の質問だけを、12か国・4言語(日本語を含む)で調べ、出典の「国籍」を数えた研究です
- 今回の論文は、話題を絞らない一般の質問500問を使い、英語の原文と機械翻訳した中国語を組にしています。数えたのは出典の国籍ではなく、表示の頻度、ドメインの集中、重なりです
- 「回答の泡」の論文の解説は、英語の質問で、引用した出典が要約にどれだけ使われるかを調べた研究です。今回の論文は、この研究を先行研究として引用しています
どうやって調べたのか
| 項目 | 設定 |
|---|---|
| 質問 | MS MARCO(検索エンジンBingに実際に入力された匿名の質問を集めた公開データ)から、重複を除いて500問を無作為に抽出 |
| 中国語の質問 | Googleの翻訳サービスで簡体字の中国語に自動翻訳。著者1人が100組を点検し、全件を「意味が保たれている」と判定 |
| 設定 | Baidu中国語、Baidu英語、Google中国語、Google英語の4通り |
| 集めた件数 | 1,998件(Baiduは各500件、Googleは各499件。各1件が記録漏れ) |
| 時期・場所 | 2026年6月20日〜7月10日。イタリアのミラノから、Chromeで収集 |
| 環境 | Googleはアカウントにログインした状態で、画面の言語は英語。Baiduは中国語の画面。シークレットモード、VPN、プロキシは不使用 |
| 集め方 | Playwright(ブラウザを自動で操作する道具)で質問を順番に入力し、画面に見えている出典だけを記録。折りたたまれた出典欄は閉じたままです |
| 話題の分類 | GPT-5.5で6分類に自動で振り分け。著者1人が60件を点検し、96.7%(58件)が正しいと判定 |
話題の内訳は大きく偏っています。一般知識が325問で、残りは買い物51問、健康43問、生活41問、仕事・お金30問、ネット・技術10問です。
出典は、サイトの住所の先頭部分を含む「ホストドメイン」の単位で数えています。たとえば百度の百科事典と、百度の質問回答サービスは、同じ百度の中でも別の出典として数えます。
1つの要約に同じドメインが何度出ても、1回と数えます。
出典の抽出の正確さは、著者1人が60件を点検し、58件(96.7%)で画面の表示と完全に一致したと報告しています。
使った指標は4つです。用語を言い換えておきます。
- 表示率:集めた件数のうち、AI要約が表示された割合
- ジニ係数:出典の回数が一部のドメインにどれだけ集中しているかを表す値。0に近いほど均等、1に近いほど一部に集中
- ジャカード係数:2つの設定で表示されたドメインの一覧が、どれだけ重なるかの値。共通するドメインの数を、どちらかに出たドメインの数で割ります
- コサイン類似度:要約の文章を、多言語に対応した文の埋め込みモデル(文の意味を数値の並びに変える仕組み)で変換し、意味の近さを測った値。1に近いほど近い意味です
結果
AI要約が表示された割合
| 設定 | 集めた件数 | 要約あり | 表示率 |
|---|---|---|---|
| Baidu中国語 | 500 | 410 | 82.0% |
| Baidu英語 | 500 | 20 | 4.0% |
| Google中国語 | 499 | 487 | 97.6% |
| Google英語 | 499 | 484 | 97.0% |
出典:論文の表1。アクセス制限や読み込みの失敗を分母から除いても、表示率は82.0%、4.0%、97.8%、97.6%で、傾向は同じだったと論文は書いています。
- Googleは、どちらの言語でもほぼすべての質問で要約を表示しました。話題別でも90.2〜100.0%です
- Baiduは、中国語では82.0%、英語では4.0%と、言語による差が最も大きい結果でした
- Baidu中国語の話題別では、健康が97.7%で最も高く、買い物が70.6%で最も低い結果でした(論文の図3)
- Baidu英語は要約が20件しかなかったため、出典の分析からは外されています
出典の量と集中の度合い
| 設定 | 出典の延べ回数 | ドメインの種類 | 1位のドメインの割合 | ジニ係数 |
|---|---|---|---|---|
| Baidu中国語 | 6,154 | 443 | 27.1% | 0.895 |
| Google中国語 | 9,053 | 2,843 | 6.6% | 0.500 |
| Google英語 | 8,061 | 2,677 | 5.5% | 0.462 |
出典:論文の付録の表3。
- 要約1件あたりの出典の数は、Baidu中国語15.0、Google中国語18.6、Google英語16.7でした
- ドメインの種類は、Google中国語がBaidu中国語の約6.4倍でした(2,843÷443で概算)
- Baidu中国語の1位は百度の百科事典(百度百科)で、延べ1,665回、全体の27.1%を占めました
- 論文の図5によると、Baidu中国語の上位10件は、百度百科、百度の健康情報サービス、百家号(百度の記事投稿の場)、百度知道(質問回答)、百度文庫など、すべて百度のサービスでした。10件の合計は延べ3,814回で、全体の約62%です(3,814÷6,154で概算)
- Google中国語の1位は中国語版ウィキペディア(6.6%)、Google英語の1位は英語版ウィキペディア(5.5%)でした。Google中国語では、百度百科も延べ300回で3位に入っています(図5)
- 話題別のジニ係数も、Baidu中国語は0.60〜0.88で、6つの話題すべてでGoogleの2設定(0.20〜0.50)より高い値でした(図4)
Google英語の上位には、学術論文のデータベース、米国の医療機関のサイト、英語の辞書や百科事典のサイトが並びました。論文は、Googleの2設定は外部のサイトに分散しており、特にGoogle中国語は百科事典、医療、商用などが混ざっていた、と述べています。
出典の重なりと、回答の意味の近さ
| 組み合わせ | 共通のドメイン | どちらかに出たドメイン | ジャカード係数 | 回答の意味の近さ(中央値) |
|---|---|---|---|---|
| Google中国語とGoogle英語 | 179 | 5,341 | 0.034 | 0.791 |
| Baidu中国語とGoogle中国語 | 103 | 3,183 | 0.032 | 0.813 |
| Baidu中国語とGoogle英語 | 25 | 3,095 | 0.008 | 0.701 |
出典:ジャカード係数は論文の表2、意味の近さは4.5節と図6。意味の近さは、3つの設定すべてで要約が出た331問に絞って計算されています。
- 出典のドメインの一覧は、どの組み合わせでも重なりが小さく、最も高いGoogle中国語とGoogle英語でも0.034でした
- 一方で、回答の意味の近さは中央値0.701〜0.813でした。最も高いのはBaidu中国語とGoogle中国語の0.813(中央の半分の範囲は0.709〜0.886)です
- 検索サービスと質問の言語が両方とも違うBaidu中国語とGoogle英語は、中央値0.701で、ばらつきも最も大きい結果でした
論文は、この2つの指標を、それぞれ別の単位で集計した記述的な値として扱っています。重なりは設定全体のドメインの一覧で、意味の近さは質問ごとの組で計算しているためです。
そのため論文は、「回答が似ているのに出典が違う」という質問単位の関係については、主張を控えています。示したのは、回答の中身と出典の表示が、AI検索の別々の側面を表しているという点です。
論文自身が書いている限界
- 出典の重なりに使ったジャカード係数は重みのない指標で、出現回数の少ないドメインの数に左右されます。値が低いことだけでは、偶然に比べて重なりが特に小さいとは言えない、と論文は断っています
- Baidu英語を出典の分析から外したため、検索サービスと言語を総当たりで組み合わせた設計になっていません。違いは設定の組み合わせの差で、検索サービスと言語それぞれの効果を切り分けたものではありません
- 集めた件数と時期が限られています。検索結果は時間で変わり、場所やブラウザの状態でも変わり得ます
- 出典の抽出は画面の構造に依存し、表示の仕方が変われば抽出のルールも直す必要があります
- Googleはログインした状態で、画面の言語を英語にして集めています。アカウントの状態と画面の言語が、結果に影響した可能性があります
- Baiduをミラノから使ったため、中国本土の利用者の体験を再現できていない可能性があります。Baidu英語の4.0%は、地域による振り分け、画面の挙動、言語の対応のいずれか、またはその組み合わせを反映しているかもしれない、と論文は書いています
- 中国語の質問は機械翻訳です。比べたのは「英語の原文と、その翻訳」で、それぞれの言語の話者が自然に入力した質問どうしの比較とは別物です
- 話題の内訳が偏っているため、話題別の結果は参考の内訳として読むべきだとしています
- 出典の正しさや信頼性は、判定の対象外です。出典の回数は「目に入りやすさ」の指標で、質の指標とは別です
- 同じ会社の別サービスを別の出典として数えています。会社単位でまとめれば、集中や重なりの値は変わり得ます
原文を読んで気づいた点
- 日本語での検証はありません。質問は英語と中国語だけで、検索の地点もミラノだけです。中国語や英語の数字を日本語の検索に当てはめるには、別の検証が必要です
- 収集の地点はミラノ1か所で、Googleはログイン状態、画面の言語は英語です。中国語圏や日本の利用者が普段見ている画面とは、条件が異なります
- 意味の近さを測る埋め込みモデルは、標準の設定で最初の128トークン(文章の区切りの単位)までしか読みません。論文も、長い要約は途中で切られると明記しています。要約の後半の違いは、0.701〜0.813の値に入っていないことになります
- 無関係な回答どうしの類似度など、比べる基準の値は論文に見当たりませんでした。0.7〜0.8がどのくらい「近い」のかは、読み手が判断する余地が残ります
- 翻訳の点検、話題の分類の点検、出典の抽出の点検は、いずれも著者1人によるものです。複数人の判定の一致は、論文自身が「計算の対象外」と書いています
- 中国語の質問は、調査対象の1つであるGoogleの翻訳サービスで作られています。この点が結果に影響するかどうかについて、論文は触れていません
- 本文は、Baiduの集中が「ほとんどの話題で」高いと書いています。図4の値を読むと、6つの話題すべてで高い値でした
- 採択先は、本会議ではなく併設のワークショップです。データとコードの公開先は、原文に見当たりませんでした
この論文から、言えること・言えないこと
| 言えること(観察した条件の範囲で) | 言えないこと |
|---|---|
| 2026年6〜7月のミラノからの検索で、Baiduは英語の質問ではほとんどAI要約を出さなかった | 中国本土や日本から検索しても、同じ表示率になる |
| Baiduの中国語のAI要約では、出典が百度のサービスに強く集中していた | 百度が自社のサービスを意図して優遇している(内部の仕組みは調べていない) |
| 設定が変わると、表示される出典のドメインの一覧はほとんど重ならなかった | 同じ質問の回答どうしで、出典がほとんど重ならない(重なりは設定全体で計算) |
| 回答の意味の近さと、出典の表示は、別々に測る必要がある | 回答が似ていれば、出典の違いは気にしなくてよい |
| 出典の回数は「目に入りやすさ」を表す | 多く表示される出典ほど、正しく信頼できる |
中小企業の視点で、どう受け取るか
ここからは論文の主張とは別の、私の読み取りです。日本語の検証はないため、方向を考える材料として読んでください。
- AIの回答を確かめるときは、回答文と出典欄を別々に記録する。回答の意味が近くても、出典の顔ぶれは大きく違い得る、というのがこの論文の中心の結果です。回答文だけを見て「いつもと同じ」と判断すると、出典の入れ替わりを見落とします
- 海外の検索サービスに向けて発信するときは、そのサービスの出典の傾向を先に見る。中国語のBaiduでは、出典の約6割が百度自身のサービスでした。自社サイトだけでなく、その地域の検索サービスが出典に選びやすい場所がどこかを確かめる価値があります
- 測った条件を一緒に残す。この論文でも、検索した場所、ログインの有無、画面の言語が限界として挙がっています。自社で確かめるときも、日付、端末、ログインの有無を記録しておくと、あとで比べられます
- 「AIに出典として載る」と「回答に内容が使われる」は分けて考える。出典に表示されることは目に入りやすさの話で、内容が要約に反映されたかは別の問題です。この点は、中国語のAI検索4サービスの引用を調べた論文の解説でも扱っています
よくある質問
BaiduとGoogleのAI要約の出典を比べたこの監査は、日本語の検索にも当てはまりますか
この論文が扱ったのは、英語と中国語の質問と、ミラノからの検索だけです。日本語の検索に当てはまるかは、まだ確かめられていない問いです。
日本語を含む比較が必要なら、健康の質問を12か国・4言語で調べた別の論文の解説が参考になります。ただし、そちらも健康の質問に限った結果です。
AI要約の回答の意味の近さが0.7〜0.8なら、BaiduとGoogleはほぼ同じ答えを出しているのですか
論文は、0.701〜0.813を「意味が近い」側の値として扱っています。ただし、この値は事実の正しさや出典の重なりを表すものではない、と論文自身が書いています。
また、測ったのは要約の冒頭の約128トークンまでで、比較の基準となる値も論文に見当たりませんでした。「ほぼ同じ答え」と言い切るには、材料が足りないと私は読んでいます。
BaiduのAI要約が百度のサービスばかりを出典にするのは、意図的な優遇ですか
論文は、検索エンジンの内部の仕組みを推し量ることを、はっきり対象外にしています。分かったのは、画面に表示された出典が百度のサービスに集中していた、という観察だけです。
理由が優遇なのか、中国語のウェブで百度のサービスに情報が多いからなのかは、この論文の範囲の外にある問いです。
まとめ:今日できる1つのこと
自社の商品やサービスについて、お客様が入力しそうな質問を1つ決めてください。AI要約が出たら、回答の要点と、出典欄に並んだサイトの名前を、表の別々の列に書き留めます。
日を変えて同じことを繰り返すと、回答が変わったのか、出典が入れ替わったのかを分けて見られるようになります。
この論文は、LLMO論文の一覧の一本です。ほかの論文の解説も、順次公開しています。
この記事に書いたことを、そのまま御社のページに
生成AIに引用されるページを、お話しいただくだけでお作りします。お時間をいただくのは初回15分のヒアリングだけです。まず1ページ、無料でお作りします。
OKが出るまで、何度でも直します。事実が違う、言い回しが硬い、この話は入れないでほしい。どれも遠慮なくおっしゃってください。何度お直ししても、追加の料金はいただきません。
これまでに127社にご利用いただきました。毎月ご依頼いただいている方の6割以上が、月10ページを選ばれています。料金はページに掲載しています。
ページを増やしても問い合わせが来ないなら、原因はページの外にあります。その場合は、下の入口からご相談ください。
自社のマーケティング課題を根本から解決しませんか?
ウェブサイトから要素を引き算し、訪れた人が迷わず次の一歩に進む形へ組み直す。初回60分のオンラインで御社のサイトを一緒に読み、どこから直すべきかをお伝えします。手順をまとめた無料の診断と解説動画もご用意しています。
初回は無料・60分・オンライン完結・その場で契約のお願いはいたしません


