Google検索とAI検索(ChatGPT・Claude・Perplexityなど)は、同じ質問を投げても、まったく違う情報源を返しています。
2026年1月に公開された「Navigating the Shift: A Comparative Analysis of Web Search and Generative AI Response Generation」は、この違いを大規模な実測で数値化した論文です。
Google検索・GPT-4o・Claude 4.5 Sonnet・Perplexity Sonar Pro・Gemini 2.5 Flashの5つを、同じ質問セットで横並びに比べています。
この記事は、原文を通読したうえで、何を測り、何が分かったのかを整理します。数値はすべて論文の本文と表から拾い、割合の差など自分で計算した箇所には「概算」と書きます。
論文が本文で述べている内容と、記事の書き手である私の読み取りは、見出しと文言で分けています。
合同会社謙虚は、3つのドメインを並行して運用し、何を変えると数字が動くかを測り続けています。この論文は、AIが答えを作るときに独自メディアの記事とSNSの投稿のどちらを重く見ているか、そして情報の新しさがどこまで効くかを、質問の種類ごとに数字で示しているため、コンテンツをどこに置くかを考える材料として読む価値があると判断しました。
結論:3行で言うと
- 1,000件の質問で比べたところ、AI検索が引用したドメインは、Google検索の上位10件とほとんど重なっていませんでした(重なりが最も少ないGPT-4oは平均4.0%、最も多いPerplexity Sonar Proでも平均15.2%)
- 出典の種類を見ると、Googleは独自メディア・SNS・自社サイトをバランスよく引用する一方、AI検索は独自メディアと自社サイトを重く見て、SNSの引用を大きく減らしていました
- GPT-4oを使った追加実験では、よく知られた話題(人気企業)では検索結果の並び順を変えても答えがほとんど変わらず、あまり知られていない話題(専門性の高い企業)では並び順で答えが大きく変わるという違いが見られました
ただし、この論文には著者自身がまとめた独立した「限界」の節はありません。並び順の実験はGPT-4o1機種だけで行われ、質問はすべて英語です。
この点は後の章で整理します。
この論文の基本情報
| 項目 | 内容 |
|---|---|
| 題名(原題) | Navigating the Shift: A Comparative Analysis of Web Search and Generative AI Response Generation |
| 著者 | Mahe Chen、Xiaoxuan Wang、Kaiwen Chen、Nick Koudas(4人。トロント大学 計算機科学科) |
| 公開日 | 2026年1月23日(arXiv初版) |
| arXiv番号 | 2601.16858 |
| 掲載/採択状況 | CEUR-WS(Vol-4192、EDBT/ICDT 2026併設ワークショップ論文集)の目次で確認したところ、10th International Workshop on Data Analytics solutions for Real-Life Applications(DARLI-AP)に採録されています。arXivのコメント欄も「Accepted at EDBT/ICDT 2026 Workshops」で、両者は一致しています |
| 種類 | 大学の研究グループによる学術論文(査読ありのワークショップ採択。EDBT/ICDT本会議の研究トラックではなく併設ワークショップ) |
| 実験データ・コードの公開先 | 論文中に公開リポジトリの記載は見当たりませんでした(確認できず) |
論文はこちらで読めます。arXiv(2601.16858)、CEUR-WS(Vol-4192、DARLI-AP)。
この論文が答えた問い
生成AIが作る答えは、Google検索の結果と、どの情報源を使うかという点でどう違うのか。そしてAIが学習の段階で身につけた知識(事前知識)は、検索して得た情報とどう混ざり合っているのか。
論文はこの問いを3つの角度に分けて調べています。1つ目は引用元ドメインの重なり、2つ目は引用元の種類(自社サイトか、独立系メディアか、SNSか)、3つ目は引用元の情報の新しさです。
そのうえで、AIが答えを作るときに事前知識と検索結果のどちらを優先しているかを、GPT-4oを使った追加実験で確かめています。
論文はこの流れを踏まえ、従来のSEO(検索エンジン最適化)に代わる新しい対策を「AEO/GEO(Answer/Generative Engine Optimization)」と呼び、GEOの原論文(KDD 2024で発表された研究)などを引用しています。
どうやって調べたのか
論文は、目的の異なる3つの実測を組み合わせています。
| 実測 | 質問数・対象 | 比べた系(システム) |
|---|---|---|
| ドメインの重なり | ランキング形式の質問1,000件(100種のテンプレート×スマートフォンや航空会社など10分野)。人気企業と専門性の高い企業を比べる質問216件(各108件)も別途実施 | Google検索、GPT-4o、Claude 4.5 Sonnet、Gemini 2.5 Flash、Perplexity Sonar Pro |
| 出典の種類 | 家電分野の質問300件(情報収集100・比較検討100・購入意図100を均等に) | 同上5系 |
| 情報の新しさ | 家電と自動車、各分野で100件のランキング質問 | Google検索、GPT-4o、Claude 4.5 Sonnet、Perplexity Sonar Pro(Geminiは対象外) |
ドメインの重なりは、質問ごとにGoogle検索の上位10件と各AIが引用したURLをドメイン単位にそろえ、両者がどれだけ重複するか(Jaccard係数という重なり具合の指標)を計算し、全質問で平均しています。
出典の種類は、GPT-4o(判定条件を固定した設定)に「Brand(自社サイト)」「Earned(独立系メディア)」「Social(SNSなど)」の3種類に振り分けさせ、無作為に抜き出した一部を人手で見直して精度を確かめています。
情報の新しさは、各ページのメタ情報や本文の日付表記から公開日を推定し、収集した時点までの経過日数(記事の古さ)を集計しています。
日付が分からないページ(未判定)を除いた集計に偏りが出ないよう、日付が判明した割合(判定できた割合)をかけ合わせた指標も別に計算しています。
結果
Google検索とAI検索は、ほぼ別のドメインを見ている
Googleの上位10件との重なりは、GPT-4oが平均4.0%(中央値0.0%)で最も低く、Gemini 2.5 Flashが11.1%、Claude 4.5 Sonnetが12.6%、Perplexity Sonar Proが15.2%(中央値14.3%)でした。
すべての系のあいだの差は、ブートストラップ法という統計的な検定(1万回の再抽出)で有意と確認されています(p<0.001)。
GPT-4oは半数以上の質問で、Googleの上位10件と1つもドメインが重ならない結果でした。
人気企業どうしを比べる質問(108件)と、専門性の高い企業どうしを比べる質問(108件)を分けて見ると、専門性の高い企業の質問のほうがGoogleとの重なりが3〜4ポイントほど増える傾向でした。この増加はClaude 4.5 Sonnet・Gemini 2.5 Flash・Perplexity Sonar Proでは統計的に有意でしたが(p<0.01)、GPT-4oでは増加幅が小さく有意ではありませんでした。専門性の高い企業の質問では、各系が引用する固有ドメインの割合が74.2%から68.6%に下がっており、限られたレビューサイトや掲示板に集中して引用する傾向がうかがえます。この重なりの小ささは、通常のGoogle検索・AI Overviews・Geminiの出典を比べた別の論文でも報告されている傾向です。
AIは独自メディアを重く見て、SNSの引用を減らす
Googleの出典構成は独自メディア(Earned)41%・SNS(Social)34%・自社サイト(Brand)26%とバランスが取れています。
一方、Claude 4.5 Sonnetは独自メディア65%・SNS1%、GPT-4oは独自メディア57%・SNS8%と、独自メディアに大きく偏っていました。
Perplexity Sonar Proは独自メディア50%・自社サイト39%、Gemini 2.5 Flashは独自メディアと自社サイトがほぼ半々(46%ずつ)で、他の2系よりバランスが取れています。
質問の種類によっても構成は変わります。比較検討の質問では、AI各系は独自メディアの比率が59〜86%に達する一方、Googleは41%のSNSに支えられています。
購入意図の質問では、AI各系は自社サイトの比率が52〜68%まで上がり、Googleはより混合した構成を保っていました。
AI検索が引用する記事のほうが新しい
家電分野では、Claude 4.5 Sonnetが最も新しい記事を引用しており、記事の古さの中央値は62.3日(日付判定できた割合92.5%)でした。
GPT-4oは79.8日(判定93.0%)、Perplexity Sonar Proは90.4日(判定63.0%)、Googleは130.4日(判定61.5%)でした。
日付が分かった割合をかけ合わせた指標では、GPT-4oがわずかにClaude 4.5 Sonnetを上回って1位でした。
自動車分野では差がさらに開きます。Claude 4.5 Sonnetの中央値は148.0日、GPT-4oは162.2日、Perplexity Sonar Proは216.6日で、Googleは492.9日でした。
同じ指標での順位はClaude 4.5 Sonnet、GPT-4o、Perplexity Sonar Proの順でした。
論文は、判定できた割合が系と分野によって大きく違う点(自動車分野ではPerplexityの42.6%からGPT-4oの93.0%まで)に注意が必要だとしており、日付が分からないページを除いた集計だけで比べると、判定できた割合が低い系ほど見かけ上の新しさが偏る可能性があります。
GPT-4oは、話題の知られ具合で挙動が変わる
GPT-4oだけを対象に、検索結果の並び順を変える・企業名を入れ替える・「与えた資料だけを根拠にせよ」という制約を加える、という3種類の操作をして、ランキングの答えがどれだけ動くかを比べています。
| 設定 | 並び順を変えた場合の変動 | 企業名を入れ替えた場合の変動 |
|---|---|---|
| 人気企業 | 2.30(制約を加えると1.52) | 2.60 |
| 専門性の高い企業 | 4.15(制約を加えると0.46) | 4.63 |
数字は、並び順や企業名を変える前後で答えの順位がどれだけずれたかの平均です。人気企業では、並び順や企業名を変えてもランキングはあまり動きませんでした。
1件ずつ2社を比べさせる別の判定方法との一致度(Kendallの相関係数という指標。1に近いほど一致)も0.911(通常設定)から1.000(制約設定)と高く、モデルが自分の中に持つ企業どうしの序列を、検索結果とは関係なくそのまま使っていることを示しています。
実際、数百件の質問を集計すると、答えに出てきた企業のうち平均16%は、検索で拾った資料のどこにも登場していませんでした。
トヨタ(見落とし率0.06)やホンダ(0.03)はほぼ資料どおりに引用される一方、キャデラック(0.58)やインフィニティ(0.73)は資料になくても答えに登場する割合が高くなっています。
専門性の高い企業では逆の傾向でした。並び順を変えるとランキングは大きく動き(制約なしの設定で4.15)、「資料だけを根拠にせよ」という制約を加えるとかえって0.46まで安定します。
一致度も0.556(通常設定)にとどまり、判定のたびに順位が入れ替わりやすいことが分かりました。論文は、専門性の高い企業ではモデルが持つ事前知識が乏しいため、検索した資料そのものに強く頼っていると解釈しています。
論文自身が書いている限界
この論文には、著者自身がまとめた独立した「限界(Limitations)」という節はありません。本文中に散らばる自己言及としては、次のような記述があります。
- 並び順・企業名入れ替えの実験は、GPT-4o1機種のみを対象にした「単一モデルのケーススタディ」だと、著者自身が明記しています
- 情報の新しさの比較では、判定できた割合(判定率)が系や分野によって大きく異なるため、この判定率をかけ合わせた指標もあわせて報告する必要があると述べています
- 出典の種類を分類する処理は自動化(GPT-4o判定)が中心で、無作為に抜き出した一部を人手で見直して精度を確かめたと書かれています
加えて、この記事を書くために原文を読んで気づいた点があります。
- 出典の種類の判定はGPT-4oが行っており、比較対象の1つであるGPT-4o自身の判定結果に、この分類方法が有利・不利に働く可能性を排除しきれません
- 統計的な有意差の検定は、ドメインの重なりの実測にのみ用いられています。出典の種類と情報の新しさの実測には、有意差の検定は示されていません(情報の新しさは図中に信頼区間が示されていますが、本文の数値には付いていません)
- 実験に使われた質問・企業名はいずれも英語圏、特に米国市場のブランド(トヨタ、キャデラックなど)が中心です。日本語での検証は報告されていません
- 採否はEDBT/ICDT本会議の研究トラックではなく、併設ワークショップ(DARLI-AP)です。ワークショップは本会議の研究トラックよりも査読が簡略な場合が一般的で、この点は本記事の基本情報の表に明記しました
この論文から、言えること・言えないこと
| 言えること(論文の設定で確認された) | 言えないこと(論文では確認されていない) |
|---|---|
| AI検索が引用するドメインは、Google検索の上位10件とほとんど重ならない | 日本語の質問でも同じ大きさの重なりの少なさになること |
| AI各系は独自メディアと自社サイトを重視し、SNSの引用を減らす傾向がある | この傾向がすべてのAI検索サービスに当てはまること(検証は5系のみ) |
| AI検索が引用する記事は、Google検索より新しい傾向がある | アクセス数や問い合わせ数など、ビジネス上の指標が改善すること |
| GPT-4oは、よく知られた企業では事前知識に頼り、専門性の高い企業では検索結果に頼る | 他のAIサービス(Claudeなど)でも同じ比率の違いが出ること(検証はGPT-4oのみ) |
中小企業の視点で、どう受け取るか
ここからは論文の主張とは別の、私の読み取りです。
- 専門性の高い企業や特定分野の話題ほど、AI各系が引用するドメインは限られたレビューサイトや専門メディアに集中していました。専門分野で戦う中小企業ほど、独立系メディアやレビューサイトに取り上げられているかどうかが、AI検索での見え方を左右しやすいと考えられます
- 比較検討や購入意図の質問では、AI各系は独自メディアや自社サイトを重く見ていました。SNSでの発信だけに頼らず、第三者の記事や自社サイトの情報を整えておくことが、AI検索での引用のされやすさにつながる可能性があります
- 情報の新しさは、AI検索が重視する要素の1つでした。ページを作りっぱなしにせず、価格や仕様など変わりやすい情報を定期的に見直すことは、AI検索でも意味があると考えられます
- 自社がまだ広く知られていない立場であるほど、GPT-4oの実験結果が示すように、AIは検索した資料そのものに強く頼る可能性があります。裏を返せば、自社の情報がその資料の中に含まれていなければ、答えに反映されにくいとも考えられます
よくある質問
Google検索での上位表示は、AI検索での引用に直接つながりますか
この論文の実測では、Google検索の上位10件とAI検索の引用ドメインは、平均4.0%から15.2%しか重なっていませんでした。
Google検索での順位が高くても、それだけでAI検索に引用される保証にはなりません。ただしGoogle検索は、AI検索が使う情報源を集める入り口の1つでもあるため、無関係だとは論文からは言えません。
AI検索の事前知識(pre-training bias)とは何ですか
AI検索の元になる大規模言語モデルは、学習の段階で大量の文章を読み込んでおり、そこで得た知識を答えに反映させます。この論文のGPT-4oを使った実験では、よく知られた企業ほどこの事前知識に頼って答えを作り、検索結果を並び替えても答えがあまり変わらないことが確かめられました。
専門性の高い企業では、事前知識が乏しいため、検索した資料の内容に強く左右されます。
この論文の結果は、日本語のサイト運営にもそのまま当てはまりますか
当てはめられません。実験に使われた質問と企業名はすべて英語圏のもので、日本語での検証は論文に含まれていません。
出典の種類の分類もGPT-4oによる自動判定が中心です。傾向として参考にはなりますが、同じ比率が日本語圏でも再現されるかどうかは、この論文からは分かりません。
まとめ:今日できる1つのこと
自社の主力ページを1つ選び、そのページの情報が「独立系メディアやレビューサイトに取り上げられているか」「価格や仕様など変わりやすい情報が最新か」の2点を確認してください。この論文が示した、AI検索が独自メディアと新しい情報を重く見る傾向に沿った、小さな見直しになります。
この論文は、LLMO論文の一覧の一本です。ほかの論文の解説も、順次公開しています。
この記事に書いたことを、そのまま御社のページに
生成AIに引用されるページを、お話しいただくだけでお作りします。お時間をいただくのは初回15分のヒアリングだけです。まず1ページ、無料でお作りします。
OKが出るまで、何度でも直します。事実が違う、言い回しが硬い、この話は入れないでほしい。どれも遠慮なくおっしゃってください。何度お直ししても、追加の料金はいただきません。
これまでに127社にご利用いただきました。毎月ご依頼いただいている方の6割以上が、月10ページを選ばれています。料金はページに掲載しています。
ページを増やしても問い合わせが来ないなら、原因はページの外にあります。その場合は、下の入口からご相談ください。
自社のマーケティング課題を根本から解決しませんか?
ウェブサイトから要素を引き算し、訪れた人が迷わず次の一歩に進む形へ組み直す。初回60分のオンラインで御社のサイトを一緒に読み、どこから直すべきかをお伝えします。手順をまとめた無料の診断と解説動画もご用意しています。
初回は無料・60分・オンライン完結・その場で契約のお願いはいたしません


