「GoogleのAI Overviews(検索結果の上に出るAIの要約)に載れば、通常の検索でも上位にいるはずだ」。そう考える方は多いのですが、実際に測った研究があります。2026年4月30日に公開された論文「How Generative AI Disrupts Search: An Empirical Study of Google Search, Gemini, and AI Overviews」です。国際会議SIGIR 2026に採択されています。
この記事は、その論文を原文から読み、何を測って、何が分かり、何が分かっていないのかを整理します。数値は論文の本文と表から拾いました。とくに、AI Overviewsが表示される割合が「51.5%」とも「65.6%」とも書かれている理由は、質問の集め方にあります。ここは、平易に解きほぐします。
合同会社謙虚は、3つのドメインを並行して運用し、何を変えると数字が動くかを測り続けています。この論文は、「同じGoogleの中でも、見え方は仕組みごとに別物だ」という前提を、大きなデータで確かめており、測り方を考える材料になります。
結論:3行で言うと
- 通常のGoogle検索、AI Overviews、Geminiが挙げる出典は、URLの重なりを示す指標(ジャッカード係数)が0.11〜0.18で、あまり重なりません。3つとも同じGoogleが作っているのに、です
- AI Overviewsが出る割合は、質問の集め方で17.4%から94.6%まで変わります。「51.5%」は実在の利用者の検索に近い5,000問での値で、「65.6%」は論文が作った11,500問全体での値です
- 同じ質問を繰り返したときの出典の安定度は、通常の検索よりAI Overviewsのほうが低いと報告されています。順位を狙う施策は、結果がぶれやすい、というのが著者の見立てです
この論文の基本情報
| 項目 | 内容 |
|---|---|
| 原題 | How Generative AI Disrupts Search: An Empirical Study of Google Search, Gemini, and AI Overviews |
| 著者 | Riley Grossman、Songjiang Liu、Michael K. Chen、Mike Smith、Cristian Borcea、Yi Chen(ニュージャージー工科大学など) |
| 公開 | 2026年4月30日。arXiv:2604.27790(分野はcs.IR、情報検索) |
| 掲載・採択 | SIGIR 2026(第49回ACM国際情報検索学会議、2026年7月20〜24日、メルボルン)に採択。根拠は、arXivのコメント欄の記載と、論文冒頭のACM書式(DOI: 10.1145/3805712.3809667)です |
| 種類 | 実際のサービスを大量に調べた実証研究(説明を中心とし、原因の特定を目的とはしていません) |
| データ・コード | 質問セットと処理済みデータ、コードをGitHub(rag24/AIO)で公開 |
論文はarXiv(2604.27790)で読めます。SIGIR 2026に採択されたと、arXivのコメント欄に書かれた論文で、GEO(生成AI向けの最適化)の効果を直接検証した研究ではなく、検索結果そのものを比べた研究です。
この論文が答えた問い
生成AIが検索に入り込むと、どのサイトが引用され、どのサイトが引用されなくなるのか。通常の検索と何が違うのか。
背景には、サイト運営者の不安があります。AIの要約で用が足りれば、利用者は元のサイトを開きません。そこで、AIの回答に出典として載ろうとする動きが出てきましたが、通常の検索と何が違うのかは、大きな規模では測られていませんでした。論文は、通常の検索、AI Overviews、Geminiの3つを、同じ質問で並べて比べました。
どうやって調べたのか
論文は、質問を9つの群に分けた11,500問の「基準となる質問セット」を作りました。
| 質問の群 | 件数 | 中身 |
|---|---|---|
| ORCAS | 5,000 | 実在の利用者の検索質問(例:公的な福祉窓口の場所) |
| Amazon Retail | 500 | 実在の商品検索の語句(例:星空プロジェクターの語句) |
| Amazon Retail-Comp | 500 | 上を「AとBを比べて」の形にした質問 |
| Amazon Retail-Q | 500 | 上を「小さな部屋に最適な〜は?」の形にした質問 |
| Debate | 1,000 | 賛否の分かれる質問(例:LGBTの権利を法で守るべきか) |
| ELI5 | 1,000 | Redditの投稿から取った、込み入った説明を求める質問 |
| Localized | 1,000 | 「近くの〜」型の質問を、実在の都市名に置き換えたもの |
| NQ | 1,000 | 「初めての携帯電話の通話はいつか」のような、答えのある質問 |
| NQ Keywords | 1,000 | 上を語句だけの形に書き換えたもの |
これに、時間とともに変わる質問(政治家名の質問、Google トレンドの話題863件)を別に足し、全体で14,212問を扱っています。
データの集め方は次のとおりです。通常の検索とAI Overviewsは、検索結果を取得するサービス(SerpAPI)を通じ、米国ニュージャージー州ニューアークのスマートフォンから検索した想定で集めました。Geminiは、Gemini 2.5 Flashというモデルに、Google検索での裏づけ(グラウンディング)を有効にして質問だけを渡しました。集めたのは2025年12月7〜8日の2日間です。
出典の重なりは、2つの指標で測っています。
- ジャッカード係数:2つのリストで、出典のURLがどれだけ共通しているかを、0(共通なし)から1(同一)で表します。順位は無視します。0.18なら、どちらかが挙げた出典のうち約18%が、両方に出ていた、という意味です
- RBO:順位つきの重なりです。上位の一致を重く見ます
結果
AI Overviewsが出る割合は、質問の集め方で大きく変わる
ここが、数字の食い違いに見える部分です。論文はまず、11,500問全体でAI Overviewsが出た割合を65.6%と述べます。そのうえで、群ごとに大きく違うことを示します。
| 集めた質問 | AI Overviewsが出た割合 |
|---|---|
| 11,500問すべて | 65.6% |
| ORCAS(実在の利用者の検索質問、5,000問) | 51.5% |
| ELI5(込み入った説明の質問) | 94.6% |
| Amazon Retail(商品の語句) | 17.4% |
| Amazon Retail-Comp / Retail-Q(同じ商品の比較・質問の形) | 88.2% / 92% |
| NQ(疑問文)/ NQ Keywords(語句だけ) | 86.2% / 76.5% |
| Localized(近くの〜) | 48.8% |
| 話題の検索(Googleトレンド) | 8.1% |
| 政治家についての質問 | 93.8% |
論文自身が、実在の利用者の検索にいちばん近いのはORCASの51.5%だと位置づけています。11,500問の65.6%は、質問の型(語句型、疑問文、比較など)を変えて作った質問セットの平均で、AI Overviewsが出やすい型も含まれています。集め方が違えば、割合が違うのは自然なことです。
この論文の中でも、同じ商品の話題なのに、語句だけの質問(Amazon Retail)は17.4%、質問の形にした(Retail-Q)は92%と、5倍以上の差があります。疑問文かどうかでも差があり、図2cでは、疑問文の質問はAI Overviewsが約9割、疑問文でない質問は約5割でした。
同じ理由で、別の研究が違う割合を報告していても、それだけでは矛盾とは言えません。質問の集め方、調べた時期、地域、端末が違えば、割合は動きます。この記事では、別の研究の数字(13.7%)の中身までは確認していません。比べるときは、「どんな質問を、いつ、どこで集めたか」を先にそろえる必要があります。
3つの出典は、あまり重ならない
7,439問(通常の検索、AI Overviews、Geminiのすべてが出典を返した質問)で、出典の重なりを測った結果です。
| 比べた組み合わせ | ジャッカード係数 | RBO |
|---|---|---|
| AI Overviews と 通常の検索 | 0.18 | 0.23 |
| Gemini と 通常の検索 | 0.16 | 0.21 |
| AI Overviews と Gemini | 0.11 | 0.15 |
- ジャッカード係数の0.11〜0.18という範囲は、論文の表2の全体平均と一致します。ただし、これは11,500問すべてではなく、3つすべてが出典を返した7,439問での平均です
- 意外なことに、同じ軽量なGeminiで作られているはずのAI OverviewsとGeminiが、いちばん重なっていません
- 返された出典の数は、Geminiが平均9.68件、AI Overviewsが9.24件、通常の検索が8.75件で、ほぼ同じです。重ならない理由は、件数の違いではなく、出典の選び方の違いだと論文は考えています
- 論文は、商品やサービスの質問(Amazon Retail、Localized)で重なりが低いと述べています。ただし表2では、Amazon Retail系が特に低く、Localizedは他の分野との差が小さい組み合わせもあります
どんなサイトが増え、どんなサイトが減ったか
- 通常の検索は、人気の高い上位1,000ドメインから出典の37.8%を取ります。AI Overviewsは1.3ポイント低く、Geminiは9.9ポイント低い値でした
- 1位に出る出典に限ると、上位1,000ドメインの割合は、通常の検索が52.7%、AI Overviewsが40.0%、Geminiが32.6%です
- 通常の検索より、AI OverviewsとGeminiで引用が増えたのは、Google自身のサイト(YouTubeなど)でした
- 政府・教育機関のサイトは、AI OverviewsとGeminiで引用が有意に減りました
- Googleのクローラー「Google-Extended」をrobots.txtでブロックしているサイトは、AI Overviewsでも引用が有意に減りました。Googleの説明では、ブロックしてもAI Overviewsには影響しないはずなので、論文はこれを意外な結果としています
人気の高い順で見ると、通常の検索のほうが人気サイトに寄っています。一方で、人気が1,000〜10,000位のサイト(アクセスは多いが、誰もが知る名前ではない層)で、生成AI側の引用が減る差がもっとも大きく出ています。
結果はぶれやすい
同じ質問を2回、または端末・地域を変えて検索し、出典の重なりを測った結果です(100問の層別標本)。
| 条件 | AI Overviews(RBO) | Gemini(RBO) | 通常の検索(RBO) |
|---|---|---|---|
| 端末も地域も同じで、2回検索 | 0.69 | 0.52 | 0.86 |
| 端末だけ変える | 0.53 | – | 0.79 |
| 質問の表現を少し変える(200問) | 0.49 | 0.50 | 0.74 |
Geminiは端末や地域を見ないため、その欄は空にしてあります。表現の変更は、短縮形にする、国名を略すなど、意味を変えない小さな編集です。AI Overviewsは、同じ質問を2回検索したときの値(0.69)から約29%下がりました。出典が変わると、生成される文章も変わることも、相関(AI Overviewsで0.62、Geminiで0.55)として示されています。
論文自身が書いている限界
- 対象はGoogleのみです。ChatGPT、Perplexity、Bing Copilotなど、ほかのサービスでも同じことが言えるかは、確かめられていません
- データの取得にAPIを使っているため、ログインした利用者ごとの違い(個人化)は調べられていません
- 分析は記述的で、ある1時点(2025年12月)に限られます。原因の特定を目的とした研究ではありません
- Geminiの結果は、Google検索での裏づけつきのAPI経由の値で、一般の利用者が使う画面の結果と同じとは限りません(この点は、著者が書いている限界というより、設計から読み取れる点です)
原文を読んで気づいた点
- 日本語や日本での検証は、原文にありませんでした。端末の所在地は米国(ニューアークとオースティン)で、質問も英語です
- 実験環境と実サービスの差:論文は、SerpAPIで集めたデータが、実際に手動でログインして検索した結果と同じくらい近い(RBOで0.67と0.79)ことを確かめています。ただし、確かめたのは100問です
- 採点は自動です。出典の重なりを式で測っており、引用の中身が正しいかどうかは、大半の分析で見ていません(政治質問の信頼性評価は、外部の格付けを使った部分的なものです)
- 査読:arXivのコメント欄に「SIGIR 2026に採択」と書かれ、ACM書式で掲載情報が付いています。学会に採択された論文と読めます
- 分析の対象7,439問は、11,500問のうち、3つの仕組みすべてが出典を返した質問に絞ったものです。出典を返さなかった質問(AI Overviews 56問、Gemini 121問)は除かれています。論文の表記からの私の読み取りでは、除外の大半は、AI Overviewsそのものが表示されなかった質問です
- 論文の考察には、著者の推測(AI OverviewsがGeminiより不安定なのは、軽量モデルだから、など)が含まれます。検証した結果ではありません
この論文から、言えること・言えないこと
| 言えること(論文の調べた範囲) | 言えないこと |
|---|---|
| Googleの中でも、通常の検索、AI Overviews、Geminiの出典は大きく異なる | 日本語の検索でも同じ数字になる |
| AI Overviewsが出る割合は、質問の型で大きく変わる | 自社のキーワードでAI Overviewsが出る割合 |
| 通常の検索に出るサイトが、AI Overviewsに出るとは限らない | 通常の検索で上位を取れば、AI Overviewsにも出る、またはその逆 |
| AI Overviewsは、同じ質問でも出典がぶれやすい | 特定のページの書き換えが、引用を増やす |
| Google-Extendedをブロックしたサイトは、引用が減っていた | ブロックをやめれば引用が増える(因果は未検証) |
中小企業の視点で、どう受け取るか
ここからは論文の主張とは別の、私の読み取りです。
- 「AI Overviewsの表示率」の数字は、質問の集め方とセットで読む。この論文の中だけでも17.4%から94.6%まで動きます。自社の業種で意味のある数字は、自社のお客様が実際に入力する質問で測ったものだけです
- 通常の検索での順位を、AI Overviewsの見え方の代わりに使わない。出典の重なりは1〜2割です。検索順位を確認する日と、AIの回答を確認する日は、別々に記録しておくほうが安全です
- 同じ質問を、日や端末を変えて何度か確かめる。AI Overviewsは同じ質問でも出典が入れ替わります。1回の結果で、一喜一憂しないほうがよいと言えます
- robots.txtの設定は、目的とあわせて見直す。Google-Extendedをブロックしたサイトは、AI Overviewsでも引用が減っていました。ただし因果は示されていないため、変更するときは、変える前後の数字を自社で記録してからにしてください
複数のAIサービスをまたいだ確認の仕方は、サーベイ論文の解説でも扱っています。
よくある質問
この論文は、GEOに効果がないと言っているのですか
言っていません。論文は、GEOの手法を直接試してはいません。出典の重なりが小さく、AI Overviewsの結果がぶれやすいことから、GEOの効果を保証するのは難しいだろう、という見立てを述べているだけです。一方で、無名の事業者が、第三者のレビューなどを通じて見え方を変えられる余地はある、とも述べています(この点は、別の研究に基づく著者の考察です)。
「51.5%」と「65.6%」、結局どちらが本当の割合ですか
どちらも、その質問セットでの実測値で、優劣はありません。論文は、実在の利用者の検索に近いのはORCASの51.5%だと述べています。65.6%は、疑問文や比較などを多く含む11,500問全体の値です。自社に当てはまる割合は、自社のお客様が入力する質問で測るしかありません。
ほかの論文の「0.11〜0.18」と違う数字を見かけました。どちらを信じればよいですか
この論文の全体平均のジャッカード係数は、3つの組み合わせで0.18、0.16、0.11でした。質問の群ごとに見ると0.06〜0.24と幅があります。ほかの数字と食い違うときは、質問の群と、指標がジャッカード係数かRBOかを確認してください。
まとめ:今日できる1つのこと
お客様が実際に入力しそうな質問を5つ書き出し、通常のGoogle検索と、AI Overviewsが出る場合はその中身を、日を変えて2回ずつ確かめてください。自社が出た、出なかったを、質問ごとに表へ記録します。次の判断の材料になるのは、この論文が示したとおり、1回の結果ではなく、積み重ねた記録です。
この論文は、LLMO論文の一覧の一本です。ほかの論文の解説も、順次公開しています。
この記事に書いたことを、そのまま御社のページに
生成AIに引用されるページを、お話しいただくだけでお作りします。お時間をいただくのは初回15分のヒアリングだけです。まず1ページ、無料でお作りします。
OKが出るまで、何度でも直します。事実が違う、言い回しが硬い、この話は入れないでほしい。どれも遠慮なくおっしゃってください。何度お直ししても、追加の料金はいただきません。
これまでに127社にご利用いただきました。毎月ご依頼いただいている方の6割以上が、月10ページを選ばれています。料金はページに掲載しています。
ページを増やしても問い合わせが来ないなら、原因はページの外にあります。その場合は、下の入口からご相談ください。
自社のマーケティング課題を根本から解決しませんか?
ウェブサイトから要素を引き算し、訪れた人が迷わず次の一歩に進む形へ組み直す。初回60分のオンラインで御社のサイトを一緒に読み、どこから直すべきかをお伝えします。手順をまとめた無料の診断と解説動画もご用意しています。
初回は無料・60分・オンライン完結・その場で契約のお願いはいたしません

