LLMO(GEO)の論文は、2023年11月の最初の1本から2年半で、急に増えました。では、その間に何が確かめられて、何がまだ確かめられていないのでしょうか。この問いに正面から答えたのが、2026年7月に公開されたサーベイ論文「Optimizing Visibility in Generative Engines: A Critical Survey of Generative Engine Optimization (2023-2026)」です。
この記事は、その論文を原文から読み、要点を整理します。前の記事で解説したGEO原論文の「最大40%」という数字に、どんな条件がついていたのかも分かります。数値は、論文が報告している値をそのまま拾いました。
合同会社謙虚は、3つのドメインを並行して運用し、何を変えると数字が動くかを測り続けています。この論文は、その「測り方」を考えるうえでも参考になります。
結論:3行で言うと
- GEOは「順位を上げる1つの作業」ではありません。検索の起動から、取得、回答、引用、クリックまで、段階ごとに別の変数があります
- 原論文の「最大40%」は、すでに5件のページがAIに渡されている実験室での相対的な伸びです。検索で拾われるかどうかや、アクセスが増えるかどうかは示していません
- サーベイが最も頑健な要因として挙げたのは、質問との関連と、AIに渡されるときの位置でした。キーワードの詰め込みは、効果がないか逆効果でした
そして、この論文の調べた範囲では、検索での取得や、クリック・成約に、長期・複数サービスで安定した因果的な効果を示せた手法は見つかっていません。これは「GEOに意味がない」という意味ではありません。まだ確かめる作業が残っている、という指摘です。
この論文の基本情報
| 項目 | 内容 |
|---|---|
| 題名 | Optimizing Visibility in Generative Engines: A Critical Survey of Generative Engine Optimization (2023-2026) |
| 著者 | Olivier Martinez(1人) |
| 公開 | 2026年7月15日。arXiv:2607.14035(分野はcs.IR、情報検索) |
| 種類 | 批判的スコーピングレビュー。医学のような系統的レビューではないと、論文自身が述べています |
| 対象 | 2023年11月16日〜2026年7月14日に公開・採択された研究45本 |
| 探した場所 | arXiv、ACM Digital Library、ACL Anthology、NeurIPS、PMLR、OpenReview |
論文はこちらで読めます。arXiv(2607.14035)。
この論文はarXivのプレプリントで、査読を経たものかどうかは、私が確認した範囲では分かりませんでした。この点は、後の「限界」の章でもう一度触れます。
この論文が答えた問い
GEOの研究は、2年半で何が確かめられ、何が確かめられていないのか。そして、その証拠はどの強さなのか。
論文が最初に指摘するのは、宣伝と証拠のずれです。原論文の「最大40%」は、しばしば「ChatGPTで上位に出られる」という一般的な約束として言い換えられます。しかし実際には、5件のページが最初から渡されている実験装置での、相対的な伸びを述べたものです。逆に、効果がなかったという別の研究が、GEOの否定として紹介されることもあります。しかし、それは別の結果を、別の条件で測ったものです。
主張1:GEOは、7つの段階に分かれている
論文は、生成エンジン(AIが検索結果をまとめて答える仕組み)の動きを、次の段階に分けます。
- 検索を起動するか、それとも自分の知識だけで答えるか
- ページがクロールされ、索引に登録される
- 質問に合うページが取得される
- 取得されたページが並べ替えられ、AIに渡される順番が決まる
- 回答が作られ、引用が付く
- 引用したページの内容が、回答にどれだけ反映されたか。引用した主張が、本当にそのページで裏づけられているか
- 読者がクリックし、問い合わせなどの成果につながる
そして、「見えている」という状態を1つの数字にまとめると、何を重視したのかが見えなくなります。そのため論文は、次の7つの成分に分けて、別々に測るべきだと主張します。
| 成分 | 何を表すか |
|---|---|
| 取得されやすさ | 質問に対して、候補として拾われる確率 |
| 文脈内の露出 | AIに渡される上位の件数に入るか、何番目か |
| 言及・引用 | 回答の中で名前やリンクが出る確率 |
| 目立ち方 | 回答の中での位置、繰り返し、占める割合 |
| 吸収 | 回答の事実・言い回し・構成に、どれだけ効いたか |
| 忠実度 | 引用した主張が、本当にそのページで裏づけられているか |
| 行動・成果 | クリック、流入、コンバージョン、売上 |
この分け方が役に立つのは、ある段階で良くなっても、別の段階で悪くなることがあるからです。論文は、次の式を示しています。
「引用される確率 = 検索が起動する確率 × 取得される確率 × 取得された上で引用される確率」
3つの確率を掛け算するので、どれか1つが低ければ、全体は低くなります。取得された後の引用率が高くても、取得される確率が低ければ、商業的には見えていないのと同じです。
実際に、引用が付かない回答は珍しくありません。論文が紹介するある研究では、ChatGPTの同時再実行のうち57.8%で、引用が1件も付きませんでした。研究は、ChatGPTが特定の質問でしかウェブ検索を使わないためと説明しています(研究が扱った設定での値です)。
主張2:原論文の「40%」の正しい読み方
サーベイは、GEO原論文の結果を、次のように整理しています。
| 原論文が確かめたこと | 原論文が確かめていないこと |
|---|---|
| すでにAIに渡されているページの文章を書き換えると、回答の中でのそのページの取り分が変わる | そのページが検索で拾われるかどうか |
| 「最大40%」は、指標が19.3から27.2になった相対的な伸び(約41%) | 読者のクリックが4割増える、または取得確率が4割上がること |
| キーワードの詰め込みは、従来のSEOのようには効かない | クリック、流入、購入などの成果 |
| 統計や引用など、すぐ取り出せる情報が使われやすい | 足した統計や出典が事実かどうか(強い真実性の制約はなかった) |
サーベイはこの点を、論文の誤りとは呼んでいません。「原論文が残した課題」と呼んでいます。そして、原論文の本当の貢献は、レシピを示したことより、商売上の直感を、実験できる問題に変えたことだと評価しています。その後の研究は、原論文がひとまとめにしていた変数を、少しずつ分解していった歴史として読める、と述べています。
2023年から2026年に、研究はどう動いたか
| 時期 | 中心の問い | 何が変わったか |
|---|---|---|
| 2023〜2024年 | ページを目立たせることはできるか | 順位のリンクから、回答の中の取り分へ。最初の実験 |
| 2024〜2025年 | 順位や推薦は、操作できるか | 取得された文章が攻撃の入口になる |
| 2025年 | 競争があっても、その方法は通用するか | 効かない場合や、みんなが使うと効果が薄れる場合が見つかる |
| 2026年 | 全体の流れを、どう測るか | 段階ごとの最適化、吸収の指標、長期の監査、ルール作り |
何が効いて、何が効かなかったか
サーベイは、白い手法(正当なコンテンツの改善)について、証拠の強さを次のように整理しています。
| 方法 | 証拠の強さ | 注意点 |
|---|---|---|
| 質問への関連性 | 制御した実験で強い | 質問の意図がはっきりしていて、内容を偽っていない場合 |
| AIに渡されるときの位置 | 強い | すでに取得されていることが前提 |
| すぐ取り出せる根拠(数字・定義・比較・出典) | 中〜強 | 真実性と出典が確かで、質問の意図に合う場合 |
| 新しさ・価格・日付 | 中 | 時事的な質問や、購入検討の質問で有用 |
| 文書の構造 | 中。結果がばらつく | 段階ごとに、効き方の向きが違う |
| 文章の滑らかさ・平易化 | 弱〜中 | 分野とサービスに依存する |
| 権威的な文体 | 弱く、不安定 | 自信と根拠は別物 |
| キーワードの詰め込み | 効果なし、または逆効果 | 複数の実験で共通 |
| 書式だけの変更・固定レシピ | 一般化しにくい | 局所的にしか効かないことがある |
根拠として紹介されている、3つの大きな研究
- ほとんどの手法は効かなかった。約1,900問、16,360本の文書、6分野を使った実験(C-SEO Bench)では、gpt-4o-miniで回答を作らせた場合、統計的に有意にプラスだったのは3か所(小売とゲームの商品推薦のみ)でした。質問応答では、どのモデルでも有意なプラスはありません。採用する競合が増えるほど利得が薄れる傾向は、小売とゲームで、最も効いた2手法について確認されています
- 効いたのは、関連性と位置だった。6つのAIモデル、18の要因、25万2,000回の試行を使った実験では、最初の引用を決める主な要因が、質問との関連と位置でした。価格や最近の日付には効果が見られましたが、書式の変更だけでは、6モデルのいずれでも有意な差が見られませんでした。なお、この研究はSIGIR 2026に採択されたもので、サーベイ執筆時点では、開催前でした
- 本文だけを最適化すると、検索段階で落ちる。17万1,003本の文書、2,700問を使ったSAGEO Arenaでは、本文だけを最適化すると、上位20位に入る割合が平均で約9%、再ランク後の上位10位が約16%、最終的な引用が約6%、それぞれ下がりました。再ランクで上位10位から外れると回答AIに渡されないため、引用率の低下には、渡される前に脱落した分が含まれると読めます(数値はいずれも相対値の平均です)
サーベイは、この最後の結果を、見かけの矛盾を解く鍵として扱っています。原論文のような固定条件の実験は、AIに渡された後の「直接の効果」を測ります。SAGEO Arenaは、その前の段階も含めた「合成された効果」を測ります。手法が渡された後の引用確率を上げても、渡される前の確率を下げれば、合計ではマイナスになり得ます。
実際のサービスで、何が起きているか
論文は、ChatGPT、Perplexity、GoogleのAI Overviewsなどの実サービスを調べた監査の結果もまとめています。
サービスごとに、出典はほとんど重ならない
- ある監査では、Bing ChatとPerplexityの回答から355のドメインが見つかり、両方に引用されたのは26%でした
- 米国とドイツで4,706問を調べた研究では、AI Overviewsに出るページの2か月間の重なりは18%でした。通常のGoogle検索は45%です
- 同じ研究で、AI Overviewsが引用したドメインの53%は、通常のGoogle検索の上位10件に入っておらず、27%は上位100件にもありませんでした
- 1万1,500問を調べた別の研究では、通常のGoogle、AI Overviews、Geminiの3つの間で、URLの重なりを示す指標が0.11〜0.18でした
サーベイは、世界共通のGEO順位という考え方は成り立たないと結論づけています。見え方は、サービスと画面ごとに決まります。通常の検索に出るサイトが、AI Overviewsには出ないこともあります。
同じ質問でも、日を変えると結果が変わる
ある研究は、4つのサービスを最長で約45日間追い、日ごとの出典の重なりを示す指標が約0.34〜0.42だったと報告しています。米国とドイツを調べた別の研究では、温度をゼロに固定できるサービスでも、繰り返しで9〜28%の判断が変わりました。「1回検索して確かめた」という結果を、そのまま信じられない理由がここにあります。
この点は、AI検索での自社ブランド表示確認の記事でも扱っています。
AIが引用した文が、本当に裏づけられているとは限らない
- 初期の監査(Bing Chat、NeevaAI、Perplexity、YouChat)では、文のうち完全に裏づけられていたのは51.5%でした。引用が主張を正しく支えていたのは74.5%です
- 2026年の別の研究では、引用元のうち信頼できる情報源の割合が71.4〜86.3%でした
- ある研究は、98,020件の主張のうち約11%が、根拠が不十分だと分類しています
つまり、引用されている状態は、信頼されている状態や、内容が正しく伝わっている状態と同じではありません。論文は、見え方を上げる取り組みは、忠実度と切り離して行ってはいけないと述べています。
名前を知っていることと、見つけて薦めることは別
112社のスタートアップを調べた研究(1本のプレプリント、2つのモデル)では、名前を出して聞いた質問のうち、ChatGPT(gpt-4o-miniのAPI、検索なし)の回答に製品名が含まれたのは99.4%でした(製品名の文字列が出たかだけの判定です)。ところが、名前を出さずにカテゴリで探す質問で製品名が出たのは3.32%でした。Perplexityは、名前を出した質問の94.3%から、カテゴリの質問の8.29%に下がっています。AIが自社を知っていることと、探している人に薦めることは、別の話です。
アクセスや成果への効果は、最も証拠が弱い
クリックや成果まで観察した研究は、ごくわずかです。あるサイトのログを分析した研究では、月ごとの集計で、ChatGPTからの流入が全体で5.7倍になりました。しかし、施策をしていないページ(対照)も同じ期間に3.5倍になっていました。施策をしたページと対照ページの比を時系列で分析すると、施策の時期に1.82倍(95%区間は1.31〜2.54)の段差がありました。しかし、施策前だけの期間で偽の施策日を試す検定ではp=0.16で、論文自身も「示唆的だが決定的ではない」としています。
サーベイは、「GEOの投資対効果に関する主張は、学術的な証拠を明らかに追い越している」と述べています。
「正当な改善」と「操作」の境目
サーベイは、正当な最適化と攻撃的な操作は、数学的には同じ目的を持つと指摘します。違いは、影響を与えるかどうかではなく、書き換えにどんな制約を課すかです。そのために、4つの確認項目を示しています。
| 確認項目 | 問い |
|---|---|
| 意味の保存 | 事実と但し書きは、書き換えた後も正しいか |
| 根拠の真正性 | 統計、口コミ、参照は、確かめられるか |
| 内容と指示の分離 | 読者に伝える文章か。AIへの隠れた命令になっていないか |
| 開示と公平 | 商業的な意図が示されているか。競合を根拠なく貶めていないか |
段落を整理したり、確かめられた一次情報を足したりする改善は、この4つを満たします。AIに向けた隠し文、捏造した口コミ、特定のブランドを薦めさせる指示は、満たしません。流暢に書かれているというだけで、正当な改善とは呼べないと、論文は述べています。
操作の実例として、ある研究は、架空のカメラの推薦率が34.0%から59.4%に上がる攻撃を示しました。一方で、みんなが同じ手法を使うと、個々の利益は薄れていくことも、複数の研究が示しています。
論文が勧める「最も裏づけのある行動」
サーベイが「最も裏づけのある推奨」として挙げているのは、控えめな内容です。
質問に関連していて、網羅的で、確かめられて、構造がはっきりして、技術的に取得できるページを作る。そのうえで、取得、引用、忠実度を、別々に測る。
サーベイは、これがキーワード操作よりも、質の高い情報設計に近いと述べています。また、数字についても、次のように明確に書いています。基準は「数字を足すこと」ではなく、関連していて、確かめられて、日付があり、出典が正しい根拠を示すことです。捏造した統計は再利用を増やしても、情報の質を下げる、という指摘です。
論文が勧める測り方
サーベイは、GEOの効果を測るための最小限の手順も示しています。自社で見え方を確かめる場合の参考になります。
- 何を測るのかを先に決める。取得後の効果か、全体の効果か、実サービスでの観測か、事業の成果か
- 1つの質問を、3〜5通りの言い方で試す
- 同じ質問を、最低でも7〜8回繰り返して始める(ある研究が、ブランドで7回、出典で8回を最低ラインとして示しています。サーベイは、この回数がスイスの質問という小さな範囲に基づく出発点で、普遍的な基準ではないと述べています)
- 日を変えて、複数のサービスで試す
- 何もしないページを基準にし、可能なら同じ長さのダミーの変更も置く
- 検索が起動しなかった回答や、引用のない回答を捨てない。それも結果の一部です
この論文自身の限界
サーベイは、自分の限界も書いています。
- 系統的レビューではなく、範囲を整理するレビューです。効果の大きさを平均する作業はしていません
- 調べた研究には、プレプリントが含まれます。とくに有力な測定研究の一部は査読を経ておらず、論文はそれらの証拠を、査読済みのものと同じ重みでは扱っていないと述べています
- 多くの研究が、英語で、匿名のアカウントを使い、少数の地域で行われている、と論文は述べています
- データベースごとの検索件数と、除外した論文の完全な記録は、保存されていません
- 製品の変化が速く、論文が調べた時点のサービスと、いま読者が使うサービスがずれている可能性があります
- 「効果がない」という主張は、調べた範囲の中に限られます
加えて、この記事を書くために原文を読んで気づいた点があります。
- 著者は1人で、この論文自体がarXivのプレプリントです。査読を経たかどうかは、確認できませんでした
- 45本の元論文のうち、私が原文を確認したのは、これまでにGEO原論文だけです。この記事の数値は、サーベイが報告している値として書いています
- 日本や日本語への言及は、原文にありませんでした
この論文から、言えること・言えないこと
| 言えること(サーベイが整理した範囲) | 言えないこと |
|---|---|
| すでにAIに渡されたページの内容は、回答を変え得る | 書き換えれば、検索で拾われるようになる |
| 質問との関連と位置が、最も再現された要素だった | 日本語のページでも同じ強さで効く |
| キーワードの詰め込みは、効果がないか逆効果だった | 1つの手法が、どのサービスでも長期に効く |
| 見え方は、サービス・質問の言い方・日によって変わる | 自社のページが、いまどう見えているかの正確な数字 |
| 引用されても、内容が正しく裏づけられているとは限らない | LLMO対策が、問い合わせや売上を増やす |
中小企業の視点で、どう受け取るか
論文の結論を、実務に当てはめて整理します。ここからは論文の主張とは別の、私の読み取りです。
- 1回の検索結果で、成果を判断しない。同じ質問でも、言い方・日・サービスで結果が変わります
- ページが取得できる状態かを先に確かめる。渡される前の段階で外れていれば、どんなに文章を整えても、回答には影響しません
- 数字や出典は、確かめられるものだけを足す。実験で効いたのは、書き換えでしたが、実務で効くのは「本当に確かめられる根拠」です
- 「LLMOで売上が上がる」という説明を、そのまま信じない。この論文の調べた範囲では、そこまでの証拠は見つかっていません
自社での確認の仕方は、GEO対策の効果測定の記事にまとめています。
よくある質問
この論文は、GEOに意味がないと言っているのですか
言っていません。論文は結論で、この限界はGEOを無効にするものではなく、GEOを宣伝の言葉ではなく積み上げられる学問にするために残っている作業を定めるものだ、と述べています。取得後の内容が回答を変え得ることは、強い証拠があります。
結局、何をすればよいのですか
論文の推奨は、質問に関連していて、網羅的で、確かめられて、構造がはっきりして、取得できるページを作ることです。そのうえで、取得・引用・忠実度を別々に測ります。
「最大40%」は、まだ使ってよい数字ですか
使うなら、条件をつけてください。「すでに5件のページがAIに渡された実験で、あるページの取り分の指標が約41%上がった」というのが、正確な言い方です。
まとめ:今日できる1つのこと
自社のいちばん大事なページについて、質問を3通りの言い方で作ってください。それを、日を変えて、2つ以上のAIサービスで試し、自社のページが出たか、出なかったかを表に記録します。次の判断の材料になるのは、1回の結果より、積み重ねた記録です。
次の記事では、この記事の中でも触れられていた、引用の「吸収」や、第三者メディアが優遇される研究など、個別の論文を読んでいきます。
この記事に書いたことを、そのまま御社のページに
生成AIに引用されるページを、お話しいただくだけでお作りします。お時間をいただくのは初回15分のヒアリングだけです。まず1ページ、無料でお作りします。
OKが出るまで、何度でも直します。事実が違う、言い回しが硬い、この話は入れないでほしい。どれも遠慮なくおっしゃってください。何度お直ししても、追加の料金はいただきません。
これまでに127社にご利用いただきました。毎月ご依頼いただいている方の6割以上が、月10ページを選ばれています。料金はページに掲載しています。
ページを増やしても問い合わせが来ないなら、原因はページの外にあります。その場合は、下の入口からご相談ください。
自社のマーケティング課題を根本から解決しませんか?
ウェブサイトから要素を引き算し、訪れた人が迷わず次の一歩に進む形へ組み直す。初回60分のオンラインで御社のサイトを一緒に読み、どこから直すべきかをお伝えします。手順をまとめた無料の診断と解説動画もご用意しています。
初回は無料・60分・オンライン完結・その場で契約のお願いはいたしません

