「統計を足す」「引用を足す」といった書き換えでAIの回答に出やすくなる。この説明の裏には、1つの前提があります。
それは「自分のページだけを書き換える」という前提です。実際には、同業他社も同じ情報を読んで、同じように書き換えています。
今回取り上げる論文は、この「競合も書き換えている」状況を正面から扱った研究です。
この記事は、米国の大手金融企業(以下、著者の所属企業)のAI研究チームが2026年8月に公開した論文を原文から読み、何を測って、何が分かり、何がまだ分かっていないのかを整理します。数値はすべて論文の表と本文から拾い、論文が明示していない計算には「概算」と書きます。
合同会社謙虚は、3つのドメインを並行して運用し、何を変えると数字が動くかを測り続けています。この論文を読む理由は、「効く書き換え」が競合の動き次第で変わっていく前提を、先に押さえておくためです。
結論:3行で言うと
- 1つの書き換え戦略だけで最適化しても、競合が同じことをすると効果は目減りするという前提に立ち、競合の書き換え状況を見て戦略の組み合わせを選ぶ手法を提案した論文です
- 提案手法は、既存の代表的な手法(AutoGEO、AgenticGEO)をすべての比較条件で上回りました。特に、多くの競合が最適化を進めた状況ほど、その差は広がりました
- 目立ち方を上げた代わりに、元の文章への忠実さを測る指標では最も低い評価になりました。この論文自身も、目立ち方と忠実さはトレードオフの関係にあると述べています
この結果は、実験用に組んだ環境で得られたものです。日本語のページや実際のChatGPT・Perplexityでの再現は確認されていません。
詳しくは後の章で扱います。
この論文の基本情報
| 項目 | 内容 |
|---|---|
| 題名(原題) | Beyond the Vacuum: Combinatorial Strategy Selection for Competitor-Aware Generative Engine Optimization |
| 著者 | Vaibhav Sourirajan、Yao Zhang、Himanshu Kumar、Sahil Wadhwa、Mann Patel、Amirfarrokh Iranitalab(6名。全員が著者の所属企業のAI研究チームの所属) |
| 公開日 | 2026年8月27日(arXiv、v1) |
| arXiv番号 | 2608.27631(分野区分:cs.IR、情報検索) |
| 掲載/採択状況 | 本文・PDFの書式に、学会や論文誌への掲載・採択を示す記載は見当たりません。確認できた範囲では、査読前のarXivプレプリントです |
| 種類 | 企業(米国の大手金融企業)の研究チームによる論文。大学等の学術機関の所属者は含まれません |
| 実験データ/コードの公開先 | 使用した既存データセット(geo-bench、Researchy-GEO、E-Commerce)は公開されMITライセンスと記載。ただし、この論文が新たに作った競合ありの評価データ(geo-benchcomp)と、学習済みの選択モデル自体の公開先は、本文中に記載が見当たりません |
論文はarXiv(2608.27631)で読めます。
この論文が答えた問い
自分のページだけでなく、競合のページも同じように書き換えられていく状況で、どの書き換え戦略の組み合わせを選べば、AIの回答の中で自分のページが目立ち続けられるのか。
従来のGEO(Generative Engine Optimization、生成エンジン最適化)研究は、対象のページを単独で書き換える前提で戦略を探してきました。
しかし、この論文は「複数のページが同じ戦略を使えば、全体としての伸びしろは減っていく」という先行研究の指摘を引用し、GEOを競合込みの相対的な問題として捉え直しています。
ある文書の最適な書き換え方は、周りの競合がどれだけ最適化を進めているかによって変わる、という考え方です。
どうやって調べたのか
論文は、質問(クエリ)1件につき文書が複数ある状況を想定します。そのうちの1つを「対象文書」とし、残りを「競合文書」として扱います。
競合のうち何割が既に書き換え済みかを表す数値を「採用率」と呼び、0から1に近い範囲で変化させます。
| 項目 | 内容 |
|---|---|
| 土台のデータ | 先行研究「geo-bench」の学習用データ(質問7,998件、各質問に文書5件) |
| 競合ありデータの作成 | 採用率0・0.2・0.4・0.6・0.8の5段階で、対象以外の文書の一部を3種類の方法のいずれかで書き換え、「geo-benchcomp」という評価用データを新たに構成 |
| 評価用データの規模 | 学習用39,990件、テスト用5,000件(テスト用の元は1,000件×5段階) |
| 書き換え戦略の数 | 15種類の二択(使う/使わない)の組み合わせで、合計32,768通り |
| 目立ち方の測り方 | PAWC(Position-Adjusted Word Count)。回答の中でそのページが根拠にされた語数を、文の位置で重みづけした値。文頭に近いほど重く数える |
15種類の戦略には、先行研究の「引用を足す」「統計を足す」「出典を示す」「専門用語を足す」「キーワードを詰め込む」などに加えて、この論文が新たに定義した5種類(事実の補強、構成の整理、両論併記、簡潔化、賛否の整理)が含まれます。
32,768通りをすべて試すのは現実的ではないため、少ない試行回数で良い組み合わせを絞り込む数理的な探索手法(BOCS)を使い、1つの質問あたり最大50回の書き換え・評価を行います。
その結果から、良かった組み合わせと惜しくも劣った組み合わせのペアを抽出し、その理由づけ文章をお手本のAIモデルに作らせ、選択役のAIモデル(パラメータ数の少ない軽量モデル)に学習させます。
この選択役は、質問と文書一式だけを見て戦略の組み合わせを提案します。採用率の数値そのものは、学習時にも評価時にも与えられません。
結果
競合がいない前提の元データでは、AutoGEOやAgenticGEOを上回った
下の表は、書き換え評価に使ったAIをgpt-oss-120bとした場合のPAWCの値です。既存手法のうちAutoGEOとAgenticGEOは、いずれもこの論文以前に提案された自動化手法です。
| 方法 | 元データでのPAWC | 競合ありデータでのPAWC |
|---|---|---|
| 書き換えなし | 20.03 | 17.99 |
| AutoGEO | 27.16 | 24.75 |
| AgenticGEO | 27.95 | 25.20 |
| 提案手法(Competitor-Aware GEO) | 32.62 | 29.93 |
元データでは、提案手法がAgenticGEOを4.67ポイント上回りました。論文は、この32.62という値が、同じ質問1件ごとに個別に探索を尽くした理論上の上限値(39.00)の84%に達すると述べています。
もう一方の評価用AI(Llama-3.3-70B-Instruct)でも、提案手法が最も高い値(29.55)でした。
競合が最適化を進めるほど、提案手法との差が広がった
競合ありデータ(採用率0から0.8までの平均)では、提案手法はAgenticGEOを18%超上回りました。論文は、AgenticGEOとの差が元データと競合ありデータの間で2.1ポイント広がったとし、競合の最適化が進むほど、競合を見て戦略を選ぶ方式の価値が上がると解釈しています。
採用率を0から0.8まで動かした実験でも、同じ傾向が出ています。単独の戦略だけを使う方法は、採用率が上がるにつれてPAWCが下がり続け、採用率0.8では書き換えなしの状態を下回りました。
提案手法も採用率が上がるとPAWCは下がりますが、下がり方が最も緩やかで、0から0.8の間で11.4%の低下にとどまりました。
採用率0から0.2の間では、統計的に意味のある低下は見られなかったとしています。
目立ち方は上がったが、忠実さの評価は下がった
論文は、AIによる採点で、元の文書への忠実さ(Faithfulness)や、主張が出典に基づいているか(Attribution Accuracy)も調べています。
| 方法 | 忠実さ(10点満点) | 出典への基づき方(10点満点) | 要点の網羅度(10点満点) |
|---|---|---|---|
| 書き換えなし | 8.29 | 6.15 | 6.60 |
| AutoGEO | 6.58 | 5.52 | 7.47 |
| AgenticGEO | 6.71 | 5.15 | 7.15 |
| 提案手法 | 4.90 | 4.18 | 7.48 |
提案手法は、要点の網羅度で最も高い値を取った一方、忠実さと出典への基づき方は、比較した手法の中で最も低い値でした。論文は、これを生成的な書き換え全般に伴う想定内のトレードオフと説明しています。
ただし、この2つの指標は「原文からどれだけ変わったか」を測るもので、事実として正しいかどうかを直接判定するものではないため、幻覚(事実でない内容の混入)と、根拠のある内容の追加を区別できないという限界も、論文自身が認めています。
未知のデータでも、既存手法より高い値になった
この論文が学習に使っていない、別の分野の2つのデータ(通販サイトの商品ページ、調べ物系の質問集)でも試しています。いずれも提案手法が最も高い値となり、その分野で最も強かった既存手法を8%超上回りました。
論文自身が書いている限界
- 評価に使った「生成エンジン」は、AIモデル(gpt-oss-120bとLlama-3.3-70B-Instruct)に文書を直接渡して答えを作らせたものです。実際の本番システムの挙動を完全に映しているとは限らないと、論文自身が断っています
- 競合の書き換え状況は、実際の採用データではなく、論文が作った人工的な分布に基づきます
- 15種類の戦略は、先行研究で確認された戦略を広く含みますが、網羅的ではありません
- 検索や再ランキングの工程は評価に含まれておらず、あくまで文書一式が既に手元にある状態からの評価です
- 提案手法は、評価時に競合文書一式を丸ごと見られるという情報面での有利さを持ちます。論文は、これは実際の検索結果ページを見れば誰でも確認できる情報だと説明しています
加えて、原文を読んで気づいた点があります。
- 日本語での検証は報告されていません。土台になったgeo-benchは英語圏のデータセットが元になっています
- 評価はすべて自動採点です。PAWCなどの指標は機械的な計算、忠実さなどの指標もAI(gpt-oss-120b)による採点で、人手による評価は見当たりません
- 実際のサービスでの検証がありません。先行研究のGEO原論文はPerplexityという実サービスでも試していましたが、この論文はAIモデルを使った実験用の環境のみで評価しています
- この論文は査読を経た学会・論文誌への掲載を確認できておらず、企業の研究チームによる自社報告という性質を持ちます
- 書き換えと学習データの生成、そして忠実さの採点までを、同じAIモデル(gpt-oss-120b)が担っています。評価する側とされる側が同じ系統のモデルである点は、論文では特に議論されていません
この論文から、言えること・言えないこと
| 言えること(論文の設定で確認された) | 言えないこと(論文では確認されていない) |
|---|---|
| 競合を見て戦略を選ぶ方式は、単独の戦略より目立ち方の指標で高い値になった | 日本語のページや実際のChatGPT・Perplexityで同じ結果になること |
| 競合の最適化が進むほど、単独戦略の効果は目減りした | 採用率が今どのくらい高いのか、実際の検索結果で測れること |
| 提案手法は未知の分野のデータでも高い値を保った | この方式を今すぐ自社で再現できること(学習の仕組みが必要) |
| 目立ち方を上げた分、忠実さの評価は下がった | 足した内容が事実として正しいかどうか |
中小企業の視点で、どう受け取るか
ここからは論文の主張とは別の、私の読み取りです。
- 「今効いている書き換え方」は、同業他社が同じ方法を真似た瞬間から効果が薄れていく可能性があります。1つの必勝パターンに頼るより、競合の記事がどう変わっているかを定期的に見る姿勢が有効だと考えます
- この論文の仕組みそのものは、探索用のAIモデルと学習の工程を必要とする研究段階の手法です。中小企業がそのまま導入できるものではなく、「競合の状況込みで戦略を見直す」という考え方だけを持ち帰るのが現実的です
- 目立ち方の指標を追うほど、元の文章から離れやすくなるという結果は、注意すべき点です。特に、金融や健康など正確さが問われる分野では、目立ち方より先に事実確認を優先すべきだと考えます
- 全員が最適化に走る状況は、選好操作攻撃の解説記事でも触れた「全員が攻撃すると、全体の推薦が減る」という囚人のジレンマの構図に近く、1社だけ抜け駆けしても長続きしにくい可能性があります
よくある質問
「Competitor-Aware GEO(競合を考慮したGEO)」は、競合のページを書き換える手法ですか
いいえ。書き換えるのは自社の対象ページだけです。
競合ページの状況を判断材料として見た上で、自社ページにどの戦略を組み合わせるかを選ぶ手法です。
「採用率(adoption rate)」が上がると、なぜ戦略の効果が落ちるのですか
同じ書き換え方を多くのページが採用すると、AIの回答の中で複数のページが似た強みを主張することになり、相対的な差がつきにくくなるためです。論文は、この現象を先行研究の指摘を引用しながら示しています。
目立ち方を上げるために、忠実さを犠牲にしてよいのですか
論文自身が推奨していません。倫理に関する記述の中で、根拠のない引用や検証できない数字を書き換えのプロンプトで明示的に禁じており、忠実さを制約に加えることを今後の課題として挙げています。
選好操作攻撃を扱った別の論文の解説記事でも近い懸念を扱っています。
まとめ:今日できる1つのこと
自社の主力記事と、検索結果で並んでいる競合記事を1本ずつ開き、同じ言い回しや同じ構成が増えていないかを比べてください。増えていれば、それは市場全体が同じ書き換え方に寄っている合図です。
そのときは、他社がまだ手をつけていない切り口を探すほうが、指標上の伸びしろは残っています。
この論文は、LLMO論文の一覧の一本です。ほかの論文の解説も、順次公開しています。
この記事に書いたことを、そのまま御社のページに
生成AIに引用されるページを、お話しいただくだけでお作りします。お時間をいただくのは初回15分のヒアリングだけです。まず1ページ、無料でお作りします。
OKが出るまで、何度でも直します。事実が違う、言い回しが硬い、この話は入れないでほしい。どれも遠慮なくおっしゃってください。何度お直ししても、追加の料金はいただきません。
これまでに127社にご利用いただきました。毎月ご依頼いただいている方の6割以上が、月10ページを選ばれています。料金はページに掲載しています。
ページを増やしても問い合わせが来ないなら、原因はページの外にあります。その場合は、下の入口からご相談ください。
自社のマーケティング課題を根本から解決しませんか?
ウェブサイトから要素を引き算し、訪れた人が迷わず次の一歩に進む形へ組み直す。初回60分のオンラインで御社のサイトを一緒に読み、どこから直すべきかをお伝えします。手順をまとめた無料の診断と解説動画もご用意しています。
初回は無料・60分・オンライン完結・その場で契約のお願いはいたしません


