生成AIが検索結果をまとめて答える「生成エンジン」向けに、自社のページを最適化する取り組みは、GEO(Generative Engine Optimization、生成エンジン最適化)と呼ばれます。2026年3月に公開された論文「AgenticGEO: A Self-Evolving Agentic System for Generative Engine Optimization」は、決まった書き換えルールをそのまま使う代わりに、書き換えの戦略と、その戦略を評価する仕組みの両方を、AIエージェントが生成エンジンとのやり取りを重ねながら育てていく方法を提案しています。
この記事では、論文の原文を読み、AgenticGEOが戦略をどう評価し、どう進化させているのかという具体的な流れと、実験で使われたデータ・比較手法・結果の数値を、原文に沿って整理します。
同じ「書き換え手法」の系統に位置するAutoGEO・AgentGEO・MAGEOとの違いにも触れます。なお、名前がよく似ているAgentGEO(arXiv:2603.09296、引用されない原因を診断して直す論文)と、本記事で扱うAgenticGEO(arXiv:2603.20213)は、別の研究チームによる別の論文です。
混同しないようご注意ください。
合同会社謙虚は、3つのドメインを並行して運用し、何を変えると数字が動くかを測り続けています。この論文が示す「戦略ごと自動で育てる」という発想は、記事づくりの型そのものを、どう検証し更新していくかを考えるうえでも参考になります。
結論:3行で言うと
- AgenticGEOは、決まった書き換えルールに頼らず、戦略の集まりと、それを評価するAI(批評役)を、生成エンジンとのやり取りを重ねながら一緒に育てていく仕組みです
- 2つの生成エンジン・3つのデータセットを使った実験で、比較対象の14手法すべてを上回り、論文が計算した平均46.4%の性能向上を報告しています
- 批評役に生成エンジンの評価を肩代わりさせることで、問い合わせを41.2%に減らしても、性能の98.1%を保てたとしています
ただし、実験で使われた「生成エンジン」は、実際のGoogleのAI OverviewsやChatGPT、Perplexityではなく、研究チームが手元で動かせる公開モデルです。この点は、後の「論文自身が書いている限界」で詳しく触れます。
この論文の基本情報
| 項目 | 内容 |
|---|---|
| 題名 | AgenticGEO: A Self-Evolving Agentic System for Generative Engine Optimization |
| 著者 | Jiaqi Yuan、Jialu Wang、Zihan Wang、Qingyun Sun、Ruijie Wang(責任著者)、Jianxin Li。北京航空航天大学の研究チーム(Jialu Wangのみ、米国在住の独立した研究者と記載) |
| 公開 | 2026年3月2日。arXiv:2603.20213(分野はcs.AI) |
| 掲載・採択状況 | arXivのプレプリント。ACM形式の会議用ひな形で書かれていますが、会議名の欄は「Conference acronym ‘XX」のまま埋まっておらず、本記事の確認時点で、掲載先や査読の状況は分かりませんでした |
| 種類 | 提案手法の論文(実験による検証つき) |
| 実験データ・コードの公開先 | コードと学習済みモデルをGitHubで公開しています |
論文はこちらで読めます。arXiv(2603.20213)。
この論文が答えた問い
生成エンジン向けの文章の書き換え方は、内容ごと、生成エンジンごとに効くものが違うのに、なぜ多くの手法は1つの固定ルールしか使わないのか。
論文はまず、9通りの書き換え戦略を同じ文章に順番に試す予備実験を行っています(付録A.1.1)。その結果、ある文章では複数の戦略が同じように効く一方、別の文章ではごく一部の戦略しか効かず、さらに別の文章では、どの戦略を使っても効果がほとんど出ませんでした。
9つの戦略のうち約半分は、実験対象の事例を十分に改善できていなかったとも述べています。この結果から論文は、内容によって効く戦略が違うという前提に立ち、内容ごとに戦略を選び分け、戦略の集まり自体も育てていく仕組みが必要だと主張します。
どうやって調べたのか
AgenticGEOは、次の3段階で動きます。
- 事前準備(オフラインでの評価役の調整)。9つの初期戦略を同じ文章・質問の組み合わせに順番に適用し、生成エンジンの実際のスコアを教師データとして、評価役(論文では「批評役」)を学習させます。批評役は、文章と質問、特定の戦略の組み合わせを見て、その戦略を使うとスコアがどれくらい上がりそうかを予測する役です
- 本番のやり取りを重ねた育成(オンラインでの共進化)。戦略の集まり(アーカイブ)から親となる戦略を選び、進化役(これもAI)が変異や組み合わせで新しい候補戦略を作ります。候補すべてを生成エンジンで試すと費用がかさむため、まず批評役が全候補を採点し、上位の候補と、ランダムに選んだ一部の候補だけを実際に生成エンジンでテストします。テストした本物のスコアと、テストしなかった候補への批評役の予測スコアを合わせて、戦略の集まりを更新します。新しい戦略は、同じ系統の中で今までより高いスコアを出すか、他のどの戦略とも違う新しいタイプであるかのどちらかを満たして初めて、集まりに加わります。ここで得られたデータを使い、進化役と批評役の両方を、繰り返しのたびに学習し直します
- 実際の書き換え(推論時の多段階の計画)。育った戦略の集まりと批評役を使い、1つの文章に対して最大3段階まで書き換えを繰り返します。各段階で批評役が「まだ使っていない戦略の中で、次に一番効きそうなもの」を選び、その戦略で文章を書き換え、効果の伸びが止まった時点で終了します
進化役の学習には、通常の強化学習ではなく、「同じ親から生まれた候補同士」を比べる方法を使っています。候補群の中で相対的にどれだけ良かったかを見ることで、生成エンジンのスコアのばらつきに振り回されにくくしていると論文は説明しています。
また、この仕組み全体について、繰り返し回数が増えるほど平均的な性能の差が理論的には縮んでいくという数学的な分析も付録に載せていますが、論文自身がこの分析を略式(正式な証明の要点をまとめたもの)と断っています。
実験の設定は、次のとおりです。
| 用途 | データセット | 内容 |
|---|---|---|
| 学習・同一分野での評価 | GEO-Bench | GEO原論文が作成。Google検索結果に基づく、幅広い分野の長文記事 |
| 未知分野への転移(1) | MS MARCO | Bingの検索ログに基づく、短い文章の受け答え |
| 未知分野への転移(2) | 独自のEコマース版 | Amazonの商品検索データがもとになっています |
比較対象はあわせて14手法です。書き換えをしない場合、キーワードの詰め込みなど9通りの固定ルール、AutoGEO(AIに生成エンジンの好みを説明させ、ルール化する手法)、そしてAutoGEOと同じ3種類の固定ルールをそれぞれ個別に学習し直した手法(3通り)です。
生成エンジンにはQwen2.5-32B-InstructとLlama-3.3-70B-Instructを使い、AgenticGEO側の批評役にはQwen2.5-1.5B、進化役にはQwen2.5-7B-Instruct、書き換え役にはQwen2.5-32B-Instructを使っています。
指標は、引用された文章がどれだけの分量を占めたか(word)、引用の並び順を考慮した重み(pos)、その組み合わせ(overall)の3つで、いずれもGEO原論文が定義したものです。
結果
まず、学習に使った分野と同じGEO-Benchでの結果です。overallスコアが高いほど、生成エンジンの回答の中でその文章が目立ったことを意味します。
| 手法 | Qwen2.5-32B-Instructのoverall | Llama-3.3-70B-Instructのoverall |
|---|---|---|
| 書き換えなし | 20.21 | 19.20 |
| 最も良かった固定ルール(引用文を加える) | 23.76 | 21.57 |
| 学習型の比較手法(AutoGEO) | 23.71 | 22.78 |
| AgenticGEO | 25.48 | 24.52 |
Qwenでは、固定ルールの「引用文を加える」がAutoGEOをわずかに上回りましたが、Llamaでは順位が入れ替わり、AutoGEOが単独で上回りました。
生成エンジンが変わると、どの固定ルールが効くかも変わるという、論文の指摘どおりの結果です。そのうえで、AgenticGEOはどちらの生成エンジンでも最も高いスコアを記録しています。
次に、学習に使っていない2つのデータセットに、そのまま適用した結果です。
| データセット・生成エンジン | 書き換えなし | 最も強かった比較手法 | AgenticGEO | 書き換えなしからの伸び(論文報告) |
|---|---|---|---|---|
| MS MARCO・Qwen2.5-32B-Instruct | 20.05 | AutoGEO(30.67) | 34.10 | 70.07% |
| MS MARCO・Llama-3.3-70B-Instruct | 19.67 | AutoGEO(30.04) | 33.50 | 70.31% |
| Eコマース版・Qwen2.5-32B-Instruct | 18.01 | 引用文を加える手法を学習させたもの(21.83) | 26.58 | 47.58% |
| Eコマース版・Llama-3.3-70B-Instruct | 19.68 | 引用文を加える手法を学習させたもの(21.70) | 26.88 | 36.59% |
本文中で論文は、MS MARCOでの伸びを「AutoGEOに対して11%を超える」と述べています。表の数値から計算すると、Qwenで約11.2%、Llamaで約11.5%です(この2つの割合は原文に書かれた文章ではなく、表の数値をもとに私が計算した概算です)。
Eコマース版でも、最も強かった比較手法に対して、Qwenで約22%、Llamaで約23.9%の伸びになります(同じく概算です)。
学習していない分野でも、比較手法との差はむしろ広がっています。
そのほか、論文が報告している主な点は次のとおりです。
- 批評役・戦略の集まり・多様性を保つ仕組みなど4つの要素をそれぞれ外す比較実験では、戦略の集まり(アーカイブ)を外したときの性能低下が最も大きく、戦略の多様性が伸びの主な源だと論文は述べています
- 書き換えの段階数を変える実験では、3段階でoverallスコアが25.48とピークになり、4・5段階に増やしても伸びはわずかでした。戦略の集まりの大きさは25〜35個が適正で、35個でピークになるとしていますが、ピークの具体的な点数は図から正確に読み取れず、本記事では文章の説明にとどめました
- 批評役の予測精度を示す指標(NDCG@5)は、学習に使ったGEO-Benchで94.98%、未知のMS MARCOで82.82%、独自のEコマース版で78.46%でした。未知の分野でも上位の予測はある程度保たれています
- 生成エンジンへの本物の問い合わせを減らす実験では、1,700回に対して700回(約41.2%)まで減らしても、overallスコアは25.12を保ち、フル回数での最良値25.60の98.1%を維持できたとしています
- 書き換え前後の意味の近さ(BERTScoreという指標で計測)は、AgenticGEOが高い性能と比較的高い意味の近さを両立していたのに対し、AutoGEOは性能は高いものの意味の近さがはっきり低く、書き換えによる内容のずれが大きい可能性があると論文は指摘しています
論文自身が書いている限界
この論文は、独立した「限界」の見出しを設けず、実験設定や理論の説明の中に、範囲を区切る記述を残す形になっています。
- 実験で使われた「生成エンジン」は、Qwen2.5-32B-InstructとLlama-3.3-70B-Instructという、研究チームが自分で動かせる公開モデルです。論文の実験設定の節に、これらを下流の生成エンジンとして使うと明記されています
- 累積後悔に関する分析は、論文自身が略式と断っており、厳密な証明や条件の詳細は付録に譲られています。本文の説明は、証明の骨格を示したものです
- 結論の章で論文は、この設計が創作者と生成エンジンの双方に利益のある持続可能な方向性を示すと述べています(この記述自体を直接検証する実験は無い、と私は読んでいます)
加えて、この記事を書くために原文を読んで気づいた点があります。
- 実際のChatGPTやPerplexity、GoogleのAI Overviewsを使った検証は、今回の論文の範囲外です。論文の冒頭ではこれらのサービスを名指しして問題意識を説明していますが、実験そのものは、研究チームが用意した模擬的な生成エンジン(公開モデルに検索結果らしき文書を渡して回答を作らせる仕組み)を対象にしています
- この手法を動かすには、批評役・進化役・書き換え役という3つのAIモデルを用意し、批評役と進化役は追加学習(ファインチューニング)まで行う必要があります。実装はGPU4台を使ったとあり、プロンプトを書き換えるだけの手法より計算資源と手間が大きくなります
- 会議名の欄が埋まっていないひな形で書かれており、arXivの投稿ページにも掲載先や査読の状況を示す注記は見当たりませんでした。この論文が査読を経ているかどうかは、私が確認した範囲では分かりませんでした
- 実験に使われた3つのデータセット(GEO-Bench、MS MARCO、独自のEコマース版)は、いずれも英語の文章です。日本語での検証や日本語への言及は、原文にありませんでした
- 比較対象の14手法のうち、AutoGEO以外の学習型手法は、AgenticGEOと同じ論文の著者自身が、比較のために独自に用意したものです
この論文から、言えること・言えないこと
| 言えること(論文が示した範囲) | 言えないこと |
|---|---|
| GEO-Bench・MS MARCO・独自のEコマース版という3つのデータセットで、比較した14手法の中で最も高いoverallスコアを記録した | 実際のChatGPTやPerplexity、GoogleのAI Overviewsでも同じ水準の効果が出る |
| 書き換え前後の意味の近さを、BERTScoreの計測範囲内でおおむね保ちながら性能を上げた | どんな内容の書き換えでも、事実を壊さず改善できる |
| 戦略の集まりを豊かに保つことが、性能向上の主な要因だった(要素を外す比較実験の結果) | 日本語のページでも同じように機能する |
| 批評役を使うことで、生成エンジンへの問い合わせを4割程度に減らしても性能をほぼ維持できた | 追加学習や計算資源をかけずに同じ効果が得られる |
中小企業の視点で、どう受け取るか
ここからは論文の主張とは別の、私の読み取りです。
- この論文が示した「戦略ごと自動で育てる」という発想そのものは、AIモデルの追加学習を行わなくても、考え方だけは借りられます。複数の書き換えパターンを試し、どれが自社のページでよく効くかを記録し続ける運用に置き換えられます
- 「1つの固定ルールが、いつでもどの生成エンジンにも効くわけではない」という論文の指摘は、実務にもそのまま当てはまります。ある生成エンジンで良かった書き方が、別のサービスでも同じように良いとは限りません
- この手法をそのまま自社で動かすには、AIモデルの追加学習や、生成エンジンへの繰り返しの問い合わせといった、相応の技術と費用が必要です。中小企業が今日から取り入れられる範囲は、仕組みそのものより「内容によって効く書き方は違う」という前提の方だと考えています
- 書き換えで意味がずれていないかを確かめる工程は、この論文ではBERTScoreという指標で数値化していますが、自社での運用では、公開前の目視確認という形でも取り入れられます
よくある質問
AgenticGEOは、名前が似ているAgentGEOと同じ研究なのですか
別の研究です。本記事で扱うAgenticGEO(arXiv:2603.20213)は、北京航空航天大学のチームが2026年3月に公開した、戦略と評価役を進化させる仕組みの論文です。
AgentGEO(arXiv:2603.09296)は、引用されない原因を分類して診断し、原因ごとに修理する仕組みを提案した、別の研究チームによる別の論文です。
名前がよく似ているため、参照する際はarXivの番号で区別することをおすすめします。
AgenticGEOのMAP-Elitesアーカイブは、AutoGEOのルール抽出とどう違うのですか
AutoGEOは、AIに生成エンジンの好みを説明させ、それをルールとして抽出し、書き換えに使う仕組みです。
ルールは一度作られると、比較的固定して使われます。AgenticGEOは、複数の戦略を似た特徴を持つグループに分けて保存する棚(MAP-Elitesアーカイブ)を用意し、生成エンジンとのやり取りのたびに、新しい戦略を追加したり入れ替えたりし続けます。
論文の実験では、AgenticGEOがAutoGEOを、2つの生成エンジン・3つのデータセットすべてで上回ったと報告されています。
AgenticGEOは、ChatGPTやGoogleのAI Overviewsでもすぐ使える手法なのですか
論文の実験は、研究チームが用意した模擬的な生成エンジン(公開されているQwen2.5-32B-InstructとLlama-3.3-70B-Instruct)を対象にしています。
実際のChatGPTやPerplexity、GoogleのAI Overviewsを使った検証は、今回の論文の範囲外です。
また、この手法を動かすには、批評役・進化役という複数のAIモデルの追加学習が必要です。すぐに自社で導入できる完成品というより、研究段階の仕組みとして読むのが適切です。
まとめ:今日できる1つのこと
いま自社で使っている書き換えのパターンを1つ選び、別の生成AIサービスでも同じように良い結果が出るかを、実際に試してみてください。もし結果が違えば、それは「1つの正解があるわけではない」というこの論文の指摘が、自社のページでも起きている証拠です。
この論文は、LLMO論文の一覧の一本です。ほかの論文の解説も、順次公開しています。
この記事に書いたことを、そのまま御社のページに
生成AIに引用されるページを、お話しいただくだけでお作りします。お時間をいただくのは初回15分のヒアリングだけです。まず1ページ、無料でお作りします。
OKが出るまで、何度でも直します。事実が違う、言い回しが硬い、この話は入れないでほしい。どれも遠慮なくおっしゃってください。何度お直ししても、追加の料金はいただきません。
これまでに127社にご利用いただきました。毎月ご依頼いただいている方の6割以上が、月10ページを選ばれています。料金はページに掲載しています。
ページを増やしても問い合わせが来ないなら、原因はページの外にあります。その場合は、下の入口からご相談ください。
自社のマーケティング課題を根本から解決しませんか?
ウェブサイトから要素を引き算し、訪れた人が迷わず次の一歩に進む形へ組み直す。初回60分のオンラインで御社のサイトを一緒に読み、どこから直すべきかをお伝えします。手順をまとめた無料の診断と解説動画もご用意しています。
初回は無料・60分・オンライン完結・その場で契約のお願いはいたしません


