生成AIに答えを作らせるとき、AIは検索で拾った複数のページを読み、それを根拠に文章を組み立てます。この仕組みでの見え方を良くする研究は、ここ数年で急速に増えました。
ですが、その多くは「1件のページを、1回だけ書き直して確かめる」という進め方に留まっています。次のページを書くときには、また同じ試行錯誤をゼロからやり直すことになります。
2026年4月に公開され、国際学会ACL 2026のFindingsに採択されたと案内されている論文「From Experience to Skill: Multi-Agent Generative Engine Optimization via Reusable Strategy Learning」(略称MAGEO)は、この「毎回ゼロから」という点に手を入れた研究です。
役割の異なる複数のAIエージェントが分担して文書を編集し、うまくいった編集のやり方を「スキル」として貯め、次の作業で呼び出して使う仕組みを提案しています。
この記事は、原文(PDF)を通読して、その仕組みと実験結果を整理します。すでに解説したAutoGEOの記事も「AIに書き換えを任せる」枠組みでしたが、AutoGEOは好みのルールをAIが言語化して使い回す設計で、蓄積の単位や複数のAIの役割分担は今回のMAGEOと異なります。
この記事の後半で、その違いを整理します。
合同会社謙虚は、3つのドメインを並行して運用し、何を変えると数字が動くかを測り続けています。この論文が扱う「うまくいった編集を貯めて使い回す」という発想は、記事を継続して作る運用そのものに関わるため、読む価値があると判断しました。
結論:3行で言うと
- MAGEOは、好みを分析する係・編集方針を決める係・実際に書き直す係・出来を検査する係の4つのAIエージェントが分担して文書を編集し、成功した編集パターンを「スキル」として蓄え、生成エンジンの種類と場面ごとに次の作業で再利用する仕組みです
- 実験(GPT-5.2、Gemini-3 Pro、Qwen-3 Maxの3つの生成エンジン)では、単純な書き換えルールのうち最も効果が高かったものと比べ、目立ち方の指標がおおむね3倍前後(論文の数値からの概算)になったと報告されています。引用の正確さを示す指標も、書き換え前より高い水準で保たれています
- 比較の対象は、研究チームが用意した9つの単純な書き換えルールに限られています。AutoGEOなど、既に本メディアで解説した他の自動化手法との直接比較は、この論文には含まれていません
この論文の基本情報
| 項目 | 内容 |
|---|---|
| 題名(原題) | From Experience to Skill: Multi-Agent Generative Engine Optimization via Reusable Strategy Learning(略称MAGEO) |
| 著者 | Beining Wuほか9名(共同筆頭は4名、責任著者はFu Li)。中国の6つの大学・研究機関の所属(杭州電子科技大学、中南大学、上海人工智能実験室、中山大学、香港科技大学広州校など) |
| 公開日 | 2026年4月21日。arXiv:2604.19516(分野はcs.AI、人工知能) |
| 掲載/採択状況 | arXivの付帯情報欄(Comments)に「ACL 2026 Findings」と記載。論文本文と謝辞には掲載先の記載なし |
| 種類 | 新しい枠組みの提案と、専用ベンチマークの構築、複数エンジンでの比較実験 |
| 実験データ/コードの公開先 | GitHub(著者リポジトリWu-beining/MAGEO)。論文が示す配布先はこのリポジトリのみ |
論文はこちらで読めます。arXiv(2604.19516)。
この論文が答えた問い
役割の異なる複数のAIが分担して文書を編集し、うまくいった編集を「スキル」として蓄積・再利用すれば、生成エンジンでの見え方(可視性)を、引用の正確さを保ったまま高められるか。
論文はまず、既存のGEO(生成エンジン最適化)研究の共通の弱点を指摘します。原論文のGEOは、キーワードの詰め込みではなく統計の追加や引用の強調が効くことを示しましたが、その手法は1件のページごとに完結し、次のページに知見を持ち越す仕組みを持ちません。
後継のRAID G-SEOは検索意図に合わせた段階的な書き換えを提案し、AutoGEOはAIに好みのルールを言語化させて使い回す設計を提案しました。
MAGEOはこれらの流れをふまえたうえで、GEOを「1回限りの修正作業」ではなく、経験を積み重ねる学習の過程として設計し直す立場を取っています。
どうやって調べたのか
論文は、書き換えの効果を検索結果の変動と切り分けるため、Twin-Branch(双子分岐)という比較の型を使います。同じ質問に対して検索で取得された文書の並びを固定し、片方の枝(基準)はそのまま生成エンジンに答えさせ、もう片方の枝(最適化)は取得された文書のうち1件だけをMAGEOが書き換えた文書に差し替えて、同じ並びのまま答えさせます。
差はその1件の書き換えだけなので、検索結果の入れ替わりに由来するぶれを取り除いた比較ができる、という設計です。
実際の編集は、次の4つのエージェントが分担します。
| エージェント | 役割 |
|---|---|
| 好み分析役(Preference Agent) | 大量の質問・回答の組を分析し、生成エンジンごとに「統計の多さ」「書式」「言い回し」などの好みの傾向をまとめる |
| 編集方針役(Planner Agent) | 好みの傾向と、スキルバンクから呼び出した過去の成功パターンをもとに、何を直すべきかの方針を決める(実際の書き換えはしない) |
| 編集実行役(Editor Agent) | 方針に沿って、構成の調整・根拠の補強・文体の調整などの具体的な書き換え案を複数作る |
| 検査役(Evaluator Agent) | AIによる採点で各案の効果を予測し、事実からの逸脱が一定より大きい案を除外したうえで、最も良い案を選ぶ |
この4役が「作る→評価する→選ぶ」を繰り返し、スコアが頭打ちになるか、編集の回数が上限に達すると打ち切ります。1件の作業が終わると、うまくいった編集とうまくいかなかった編集の記録が、次の仕組みに引き継がれます。
それが「スキルバンク」です。論文は、その場限りの記録(セッション内の記憶)と、繰り返し確認された成功パターン(創作者レベルの記憶)を分けて管理し、後者を生成エンジンの種類と場面ごとに整理して保存します。
次に似た場面が来たとき、編集方針役はこの保存分から使えそうな型を呼び出し、ゼロからの試行錯誤を減らします。保存できる型の数には上限があり、あふれた分は使われた頻度や新しさの低いものから入れ替えます。
効果を測る指標には、DSV-CF(可視性と忠実性の二軸指標)という自作の指標を使っています。目立ち方を表す4つの値(引用された文字量の割合、文書中の位置の重み、引用の目立ち方、主観的な印象)と、内容への影響を表す4つの値(引用が正しい文書に対して行われているか、回答全体としての事実整合性、要点の網羅度、比較質問での推薦の強さ)を組み合わせ、事実からずれた引用が多いほど点数を差し引く設計です。
この指標は、3人の評価者による人手採点100件との相関(スピアマンの順位相関係数)が0.81(95%信頼区間0.76〜0.85)であり、別に用意した50組の比較でAIの判定と人の判定が一致した割合は81.5%だったと報告されています。
実験の対象は、次のとおりです。
| 項目 | 内容 |
|---|---|
| データセット | 自作のMSME-GEO-Bench(健康、金融、教育、消費、法律・市民生活の5領域15分野の質問を、検索APIで取得した文書と組み合わせて構築)と、既存の標準ベンチマークGEO-Bench(直接比較のため) |
| 対象の生成エンジン | GPT-5.2、Gemini-3 Pro(いずれも非公開の商用モデル)、Qwen-3 Max(重みが公開されたモデル) |
| 比較した手法 | 原論文GEOが公式に配布する9つの単純な書き換えルール(権威的な文体、信頼できる出典の引用、統計の追加、引用文の追加、平易な言い回し、流暢さの向上、独自の言葉づかい、専門用語の使用、キーワード最適化) |
| 主な評価指標 | DSV-CFと、その内訳の8指標 |
MSME-GEO-Benchの作成手順も、原文に具体的に書かれています。質問案を作り、検索APIで上位10件の文書を取得し、そのうち1件を対象文書として固定します。
次に、その対象文書だけで答えられる質問をAIに逆算して作らせ、その質問をもう一度検索にかけ、対象文書が上位10件に残った場合だけ採用します。
この手順により、書き換えの効果が実際に観測できる組み合わせだけが残ります。最後に生活領域・意図・難易度をAIがラベル付けし、人手による確認では9割5分を超える精度だったとしています。
結果
| 設定 | 目立ち方の指標(WLV) | 備考 |
|---|---|---|
| 書き換えなし(基準) | 1.00 | 各設定の基準値 |
| 最も強かった単純ルール | 1.29〜1.65 | データセット・生成エンジンの組み合わせにより変動 |
| MAGEO(提案手法) | 3.84〜5.30 | 3つの生成エンジンで最上位(Qwen-3 Maxはもう一方のベンチマークでの結果が論文に見当たりません) |
MSME-GEO-BenchでGPT-5.2を使った実験では、MAGEOのWLVが4.52となり、単純ルールのうち最も強かった「引用を増やす」ルールの1.33を、論文の表現で「3倍以上」上回りました。
Gemini-3 Proでは5.30に達しています。私が原文の数値から計算すると、実際に数値がそろっている5つの組み合わせ(GPT-5.2とGemini-3 Proは2つのベンチマーク、Qwen-3 Maxは1つのベンチマーク)で、MAGEOは最良の単純ルールのおよそ2.6倍から4.1倍にあたる値になっています(概算)。
オープンウェイトのQwen-3 Maxでも同じ傾向が見られ、単純ルールがWLV1.33止まりのところ、MAGEOは3.84に達しました。
目立ち方が上がっただけではありません。引用が正しい文書を指しているかを示す指標や、回答全体の事実整合性を示す指標も、書き換えなしの状態より高い水準で保たれています。
論文は、キーワード最適化のような単純ルールでは事実からのずれによる減点が起きやすいのに対し、MAGEOは検査役が事実からの逸脱が大きい案をあらかじめ除外するため、目立ち方と正確さを両立できたと説明しています。
内訳を分解する実験(消去実験)では、次の2点が示されています。
- 好み分析役(生成エンジンごとの好みのモデル化)を外すと、GPT-5.2での総合指標がおよそ19%低下しました
- スキルバンクを外すと、総合指標がおよそ13%低下しました。過去の成功パターンを呼び出せないため、編集方針役は毎回ゼロからの試行錯誤に戻ります
編集を繰り返す過程を追った分析では、目立ち方の指標は最初の数回で急に伸び、5回目あたりでピークを迎えたあと、それ以上編集を重ねても伸びが鈍り、事実整合性がわずかに下がる場面も見られました。論文はこれを「最適化しすぎによる疲れ」と呼び、編集回数を早めに打ち切る仕組みの根拠としています。
費用の面では、書き換えなしを基準としたトークン消費量が、単純ルール(引用追加)で1.8倍、MAGEOの軽量版で2.9倍、full版で4.0倍でした。
軽量版はfull版の目立ち方の指標(4.52)のうち3.95まで達しており、論文は費用を抑えたい場合は軽量版、性能を優先する場合はfull版を勧めています。
また、単純ルールを4つ同時に使う組み合わせ手法(引用増加・信頼できる出典・権威的な文体・専門用語)を作って比較したところ、その総合指標はMAGEOの単独の結果に届きませんでした。
論文はこれを、MAGEOの効果が単純ルールの足し算では説明できない根拠として挙げています。
論文自身が書いている限界
- 複数のAIが何度も呼び出される仕組みのため、単純な書き換えルールよりトークンの消費量と待ち時間が大きく、即時応答が必要な場面や大量処理が必要な場面では導入のハードルになります
- 自作のMSME-GEO-Benchは、細かい分野別の分析をするには、規模がまだ小さい状態です
- ベンチマークの質問作成とラベル付けにGemini-3 Proを使っているため、検索での再確認や人手の抜き取り確認をしていても、特定のモデルの癖が残っている可能性があります
- 未見の場面へスキルがどこまで一般化するか、経験が増えるにつれて効率がどう上がるかは、今後の分析課題として残っています
- 生成エンジンが時間とともに変わっていくと、いま学習したスキルの効果は薄れていく可能性があります。この枠組みは文章だけを対象としており、画像や動画を含むマルチモーダルへの対応は今後の課題です
原文を読んで気づいた点
- 消去実験の「約19%」「約13%」という数値は、内訳を示す表(WLVなど8指標)には直接載っておらず、合成後のDSV-CF自体の数値は本文の表からは確認できませんでした。論文の記述をそのまま引用していますが、自分で検算はできていません
- 実験の土台はTwin-Branchという、検索結果の並びをあらかじめ固定した設定です。実際に稼働しているChatGPTやPerplexityなどのサービスに、書き換えた文書がそのまま検索で拾われるかどうかは、この実験の範囲外です。この点は、以前解説したGEOのサーベイ論文も、原論文のような固定条件の実験は書き換え後の「直接の効果」しか測れず、検索で拾われるかどうかは別問題だと指摘しているのと重なります
- 比較対象は原論文GEOの9つの単純ルールのみで、AutoGEOやRAID G-SEOといった、他の学習型の自動化手法は比較実験に含まれていません。関連研究の章で名前は挙がりますが、数値での優劣は示されていません
- 掲載先の「ACL 2026 Findings」は、arXivの付帯情報欄に書かれている表記で、論文本文や謝辞には見当たりませんでした
- 実験は英語の質問と英語圏の生成エンジンに閉じており、日本語での検証は見当たりませんでした
- 謝辞に記載された研究費は、大学における思想政治教育の仕組み改革に関する、中国教育部の別プロジェクトのものでした。GEOの研究内容そのものへの助成とは異なる名目である点が目を引きましたが、実験の内容や結果の解釈には影響しないと考えます
この論文から、言えること・言えないこと
| 言えること(この論文が示した範囲) | 言えないこと |
|---|---|
| 4つの役割に分けたAIと、成功パターンを貯めるスキルバンクの組み合わせが、実験の設定内で単純な書き換えルールを上回った | 実際に稼働している生成エンジンで、書き換えた文書が検索に拾われるかどうか |
| 生成エンジンごとの好みをモデル化することが、成果の大きな部分を占めた(除去実験でおよそ19%の差) | AutoGEOなど、他の自動化手法との数値での優劣 |
| オープンウェイトのモデル(Qwen-3 Max)でも同じ傾向が見られた | 日本語のページや日本語の質問でも同じ結果になるか |
| 目立ち方が上がっても、事実整合性の指標は書き換えなしより高い水準で保たれた | 実際の閲覧数や問い合わせ、売上への効果 |
中小企業の視点で、どう受け取るか
ここからは論文の主張とは別の、私の読み取りです。
- 「うまくいった編集の型を貯めて、次に使い回す」という発想は、記事を継続して作る運用にそのまま重なります。1本ごとに毎回ゼロから考えるより、効果があった構成や見出しの付け方を記録し、次の記事に持ち越す価値はありそうです
- 生成エンジンごとに好みが違う、という前提を実務でも置いたほうがよさそうです。論文は、Gemini系がコンパクトで構造化された根拠を好み、GPT系は権威的な文体と引用の書式を重視し、Qwen系は丁寧で安全志向の構成を好む傾向があると述べています。1つの型を全サービスに使い回す発想は、この論文の枠組みとは相性が悪いといえます
- 目立ち方と事実整合性は、セットで確認したほうがよいという示唆です。目立ち方だけを追うと、キーワードの詰め込みのように、事実からのずれで評価を落とす編集をしてしまう恐れがあります
- この論文の実験は、英語・海外の生成エンジンに閉じています。複数の役割に分けて編集し、型を貯めるという設計の考え方は参考になりますが、日本語のページで同じ倍率の効果が出るとは、この論文からは判断できません
よくある質問
MAGEOは、AutoGEOより優れているのですか
この論文だけでは判断できません。MAGEOが比較しているのは原論文GEOの9つの単純ルールで、AutoGEOは関連研究として名前が挙がるだけで、数値の比較には登場しません。両者は「AIに好みを分析させ、書き換えに反映する」という考え方は近いものの、AutoGEOが好みをルール化して使い回すのに対し、MAGEOは複数の役割に分けたAIと、場面ごとのスキルの蓄積という、異なる構成を取っています
いま自社のページで、この仕組みをそのまま使えますか
論文はコードをGitHubで公開していますが、研究用の実装であり、複数のAIを繰り返し呼び出す設計のぶん、費用と待ち時間もかかります。実験は英語圏の生成エンジンに限られており、日本語のページに使う場合は自社での確認が前提になります。取り入れやすいのは、仕組みそのものより、「成功した編集を記録し、次に使い回す」という考え方の部分です
まとめ:今日できる1つのこと
自社の記事を書き直すたびに、「どこを、どう直したか」「その結果、何が変わったか」を1行でよいので記録してください。MAGEOのスキルバンクほど自動化されていなくても、記録を貯めて次の記事に生かすという発想は、今日から真似できます。
この論文は、LLMO論文の一覧の一本です。ほかの論文の解説も、順次公開しています。
この記事に書いたことを、そのまま御社のページに
生成AIに引用されるページを、お話しいただくだけでお作りします。お時間をいただくのは初回15分のヒアリングだけです。まず1ページ、無料でお作りします。
OKが出るまで、何度でも直します。事実が違う、言い回しが硬い、この話は入れないでほしい。どれも遠慮なくおっしゃってください。何度お直ししても、追加の料金はいただきません。
これまでに127社にご利用いただきました。毎月ご依頼いただいている方の6割以上が、月10ページを選ばれています。料金はページに掲載しています。
ページを増やしても問い合わせが来ないなら、原因はページの外にあります。その場合は、下の入口からご相談ください。
自社のマーケティング課題を根本から解決しませんか?
ウェブサイトから要素を引き算し、訪れた人が迷わず次の一歩に進む形へ組み直す。初回60分のオンラインで御社のサイトを一緒に読み、どこから直すべきかをお伝えします。手順をまとめた無料の診断と解説動画もご用意しています。
初回は無料・60分・オンライン完結・その場で契約のお願いはいたしません


