「AIに取り上げられやすい文章の書き方」は、これまで研究者が手作業で考えたルール(引用を足す、統計を足す、など)を試す形で調べられてきました。
2025年10月に公開された論文「What Generative Search Engines Like and How to Optimize Web Content Cooperatively」は、そのルール作り自体をAIに任せる枠組み「AutoGEO」を提案しています。
カーネギーメロン大学の研究者らと、民間企業に所属する研究者1名による論文です。
この記事は、その論文を原文から読み、AutoGEOの仕組みと、実験で何が分かり、何が分かっていないのかを整理します。数値はすべて論文の本文と表から拾いました。
自分で計算した相対的な伸びには「概算」と書き添えています。
合同会社謙虚は、3つのドメインを並行して運用し、何を変えると数字が動くかを測り続けています。この論文は、「AIが何を好むか」を人が推測するのではなく、AI自身に説明させて確かめようとする発想で、私たちが数字で検証する姿勢とも近い研究です。
結論:3行で言うと
- AutoGEOは、生成AI(生成エンジン)に「なぜこの文書を回答で多く使ったか」を説明させ、その説明から目立ち方のルールを自動で取り出し、そのルールで文書を書き換える枠組みです。プロンプトだけで動く「AutoGEO-API」と、軽量AIを訓練する「AutoGEO-Mini」の2種類を作りました。
- 3つのデータセットで試した結果、AutoGEO-APIは最も強い比較手法(流暢さの改善)に対し最大50.99%、目立ち方の指標が上がったと論文は述べています。書き換えなしとの比較では、データセットによって約80〜117%(概算)伸びています。
- 命令文を紛れ込ませて生成AIをだます手口と比べると、AutoGEOは回答の質を保ちながら目立ち方を上げられたと報告されています。ただし表を細かく見ると、一部の条件では引用の正確さがむしろ下がっています。
この論文の基本情報
| 項目 | 内容 |
|---|---|
| 原題 | What Generative Search Engines Like and How to Optimize Web Content Cooperatively |
| 著者 | Yujiang Wu、Shanshan Zhong(この2名が共同筆頭著者)、Yubin Kim、Chenyan Xiong。著者4名のうち3名(Wu・Zhong・Xiong)はカーネギーメロン大学、Yubin Kim氏は民間企業1社のみの所属 |
| 公開 | 2025年10月13日。arXiv:2510.11438(分野はcs.IR、情報検索) |
| 掲載・採択 | ICLR 2026(学習表現に関する国際会議)に採択。根拠は、論文が公開しているGitHubリポジトリの表記(「採択された」という記載)です。私が読んだarXivのPDF(初版、2025年10月13日提出)自体には「プレプリント、作業中」という表記が残ったままで、arXivのコメント欄にも採択の記載はありませんでした |
| 種類 | 大学発の手法提案と実験。謝辞に、共著者1名の所属企業が研究を一部支援したと明記されています |
| データ・コード | GitHubで実装を公開。論文が新しく作った2つのベンチマーク(Researchy-GEOとE-commerce)も、同じ場所で公開すると書かれています |
論文はarXiv(2510.11438)で読めます。コードはGitHub(cxcscmu/AutoGEO)で公開されています。
この論文が答えた問い
生成AIが検索の答えを組み立てるとき、どの文書を多く使うかには、何らかの好みがあるのではないか。あるなら、その好みを自動で取り出し、文書の書き換えに使えないか。
これまでのGEO(生成AI向けの最適化)研究は、「引用を足す」「統計を足す」のように、研究者が事前に考えた書き換え方針を試す形が中心でした。
論文は、この方針そのものが人の勘に頼っており、生成AIごと・分野ごとの違いを体系的にはとらえていないと指摘しています。AutoGEOは、好みの説明・ルール化・書き換えを、すべてAIに任せる点が違いです。
どうやって調べたのか
ルールを取り出す4つの役割
AutoGEOは、まず生成AI(生成エンジン)に質問への回答を作らせ、同時に渡した候補文書のうち、回答でよく使われた文書とあまり使われなかった文書のペアを選びます。そのペアを、次の4つの役割を持つAIに順番に処理させます。
- 説明役:2つの文書のどこが違うから扱いに差が出たのかを、自然な文章で説明する。
- 抽出役:その説明から、要点だけを短くまとめる。
- 統合役:大量の要点を束ねて、共通するルールの候補にする(数万件を扱うため、段階を分けて少しずつ統合する)。
- 絞り込み役:あいまいなルールやノイズを取り除き、信頼できるルールだけを残す。
できあがったルール集は、プロンプトにそのまま埋め込んで使う「AutoGEO-API」と、そのルールを守れているかを報酬にして軽量AIを強化学習で訓練する「AutoGEO-Mini」の、2つの書き換えAIに使われます。AutoGEO-Miniの報酬は、目立ち方が上がったか・ルールに沿っているか・元の文書の意味からずれていないか、の3つを組み合わせたものです。
3つのデータセットと、各質問5件の候補文書
| データセット | 質問数(学習/テスト) | 中身 |
|---|---|---|
| GEO-Bench | 8,000 / 1,000 | 既存の研究(Aggarwal et al., 2024)が作った、分野をまたぐ質問集 |
| Researchy-GEO(新規) | 10,000 / 1,000 | 調べものが必要な質問集「Researchy Questions」から作った、この論文の新しいベンチマーク |
| E-commerce(新規) | 1,667 / 416 | 実際のAIとの会話ログ「LMSYS-Chat-1M」から、通販に関わる質問だけを絞り込んだ、この論文の新しいベンチマーク |
各質問には、検索エンジン用の文書集合「ClueWeb22」から取った5件の候補文書が付きます。書き換えの対象は、その5件のうち1件です。
生成AIは、この5件だけを材料に回答を作ります。実際の検索で候補文書として拾われるかどうかは、この実験の対象外です。
どのAIが、どの役割を担ったか
| 役割 | 使ったAI |
|---|---|
| 回答を作る生成エンジン(書き換えの効果を測る対象) | Gemini-2.5-Flash-Lite、GPT-4o-Mini、Claude-3-Haikuの3つを個別に使用 |
| ルールの説明・抽出 | Gemini-2.5-Flash-Lite |
| ルールの統合・絞り込み、AutoGEO-APIの書き換え | Gemini-2.5-Pro |
| AutoGEO-Miniの書き換え(訓練対象の軽量AI) | Qwen3-1.7B |
比較の相手は、既存研究が示した9つの書き換え方針(専門用語を足す、出典を示す、キーワードを詰め込む、流暢さの改善、など)と、書き換えなしの「バニラ」です。
さらに、命令文を文書に紛れ込ませて生成AIの判断をゆがめようとする2つの敵対的な手法とも比べています。目立ち方は、既存研究(Aggarwal et al., 2024)と同じ「語数」「位置」「総合」の3指標で測り、回答としての質(論文はGEUと呼ぶ)は、関連性・正確さ・明快さなど複数の観点で自動採点しています。
結果
目立ち方は、条件によって2倍以上に
Geminiを生成エンジンにした場合の「総合」の値です。表の右端は、書き換えなしとの差を私が計算した概算です。
| データセット | 書き換えなし | 最良の比較手法(流暢さの改善) | AutoGEO-API | AutoGEO-Mini | API版の伸び(概算) |
|---|---|---|---|---|---|
| E-commerce | 18.32 | 22.99 | 34.05 | 25.25 | +85.9% |
| GEO-Bench | 19.44 | 23.73 | 34.92 | 27.12 | +79.6% |
| Researchy-GEO | 20.18 | 27.75 | 43.76 | 38.53 | +116.8% |
- 論文の本文は、AutoGEO-APIについて「最も強い比較手法(流暢さの改善)に対し、最大50.99%の改善」とまとめています。表の数字は小数第2位までなので、私が計算し直した値(43.9〜57.7%の幅)とは、丸め方の違いで少しずれます。
- AutoGEO-Miniは、書き換えなしと比べて約38〜91%(概算)の伸びで、AutoGEO-APIには届かないものの、すべての比較手法を上回りました。
- 検索順位が低い文書(候補5件の中で最も目立たなかった文書)だけに絞った追加実験でも、AutoGEO-APIは総合9.46から35.83へ、最も苦しい条件でも大きく伸びています。
AIの好みは、相手のAIより分野で変わる
抽出したルールをキーワード化し、重なり具合を比較した分析です。
- 同じデータセット(Researchy-GEO)で、異なる生成AI(Gemini・GPT・Claude)が持つルールの重なりは78.95〜84.21%と、かなり高い数値でした。
- 同じ生成AI(Gemini)で、異なる分野のルールを比べると、調べもの系のResearchy-GEOとGEO-Bench同士は88.24%重なる一方、通販系のE-commerceを含む組み合わせは34.78%・40.00%まで下がりました。
- つまり、「どのAIを使うか」より「どんな分野の質問か」のほうが、好みの違いに効いているというのが論文の読み取りです。
- 他のAI・他の分野で作ったルールを流用しても、書き換えなしよりは伸びますが、そのAI・その分野専用のルールほどの伸びにはなりませんでした。
回答の質は保たれたか
論文全体の結論は「目立ち方を上げつつ、回答としての質もおおむね保たれた」というものです。ただし、条件を分けて表を見ると、ばらつきがあります。
引用の正確さ(Precision)を例に、3つのエンジンで比べます。
| 生成エンジン | 書き換えなし | AutoGEO-API | AutoGEO-Mini |
|---|---|---|---|
| Gemini(Researchy-GEO) | 96.05 | 97.02 | 96.89 |
| GPT(Researchy-GEO) | 91.51 | 94.30 | 93.68 |
| Claude(Researchy-GEO) | 96.51 | 84.98 | 84.88 |
GeminiとGPTでは引用の正確さがむしろ上がっているのに対し、Claudeでは約11.5ポイント下がっています。
同じ傾向はE-commerceデータセットのClaudeでも見られます(53.45から75.89へ改善する一方、AutoGEO-Miniでは51.24と、書き換えなしとほぼ同じ水準です)。
論文の本文では、この食い違いへの説明は省かれています。
敵対的な手法との比較(Researchy-GEO、Geminiエンジン)では、命令文を紛れ込ませる2つの手口(総合31.20と30.71)も目立ち方は上がりましたが、明快さは両方とも書き換えなし(60.10)を下回りました(59.08、57.82)。
引用の正確さは、Hijack Attackで95.64とわずかに下がった一方、Poisoning Attackでは96.39とわずかに上がっており、結果は割れています。
一方でAutoGEO-API(総合43.76)は、引用の正確さ97.02、明快さ61.97と、両方とも書き換えなしを上回っています。
目立ち方を上げる手口と、AIをだます手口は別物だというのが、この比較から論文が示したかった点です。
どのルールが効いているのか
AutoGEO-Miniを分解する実験(Researchy-GEO、Gemini)では、3つの報酬(目立ち方・ルール遵守・意味の一致)に、ルールをプロンプトに含めるかどうかを合わせた4つの要素のうち、ルール遵守の報酬を外すと総合が38.53から31.41へ最も大きく落ちました。
意味の一致を守る報酬を外した場合は37.79で、低下幅がいちばん小さい結果でした。論文は、4つの要素すべてに底上げの効果があり、なかでもルール遵守の報酬の寄与が最も大きいとまとめています。
費用については、AutoGEO-Miniのコストは、AutoGEO-APIの約0.0071倍だと論文は見積もっています。この数字は、AutoGEO-Miniを動かすGPU(1時間0.75ドル)と、AutoGEO-APIが使うAI(入力100万語あたり1.25ドル、出力100万語あたり10ドル)の、2025年10月時点の価格を比べた概算で、実際の運用コストとは別の数字です。
論文自身が書いている限界
- 実験で使った生成エンジンは、GEO-Benchの手法を踏襲し、あらかじめ決まった5件の候補文書から回答を作る設計です。実際のサービスにある、その場での検索・再検索は範囲外です。
- 結論部分では、この枠組みをエージェント型・複数のメディア形式(マルチモーダル)を扱う生成AIへ広げることと、Web上の複数の利害関係者を考慮した設計を、今後の課題として挙げています。
- 論文には、独立した「限界」の節はなく、上記は結論の記述から拾いました。
原文を読んで気づいた点
- 査読:arXivのPDF自体は「プレプリント、作業中」のままで、arXivのコメント欄は採択について空欄でした。ICLR 2026採択は、論文が公開しているGitHubリポジトリの表記が根拠です。学会の正式な査読済み版(カメラレディ版)は、私が読んだarXiv初版と内容が異なる可能性があります。
- 実験環境と実サービスの差:「生成エンジン」は、あらかじめ用意した5件の候補文書にAIで回答させる自作の仕組みで、実際のChatGPTやGoogleのAI Overviewsのような、公開のWeb全体からその場で検索する仕組みとは異なります。
- 検索段階への影響は、この論文の測定範囲外です。当メディアで先に解説した別の論文(SAGEO Arena)は、検索から生成までを通しで測る実験の中でAutoGEOによる書き換えを試し、本文だけの書き換えで検索段階のH@20(上位20件到達率)が平均36%、再ランク段階のH@20が平均42%下がったと報告しています(平均順位そのものは22.35位下がったとしています)。AutoGEO自身の論文が検証したのは、書き換え後の目立ち方だけです。
- 採点はほぼ自動です。目立ち方は式で計算し、回答としての質も別のAIによる自動採点(DeepResearchGymという枠組みを利用)が中心で、評価の主役はAIです。
- データセットは3つとも英語です。日本語での検証は範囲外です。
- 「回答の質はおおむね保たれた」という要旨の記述に対し、表を細かく見ると、Claudeエンジンでは引用の正確さが目立って下がる組み合わせがありました(前述)。
この論文から、言えること・言えないこと
| 言えること(論文の設定で確認された) | 言えないこと(論文では確認されていない) |
|---|---|
| AIに好みを説明させ、ルール化して書き換えると、目立ち方の指標が上がった | 実際のChatGPTやGoogleのAI Overviewsで同じ幅の効果が出ること |
| 分野が変わると、AIの好むルールも大きく変わった(E-commerceで顕著) | 日本語のページでも同じ大きさで効くこと |
| 命令文を紛れ込ませる手口より、回答の質を保ちながら目立ち方を上げられた | どのAI・どの条件でも回答の質が保たれること(引用の正確さが下がる組み合わせがある) |
| 軽量AIに訓練しても、既存の比較手法より高い目立ち方を達成できた | 検索順位や、実際のアクセス数・問い合わせが増えること |
中小企業の視点で、どう受け取るか
ここからは論文の主張とは別の、私の読み取りです。
- 「AIの好みは分野ごとに違う」という結果は、自社の業種に当てはめて考える価値があります。論文では通販系の質問が、調べもの系の質問と大きく異なるルールを持っていました。自社の業種にどんなルールが向くかは、自社で確かめる必要があります。
- この論文が示したルールの一部(要点を先に書く、出典を示す、簡潔にする)は、これまで解説してきた他の論文とも重なります。特定の手法名に頼るより、原則として押さえておく価値がありそうです。
- 「目立ち方が上がった」ことと「回答の質が保たれた」ことは、別々に確認する必要があります。この論文でも、指標や条件によっては質が下がる組み合わせがありました。書き換えの効果を自社で確かめるときも、両方を見る姿勢が参考になります。
- 実際の検索段階への影響は、書き換えの前後で自社が測るのが確実です。この論文も、別の論文(SAGEO Arena)も、それぞれ自分の実験の範囲だけを測っています。
よくある質問
AutoGEOは、誰でもすぐ使える道具ですか
論文はコードをGitHubで公開していますが、これは研究用の実装です。実験は英語の3つのデータセットに限られており、日本語のページへの適用は自社での確認が必要です。
仕組みの考え方(AIに好みを説明させてルール化する)が参考になる論文です。
目立ち方が上がれば、検索の流入も増えますか
この論文が確認したのは、目立ち方の指標だけです。実験の候補文書は5件に固定されており、書き換えた文書が実際の検索で拾われるかどうかは対象外です。
別の論文(SAGEO Arena)では、本文だけの書き換えが検索段階の順位を下げたという結果も出ています。
AutoGEO-APIとAutoGEO-Miniは、どちらが良いのですか
目立ち方の指標だけを見ればAutoGEO-APIが上回りますが、AutoGEO-Miniは費用が約0.0071倍で済むと論文は見積もっています。どちらも研究用の実装で、実運用の使い分けまでは論文の範囲外です。
まとめ:今日できる1つのこと
自社のページを1つ選び、「要点を冒頭に書いているか」「出典を示しているか」「話題を絞れているか」の3点を確認してください。
これらは、この論文が抽出したルールにも、以前解説したGEOの原論文にも共通して出てくる要素です。1つの手法名にこだわるより、共通する原則から見直すのが確実です。
この論文は、LLMO論文の一覧の一本です。ほかの論文の解説も、順次公開しています。
この記事に書いたことを、そのまま御社のページに
生成AIに引用されるページを、お話しいただくだけでお作りします。お時間をいただくのは初回15分のヒアリングだけです。まず1ページ、無料でお作りします。
OKが出るまで、何度でも直します。事実が違う、言い回しが硬い、この話は入れないでほしい。どれも遠慮なくおっしゃってください。何度お直ししても、追加の料金はいただきません。
これまでに127社にご利用いただきました。毎月ご依頼いただいている方の6割以上が、月10ページを選ばれています。料金はページに掲載しています。
ページを増やしても問い合わせが来ないなら、原因はページの外にあります。その場合は、下の入口からご相談ください。
自社のマーケティング課題を根本から解決しませんか?
ウェブサイトから要素を引き算し、訪れた人が迷わず次の一歩に進む形へ組み直す。初回60分のオンラインで御社のサイトを一緒に読み、どこから直すべきかをお伝えします。手順をまとめた無料の診断と解説動画もご用意しています。
初回は無料・60分・オンライン完結・その場で契約のお願いはいたしません


