1つのページに、複数の質問が同時に届くことがあります。「AIが検索結果をまとめて答える」生成エンジンの世界では、これは珍しくありません。
同じ商品ページでも、「使い方を知りたい人」と「他社製品との違いを知りたい人」では、読みたい情報が違います。ページを書き換えて目立ちやすくする対策(GEO、Generative Engine Optimization)は、この「複数の質問」を同時に満たそうとすると、書き換えの要求どうしがぶつかる場面が出てきます。
2026年1月に公開された「IF-GEO: Conflict-Aware Instruction Fusion for Multi-Query Generative Engine Optimization」は、この「要求がぶつかる」問題を正面から扱った論文です。
ACL Anthology(自然言語処理分野の主要な論文アーカイブ)で、Findings of ACL 2026への採択が確認できました。
この記事は、原文を通読し、何を問題にして、どう解決を試み、実験で何が分かったのかを整理します。数値はすべて論文の表から拾い、相対的な伸びを計算した箇所には「概算」と書きます。
合同会社謙虚は、3つのドメインを並行して運用し、何を変えると数字が動くかを測り続けています。1本の記事に来る質問は1つとは限らず、FAQやカテゴリページのように複数の意図が重なる場所ほど、書き換えの方針が割れやすいと感じていました。
この論文は、その割れ方を数値で示した数少ない研究なので、読む価値があると判断しました。
結論:3行で言うと
- 1つの文書を複数の質問に合わせて書き換えると、ある質問への対応が、他の質問への効果を食いつぶすことを、論文は診断実験で確かめています
- 提案手法IF-GEOは、複数の質問ごとの書き換え要求を洗い出してから、優先度と重複を整理し、矛盾する要求を1つの改稿方針(Global Revision Blueprint)にまとめてから編集する、2段階の枠組みです
- 実験では、目立ち方の総合指標で最も強い比較手法を約45%上回り(概算)、質問ごとの最悪の下落幅も小さく抑えられました
ただし、これはAIが生成した回答をAIが採点する、実験室での結果です。日本語のページでの検証はなく、比較対象のAutoGEOとRAIDはいずれも査読前のプレプリントである点にも注意が必要です。
この論文の基本情報
| 項目 | 内容 |
|---|---|
| 題名(原題) | IF-GEO: Conflict-Aware Instruction Fusion for Multi-Query Generative Engine Optimization |
| 著者 | Heyang Zhou、JiaJia Chen、Xiaolu Chen、Jie Bao、Zhen Chen(責任著者)、Yong Liao(6人。中国科学技術大学サイバーサイエンス・技術学院、合肥総合国家科学センター データスペース研究所) |
| 公開日 | 2026年1月20日(arXiv初版) |
| arXiv番号 | 2601.13938 |
| 掲載/採択状況 | ACL Anthologyで確認したところ、Findings of ACL 2026に採択されています(論文ID:2026.findings-acl.1373)。arXiv側のコメント欄は本稿確認時点でも「Submitted to ACL 2026」のままで、採択を反映した更新はされていません |
| 種類 | 大学の研究グループによる学術論文(査読あり、Findings採択) |
| 実験データ・コードの公開先 | 論文中に公開リポジトリの記載は見当たりませんでした(確認できず) |
論文はこちらで読めます。arXiv(2601.13938)、ACL Anthology(2026.findings-acl.1373)。
この論文が答えた問い
1つの文書を、複数の異なる質問に対して同時に最適化しようとすると、質問どうしの書き換え要求が競合する。この競合を、どう調整すれば、全体として安定した効果を得られるか。
論文はまず、この競合が実際に起きることを、付録の診断実験で示しています。200件の文書それぞれに5つの質問を用意し、1つの質問だけを狙って書き換えたときの効果を、残り4つの質問への影響も含めて測っています。
結果は次のとおりでした。
| 対象 | 平均の伸び | 効果がマイナスになった割合 |
|---|---|---|
| 狙った質問 | 0.277 | 12.4% |
| 狙わなかった質問 | 0.087 | 30.6% |
狙った質問への伸びは、狙わなかった質問より平均で0.189大きく、狙わなかった側の質問の69.2%で、狙った質問より効果が下回っていました(相対的な下振れの大きさを示すDM指標は0.228)。1つの質問だけを見て書き換えると、他の質問向けの効果を犠牲にしやすいというのが、論文が実測で示した出発点です。
近い立ち位置の論文との違い
合同会社謙虚のこの連載ではこれまで、GEOの書き換え手法を扱った論文をいくつか紹介してきました。AutoGEOは、目立った文書とそうでない文書のペアから生成エンジン全体に効くルールを学習する方法です。
AgentGEOは、引用されなかった原因を分類してから、原因に合う専用ツールで直す方法です。
MAGEOは、複数のAIエージェントが役割分担し、うまくいった編集を「スキル」として貯めて使い回す方法です。
この3つは、いずれも「1つの文書を、どう書き換えるか」を扱っています。IF-GEOが扱うのは、もう1段手前の問題です。
1つの文書に複数の質問が来るとき、誰の要求を、どこまで通すかという調整の問題で、他の3本とは軸が異なります。
論文自身が比較対象にしているのも、この調整をしない従来手法です。
どうやって調べたのか
実験の舞台
論文は、同じ研究グループの一部が関わった先行研究RAID(Chen et al., 2025b)が作ったベンチマークを使っています。これは、GEOの原論文(Aggarwal et al., 2024、KDD 2024)が作った「GEO-Bench」を拡張したものです。
| 項目 | 内容 |
|---|---|
| 元になる文書 | ある質問に対してGoogle検索で上位5件に入った、実在のページ |
| 質問の作り方 | 1つの元の質問を、定義・使い方・利点や欠点など、異なる観点をもつ5件の関連質問に広げたもの |
| 回答を作る生成エンジン | GPT-4o-mini(全手法で統一。方式の違いだけを比べるため) |
| 評価に使った質問数 | 主結果は1,000件(元のGEO-Benchのテスト件数に合わせた数)、アブレーション実験は250件、質問数を変える実験は500件 |
比較した3種類の手法
| 手法 | やり方 |
|---|---|
| GEO(9つのルール) | 引用を足す、統計を足すなど、GEO原論文の人手ルールをそのまま適用 |
| RAID(RAID G-SEO) | 複数の役割を持つAIに質問の意図を推測させ、1つに絞った意図に沿って書き換える |
| Auto-GEO | 大量のランキングデータから、生成エンジンが好む傾向をルール化して適用 |
ここで押さえておきたいのは、比較対象のRAID(G-SEO)と、評価に使ったベンチマークは、どちらもXiaolu Chen、Jie Bao、Zhen Chen、Yong Liaoという、IF-GEOの著者6人のうち4人が名前を連ねる別の論文が出所だという点です。同じ研究グループが自分たちの先行手法とベンチマークを土台に、新手法を比較している構図で、完全に独立した第三者のデータや手法との比較ではありません。
IF-GEOの手順
IF-GEOは、「まず広げ、次にまとめる」(“diverge-then-converge”)という2段階で動きます。すべての手順はAI(大規模言語モデル)への指示として実装されており、自由な書き換えではなく、決まった形式の中間成果物を出力させる作りです。
- 質問の掘り起こし:AIに検索アナリスト役をさせ、その文書が答えになりそうな質問を(重複した言い換えを避けながら)複数個、人気度の推定スコア付きで洗い出します(既定は5個)
- 質問ごとの書き換え要求の生成:質問ごとに、AIがその文書の弱点を診断し、「該当箇所・具体的な修正案・必要度スコア(0〜100)」の3点セットで要求を作ります(質問1件あたり既定5件)
- 優先度づけと重複排除:人気度×必要度で全体の優先度を算出し、しきい値(既定0.7)未満を除外。同じ狙いの要求はAIが1つにまとめます
- 対立の解消:同じ箇所を狙う要求どうしが両立しない場合、優先度に大きな差があれば高いほうを採用し、差が小さければAIが両方の要求を汲んだ折衷案を新たに作ります
- 改稿方針の設計:整理された要求を文書の各セクションに割り当て、実行順に並べた「Global Revision Blueprint」を作ります
- 方針に沿った編集:編集役のAIが、この方針だけに従って該当セクションを書き換えます。方針に出てこないセクションは、そのまま残すよう指示されています
何を測ったか
目立ち方(visibility)は2種類の指標で測っています。1つは、回答の中でその文書を根拠にした語数を、出てくる位置で重みづけした客観指標(PAWC、Position-Adjusted Word Count。
表ではWord・Position・Overallの3列)。もう1つは、AI(G-EVAL方式)に7つの観点で採点させた主観指標(関連性・影響度・独自性・多様性・追加質問への強さ・位置・分量。
表ではAverage列に平均をまとめています)です。
安定性は、質問ごとの伸び幅から3つの指標で測っています。最も下がった質問の下落幅(WCP、値が0や正に近いほど良い)、マイナスになった伸びだけを二乗して集めた下振れリスク(DR、小さいほど良い)、伸びがマイナスにならなかった質問の割合(WTR、大きいほど良い)です。
結果
目立ち方は、比較手法の中で最も高かった
論文の表1から、代表的な手法の総合値を拾います。
| 手法 | 客観指標(Overall) | 主観指標(Average) |
|---|---|---|
| GEOの最良ルール(出典を示す) | 4.71 | 3.31 |
| RAID(G-SEO) | 0.88 | 1.36 |
| Auto-GEO | 7.59 | 5.30 |
| IF-GEO | 11.03 | 5.87 |
IF-GEOは、最も強い比較手法だったAuto-GEOより、客観指標で約45%(概算、(11.03-7.59)÷7.59)、主観指標で約11%(概算、(5.87-5.30)÷5.30)上回りました。RAID(G-SEO)は、1つに絞った質問の意図だけを追う設計のため、この実験では伸びが小さくなっています。
質問間のバラつきも、最も抑えられていた
論文の表2から、同じ手法の安定性指標を拾います。
| 手法 | 最悪ケースの下落幅(WCP) | 非悪化率(WTR) | 下振れリスク(DR) |
|---|---|---|---|
| Auto-GEO | -0.0511 | 73.56% | 0.0043 |
| IF-GEO | -0.0090 | 80.50% | 0.0023 |
IF-GEOは、最悪の質問でも下落幅が-0.0090にとどまり、Auto-GEOの-0.0511より小さく済んでいます。
非悪化率(伸びがマイナスにならなかった質問の割合)は80.50%で、Auto-GEOを6.94ポイント上回りました。下振れリスクはAuto-GEO比で約47%小さく(概算、(0.0043-0.0023)÷0.0043)なっています。
どの手順が効いているのか
論文は、対立解消・改稿方針の設計・「対立解消から改稿方針まで(Instruction Fusion)全体」をそれぞれ取り除く実験もしています(250件で評価、フル版の総合値は9.24)。
| 取り除いた手順 | 総合値 | 最悪ケースの下落幅 | 非悪化率 |
|---|---|---|---|
| (取り除かない、フル版) | 9.24 | -0.0328 | 80.80% |
| 改稿方針の設計 | 8.18 | -0.0517 | 81.20% |
| 対立解消〜改稿方針まで全体 | 7.07 | -0.0569 | 74.80% |
| 対立の解消だけ | 6.14 | -0.0713 | 77.20% |
対立の解消を外すと、総合値の落ち込みと最悪ケースの下落幅の両方が最も悪化しました。論文は、対立解消が「安全装置」の役割を果たし、対立解消から改稿方針までの流れ全体は非悪化率の維持に効いていると解釈しています。
改稿方針の設計だけを外した場合は、総合値は下がるものの下振れリスクはほぼ変わらず、役割が分かれていることを示しています。
質問の数・生成エンジン・検索順位を変えても
質問の掘り起こし件数(既定5件)を1〜9件で振った実験では、総合値は件数が増えるほど上がり続けます(1件で8.06、9件で10.02)が、非悪化率は5件で80.00%とピークになり、それ以降は上下に変動しました(下振れのリスクと最悪ケースの下落幅は、5件以降ほとんど変わりません)。計算コストが件数にほぼ比例して増えることもあり、論文は5件を既定値として選んでいます。
回答を作る生成エンジンをGemini-2.0-Flashに変えた追試(付録E)でも、IF-GEOは総合値14.17で全手法中最も高く、非悪化率84.07%・下振れリスク0.0054も最良でした。また、書き換え前の検索順位別に分けた分析(付録D)でも、下位のページ(4位・5位)だけが伸びるのではなく、いずれの順位帯でも総合値と主観指標の両方が伸びており、順位が低いページへの底上げに偏った結果ではないと論文は述べています。
論文自身が書いている限界
論文は末尾で、3つの限界を挙げています。
- 計算コストが高いこと。複数段階でAIを繰り返し呼び出すため、1文書あたりのトークン消費量は、1回だけ書き換える従来手法より多くなります。付録によると、IF-GEOは平均10,327.7トークンを使い、GEOのルール手法(2,171.6〜2,802.2トークン)の3.7〜4.8倍です(概算)
- 模擬環境であること。GEO原論文の実験手順にならい、GPT-4o-miniによる模擬環境で評価しており、実際に商用で使われている生成エンジンの挙動を完全に再現しているとは限らない、と論文は明記しています
- 質問の掘り起こしの精度に結果が左右されること。改稿方針の質は、最初に洗い出す質問集が実際の検索意図をどれだけ捉えているかに依存し、この掘り起こしが不十分だと最適化の方向がずれる可能性がある、と論文自身が認めています
加えて、この記事を書くために原文を読んで気づいた点があります。
- 比較手法の1つ(RAID G-SEO)と、評価に使ったベンチマークの土台は、どちらもIF-GEOの著者6人のうち4人が共著者に入る別論文が出所です。独立した第三者のベンチマーク・手法との比較ではなく、自分たちの先行研究を基準にした比較が含まれています
- 目立ち方の評価は、AIが生成した回答をAIが採点する仕組みで完結しており、人手による評価は報告されていません
- 実験に使われた質問・文書は英語圏のものです。日本語のページでの検証は報告されていません
- arXivのコメント欄は本稿確認時点で「Submitted to ACL 2026」のままで、Findings採択の事実はACL Anthology側の掲載情報で確認したものです。arXivの版のみを見て「投稿中」と判断すると、実際の採択状況とずれます
この論文から、言えること・言えないこと
| 言えること(論文の設定で確認された) | 言えないこと(論文では確認されていない) |
|---|---|
| 1つの質問だけを狙った書き換えは、他の質問への効果を犠牲にしやすい | 日本語のページでも同じ大きさの競合が起きること |
| 質問ごとの要求を整理してから編集すると、目立ち方と安定性の両方が、比較した3手法より高かった | 実際の商用生成エンジンで同じ倍率の差が出ること |
| 対立解消の手順を外すと、最も大きく成績が落ちた | 検索順位や問い合わせ数など、ビジネス上の指標が改善すること |
| Gemini-2.0-Flashに生成エンジンを替えても、同じ傾向が見られた | すべての生成エンジンで同じ結果になること(検証は2種類のみ) |
中小企業の視点で、どう受け取るか
ここからは論文の主張とは別の、私の読み取りです。
- 1本の記事やFAQページに複数の検索意図が混ざるのは、中小企業のサイトでもよくあります。書き換えるときに「今回はどの質問を優先するか」を先に決めずに直すと、この論文が診断実験で示した「一方が伸びて、もう一方が落ちる」状態を、人手でも再現しやすいと考えられます
- IF-GEOの仕組みをそのまま自動化しなくても、「複数の想定読者ごとに書き換え案を出してから、矛盾する箇所だけを見比べて1つに決める」という順番自体は、人手の編集フローに取り入れられそうです
- 計算コストの高さ(1文書あたり従来手法の4倍前後のやり取り)は、記事を量産する運用では無視できないコストです。効果が大きい主要ページから優先して試す、という使い分けが現実的だと考えます
- 比較対象と評価基盤の一部が自分たちの先行研究由来である点は、数字を鵜呑みにせず、独立した検証を待つ理由になります
よくある質問
IF-GEOは、これまでのGEO対策と何が違いますか
従来のGEO対策の多くは、1つの想定質問に対して文書をどう書き換えるかを扱っています。IF-GEOが扱うのは、複数の質問が同時に来たときに、それぞれの書き換え要求のどこまでを、どう両立させるかという調整の問題です。
書き換え方そのものではなく、要求の優先順位づけと対立解消に主眼があります。
IF-GEOは日本語のページでも同じように効きますか
論文では検証されていません。使われた文書・質問はいずれも英語圏のもので、日本語のページで同じ規模の競合や改善が起きるかどうかは、この論文からは分かりません。
IF-GEOの結果は、そのまま自社の数字に当てはめてよいですか
当てはめられません。評価はAIが生成した回答をAIが採点する模擬環境で行われており、比較対象の一部も同じ研究グループの先行研究です。
論文が示したのは「要求を整理してから編集すると、整理せずに編集するより安定した」という相対的な傾向で、実際のアクセス数や問い合わせ数が同じ比率で伸びることは確認されていません。
まとめ:今日できる1つのこと
複数の読者層が集まるページを1つ選び、「このページに来る質問は何種類あるか」を書き出してみてください。書き換えを検討するときは、質問ごとに何を優先するかを先に決めてから直すと、この論文が指摘した「一方だけが良くなる」状態を避けやすくなります。
この論文は、LLMO論文の一覧の一本です。ほかの論文の解説も、順次公開しています。
この記事に書いたことを、そのまま御社のページに
生成AIに引用されるページを、お話しいただくだけでお作りします。お時間をいただくのは初回15分のヒアリングだけです。まず1ページ、無料でお作りします。
OKが出るまで、何度でも直します。事実が違う、言い回しが硬い、この話は入れないでほしい。どれも遠慮なくおっしゃってください。何度お直ししても、追加の料金はいただきません。
これまでに127社にご利用いただきました。毎月ご依頼いただいている方の6割以上が、月10ページを選ばれています。料金はページに掲載しています。
ページを増やしても問い合わせが来ないなら、原因はページの外にあります。その場合は、下の入口からご相談ください。
自社のマーケティング課題を根本から解決しませんか?
ウェブサイトから要素を引き算し、訪れた人が迷わず次の一歩に進む形へ組み直す。初回60分のオンラインで御社のサイトを一緒に読み、どこから直すべきかをお伝えします。手順をまとめた無料の診断と解説動画もご用意しています。
初回は無料・60分・オンライン完結・その場で契約のお願いはいたしません


