生成AIが検索の答えをまとめる場面で、自社のページがどれだけ引用されるか。この問いへの答え方として、これまでの研究の多くは「文章の言い回しをどう変えるか」を扱ってきました。
2026年4月に公開された論文「Think Before Writing: Feature-Level Multi-Objective Optimization for Generative Citation Visibility」は、この発想を一段階引き上げます。
文章そのものを直接書き換えるのではなく、見出しの数や統計の密度といった「ページの性質」を先に決め、そこから文章を組み立てるという手法(FeatGEO)を提案した論文です。
この記事は、論文をarXivの原文(PDF)から通読し、本文・図表・付録・限界の節までを確認したうえで、何を測り、何が分かったのかを整理します。数値はすべて原文の表と本文の記述から拾い、論文自身が計算した相対的な伸びは、そのまま論文の記述として扱います。
合同会社謙虚は、3つのドメインを並行して運用し、何を変えると数字が動くかを測り続けています。この論文を読む理由は、キーワードの詰め込みなど従来のテクニックが、AIが生成した文章にはむしろ逆効果になり得るという結果を、記事づくりの前提として確かめておきたかったためです。
結論:3行で言うと
- ページの細かい書き換えではなく、統計の密度・出典の頻度・見出しの構成といった「特徴量」を先に決めてから文章を生成する手法(FeatGEO)を提案し、3種類の生成AIのすべてで、従来のキーワード追加や権威的な文体などの書き換え手法より高い引用の目立ち方を達成しました
- 実験で使ったAI生成の宣伝ページ(広告主ページ)に対しては、従来の書き換え手法9種類(キーワードの詰め込みを含む)がすべて、書き換えなしより目立ち方の値を下回りました
- 一方、人間が書いた既存ページに同じ書き換え手法を試した別の実験では、目立ち方の値が平均で上向きました。書き換えの効き方は、もとの文章の完成度によって逆転します
この論文の基本情報
| 項目 | 内容 |
|---|---|
| 題名 | Think Before Writing: Feature-Level Multi-Objective Optimization for Generative Citation Visibility |
| 著者 | Zikang Liu、Peilan Xu(2名。南京信息工程大学 人工知能学院、中国) |
| 公開日 | 2026年4月21日(arXiv初版v1) |
| arXiv番号 | 2604.19113 |
| 掲載/採択状況 | ACL 2026(第64回計算言語学会年次大会)にLong Paperとして採択・掲載。Proceedings, Volume 1: Long Papers, pp.20290-20303。DOI: 10.18653/v1/2026.acl-long.929 |
| 種類 | 学術研究。大学の研究室による発表で、企業の自社報告には当たりません |
| 実験データ/コードの公開先 | GitHub(論文にURLの記載あり) |
論文はこちらで読めます。arXiv(2604.19113)。
この論文が答えた問い
生成AIが回答の中で引用するページを、文章の細かい書き換えではなく、ページの性質そのものを狙って動かすことはできるのか。できるとして、それは内容の質を保ったまま実現できるのか。
これまでのGEO(Generative Engine Optimization、生成エンジン最適化)の研究は、キーワードを増やす、権威的な文体にするといった、文章そのものを直接書き換える手法が中心でした。
この分野の出発点になったGEO原論文の解説記事で扱った9つの手法も、この系統に入ります。
論文は、この方法には「なぜ効いたのかを説明しにくい」「引用の目立ち方と文章の質のどちらを優先するかを、細かく調整しにくい」という2つの弱点があると指摘し、文章を直接触る代わりに、ページを13個の性質(特徴量)にいったん抽象化してから最適化する、という発想に切り替えました。
どうやって調べたのか
実験の舞台
実験は、質問に対してAIが検索結果をもとに回答をまとめ、根拠にしたページを引用する一連の流れ(検索拡張生成、RAG)の中で行われました。
| 項目 | 設定 |
|---|---|
| 質問集 | GEO-Bench(Aggarwal et al. 2024が作成)。1万問、25分野、9つの元データセット(MS MARCOやNatural Questionsなど)から構成 |
| 検索と注入 | Google検索で上位5件のページを取得し、そこへ「広告主ページ」と呼ばれる宣伝目的の1ページを加えてAIに渡す |
| 回答生成AI(3種) | GPT-4o-mini、Gemini-2.5-flash、Qwen-plus。異なる生成AIでも同じ傾向になるかを確かめるため |
| 広告主ページを作るAI | GPT-4o-mini(全手法で共通・固定)。生成する能力の差が結果に混ざらないようにするため |
| 比較した手法 | (1)書き換えなし (2)従来のGEO手法9種 (3)AutoGEO-global (4)AutoGEO-instance (5)FeatGEO(提案手法) |
ここで押さえておきたいのは、実験で書き換えの対象になったのが、「広告主ページ」と呼ばれる宣伝目的の文章だったことです。
論文の付録には、このページを作らせるための指示文が載っており、ブランド名を毎段落入れる、驚くような統計を添える、期間限定を思わせる表現で急がせる、体験談を入れる、といった注文が明記されています。
会社のブログ記事や解説記事とは、前提になる文章の性格が異なります。
ページを13個の性質に置き換える
FeatGEOは、ページの文章を直接いじる代わりに、ページを3つの層・13個の性質(特徴量)で表します。
| 層 | 特徴量 | 意味 |
|---|---|---|
| 構造 | 導入部の要約 | 冒頭に要約段落があるか |
| 構造 | 見出しの階層 | 見出し・小見出しの階層と数 |
| 構造 | 箇条書きの密度 | 箇条書き・番号付きリストの頻度 |
| 構造 | 記事の長さ | 全体の長さ。内容の厚みを反映 |
| 内容 | 統計の密度 | データ・統計・割合の密度 |
| 内容 | 出典を示す頻度 | 権威ある情報源・機関・報告書への言及頻度 |
| 内容 | 引用の頻度 | 専門家や権威者からの引用の頻度 |
| 内容 | 独自情報の豊かさ | 他にない情報・差別化された内容の豊富さ |
| 内容 | 専門用語の密度 | 専門用語の使用頻度 |
| 言語 | 権威的な文体 | 断定的で説得力のある文体の強さ |
| 言語 | 読みやすさ | 言葉の平易さ |
| 言語 | 流暢さ | 文章の滑らかさ・論理的なつながり |
| 言語 | キーワードの集中度 | 中核となる語の反復の強さ |
それぞれの性質には目安となる数値の範囲がありますが、論文はこれを厳密な指定ではなく「おおまかな方向づけ」として扱い、実際の文章に起こす作業はAIに任せています。
この13個の数値の組み合わせを、NSGA-II(多目的最適化の手法の一つ)で探し、目立ち方と質の両方が高い組み合わせ(パレート最適な組み合わせ。
片方を犠牲にしないと他方を上げられない状態)を見つけていく流れです。
何を測ったか
評価は2種類です。目立ち方(Visibility)は、回答の中でその広告主ページを根拠にした文が、語数と位置(回答の前のほうにあるほど大きく数える)で見てどれだけの割合を占めるかで、GEO原論文と同じ考え方の指標です。
文章の質(Quality)は、AIが7つの観点(内容側の4つ:流暢さ・有用性・信頼性・構成、訴求側の3つ:独自性・魅力・回答全体への影響)で1〜5点をつけ、0〜1に正規化して合成し、百分率で表しています。
結果
従来の書き換え手法は、AI生成の宣伝ページには効かなかった
まず、3種類の生成AIそれぞれで、書き換えなし・従来のGEO手法・AutoGEO・FeatGEOの目立ち方(Visibility)を比べた結果です(論文の表2)。数値は百分率で、値が大きいほど回答の中でそのページが目立ったことを示します。
| 手法 | GPT-4o-mini | Gemini-2.5-flash | Qwen-plus |
|---|---|---|---|
| 書き換えなし | 13.34 | 8.89 | 5.20 |
| 従来のGEO手法9種(範囲) | 10.92〜12.21 | 4.62〜5.62 | 2.75〜3.72 |
| AutoGEO-instance | 12.12 | 7.04 | 4.25 |
| FeatGEO(提案手法) | 18.31 | 15.35 | 10.17 |
論文は、FeatGEOの伸びを書き換えなしとの相対値で示しています。GPT-4o-miniで37%、Geminiで73%、Qwen-plusで96%です(いずれも論文本文の記述)。
一方、従来のGEO手法9種は、キーワードの詰め込みを含めて3つの生成AIのすべてで、書き換えなしを下回りました。
AutoGEOの2種類も、同じく3つのすべてで書き換えなしを下回っています。
文章の質(Quality)は、FeatGEOが書き換えなしと比べて同等かそれ以上でした。GPT-4o-miniで79.17から81.52、Geminiで75.59から76.14、Qwen-plusで76.81から77.12と、いずれも上向いています。
審査するAIを変えても、評価は崩れなかった
質の評価をGPT-4o-mini単独に頼っていないかを確かめるため、論文はGemini-2.5-flashとClaude-3.5-Sonnetを別の審査役に立てて、同じ出力を採点し直しています。FeatGEOは両方で最も高い評価となり(Geminiで75.28点、Claudeで72.63点)、次点の手法をそれぞれ4.26点、0.53点上回りました。
人間が書いたページには、逆の結果が出た
論文は、AIが生成した宣伝ページとは別に、人間が書いた既存の競合ページに、同じ9つの書き換え手法を試す実験も行っています(表4)。ここでの書き換えなしの目立ち方は18.72%です。
| 手法 | 書き換え前 | 書き換え後 | 差 |
|---|---|---|---|
| 統計を足す | 18.72 | 21.05 | +2.33 |
| AutoGEO-global | 18.72 | 22.86 | +4.13 |
| 出典を示す | 18.72 | 19.84 | +1.11 |
| 引用を足す | 18.72 | 19.97 | +1.25 |
| 流暢さの改善 | 18.72 | 20.21 | +1.49 |
| 権威的な文体にする | 18.72 | 19.37 | +0.65 |
| キーワードを詰め込む | 18.72 | 19.44 | +0.72 |
| 専門用語を足す | 18.72 | 19.14 | +0.42 |
| やさしい言葉にする | 18.72 | 18.89 | +0.16 |
| 珍しい語を足す | 18.72 | 16.34 | -2.38 |
| 9手法の平均 | 18.72 | 19.71 | +0.99 |
9手法の平均は18.72%から19.71%へと、わずかに上向きました。最も伸びたのはAutoGEO-globalの22.86%(+4.13)で、下がったのは珍しい語を足す手法の1件だけです。
論文はこの逆転を、「すでに流暢な生成AI製の文章に対しては、書き換えが冗長さを増やし、生成AIが好む自然さを崩すため逆効果になりやすい。
一方、人間が書いた完成度の低い文章には、同じ書き換えが構造や文体の隙間を埋めて効きやすい」という考え方で説明しています。
ここで注意したいのは、FeatGEO自体は、この人間が書いたページの実験の対象外だという点です。
効いた性質・効かなかった性質
論文は、13個の性質のうち、どれが引用の目立ち方に効いたかを、1つずつ外して確かめる分析(図4)も行っています。
- 最も寄与が大きかったのは統計の密度と出典を示す頻度でした
- 引用の頻度・見出しの階層・記事の長さ・箇条書きの密度も、目立ち方をプラスの方向に押し上げました
- 流暢さとキーワードの集中度は、むしろわずかにマイナスの寄与でした。独自情報の豊かさも、場合によってはマイナスに働きました
教育分野の質問を例にした比較(表5)では、目立ち方を優先した組み合わせ(23.7%・質87.8)は引用や権威的な文体を強めに、質を優先した組み合わせ(8.4%・質92.7)は箇条書きの構成を強めにしていました。組み合わせ次第でどちらかに寄りやすいことを示す例です。
モデルの規模を変えても、優位性は保たれた
ページを生成するAIを、より小さなQwen3の3モデル(パラメータ数が4B・8B・14Bと異なる)に差し替えた実験でも、FeatGEOは一貫して書き換えなしを上回りました。論文は、モデルの規模による差より両者の差のほうが大きいとし、学習した特徴量の組み合わせが特定のモデルに依存しない性質を持つと解釈しています。
計算コストは軽くない
論文の付録によると、FeatGEOを1件のページに適用するのに、平均で約1,721秒(29分弱)、AIへの呼び出し366回、入力トークン約100万個を要します。このうち87.8%の時間は、多目的最適化を繰り返す段階に使われています。
論文自身が書いている限界
論文は最後に、限界を4つ挙げています。
- 実験は、候補が最初から「上位5件+広告主ページ1件」に固定された設定で行われました。検索で候補に入るかどうかを左右する、上流の検索・順位づけの仕組みは対象に含めていません
- 評価の材料は、AIによる生成と自動での引用判定です。実際のサービスでは引用の形式や振る舞いが変わり得るため、結果がそのまま当てはまるとは限らないと論文自身が述べています
- 文章の質はAIによる自動採点です。人手による評価とは食い違う可能性があり、生成AIが作る文章に誤った情報が混ざる可能性も、GEOの手法全般に共通する課題として残ります
- 最適化には何度もAIを呼び出す必要があり、計算コストが実験の規模を制限しています
加えて、この記事を書くために原文を読んで気づいた点があります。
- 実験の主な結果(表2)で書き換えの対象になったのは、AI(GPT-4o-mini)が生成した宣伝目的の「広告主ページ」です。人間が書いた既存ページへの効果は別の実験(表4)で調べられていますが、FeatGEO自体は含まれていません。人間が書いた実在のページへのFeatGEOの効果は、この論文からは確認できません
- 検証の範囲は英語圏のデータセットにとどまります。GEO-Benchの元になった9つのデータセットは、MS MARCOやNatural Questionsなど英語のものです
- 評価は自動化の範囲で完結しており、人手による評価は行われていません。ただし審査に使うAIを変えても、手法どうしの順位はおおむね保たれています
- arXivのcomment欄自体は「14 pages, 5 figures」のまま採択後も更新されていませんが、ACL Anthologyで採択・掲載を確認できます
- 著者は2名で、大学(南京信息工程大学)の研究室による発表です。自社製品の宣伝目的ではなく、学術研究として公開されています
この論文から、言えること・言えないこと
| 言えること(論文の設定で確認された) | 言えないこと(論文では確認されていない) |
|---|---|
| AI生成の宣伝ページに対しては、特徴量レベルの最適化(FeatGEO)が、従来の書き換え手法より一貫して高い引用の目立ち方を達成した | 人間が書いた実在のページに、FeatGEO自体を適用した場合の効果 |
| 同じAI生成ページに対しては、キーワードの詰め込みを含む従来の書き換え手法が、書き換えなしを下回った | 日本語のページでも同じ大きさで効くこと |
| 人間が書いた既存ページに対しては、同じ従来の書き換え手法がむしろ目立ち方を上げた | 今のChatGPTなど、実際に使われているサービスでの効果 |
| 統計の密度・出典を示す頻度・見出しの構成が、目立ち方への寄与が大きかった | 検索で候補に入るかどうかへの影響 |
| 特徴量の組み合わせの優位性は、生成AIのモデル規模を変えても保たれた | 足された統計や引用の内容が事実かどうか |
中小企業の視点で、どう受け取るか
ここからは論文の主張とは別の、私の読み取りです。
- この論文は、文章の言い回しを直す前に、記事に統計や出典、見出しの構成といった「性質」がそろっているかを先に確かめる、という順番を後押しする結果に読めます。13個の特徴量を自動で最適化する仕組みそのものを導入するかどうかは別として、記事を作る際の確認項目として持ち込む価値はありそうです
- すでに整った文章を、キーワード追加や権威的な文体などの小手先の技で書き換えることには、慎重になったほうがよさそうです。この論文の実験では、AIが生成した完成度の高い文章に対して、そうした書き換えはむしろ目立ち方を下げていました
- 一方、人間が書いた既存記事に統計や出典を足す作業は、この論文の別の実験では目立ち方を押し上げる方向に出ています。会社のブログ記事の多くは人間が主体になって書いているはずなので、こちらの結果のほうが実態に近い可能性があります
- この論文の実験対象は、ブランド名の反復や急がせる表現を含む「宣伝ページ」です。効いた要素をそのまま、比較や解説を目的にした記事に持ち込むと、宣伝色が強すぎると受け取られる恐れがあります
よくある質問
FeatGEOという手法は、既存のGEO(Generative Engine Optimization)の書き換え手法と何が違いますか
既存のGEOの手法は、キーワードを増やす、権威的な文体にするといった、文章そのものを直接書き換える方法でした。FeatGEOは、ページをいったん見出しの数や統計の密度など13個の性質に置き換え、その組み合わせを最適化してから、AIに文章として書き起こさせます。
文章を直接いじる前に、「何を、どれくらいの密度で書くか」を先に決める点が違いです。
FeatGEOで目立ち方が上がったのは、どんな文章に対してですか
AI(GPT-4o-mini)が生成した「広告主ページ」と呼ばれる宣伝目的の文章に対してです。人間が書いた既存のページにFeatGEO自体を適用した場合の効果は、この論文の実験には含まれていません。
FeatGEOの論文は、学会で発表された査読済みの研究ですか
はい。この論文は、ACL 2026(第64回計算言語学会年次大会)にLong Paperとして採択され、査読を経て掲載されています。
arXivのcomment欄自体は採択後も更新されていませんが、ACL Anthologyで掲載を確認できます。
まとめ:今日できる1つのこと
自社でよく読まれている記事を1本選び、統計・出典・見出しの3つがそろっているかを確認してください。この論文の実験で、目立ち方への寄与が最も大きかったのは統計の密度と出典を示す頻度でした。
数字や出典が足りない主張が見つかったら、元の資料で確かめられる範囲で1つだけ足し、確かめられない場合は断定をやわらげます。
この論文は、LLMO論文の一覧の一本です。ほかの論文の解説も、順次公開しています。
この記事に書いたことを、そのまま御社のページに
生成AIに引用されるページを、お話しいただくだけでお作りします。お時間をいただくのは初回15分のヒアリングだけです。まず1ページ、無料でお作りします。
OKが出るまで、何度でも直します。事実が違う、言い回しが硬い、この話は入れないでほしい。どれも遠慮なくおっしゃってください。何度お直ししても、追加の料金はいただきません。
これまでに127社にご利用いただきました。毎月ご依頼いただいている方の6割以上が、月10ページを選ばれています。料金はページに掲載しています。
ページを増やしても問い合わせが来ないなら、原因はページの外にあります。その場合は、下の入口からご相談ください。
自社のマーケティング課題を根本から解決しませんか?
ウェブサイトから要素を引き算し、訪れた人が迷わず次の一歩に進む形へ組み直す。初回60分のオンラインで御社のサイトを一緒に読み、どこから直すべきかをお伝えします。手順をまとめた無料の診断と解説動画もご用意しています。
初回は無料・60分・オンライン完結・その場で契約のお願いはいたしません


