生成AIの検索では、回答の中で「引用されるかどうか」が、作り手に届く注目や信頼を左右します。そのため作り手は引用されやすい書き換えを競い、AIの側はそれを見抜いて抑えようとします。
2026年8月にarXivで公開された論文「Mechanism Design for Generative Engines: From Exploitation toward Win-Win Outcomes」は、この駆け引きの繰り返しをゲーム理論で描き、罰するだけの防御が行き詰まる理由と、作り手と利用者の両方が得をする仕組みを提案しました。
この記事では、登場人物と前提、提案された仕組み、結果、論文が言えていないことを原文から整理します。
合同会社謙虚は、3つのドメインを並行して運用し、何を変えると数字が動くかを測り続けています。AIの引用が「罰の強化」と「中身への加点」のどちらへ設計されうるかを知ることは、自社のページで何を直すかを決める前提になるため、この論文を読みました。
結論:3行で言うと
- 引用をめぐる作り手とAI(生成エンジン)のやり取りを繰り返しのゲームとして描き、操作を罰するだけの防御は、品質と操作の目印が絡み合うほど弱まり、全体の得がほとんど増えない状態に落ち着きうることを、近似した理論で示しました
- 提案された仕組み(VCR)は、罰に加えて、元の文書で裏づけが取れる事実を目立たせた書き換えに加点します。根拠のない「専門家推奨」のような付け足しは加点されません
- シミュレーションでは、VCRが9通りの条件すべてで総合点が最も高く、最も強い比較手法を平均12.1ポイント上回りました。ただし実サービスや実データでの検証はなく、査読前のプレプリントです
この論文の基本情報
| 項目 | 内容 |
|---|---|
| 題名(原題) | Mechanism Design for Generative Engines: From Exploitation toward Win-Win Outcomes(arXivの登録名。PDF本体の題名は「Mechanism Design for Generative Engine: From Exploitation to Win-Win Equilibrium」で、Engineが単数形なのと副題が異なります) |
| 著者 | Chen Xu、Zitian Guo、Chenyan Xiong(3人。所属はカーネギーメロン大学、カリフォルニア大学サンディエゴ校) |
| 公開日 | 2026年8月11日(arXivへの初版登録。2026年9月30日時点で版は1つ) |
| arXiv番号 | 2608.11390(分類は機械学習) |
| 掲載・採択状況 | arXivのプレプリント。arXivのコメント欄は空欄で、PDFにも学会名の記載がないため、査読前の段階と見られます |
| 種類 | 理論(ゲーム理論のモデル)と仕組みの提案、それを確かめるシミュレーション実験 |
| 実験データとコード | 公開先は論文に記載 |
論文はこちらで読めます。arXiv(2608.11390)、DOI(arXivが付与)。
この論文が答えた問い
引用を求める書き換えと、それを抑える防御を繰り返すと、何が起きるのか。罰するだけで足りないなら、どんな仕組みにすれば両者が得をする状態に向けられるのか。
論文によると、これまでのGEO(生成AIの回答で引用されるための最適化)の研究の多くは、1回の書き換えが効くかという片側の問題として扱ってきました。
実際には書き換えと防御は何度も応酬し、GEOが中身の改善から「防御ルールへの適応」へ変わるおそれがある、というのが論文の問題意識です。
論文はまず、通販の質問で5回のやり取りを再現しました。
作り手は既存の自動書き換え手法AutoGEO(AutoGEOの解説記事)を使い、AIは警告文を添える標準的な防御をかけています。
すると、書き換えた文書の質は早い回からマイナスに転じ、代表例の文書には根拠のない主張や作り話の細部が積み上がりました。論文は、こうしたエスカレートを「引用戦争(citation wars)」と呼んでいます。
どうやって調べたのか
登場人物と前提
| 登場人物 | 望むこと | 見えるもの |
|---|---|---|
| 作り手(論文の表記は供給者・クリエイター) | 自分の文書の引用を増やしたい。書き換えには手間、事実のずれ、見抜かれる危険というコストがかかる | AIの現在の防御ルール |
| 生成エンジン(検索して回答をまとめるAI) | 操作で増えた引用を抑えたい。まともな文書を誤って抑える誤検出は避けたい | 書き換え前と後の文書の組だけ。作り手の本当の書き換え方針は見えない |
| 利用者 | 質が高く、信頼できる回答がほしい | 論文は、利用者の得をエンジンの得と1つにまとめて扱う |
毎回、作り手は前回の防御を見て書き換え、エンジンは書き換え前後の組から手口を推定して防御を更新します。論文はこれを「繰り返しのシュタッケルベルク・ゲーム」(一方が先に手を決め、もう一方が応じる駆け引きのモデル)と呼びます。
各文書には、利用者の役に立つ「中身の質」と、引用を狙った表面的な「操作の度合い」があると仮定します。エンジンは質が高い文書ほど引用し、防御を強めるほど操作の度合いが高い文書を引用しにくくする、という単純な式で表されます。
提案された仕組み:VCR(検証できる中身への報酬)
VCRは verifiable-content rewards の略で、エンジン側に置く仕組みです。罰だけだった防御に加点を足し、「両側の誘因」にするのが狙いです。
- 加点:元の文書に裏づけがあり、書き換え後に目立つ位置へ出てきた事実・数値・出典名の数を、AIの判定役が数えます。加点には上限があります
- 罰:書き換え前後の組から作り手のいまの書き換えルールをAIで抽出し、ルールとの一致度に書き換えの大きさを掛けて「疑わしさ」とします。そこから加点を差し引きます
- ゆるい並べ替え:差し引き後の値が低い文書を、AIに渡す資料の前のほうへ並べ、確かめられる主張を優先するよう警告文を添えます。文書は削除しません
論文の例では、イヤホンの説明文で、元の文書にあった電池の持ち時間、汗への強さ、片耳の重さを前に出した書き換えが3件の加点を得ました。
元の文書に根拠のない「専門家推奨」「業界トップクラス」は加点されず、操作の目印の側に数えられます。
前の版がない新しいページは加点が0で、罰だけの防御と同じ扱いです。論文は2003〜2004年の先行研究を引き、ページの約40%は1週間以内に変わると述べています。
シミュレーションの設定
| 項目 | 設定 |
|---|---|
| データ | 通販の検索(E-COMMERCE)、一般的な事実の質問(GEO-BENCH)、調べもの型の質問(Researchy-GEO)の3種類。1問につき候補文書5件、テスト用は最大1,000問 |
| 回答を作るAI | 既定はGemini 2.5 Flash-Lite。ほかにGPT-4o-mini、Claude Haiku 4.5 |
| 作り手の書き換え手法 | 既定はAutoGEO。通販データでは、ほかに4手法(RAID、IF-GEO、SAGEO、統計を足す手法) |
| やり取りの回数 | 5回(確認のため8回まで延ばした実験もある) |
| 比べた防御 | 警告文型(疑わしさの表示、並べ替え、警告文)、除外型(疑わしい文書を外す)、語句除去型(GEO風の言い回しを機械的に消す)、VCR |
| 判定役のAI | ルール抽出と加点の判定はGPT-4o-mini |
指標は、書き換えた文書が回答の中でどれだけ、どの位置で引用されたかという「目立ち方」から計算します。
- 防御側の得(論文の表記はDef.):書き換えで増えた目立ち方のうち、防御で元に戻せた割合。論文はこれをエンジンと利用者の得として扱います
- 作り手の得(Welf.):書き換える前と比べた目立ち方の増減。マイナスは、防御が本来の露出まで削ったことを示します
- 総合点(Net):上の2つを同じ重みで足したもの
作り手の得が±5ポイント以内なら、書き換え前と「同等」とみなします。事前の繰り返し実行で、ばらつき(標準偏差)が約5ポイントだったことが根拠です。
結果
理論:罰だけの防御は、動きの止まった状態に落ち着きうる
理論は、ある点のまわりで式を近似した「局所的な」分析で、全体の均衡を示したものではないと論文自身が断っています。
- 品質と操作の目印が連動しているほど、エンジンにとって最適な防御は弱まります。罰すると役に立つ中身まで巻き添えになるためで、連動が境目を超えると最適な対応は「罰さないこと」に切り替わります
- 作り手の得を引用の量そのもので測る場合、もともと質の高い文書を書き換えの対象に選ぶほうが有利になりえます
- 防御の効き目は、手口の推定の正確さ、書き換えの大きさ、防御の強さの掛け算で決まり、作り手が適応するとどれも目減りしえます
合わせると、罰だけの防御は、中身の改善も操作も伸びしろを使い切り、やり取りを重ねても全体の得がほとんど増えない状態に近づきうる、というのが論文の結論です。
操作は罰しても、利用者の得に沿う行動に報いるものがない「一方向」の防御だからだと論文は説明しています。
VCRを足すと、加点が小さい範囲で、前提が成り立つ局所近似の上では、エンジンと利用者の側の得が増え、作り手の得は第1近似で変わらないと示しています。
前提は確かめられる中身の量が操作の度合いと無関係なことで、実験データでの相関は-0.05〜0.1でした。
既定の回答AIでの結果
論文の表1から、既定の回答AI(Gemini 2.5 Flash-Lite)での5回目の値を拾います。各欄は「防御側の得 / 作り手の得 / 総合点」で、単位はポイントです。
| 防御 | 通販の検索 | 事実の質問 | 調べもの型の質問 |
|---|---|---|---|
| 警告文型 | 2.7 / -2.0 / 0.7 | 3.4 / -3.5 / -0.1 | 0.8 / -0.7 / 0.1 |
| 除外型 | 50.2 / -50.8 / -0.6 | 33.8 / -33.1 / 0.7 | 63.8 / -63.3 / 0.5 |
| 語句除去型 | -1.0 / 0.0 / -1.0 | -0.1 / 0.3 / 0.1 | 0.2 / 0.2 / 0.4 |
| VCR | 14.4 / 2.2 / 16.6 | 11.4 / -3.3 / 8.1 | 8.0 / -1.7 / 6.3 |
- 除外型は、防御側の得を上げた分だけ作り手の得を削り、総合点は0前後でした。論文は「防御を、作り手の露出とほぼ1対1で引き換えにしている」と表現しています
- VCRは、作り手の得を±5ポイントの帯に収めたまま、防御側の得を8.0〜14.4ポイント確保しました
条件を替えても、部品を外しても
- 3つのデータと3つの回答AIの9通りすべてで、VCRの総合点が最も高くなりました。最も強い比較手法との差は平均12.1ポイントで、表1から私が計算し直しても約12.1ポイント(概算)でした
- VCRの総合点は、GPT-4o-miniで3.3〜9.7、Claude Haiku 4.5で20.3〜25.6でした。作り手の得は9通りすべて-4.8〜+2.2に収まっています
- 通販データで書き換え手法を5つに替えても、5回目のVCRの総合点は5.2〜24.4(図の数値)で、いずれも比較手法を上回りました
- 通販データでVCRの部品を外すと、罰なしで-1.8、加点なしで0.7、判定を並べ替えに使わず文章でAIに渡すだけで1.3でした。すべてそろうと16.6です
判定の手間をそろえても、並べ替えで効かせなければ差は出ませんでした。論文は、差を生んだのは判定の量よりも、罰と加点の両側の誘因だとしています。
文書の質と作り話
- 通販データで質をAIに採点させると、書き換えた文書の平均はVCRが0.760、他の防御が0.724〜0.741、回答の平均は0.520対0.506〜0.515でした。差は小さいものの、文書の5項目すべてと回答の平均で、VCRが最も高い値です
- 同じ質問と文書を追った事例では、警告文型の下で裏づけのない主張が4〜6件、作り話の害の指標が0.42でした。VCRでは1件、0.21でした
- 加点の拠り所を、作り手が用意した外部の「裏づけページ」に替えると、加点は0.287から0.026へほぼ消える一方、見つかる作り話も1書き換えあたり2.08件から1.28件に減りました。論文は、拠り所を書き換え前の文書に置くべきだとしています
どんな条件で、奪い合いが共存に変わるのか
理論と実験を論文の主張の範囲で整理すると、条件は次の3つです。
- 罰に加えて、利用者の得に沿う行動(元の文書で確かめられる事実を出すこと)に報いる加点を持つこと
- 加点の対象が操作の目印と切り離せること。論文は事実の単位に絞り、書き換え前の文書を拠り所にして満たしています(権威の表示に加点すると出典の捏造を招くとしています)
- 罰と加点の判定を、並べ替えで実際に効かせること
評価の重みにも条件があります。
VCRが最良になるのは、総合点での防御側の重みが、通販データで0.60未満、事実の質問で0.24〜0.57、調べもの型で0.20〜0.53の範囲でした。
論文自身が書いている限界
- 理論は局所的な近似で、実験は有限回のやり取りです。どちらも全体の均衡を示すものではないとしています
- モデルにはエンジン1つと作り手の集団1つしか登場しません。複数のエンジンの競争や有料の掲載は今後の課題です
- 加点は前の版との照合で、内容の真偽を確かめるものとは別物です。前の版にあった誤りも加点されうると書いています
- AIによる主張の数え方は誤りうるうえ、裏づけのある主張を繰り返したり分割したりして加点の上限に近づける余地が残ります
- ±5ポイントの帯は運用上の許容幅で、厳密な同等性の検定とは異なると明記しています。信頼できる外部の検証役は今後の課題です
原文を読んで気づいた点
- 実サービスと実データでの検証はありません。エンジンは研究者が組んだ仕組みで、回答AIにモデルを使っています
- 日本語での検証もありません。3つのデータはGEOの原論文とAutoGEOの研究で作られたもので、論文に日本語のデータは出てきません
- 評価は目立ち方の自動計算とAIによる採点だけで、人手の評価は含まれていません。判定役のモデルを替えても加点の大小関係は変わらなかった、という確認はあります
- 「利用者の得」は、主に書き換えで増えた目立ち方をどれだけ戻せたかで測っています。回答の質を直接採点した差は0.506〜0.520の範囲にとどまります
- 本文は「回答AIを替えたとき、総合点が厳密にプラスなのはVCRだけ」と書いていますが、表1ではClaude Haiku 4.5の語句除去型も3つのデータすべてでプラス(0.9〜3.7)です。本文と表が食い違っています
- 通販データでは、作り手の得の95%信頼区間の上端が5.4で、±5ポイントの帯をわずかに超えます(論文も認めています)
- 既定の書き換え手法AutoGEOは、この論文の最終著者を含む研究チームが提案したもので、VCRの罰の側もその手順を流用しています
この論文から、言えること・言えないこと
| 言えること | 言えないこと |
|---|---|
| このモデルとシミュレーションでは、罰だけの防御は効き目が薄れた | 実際のAI検索で「引用戦争」が起きている |
| VCRは9通りすべてで総合点が最も高く、作り手の得を±5ポイント以内に保った | 実際のAI検索がVCRのような加点を採用している、または採用する予定がある |
| 元の文書で裏づけられる事実を目立たせた書き換えは、この仕組みでは加点された | 事実を前に出せば、いまのAI検索で引用が増える |
| 警告文型の事例では、繰り返しの書き換えで作り話が積み上がった | 日本語のページや実在の業種で、同じ結果になる |
| 加点の拠り所は、書き換え前の文書に置くほうがよい | 書かれた事実の正しさを、この仕組みが確かめてくれる |
中小企業の視点で、どう受け取るか
ここからは論文の主張とは別の、私の読み取りです。
型で引用を取りにいく書き換えは、防御との追いかけっこになる
シミュレーションでは、エンジンが手口を学ぶたびに書き換えは別の見せ方へ移り、文書の質は下がっていきました。
型をまねる手間より、次の2つに時間を使うほうが、AI側の対策がどう転んでも損が小さいと私は受け取っています。
確かめられる事実を、本文の奥に埋もれさせない
提案された仕組みが加点したのは、元の文書にある仕様や数値、出典名を見つけやすい位置に出した書き換えでした。
実際のAI検索がこの仕組みを使う証拠は論文にありませんが、裏づけを示せる価格や条件を読みやすい位置に置くことは、人の読者にも役立つ方向だと考えます。
根拠を示せない修飾語と、AIの書き換えで増えた細部を点検する
論文の例で加点されなかったのは、「専門家推奨」のような根拠のない言葉でした。書き換えを重ねると根拠のない細部が増えていく事例も示されています。
AIで手直ししたら、元の原稿にない数字や固有名が増えていないかを、公開前に毎回確かめるのが安全です。
よくある質問
VCR(検証できる中身への報酬)は、GoogleやChatGPTなどの実際のAI検索で使われていますか
論文は仕組みの提案とシミュレーションで、実際のAI検索がVCRを採用しているとは書いていません。資料を並べて防御をかける部分は、研究者が組んだ仕組みです。
この論文の「引用戦争」と、選好操作攻撃の「囚人のジレンマ」は、何が違いますか
選好操作攻撃の論文は、作り手どうしが攻撃し合うと全体の推薦が減る構図を論じました。
有名ブランドへのひいきを調べた論文では、全社が同じ説得の文言を使うと1社あたりの得がほぼ0まで縮みました。
今回の論文は作り手とエンジンのやり取りに焦点を当て、エンジン側の仕組みで奪い合いの行き先を共存へ向けられるかを扱っています。
VCRのルールを知った作り手が攻略しようとすると、仕組みは崩れますか
作り手にVCRのルールを教えて最適化させた実験では、総合点は下がったものの、警告文型を大きく上回ったままでした。
加点されるのは確かめられる事実だけなので、攻略の近道が、確かめられる中身を実際に足すことになるためだと論文は説明しています。
まとめ:今日できる1つのこと
この論文は、罰だけの防御が行き詰まりうることと、確かめられる事実への加点で行き先を変えられることを、理論とシミュレーションで示しました。
実サービスでの検証は、これからです。
今日できることを1つ挙げるなら、主要なページを1つ開き、価格や仕様、条件のような確かめられる事実が本文の奥に埋もれていないか、根拠を示せない「No.1」「専門家推奨」が残っていないかを見直すことです。
これは私の読み取りに基づく提案です。
この論文は、LLMO論文の一覧の一本です。ほかの論文の解説も、順次公開しています。
この記事に書いたことを、そのまま御社のページに
生成AIに引用されるページを、お話しいただくだけでお作りします。お時間をいただくのは初回15分のヒアリングだけです。まず1ページ、無料でお作りします。
OKが出るまで、何度でも直します。事実が違う、言い回しが硬い、この話は入れないでほしい。どれも遠慮なくおっしゃってください。何度お直ししても、追加の料金はいただきません。
これまでに127社にご利用いただきました。毎月ご依頼いただいている方の6割以上が、月10ページを選ばれています。料金はページに掲載しています。
ページを増やしても問い合わせが来ないなら、原因はページの外にあります。その場合は、下の入口からご相談ください。
自社のマーケティング課題を根本から解決しませんか?
ウェブサイトから要素を引き算し、訪れた人が迷わず次の一歩に進む形へ組み直す。初回60分のオンラインで御社のサイトを一緒に読み、どこから直すべきかをお伝えします。手順をまとめた無料の診断と解説動画もご用意しています。
初回は無料・60分・オンライン完結・その場で契約のお願いはいたしません


