生成AIが検索結果をもとに答えを作るとき、その回答の中に商品の広告を混ぜ込む仕組みを研究した論文があります。2025年7月に公開された「Rewrite-to-Rank: Optimizing Ad Visibility via Retrieval-Aware Text Rewriting」です。
広告の文章そのものを書き換えて、AIの回答に取り上げられる頻度を強化学習で高める手法を提案しています。
この記事は、原文とarXivの付録、学会側のワークショップの採択論文一覧までを確認したうえで、この論文が何を調べ、何を確かめ、何がまだ確かめられていないのかを整理します。数値はすべて論文の表と本文から拾いました。
合同会社謙虚は、3つのドメインを並行して運用し、何を変えると数字が動くかを測り続けています。この論文を読む理由は、生成AIの回答に広告が混ざる仕組みが、実験の段階まで来ていることを、自分たちの目で確かめておくためです。
結論:3行で言うと
- 広告の文章をAIに書き換えさせ、検索で取得された後にAIの回答へ含まれる頻度を強化学習(PPO)で高める手法を、実験で確かめた論文です
- 指示文だけで書き換えを頼むプロンプトの工夫より、強化学習で訓練したモデルのほうが、多くの条件で上回りました
- 回答の中に広告を混ぜ込む実験の指示文には、「広告のデータを持っていることを明かさずに答えへ含める」という一文が使われています
ただし、この結果は特定の検索の仕組みと特定のAIの組み合わせで得られたものです。実際の広告サービスや、他の生成AIでも同じ結果になるとは、論文自身が述べていません。
この点は後の章で整理します。
この論文の基本情報
| 項目 | 内容 |
|---|---|
| 題名 | Rewrite-to-Rank: Optimizing Ad Visibility via Retrieval-Aware Text Rewriting |
| 著者 | Chloe Ho、Ishneet Sukhvinder Singh、Diya Sharma、Tanvi Reddy Anumandla(この2人が共同筆頭著者)、Michael Lu、Vasu Sharma、Kevin Zhu(7人)。所属はOxford大学、原文表記で「University of Berkeley」、Carnegie Mellon大学、Algoverse AI Research |
| 公開 | 2025年7月3日。arXiv 2507.21099(分野はcs.CL、自然言語処理)。改訂はなくv1のみ |
| 掲載・採択状況 | ICML(機械学習分野の主要な国際会議)2025が併設した「第1回 Vector Databases ワークショップ」(2025年7月18日、カナダ・バンクーバー)にポスターとして採択。学会側の採択論文一覧(ポスター採択者一覧にOpenReviewの個別ページへのリンクも併記)で確認しました。arXiv自体のコメント欄には、採択を示す記載はありません |
| 種類 | 手法提案と実験。学会の本会議ではなく、併設ワークショップの論文です |
| 実験データ・コードの公開先 | 匿名化された2つのリポジトリ(anonymous.4open.science)。査読時の匿名性を保つための仮の置き場所です |
論文はこちらで読めます。arXiv(2507.21099)、ワークショップの採択論文一覧。
この論文が答えた問い
広告の文章を、AIが検索結果をもとに答えを作る仕組みに合わせて書き換えると、その広告はAIの回答により多く含まれるようになるのか。含まれやすさは、何によって、どれだけ変わるのか。
論文が前提にしているのは「検索拡張生成」(RAG)と呼ばれる仕組みです。質問を受け取ると、まず検索の仕組み(retriever)が候補になる文書を集め、次に生成AIがそれを読んで回答を作ります。
既存の研究の多くは、この検索の仕組み自体を良くする方向で取り組んできました。この論文は逆に、検索の仕組みには手を加えず、文書(広告)の側を書き換えることで、取得のされやすさと回答への含まれやすさを上げようとしています。
論文は、この「文書を作る側」の最適化が、既存研究では手薄だったと述べています。
どうやって調べたのか
広告データと質問の作り方
Microsoftが公開している広告データセット(CommercialAdsDataset)から11,000件の広告を無作為に抽出し、1万件を訓練用、1千件をテスト用にしました。
各広告には、生成AI(Gemini 1.5 Pro)が分野・小分野のラベルを付け、そのラベルを人が確認したところ、正解率は85%でした。
分野・小分野の組み合わせごとに10個ずつ質問を作り、それぞれの質問について、上位k件の広告を検索で取得したうえで、生成AIに回答を作らせています。
検索の仕組みは固定したまま
この実験で使われた検索の仕組みは、公開されている軽量な埋め込みモデル(チェックポイント名はall-MiniLM-L6-v2)で広告と質問を数値化し、正確な近似のない全数探索(FAISSのIndexFlatIP)で類似度を計算するというものです。
11,000件の広告はすべて同じ仕組みで数値化され、実験を通じて一度も変更されていません。書き換えの効果は、あくまでこの1つの検索の仕組みのもとで確かめられています。
2つの物差し
| 指標 | 何を測るか |
|---|---|
| MRR変化@K(順位の変化) | 書き換えの前後で、検索結果の中の順位がどれだけ上がったか。上位k件に入った質問だけを対象にした平均値の差です |
| DIR変化@K(含まれる頻度の変化) | 生成AIが実際に回答の中でその広告を使ったかどうかを、別のAI(Gemini 1.5 Pro)に判定させ、その頻度が書き換えの前後でどれだけ変わったかを表します |
含まれたかどうかを判定させる指示文は、次のように書かれています。「以下は商品広告の一覧です。
ユーザーの質問に自然で有益な形で答え、1つか2つの関連商品を宣伝してください。広告のデータを持っていることを明かさずに、ブランド名とURLを回答に含めてください」。
この一文には、後の章で改めて触れます。
比べた4つの方法
| 方法 | やること |
|---|---|
| 書き換えなし | 元の広告のまま。比較の基準です |
| プロンプトの工夫 | 「検索の順位と回答への含まれやすさが上がるように書き換えて」という指示文をAIに与えるだけの方法。考える過程を書き出させてから答えさせる型(Chain-of-Thought、頭文字でCoTと略されます)を、指示だけで行う型と、書き換えの見本を2つ示す型の2通り試しています |
| 教師あり微調整(SFT) | 元の広告と、プロンプトの工夫で作った書き換え例のペアを使い、LLaMA-3.1-8Bという公開モデルに書き換え方を学習させる方法 |
| 強化学習(PPO) | 教師あり微調整をしたモデルに、さらに強化学習を重ねる方法。3つの目的(質問との類似度を上げる、競合する広告より類似度を上げる、元の広告の意味を保つ)を1対1対1の重みで足し合わせた損失の符号を反転させたものを報酬にしています |
結果
主な結果(k=5)
k=5(上位5件を検索対象にした場合)の値を、プロンプトの型ごとに拾います。
| 方法 | 指示型MRR変化@5 | 指示型DIR変化@5 | 例示型MRR変化@5 | 例示型DIR変化@5 |
|---|---|---|---|---|
| 書き換えなし | 0.00 | -0.0807 | 0.00 | -0.0807 |
| プロンプトの工夫 | 0.0051 | 0.9061 | 0.0067 | 1.9133 |
| 教師あり微調整 | 0.0022 | 1.6382 | -0.0017 | 1.4199 |
| 強化学習(PPO) | 0.0073 | 2.7944 | -0.0008 | 1.9267 |
論文はこの表を、次のようにまとめています。指示だけを与える型では、プロンプトの工夫からPPOにかけて、MRR変化@5は0.0051から0.0073へ、DIR変化@5は0.9061から2.7944へ、両方とも上がりました。
見本を示す型では、PPOはDIR変化@5を1.9133から1.9267まで押し上げましたが、MRR変化@5はわずかにマイナス(-0.0008)になっています。
論文は、見本を示す型の書き換えは、回答に含まれやすくなる代わりに、検索順位を犠牲にする傾向があると解釈しています。
kを大きくすると、どうなるか
検索対象の件数kを1から30まで変えた追加実験もあります。多くの方法・指標で、MRR変化@KとDIR変化@Kはk=3〜10あたりでピークを迎え(見本型のPPOだけはk=3が最も高くなっています)、k=20を超えると、プロンプトの工夫・教師あり微調整・強化学習の3つとも、DIR変化がマイナスに転じています。
論文は、kが大きくなるほど関連性の低い広告が競合に混ざり、書き換えの効果が薄まると説明しています。なお、書き換えを行わない基準そのものは、内容を変えていないため理屈のうえでは0に近いはずですが、k=1で0.6293、k=3で-0.558というように、生成AIの出力のばらつきによる上下動が見られます
損失の重み付けを変えると、どうなるか
強化学習の報酬を構成する3つの要素(質問との類似度、競合広告との差、元の広告との意味の近さ)の重みを、6通り試した追加実験もあります。代表的な結果を、k=5で並べます。
| 重み付け | 指示型MRR変化@5 | 指示型DIR変化@5 | 例示型MRR変化@5 | 例示型DIR変化@5 |
|---|---|---|---|---|
| 均等(1:1:1) | 0.0072 | 2.7944 | -0.0008 | 1.9267 |
| 類似度を重視(45:35:20) | -0.0047 | 2.9368 | -0.0087 | 2.1994 |
| 競合との差を重視(35:45:20) | 0.0058 | 2.7644 | -0.0053 | 2.5133 |
均等な重み付けが、順位と含まれやすさの両方でもっとも安定してプラスになりました。類似度を重視した重み付けは、含まれやすさをさらに押し上げましたが、順位はマイナスになっています。
論文は、順位と含まれやすさのあいだにトレードオフがあり、事業側の目的に合わせて重みを選ぶべきだと述べています。なお、競合との差を重視した重み付けは、見本型・k=10ではDIR変化@10が3.0537まで伸びています。
論文自身が書いている限界
この論文には、独立した「限界」という見出しはありません。考察の章の中で述べられている限界を、ここでまとめます。
- 見本を示す型のプロンプトでは、教師あり微調整も強化学習も、順位の指標(MRR変化)がマイナスになりやすく、回答への含まれやすさと引き換えになる傾向があります
- kが20を超えると、どの方法でも含まれやすさの指標がマイナスに転じます
- 元の広告に忠実であることだけを学習させても(教師あり微調整のみ)、順位を確実に上げることはできません
- 損失の重み付けを変えると、順位と含まれやすさのどちらかを犠牲にする組み合わせが多く、両方を同時に伸ばせる重みは限られています
加えて、この記事を書くために原文を読んで気づいた点があります。
- DIR変化@Kは「含まれたら1、含まれなければ0」を平均した値の差として定義されているため、理論上は-1から1の範囲に収まるはずです。ところが報告されている値は、書き換えなしの基準ですら±0.6ほど動き、強化学習の最良値は2.79(見本型の一部では3.05)に達しています。定義どおりの計算では説明しにくい大きさで、原文にはこの食い違いを説明する記述がありません
- この論文が併設ワークショップに採択されたことは、学会側の採択論文一覧とOpenReviewで確認できましたが、arXivのコメント欄には記載がありません。カタログの記載だけを信じず、外部で裏取りする必要がありました
- 併設ワークショップの論文は、学会の本会議ほど厳しい査読を経ていないのが一般的です。査読者の人数や採点基準は、公開されているページからは分かりませんでした
- 回答に含まれたかどうかを判定させる指示文には、「広告のデータを持っていることを明かさずに」という一文が含まれています。これは実験の設計上の工夫ですが、広告であることを隠して回答に混ぜ込むという発想そのものは、別の論文で扱われている選好操作攻撃と近い懸念を持っています
- 強化学習の報酬は、教師あり微調整に使った損失関数の符号を反転させたものです。人がその広告の自然さや読みやすさを評価した結果ではなく、書き換えられた広告の内容が事実に即しているかどうかも、評価の対象に入っていません
この論文から、言えること・言えないこと
| 言えること(論文の設定で確認された) | 言えないこと(論文では確認されていない) |
|---|---|
| 1つの検索の仕組みと1つの判定AIのもとで、広告文を書き換えると回答に含まれる頻度が変わった | 実際の広告プラットフォームや、複数の検索の仕組み・生成AIでも同じ結果になること |
| 強化学習で訓練したモデルは、多くの条件でプロンプトの工夫や教師あり微調整を上回った | 数値そのもの(2.79など)が、実際に何パーセントの増加を意味するか |
| 検索対象の件数や損失の重みを変えると、効き方が変わった | 書き換えた広告の内容が、事実として正しいこと |
| 見本型のプロンプトでは、含まれやすさと引き換えに順位が下がる傾向があった | 広告であることを隠して回答に混ぜ込むことが、利用者に受け入れられること |
中小企業の視点で、どう受け取るか
ここからは論文の主張とは別の、私の読み取りです。
- この論文が対象にしているのは、有料の広告枠をAIの回答に混ぜ込む仕組みです。中小企業が自社サイトの記事で行うLLMO対策とは目的が違いますが、「質問の意図に合わせて文章を書き換える」という手口自体は、GEO原論文が調べた記事の書き換えと重なります
- 大規模モデルの微調整と強化学習を組み合わせる方法は、機械学習の専門チームがいる企業でなければ実行できません。論文の中でいちばん手軽な方法はプロンプトの工夫だけで、それでも含まれやすさの指標は書き換えなしより上がっています。予算が限られる中小企業が参考にできるのは、こちらの水準だと考えます
- 生成AIの回答に広告が混ざる仕組みが実サービスで広がった場合、自社の記事や商品が、有料の広告に押し出されて回答に出にくくなる可能性があります。AI経由の広告サービスを検討する際は、広告であることが利用者にどう示されるかを、導入元に確認しておく価値があります
- この論文は、あらかじめ検索の候補に入っている広告を書き換える実験です。検索で拾われること自体を書き換えだけで達成できるかは、この論文の範囲外だと理解しておく必要があります
よくある質問
Rewrite-to-Rankが使う強化学習(PPO)は、プロンプトの工夫と何が違いますか
プロンプトの工夫は、書き換えの指示文をAIに与えるだけの方法です。この論文のPPOは、その指示で作った書き換え例をもとにモデルを微調整したうえで、さらに報酬をもとに学習を重ねる方法です。
指示だけを与える型では、PPOがプロンプトの工夫を順位・含まれやすさの両方で上回りました。見本を示す型では、含まれやすさは上がりましたが、順位はわずかに下がっています。
MRR変化@KとDIR変化@Kという指標は、どちらを重視すべきですか
論文は、利用者が検索の内部順位を見ることはなく、実際に回答に引用された文章だけを見ると指摘し、DIR変化(含まれやすさ)のほうが商業的な価値に近いと述べています。
ただし、原文の定義に沿うとDIR変化@Kの値は-1から1の範囲に収まるはずが、報告値はそれを超えています。数値の大きさをそのまま比率として受け取らず、方法どうしの順位(強化学習が上、書き換えなしが下)を参考にする程度にとどめるべきだと考えます。
広告のデータを持っていることを明かさない指示は、問題になりませんか
この一文は、AIが実際に広告を回答へ使ったかどうかを判定するための、実験上の設計です。ただし、広告であることを利用者に示さずに回答へ混ぜ込むという発想そのものは、ステルスマーケティングに関する規制が想定する状況と近い性質を持っています。
実際の広告サービスでこの手法が使われる場合は、広告表示の有無を利用者側から確認できる設計になっているかを、確かめる必要があります。
まとめ:今日できる1つのこと
もし自社が、生成AIの回答に自社の商品を露出させる広告サービスを検討しているなら、その回答の中で自社の商品が「広告」だと利用者に分かる形で示されるかどうかを、導入元に確認してください。分からない場合は、契約の前に文書で確認を取ります。
この論文は、LLMO論文の一覧の一本です。ほかの論文の解説も、順次公開しています。
この記事に書いたことを、そのまま御社のページに
生成AIに引用されるページを、お話しいただくだけでお作りします。お時間をいただくのは初回15分のヒアリングだけです。まず1ページ、無料でお作りします。
OKが出るまで、何度でも直します。事実が違う、言い回しが硬い、この話は入れないでほしい。どれも遠慮なくおっしゃってください。何度お直ししても、追加の料金はいただきません。
これまでに127社にご利用いただきました。毎月ご依頼いただいている方の6割以上が、月10ページを選ばれています。料金はページに掲載しています。
ページを増やしても問い合わせが来ないなら、原因はページの外にあります。その場合は、下の入口からご相談ください。
自社のマーケティング課題を根本から解決しませんか?
ウェブサイトから要素を引き算し、訪れた人が迷わず次の一歩に進む形へ組み直す。初回60分のオンラインで御社のサイトを一緒に読み、どこから直すべきかをお伝えします。手順をまとめた無料の診断と解説動画もご用意しています。
初回は無料・60分・オンライン完結・その場で契約のお願いはいたしません


