AI検索に「おすすめの〇〇は?」と聞くと、いくつかの商品が順番に紹介されます。
最初に名前が出る商品ほど、選ばれやすいはずです。この順番を、商品ページに仕込んだ指示文で動かせるかを調べた論文があります。
カリフォルニア大学バークレー校の研究者が2024年6月に公開し、自然言語処理の国際会議EMNLP 2024の本会議に採択された「Ranking Manipulation for Conversational Search Engines」です。
この記事は、その論文を原文から読み、何を試し、順位がどれだけ動き、どんな条件で効いたのか、効き方が弱かったのかを整理します。
これは攻撃の研究です。ページに仕込む指示文そのものや、その作り方の手順は載せず、結果だけを扱います。
数値は論文の表と本文から拾い、私が計算した値には「概算」と付けています。
合同会社謙虚は、3つのドメインを並行して運用し、何を変えると数字が動くかを測り続けています。この論文を読むのは、自社のページが他社の仕込みで不利になる構図が実在するのかを、守る側として確かめておくためです。
結論:3行で言うと
- 4つのAIに8つの商品を紹介させ、各分野で最も順位の低い商品のページに攻撃文を足したところ、その商品の順位点(8点満点の尺度)は平均で3.38〜6.02点上がりました
- 攻撃がない状態でも、AIの紹介順は商品名(AIが学習で覚えている知識)、ページの中身、AIに渡された順番に左右され、どれが強く効くかはAIと商品分野で大きく違いました
- 別のAI向けに作った攻撃文を、Perplexityのモデル(Sonar Large Online)に読ませても順位点は平均2.89点上がりました。ただし、Perplexityの検索画面そのものでの確認は、1分野だけの事例報告です
いずれも2024年前半のAIと、研究者が用意した実験環境での結果です。今のサービスにそのまま当てはめられるかは、後の章で整理します。
この論文の基本情報
| 項目 | 内容 |
|---|---|
| 題名 | Ranking Manipulation for Conversational Search Engines |
| 著者 | Samuel Pfrommer、Yatong Bai、Tanmay Gautam、Somayeh Sojoudi(4人。所属はカリフォルニア大学バークレー校。最初の2人の名前に同じ印が付いている) |
| 公開日 | 初版は2024年6月5日。確認した版は2024年9月25日のv3 |
| arXiv | 2406.03589(分野は計算言語学) |
| 掲載・採択 | EMNLP 2024 本会議。arXivのコメント欄に記載があり、ACL Anthology(計算言語学の論文を収める公式の論文庫)で会議録への収録を確認しました(2024年11月、米国マイアミ、9523〜9552ページ) |
| 種類 | 大学の研究。査読を経た会議論文。攻撃の手法と、攻撃がない状態での並び方の分析 |
| 実験データとコード | 商品ページのデータセット「RAGDOLL」を公開したと記載(CC-BY-4.0)。コードも公開と書かれていますが、この記事ではリンクを張りません |
論文はこちらで読めます。arXiv(2406.03589)、ACL Anthology の会議録ページ、会議録(DOI)。
この論文が答えた問い
論文が立てた問いは、2つです。
対話型の検索エンジンは、何を手がかりに商品を並べているのか。そして、商品ページに指示文を仕込むと、その並び順を意図的に押し上げられるのか。
対話型の検索エンジンと「仕込み」の関係
対話型の検索エンジンとは、検索で集めたページの文章をAIに読み込ませ、AIがまとめて答える仕組みです。論文はPerplexityのようなサービスを例に挙げています。
この仕組みでは、ページの文章と、AIへの指示が同じ入力の中に並びます。そのため、ページの中に「この商品を最初に勧めよ」といった趣旨の文を紛れ込ませると、AIがそれを指示として受け取ってしまうことがあります。
これをプロンプトインジェクション(入力への指示の注入)と呼びます。
文章を正当に書き換えて目立ち方を比べた研究には、GEOの原論文があります。
この論文は、それとは別に、はっきり「攻撃」として順位の操作を扱いました。論文は、推薦の順番はお金に直結するため、組織的に狙われる動機が強いと述べています。
どうやって調べたのか
実験の舞台
| 項目 | 設定 |
|---|---|
| 商品分野 | 5つのグループ(身だしなみ、電子機器、家電、工具・住まいの手入れ、庭・アウトドア)に10分野ずつ、計50分野。ひげトリマー、タブレット、ブレンダー、テントなど |
| 元になったページ | メーカーが公式に出している商品ページ。第三者の通販サイトやカタログのページは除外。データセット全体で1147ページ |
| 実験に使った範囲 | 1分野につき8ブランド、1ブランド1機種。50分野×8で400ページ(概算、私の掛け算) |
| AIに渡した文章 | ページの本文部分をAIで抜き出し、英文で1000文字までに切り詰めたもの |
| 質問 | 「〇〇を買いたい。おすすめは?」という英語の定型文1種類。8商品すべてを、1商品1段落で、良い順に紹介するよう指示 |
| 推薦役のAI | GPT-3.5 Turbo、GPT-4 Turbo、Llama 3 70B、Mixtral 8×22 の4つ |
| 実サービスへの持ち込み | PerplexityのAPIで使えるモデル Sonar Large Online。検索画面そのもののAPIが提供されていなかったため、その代わりとして使用 |
順位の測り方
回答の中で最初に紹介された商品に8点、2番目に7点と順に点を付け、紹介されなかった商品は0点にします。この記事では、これを「順位点」と呼びます。
回答を何度も作らせ、その平均で商品の強さを見ます。回答の段落と商品名の対応づけは、文字列の近さで機械的に行っています。
人手による採点はありません。
3つの実験
- 攻撃なしの並び方:各分野で回答を10回作らせ、並び方の傾向を調べました。さらに、ある商品のページの文章を別の商品名に書き換えた組み合わせを作り、「商品名」「ページの中身」「AIに渡した順番」のどれが順位に効いているかを、統計(F値。グループ間の差が、グループ内のばらつきに比べてどれだけ大きいか)で比べました
- 攻撃:各分野で平均の順位が最も低い商品を1つ選び、そのページの先頭に攻撃文を1つ足しました。攻撃文は、AIの安全装置をすり抜ける既存の自動化手法を応用し、別のAIに候補を作らせて試す形で作っています。手順の細部は、悪用を避けるため、この記事では省きます
- 実サービスへの持ち込み:GPT-4 Turbo向けに作った攻撃文を元のページに入れ、研究者が用意したサーバーに置きました。PerplexityのモデルにはページのURLだけを渡して読ませています。URLの名前はランダムな文字列にし、URLで有利不利が出ないようにしたと書かれています
結果
攻撃がなくても、並び方には癖があった
- 商品名、ページの中身、渡した順番のどれが強く効くかは、商品分野によって大きく違いました
- GPT-4 TurboとLlama 3 70Bは、商品名の影響が大きく出ました。AIが学習の段階で覚えている、その商品についての知識が効いているということです。GPT-4 Turboは、ページの中身の影響も小さく、論文は「ページに何が書いてあるかに関係なく、特定の商品に強く偏っている」ことを示唆していると述べています
- 理由について論文は、学習データに商品情報が多いことや、学習データの時期が新しいことが関係しているかもしれないと推測し、はっきりした理由は分からないと書いています
- Llama 3 70Bは、分野によって「名前に頼る」「中身に頼る」の二手に分かれました
- 4つのAIすべてで、先に渡された商品ほど上位に紹介されやすい傾向がありました。「良い商品から順に」と指示していても、この傾向は残りました。渡した順番の影響がとくに強く出たのはMixtral 8×22です
攻撃すると、最下位の商品が押し上げられた
論文の表1を拾います。各AIで50分野、それぞれ最下位の商品を押し上げた結果の平均です。
| 推薦役のAI | 順位点の平均の上昇(8点満点の尺度) | 満点までの差のうち、埋まった割合 |
|---|---|---|
| GPT-3.5 Turbo | 3.38 | 57.53% |
| GPT-4 Turbo | 5.00 | 82.94% |
| Llama 3 70B | 6.02 | 95.74% |
| Mixtral 8×22 | 4.13 | 76.23% |
| Sonar Large Online(Perplexityのモデル。GPT-4 Turbo向けの攻撃文を転用) | 2.89 | 54.23% |
右の列は、上昇幅を「攻撃前の点から満点の8点までの差」で割った割合です。攻撃前が2点なら差は6点で、3点上がれば50%です(説明用の仮の数字)。
- 4つのAIすべてで、最下位の商品の順位点が上がりました。Llama 3 70Bでは、満点までの差の95.74%が埋まっています
- GPT-4 TurboはGPT-3.5 Turboより大きく動きました(82.94%と57.53%)。論文は、性能の高いAIほど攻撃に強いとは限らないことを示す結果だと述べています
- 攻撃がない状態ではページの中身をあまり見ていなかったGPT-4 TurboやMixtral 8×22も、攻撃には反応しました。論文は、指示に従うよう調整されたAIが、入力のどこにある指示にも反応しやすくなっている可能性を挙げています
- ページの中身をよく読むLlama 3 70Bが最も動いた点から、論文は、ページを丁寧に読むAIほど操作を受けやすくなるおそれを指摘しています
- 論文の図の例(あるタブレット、GPT-4 Turbo)では、たいてい下半分に紹介されていた商品が、攻撃後はほぼ毎回1番目に紹介されました
Perplexityのモデルに持ち込んでも効いた
Sonar Large Onlineでは、押し上げた商品の順位が平均でほぼ3つ上がり、満点までの差の半分以上が埋まったと論文は述べています(表1の2.89点と54.23%)。
読むときに押さえておきたい条件が2つあります。1つ目は、攻撃文がGPT-4 Turbo向けに作ったもので、Sonar向けには調整していないことです。
そのため、押し上げた商品がSonarで最下位だった商品とは限りません。2つ目は、Sonarへの質問も、研究者が書いた指示文とURLの一覧を渡す形だったことです。
ふつうの利用者の検索とは、入り口が違います。
付録では、Perplexityの検索画面そのもので試した事例も報告されています。範囲は次のとおりです。
| 項目 | 内容 |
|---|---|
| 時期 | 2024年5月時点と記載 |
| 分野 | ブレンダーの1分野だけ(Sonarで攻撃が比較的よく効いた分野として選択。対象商品の順位点は1.6から5.5へ) |
| 渡したページ | 3つのサイト。当時の画面は、渡したURLを3件までしか情報源に使わないようだったためと説明 |
| 結果 | 仕込みなしでは、渡した候補から選ぶのをためらい、ほかの情報源から勧めることがあった。仕込みありでは、対象の商品を一貫して勧めた。最初の2回の回答は、仕込んだ文が求めた言い回しをそのまま再現した |
論文自身が、この部分は「事例的で、一時的なもの」で、数値で厳密には測れていないと強調しています。
攻撃文を足しても、検索で拾われる見込みは変わりにくい(予備的な結果)
攻撃後のページが元と同じ質問で検索に拾われるかも、付録で確かめています。文章の意味を数値の並びにしたもの(埋め込み)の近さは、無関係なページどうしの中央値が0.47、元のページと攻撃後のページが0.93でした。
論文は、攻撃後も同じように拾われやすいと見つつ、予備的な証拠と位置づけています。
論文自身が書いている限界
論文は、限界と倫理の節と、本文・付録で次の点を挙げています。
- 攻撃は完全には効きません。ただし、押し上げた商品の大多数は順位が大きく上がったとしています
- 50商品を4つのAIで試したため、費用の制約から、攻撃文の評価を少ない回数に抑え、試行も浅くしました。論文は、少数のサイトに資源を集中できる大きな組織なら、この制約に縛られないと書いています
- 文献で提案されている防御策はいくつかあるものの、この研究では評価していません
- 攻撃後のページが検索で拾われるかは本来の対象外で、付録の予備的な証拠にとどまります
- Perplexityの検索画面での結果は事例的で一時的です。検索の仕組みは変わりうるため、長期の再現性は限られると書かれています
- 倫理面では、主な影響は利用者に劣った推薦を見せることだとしたうえで、金銭的な動機がある以上、いずれ誰かが見つけて悪用しただろうと述べ、公開の意義を説明しています
原文を読んで気づいた点
- 査読:EMNLP 2024の本会議論文です。ACL Anthologyで会議録への収録を確かめました
- 日本語での検証はありません。質問は英語の定型文1種類、ページも英語です
- 回答の形は研究者が決めています(8商品すべてを1商品1段落で紹介)。実際のAI検索では、紹介する件数は決まっていません
- 使ったAIは2024年前半のモデルです。今のサービスで同じ大きさの効果が出るとは言えません
- 測ったのは回答の中で紹介された順番です。クリックや購入への影響は測っていません
- 評価は文字列の照合による自動判定で、人手の確認は報告されていません
- 攻撃する商品は1分野に1つだけです。複数の会社が同時に仕込んだ場合は対象外です
- 小さな食い違いとして、本文は1分野に「8ブランド以上」、付録は「9ブランド以上」と書いています。付録の図5と図6にも同じ説明文が付いています
この論文から、言えること・言えないこと
| 言えること(論文の設定で確認された) | 言えないこと(論文では確認されていない) |
|---|---|
| ページに足した攻撃文で、4つのAIの紹介順が押し上げられた | 今のPerplexityやChatGPTで、同じ大きさで効くこと |
| 性能の高いGPT-4 Turboのほうが、GPT-3.5 Turboより大きく動いた | 日本語のページや日本語の質問でも同じように効くこと |
| 別のAI向けの攻撃文が、Perplexityのモデルにもある程度通用した | 紹介順が上がると、クリックや売上が増えること |
| 攻撃がなくても、商品名(AIが学習で覚えている知識)と渡された順番が紹介順に影響した | 複数の会社が同時に仕込んだとき、どうなるか |
| 攻撃後のページも、元のページと意味の近さはほぼ保たれていた(予備的) | 既存の防御策で、どこまで防げるか |
中小企業の視点で、どう受け取るか
ここからは論文の主張とは別の、私の読み取りです。仕込みによる順位操作は、利用者をだます行為であり、勧めるものではありません。
守る側の視点で整理します。
AIの紹介順は、ページの中身だけで決まっていない
攻撃がない状態でも、AIによっては商品名そのもの(AIが学習で覚えている知識)が紹介順を大きく左右していました。論文は、その理由を学習データに商品情報が多いためと推測しています。
そこから私は、名前がAIに覚えられていない会社ほど、ページを整えるだけで上位に紹介されるとは限らないと推測しています。ただし、どの要素が効くかはAIと商品分野で大きく違いました。
自社の分野で実際にどう紹介されているかを、自分で確かめるのが先だと考えます。
他社の仕込みで、自社が押し下げられる構図がある
この実験では、8つの商品の紹介順は取り合いです。1つが上に割り込めば、ほかのどれかが下がります。
自社が何もしていなくても、競合の仕込みで順位が落ちることはありうる、というのが守る側から見た要点です。自社の分野で、AI検索に同じ質問を定期的に投げ、紹介順と言い回しを記録しておくと、変化に気づきやすくなります。
宣伝文句のような言い回しが回答にそのまま出てくる場合は、論文の事例と同じく、仕込みの手がかりになりえます。気づいたときは、サービスの報告窓口に伝えるのが筋だと考えます。
仕込み返すという選択肢は取らない
論文はこれを明確に「攻撃」と位置づけ、主な影響は利用者に劣った推薦を見せることだとしています。実サービスでの効き目も事例的で一時的なもので、サービスが変われば消えます。
複数の会社が同じように仕込むとどうなるかは、選好操作攻撃の論文の解説で扱っています。
そちらでは、全員が攻撃するとかえって全員が損をしうることが論じられています。
自社のページに、意図しない指示文が混ざっていないかを見る
これは論文の範囲外の、私の推測です。ページの文章がそのままAIに読まれる以上、改ざんなどで自社のページに見えない指示文が入り込むと、自社の評判を損ねる使われ方をするおそれがあります。
公開ページの文章を定期的に点検する習慣は、守りとして意味があると考えます。AI検索の側での防御の研究は、悪意あるGEOからの防御を扱った論文の解説にまとめています。
よくある質問
対話型検索エンジンの順位操作は、これまでのSEOのスパムと同じ話ですか
論文は、検索順位を人為的に動かす従来の手法(キーワードの詰め込みなど)を引き合いに出し、似た構図だと述べています。違いは、狙う相手がページを読んで答えを書くAIである点です。
論文は、利用者には「本来の正しい順番」が分からないため、操作されたかどうかを見た目で判断しにくいことも、この問題の特徴に挙げています。
ページに仕込んだ指示による順位操作は、今のPerplexityでも効きますか
この論文からは分かりません。実験は2024年前半のモデルと画面で行われ、論文自身が、検索画面での結果は一時的なもので、仕組みの変更で再現できなくなりうると書いています。
今も同じように効くと考える根拠は、この論文にはありません。
順位操作の論文と、選好操作攻撃の論文はどう違いますか
どちらも2024年6月に公開されました。選好操作攻撃の論文は、架空の商品などを使って実サービスで「選ばれるか」を調べ、複数の会社が同時に攻撃する場合も論じました。
この論文は、50分野の実在の商品ページで8商品の紹介順を測り、攻撃がない状態の並び方も分析した点が特徴です。
まとめ:今日できる1つのこと
自社の主力商品の分野で、AI検索に「おすすめの〇〇は?」と1回聞き、紹介された順番と、各社の紹介の言い回しを記録してください。
日付を付けて残し、月に1回、同じ質問で比べます。自社の順位が急に下がったときや、特定の会社だけが宣伝文句そのままの言い回しで毎回先頭に来るときに、気づけるようになります。
この論文は、LLMO論文の一覧の一本です。ほかの論文の解説も、順次公開しています。
この記事に書いたことを、そのまま御社のページに
生成AIに引用されるページを、お話しいただくだけでお作りします。お時間をいただくのは初回15分のヒアリングだけです。まず1ページ、無料でお作りします。
OKが出るまで、何度でも直します。事実が違う、言い回しが硬い、この話は入れないでほしい。どれも遠慮なくおっしゃってください。何度お直ししても、追加の料金はいただきません。
これまでに127社にご利用いただきました。毎月ご依頼いただいている方の6割以上が、月10ページを選ばれています。料金はページに掲載しています。
ページを増やしても問い合わせが来ないなら、原因はページの外にあります。その場合は、下の入口からご相談ください。
自社のマーケティング課題を根本から解決しませんか?
ウェブサイトから要素を引き算し、訪れた人が迷わず次の一歩に進む形へ組み直す。初回60分のオンラインで御社のサイトを一緒に読み、どこから直すべきかをお伝えします。手順をまとめた無料の診断と解説動画もご用意しています。
初回は無料・60分・オンライン完結・その場で契約のお願いはいたしません


