AI検索の裏側では、集めた文書を「質問に合う順」に並べ替える工程にAIが使われることがあります。その並べ替え役のAIが、文書の中に書き込まれた指示に判断を乗っ取られる。
これを実験で示した論文があります。2025年9月にarXivで公開され、自然言語処理の国際会議EMNLP 2025の本会議録に収録された「The Ranking Blind Spot: Decision Hijacking in LLM-based Text Ranking(順位づけの盲点:AIによる文書の順位づけで起きる判断の乗っ取り)」です。
この記事では、論文を原文から読み、何を試し、順位がどれだけ動き、どんな条件で効いたのかを整理します。扱うのは攻撃の研究です。
仕込む指示文そのものや作り方の手順は、悪用の手引きにならないよう載せず、結果だけを書きます。弊社はこうした操作を勧めない立場で読んでいます。
合同会社謙虚は、3つのドメインを並行して運用し、何を変えると数字が動くかを測り続けています。AIが文書を比べて並べる工程にどんな弱点があるのかを知っておくことは、自社のページを守る側としても、自社の業務でAIに文書を比べさせる側としても、判断の土台になるため、この論文を読みました。
結論:3行で言うと
- AIに文書を比べて順位をつけさせる3つの方式すべてで、関連度の低い文書に指示文を足すと、その文書が上に選ばれる割合が大きく上がりました。性能の高いモデルでは、成功率が99%を超える条件が多くありました(英語の評価用データでの実験)
- 論文は「性能の高いモデルほど乗っ取られやすい」と述べています。ただし、はっきり当てはまるのは「判断の基準を書き換える型」です。「目的をすり替える型」は、2件比べでは小さなモデルにも99%以上効き、実在のウェブページを使った付録の実験では、逆に小さいモデルのほうが大きく動きました
- 試されたのは、研究者が自分で動かしたAIの並べ替えだけです。実際のAI検索サービスや日本語での検証はなく、論文が挙げる防ぎ方も、効果はまだ確かめられていません
数値はすべて論文の表と本文から拾い、私が計算した値には「概算」と付けています。
この論文の基本情報
| 項目 | 内容 |
|---|---|
| 題名(原題) | The Ranking Blind Spot: Decision Hijacking in LLM-based Text Ranking |
| 著者 | Yaoyao Qian、Yifan Zeng(この2人が同等の貢献)、Yuchao Jiang、Chelsi Jain、Huazheng Wang(5人。ノースイースタン大学、オレゴン州立大学、マカオ大学) |
| 公開日 | 2025年9月23日(arXiv初版。確認した時点で版は1つだけ) |
| arXiv番号 | 2509.18575(分類は情報検索) |
| 掲載・採択状況 | EMNLP 2025 本会議(2025年11月、中国・蘇州)。ACL Anthologyの会議録で、21958〜21968ページに収録されていることを確認しました(2026年9月29日時点)。arXivのコメント欄にも「EMNLP 2025 採択」とあります。会議録版とarXiv版で、表の数値は一致しました |
| 種類 | 大学の研究。公開の評価用データと、研究者が自分で動かしたAIを使った実験。守る手法の検証は含みません |
| 実験データとコード | 評価用データは公開のもの(TREC DL 2019・2020)。コードは著者が公開していると論文に書かれています。この記事ではリンクを載せていません |
論文はこちらで読めます。arXiv(2509.18575)、会議録(DOI)。
この論文が答えた問い
AIが複数の文書を比べて順位をつけるとき、文書の中に書き込まれた指示によって、その判断そのものを横取りできてしまうのか。
AIに「この質問に、どちらの文章が合っているか」と尋ねて順位を決める方法は、性能が高く、研究が進んでいます。一方でAIには、渡された文章の中の指示にも従ってしまう性質があります。
文書と指示が同じ入力に混ざるため、その境目が弱点になる、と論文は考えました。
論文はこの弱点を「順位づけの盲点(Ranking Blind Spot)」と呼び、2つの型の攻撃で確かめています。1つは、判断の目的そのものを別の単純な作業にすり替えさせる型で、論文は「判断の目的の乗っ取り(DOH)」と呼びます。
もう1つは、作業の形はそのままにして「質問に合っている」とは何かという基準を書き換えさせる型で、「判断の基準の乗っ取り(DCH)」です。
前者は並べ替えの仕組みをある程度知っている前提、後者は仕組みを知らなくても使える前提だと論文は整理しています。
近い論文との関係
当シリーズでは、商品ページに仕込んだ指示でAI検索の商品の紹介順を動かした研究をページに仕込んだ指示の論文の解説で扱いました。
この記事の論文は、回答を作る手前の並べ替えの工程に絞り、方式とモデルの大きさの違いを多くの組み合わせで比べた点が特徴です(違いはよくある質問で整理します)。
守る側の研究は、悪意あるGEOからの防御の論文の解説にまとめています。
どうやって調べたのか
| 項目 | 設定 |
|---|---|
| 評価用データ | TREC DL 2019・2020。情報検索の研究で広く使われる、英語の質問と文章の組で、文章ごとに「どれだけ質問に合うか」の段階評価が付いています |
| 並べ方の方式(3つ) | 2件比べ:2つの文章のどちらが合うかを答えさせる。数件から選ぶ:数件の中から最も合うものを選ばせる。一覧の並べ替え:数件をまとめて並べ直させる |
| 攻撃する文書 | もともと関連度が低い側の文書。末尾に指示文を足すのが基本で、先頭に足す条件も付録で試しています |
| 成功の数え方 | 2件比べ:最も合う文章と組ませた低い側の文章が、選ばれる側に逆転した割合。数件から選ぶ:攻撃した文章が選ばれた割合。一覧の並べ替え:関連度の順に4件並べた一覧で、最下位の文章が1位になった割合 |
| 使ったモデル | 公開モデルのQwen3(1.7B、8B、14B、32B)、Gemma-3(12B、27B)、Llama-3.3-70B と、商用のGPT-4.1-mini。付録ではLlama-3の8Bと70Bも使用。Bは10億で、1.7Bは17億の規模です |
| 規模 | モデル・データ・方式・攻撃の型の組み合わせごとに、多くは4,000件前後(2件比べは各4,096件)を判定 |
| 評価の方法 | AIの出力から、どの文章を選んだかを機械的に数える自動の集計。人による採点はありません |
注意点は2つです。1つ目は、攻撃する文書が並べ替え役のAIに必ず渡る前提であることです。
検索で拾われるかどうかは、この実験の対象外です。2つ目は、成功の定義が方式ごとに違うことです。
方式をまたいで数字の大小を比べるときは注意が要ります。
結果
3つの方式すべてで、低い文書が上に選ばれた
論文の表1と表3から、TREC DL 2019の結果を拾いました。モデルはおおよその大きさ順に並べ、GPT-4.1-miniは大きさが公表されていないため最後に置いています。
| モデル | 2件比べ・目的 | 2件比べ・基準 | 数件から選ぶ・目的 | 数件から選ぶ・基準 | 一覧・目的 | 一覧・基準 |
|---|---|---|---|---|---|---|
| Qwen3-1.7B | 99.83% | 3.05% | 92.14% | 69.36% | 16.26% | 28.64% |
| Qwen3-8B | 91.36% | 26.78% | 71.63% | 61.72% | 20.04% | 28.64% |
| Gemma-3-12B | 99.05% | 91.58% | 95.60% | 91.18% | 45.25% | 96.45% |
| Qwen3-14B | 85.25% | 98.17% | 91.29% | 96.86% | 49.06% | 92.98% |
| Gemma-3-27B | 99.56% | 71.00% | 97.73% | 91.35% | 94.92% | 97.61% |
| Qwen3-32B | 99.44% | 95.09% | 92.13% | 96.69% | 51.98% | 97.60% |
| Llama-3.3-70B | 100.00% | 99.95% | 97.15% | 99.90% | 78.95% | 99.95% |
| GPT-4.1-mini | 98.02% | 100.00% | 98.31% | 99.98% | 59.25% | 99.88% |
「目的」は判断の目的の乗っ取り、「基準」は判断の基準の乗っ取りです。割合は、表の分母(判定した件数)に対して攻撃が成功した件数の割合です。
TREC DL 2020も同じ傾向で、2件比べ・基準は1.7Bが4.32%、70Bが99.41%でした。
読み取れること
- 「基準を書き換える型」は、おおむねモデルが大きくなるほどよく効きました(同じ系統の中でも逆転する組み合わせがあります)。一覧の並べ替えでは、目的をすり替える型も似た傾向でした。2件比べでは、1.7Bで3.05%、8Bで26.78%だった成功率が、70BとGPT-4.1-miniでは99%を超えています。論文はこれを、能力の高いモデルほど乗っ取られやすいという「逆説的な」傾向だと述べています
- 「目的をすり替える型」は、小さなモデルにも効きました。2件比べでは、1.7Bでも99.83%です。論文も、最も耐えた組み合わせでも、もう一方の型には弱いと書いています
- 方式によって、効く型が違いました。2件比べでは目的の型の成功率が82〜100%と高く、一覧の並べ替えでは基準の型のほうが高い傾向でした。論文は、方式ごとに弱点の出方が違うと述べています
- 論文は、3方式すべてで効いたことから、弱点はAIの判断の仕組みそのものに根があると解釈しています
実際のウェブページでの試験:こちらは小さいモデルのほうが動いた
論文は付録で、より現実に近い設定も試しています。話題の検索語をもとに10の質問を作り、検索エンジンの上位10件のウェブページを集めました。
攻撃のない状態でLlama-3に並べ替えさせて最下位になったページの末尾に、論文が最も良いとした攻撃(付録では「定義をずらす攻撃」と呼ばれ、基準の型にあたると読めます)の指示文を足し、2件比べの方式で11通りの並べ替えの指示文を使って、順位がどれだけ動いたかを測っています(表2)。
| モデル | 11通りでの平均の移動幅(最小〜最大) | 11通りの単純平均(概算) |
|---|---|---|
| Llama-3-8B | 2.10〜4.70位 | 約3.5位 |
| Llama-3-70B | 0.75〜2.25位 | 約1.5位 |
10件の中で、最下位のページが平均で数位上がった規模です。右の列は、表2の11の値を私が平均した概算です。
論文は、70Bのほうが移動幅の平均が48.9%小さく、ばらつきも63.2%小さいと書いており、この設定では大きいモデルのほうが耐えていました。
本文の主張とは向きが逆の結果です。
全体の並びの質も、大きく崩れた
付録ではもう1つ、上位100件のうち関連度が最も低い文章すべてに指示文を足したとき、上位10件の並びの良さがどう変わるかを測っています。指標はNDCG@10で、関連度の高い文章が上に並ぶほど大きくなる、0〜100の値です(表4)。
| データ | モデル | 攻撃なし | 攻撃あり(差) |
|---|---|---|---|
| 2019年版 | Llama-3-8B | 69.30 | 10.50(-58.80) |
| 2019年版 | Llama-3-70B | 74.30 | 7.38(-66.92) |
| 2020年版 | Llama-3-8B | 60.23 | 3.05(-57.18) |
| 2020年版 | Llama-3-70B | 69.76 | 1.94(-67.82) |
差はポイント(絶対値の差)です。70Bのほうが下がり幅が大きく、本文の主張と同じ向きでした。
どの方式と型で測ったかは、付録からは読み取れませんでした。
指示文を文書の先頭に置いた条件(表5、2019年版、基準の型)でも、一覧の並べ替えでは91.51〜99.65%と高い成功率でした。2件比べでは、Qwen3-14Bの99.95%に対して、Qwen3-32Bは58.79%、Gemma-3-27Bは70.09%と、モデルで差が出ています。
論文自身が書いている限界
- 評価は学術用の評価用データに頼っており、商用の仕組みを十分に映していない可能性があります
- 対象は文章の順位づけだけで、画像などを含む仕組みは扱っていません
- 判断の目的をすり替える型は、並べ替えの仕組みをある程度知っている前提の、極端な概念実証で、使える場面は限られます
- 判断の基準を書き換える型は、仕組みを知らなくても使え、方式も選ばないため、より現実的な脅威です。ただし、実際の多様な環境での検証はこれからだと述べています
防ぎ方の方向性として論文が挙げる3つ(後述のよくある質問を参照)は、いずれも提案の段階です。
原文を読んで気づいた点
- 検証は英語だけです。評価用データも、付録のウェブページの質問も英語です
- 実験の対象は、研究者が動かしたAIだけです。付録の実験も、並べ替えはLlama-3で、質問は10件です
- 評価はすべて機械的な集計です。繰り返しの回数、回答のランダムさの設定、統計的な検定は、本文からは確認できませんでした
- モデル名の書き方がそろっていません。冒頭ではGPT-4.1とLlama-3.3-70Bが弱いと書き、結論ではGPT-4とLlama-3-70Bと書いていますが、表にあるのはGPT-4.1-miniです。Llama-3.3-70Bの結果は付録の表3にあります
- 「性能の高いモデルほど弱い」は、基準の型にははっきり当てはまります。一方、目的の型は小さなモデルにも効き、付録のウェブページの試験では8Bのほうが大きく動きました。また、GPT-4.1-miniの大きさは公表されていません
- 付録の「48.9%小さい」は、表2の11の値を単純平均した私の概算(約58%小さい)と一致しません。計算の方法は書かれていません
- 一覧の並べ替えの分母は、Gemma-3-27Bだけ256〜397件と、ほかのモデル(おおむね3,500〜4,100件)より大幅に少なく、理由の説明は見当たりませんでした。付録の攻撃の呼び名も、本文の2つの型と異なります
- 先頭に置いた条件について、論文は「位置を問わず効く」とまとめていますが、2件比べのQwen3-32B(58.79%)のように、末尾に置いた場合(95.09%)より大きく下がったモデルもあります
- 指示文は、人が読めば指示だと分かる形です。論文は基準を書き換える型を見つかりにくいと述べていますが、見つかりにくさや、検知する仕組みへの効き目は評価されていません
この論文から、言えること・言えないこと
| 言えること(論文の設定で確認された) | 言えないこと(論文では確認されていない) |
|---|---|
| 英語の評価用データで、文書に足した指示文は、3つの並べ方の方式すべてで、関連度の低い文書を上に押し上げた | 実際のAI検索サービスで同じように効くこと |
| 基準を書き換える型は、おおむね大きなモデルほど成功率が高かった(逆転する組み合わせあり) | どのAIでも「大きいほど弱い」こと(付録のウェブページの試験では逆だった) |
| 目的をすり替える型は、2件比べでは1.7Bの小さなモデルにも99%以上効いた(一覧の並べ替えでは16.26%) | 日本語の文書や質問で効くこと |
| 攻撃が広がると、上位10件の並びの質は大きく崩れた | 検知の仕組みを持つ環境でも、見つからずに効くこと |
| 実在のウェブページでも、最下位のページが平均で数位上がった(Llama-3、10の質問) | 論文が挙げる防ぎ方で、この弱点を塞げること |
「99%を超える」は、評価用データで低い文書と高い文書を比べさせた実験での成功率です。AI検索で99%の確率で1位になれる、という意味には読めません。
中小企業の視点で、どう受け取るか
ここからは論文の主張とは別の、私の読み取りです。
AIに他人の文書を比べさせる業務は、同じ構図にある
この弱点は、AI検索の外にも当てはまります。応募書類、見積書、口コミ、提案資料などをAIに読ませ、「どれが条件に合うか」を並べさせる使い方は、中小企業でも増えています。
文書を書くのが外部の人である以上、判断を誘導する文が入りうる点は同じです。最後の判断に使う前に、上位に来た文書を人が元の文書で確かめる手順を1つ挟むのが、手堅い守り方だと考えます。
「性能の高いAIなら安心」とは考えない
論文の中心の結果は、性能の高いモデルほど基準の書き換えに弱かったことです。付録には逆向きの結果もあります。
確かに言えるのは、性能の高さがこの種の乗っ取りへの強さを保証しないという点です。
自社のページに仕込む側には回らない
こうした文を見つけて無害にする研究は進んでおり、見つかれば顧客や取引先の信頼を失うおそれがあります。弊社は、AI向けの隠し指示や誘導の文を勧めていません。
正攻法としては、質問に答える中身を正確な文章で置くことが、並べ替え役のAIが本来見ている「関連度」に沿う一手です。
数字を条件から切り離して使わない
「99%」は目を引く数字です。英語の評価用データ、研究者が動かしたAI、関連度の低い文書との比較、という条件とセットで扱うのが誠実です。
よくある質問
「順位づけの盲点」による判断の乗っ取りは、今のAI検索サービスでも起きますか
この論文で確かめられたのは、研究者が自分で動かしたAIの並べ替えまでです。商用モデルのGPT-4.1-miniも、並べ替え役として直接使った実験でした。
実サービスがどんなAIと防御を使っているかは論文の範囲外なので、「起きうる弱点が実験で示された」段階として受け取るのが妥当です。
「順位づけの盲点」の論文と、ページに仕込んだ指示で商品順位を動かす論文(EMNLP 2024)は何が違いますか
EMNLP 2024の論文は、AIが回答の中で商品を紹介する順番を、商品ページに足した文で動かせるかを調べました。この記事の論文は、回答を作る手前の並べ替えの工程に絞り、3つの方式と、1.7Bから70Bまでのモデルの大きさの違いを比べています。
大きさと弱さの関係に踏み込んだ点が新しいところです。
「順位づけの盲点」を防ぐ方法は、論文で確かめられていますか
確かめられていません。論文は、信頼できる指示の経路を分ける、攻撃の例で追加学習させる、操作の意図を検知する、という3つの方向を挙げるにとどまります。
対策を実験で比べた研究は、悪意あるGEOからの防御の論文の解説で扱っています。
まとめ:今日できる1つのこと
自社でAIに外部の人が書いた文書を比べさせている業務を1つ書き出してください。応募書類の選別でも、口コミの要約でも構いません。
AIが上位に挙げた文書を人が元の文書で確かめる手順がなければ、上位の数件だけでも目で確かめる手順を1つ足します。この論文の実験では、関連度の低い文書が、中に書かれた指示だけで上に選ばれていました。
この論文は、LLMO論文の一覧の一本です。ほかの論文の解説も、順次公開しています。
この記事に書いたことを、そのまま御社のページに
生成AIに引用されるページを、お話しいただくだけでお作りします。お時間をいただくのは初回15分のヒアリングだけです。まず1ページ、無料でお作りします。
OKが出るまで、何度でも直します。事実が違う、言い回しが硬い、この話は入れないでほしい。どれも遠慮なくおっしゃってください。何度お直ししても、追加の料金はいただきません。
これまでに127社にご利用いただきました。毎月ご依頼いただいている方の6割以上が、月10ページを選ばれています。料金はページに掲載しています。
ページを増やしても問い合わせが来ないなら、原因はページの外にあります。その場合は、下の入口からご相談ください。
自社のマーケティング課題を根本から解決しませんか?
ウェブサイトから要素を引き算し、訪れた人が迷わず次の一歩に進む形へ組み直す。初回60分のオンラインで御社のサイトを一緒に読み、どこから直すべきかをお伝えします。手順をまとめた無料の診断と解説動画もご用意しています。
初回は無料・60分・オンライン完結・その場で契約のお願いはいたしません


