ページにAIへの指示を仕込むと、AIのおすすめ順を動かせる。そうした「プロンプトインジェクション(AIへの指示の割り込み)」の論文の多くは、攻撃したページを最初からAIに渡して実験しています。
実際のAI検索では、ページはまず検索で拾われ、並べ替えを通ってから、回答を作るAIに届きます。
2026年5月にarXivで公開された「Can It Reach the Generator?」は、クイーンズランド大学などのチームが、既存の7つの攻撃を「検索、並べ替え、回答」の3段に通し、どの段階でどれだけ落ちたかを測り直した研究です。この記事では、攻撃の種類ごとの残り方と見張り役のAIの検知結果を整理し、攻撃の文面やすり抜けの工夫の具体は扱いません。
合同会社謙虚は、3つのドメインを並行して運用し、何を変えると数字が動くかを測り続けています。「ページに仕込めばAIに推薦される」という話が、実際の流れに近い条件でどこまで成り立つのかを確かめるために、この論文を読みました。
結論:3行で言うと
- 攻撃したページを回答AIに直接渡すこれまでの測り方は、攻撃の効果を大きく見積もっていたと論文は結論づけています。3段に通すと、並べ替えで10位だったページに仕込んだ攻撃では、平均で約2割が検索の上位10件から外れました
- 回答のおすすめ3件に攻撃した商品が入った割合は、勾配を使う攻撃3種で2%前後以下(最大2.5%)、指示で上書きする攻撃で約15%まで下がりました。40〜54%程度残ったのは、別のAIに文面を書き直させる型の攻撃だけでした(10位に仕込んだ場合、2つの検索方式の平均)
- 既製の見張り3種は、最も残った攻撃を見逃しました。一方、104問分のデータで追加学習した小さな見張りは、7種すべてでF1(見逃しの少なさと警告の正確さをまとめた指標)が90%以上でした(攻撃ありと無しが半々の条件。同じ7種で学習しています)
ただし、実験は研究者が組んだ流れで、1つのAIモデルと英語の商品データだけを使い、実際のAI検索サービスでは試していません。
この論文の基本情報
| 項目 | 内容 |
|---|---|
| 題名(原題) | Can It Reach the Generator? Investigating the Survival of Prompt-Injection Attacks in Realistic RAG Settings |
| 著者 | Yu Yin、Shuai Wang、Bevan Koopman、Guido Zuccon(4人。所属はクイーンズランド大学、オーストラリア連邦科学産業研究機構) |
| 公開日 | 2026年5月27日(第1版)。確認した版は5月28日の第2版 |
| arXiv番号 | 2605.28017(分類は暗号・セキュリティ、情報検索) |
| 掲載・採択状況 | arXivのプレプリント。要旨ページのコメント欄は「18ページ、図6点」だけで、採択の記載はありません。査読前の版として読みます |
| 種類 | 既存の攻撃の測り直し。論文は倫理の節で、新しい攻撃は提案していないと明記しています |
| 実験データ/コード | 公開先は論文に記載 |
論文はこちらで読めます。arXiv(2605.28017)、DOI。
この論文が答えた問い
ページに仕込んだ攻撃は、検索と並べ替えを通り抜けて、回答を作るAIまで本当に届くのか。届くなら、どの種類の攻撃が、どの段階でどれだけ残るのか。
RAG(検索で集めた文書をAIに読ませて答えを作る仕組み)への攻撃を調べた先行研究は、成功率を5割超、強いものでは8割前後と報告してきました。このシリーズで読んだページに仕込んだ指示で商品順位を動かす研究や、口コミ風の文章でおすすめ順を動かす研究も、その流れにあります。
論文は、これらに共通する測り方を「固定文脈」と呼び、2つの段階を飛ばしていると指摘します。1つは検索です。
攻撃で文書の中身が変わると、検索で拾われるかどうかも変わり得ます。もう1つは並べ替えです。
実際のRAGでは、拾った候補を並べ替え役(リランカー)が並べ直し、上位だけを回答AIに渡すのが一般的です。
どうやって調べたのか
実験に使った「3段の流れ」
| 段階 | 論文の設定 |
|---|---|
| 文書の集まり | 公開の商品検索データセット「ESCI」の米国向け(英語)。質問と商品の関連度を人が4段階で付けたもの。関連づけられた商品が40件以上ある質問1,294問から、検索方式ごとに200問を選んだ(共通する質問は55問) |
| 1段目:検索 | BM25(単語の一致で探す方式)と、bge-large-en-v1.5(意味の近さで探す方式)を別々に試した |
| 2段目:並べ替え | Qwen3-8B(公開されている80億パラメータ規模のAIモデル)が、候補をまとめて見て順位をつける方式(RankGPT方式)で上位10件を並べ替える |
| 3段目:回答 | 同じQwen3-8Bが、並べ替え後の上位5件だけを受け取り、おすすめの商品を3つ答える |
| 攻撃する文書 | 攻撃前の並べ替えで10位の商品と、6位の商品(回答AIに渡らなくなる最初の1件)。1回に攻撃するのは1件だけ |
| 規模 | 200問×2つの位置×2つの検索方式=800件の対象に、7つの攻撃をそれぞれ適用 |
商品は「題名」と「箇条書きの説明」だけで表されています。Qwen3-8Bについて論文は、並べ替えの性能が高い一方で攻撃に弱いことが先行研究で示されたモデルだと説明しています。
勾配を使う攻撃も、このモデルを標的に作っています。攻撃側に有利な条件を選んだ実験です。
比べた測り方と、3つの指標
同じ攻撃を、先行研究と同じ「固定文脈」(攻撃前の検索結果をそのまま使い、対象の文書だけを攻撃版に差し替える)と、「通し」(攻撃した文書で索引を作り直し、検索から回答まで全部を通す)で流しました。数えたのは次の3つです。
- 検索で残った割合:攻撃した文書が、検索の上位10件に入った割合
- 回答AIに渡った割合:並べ替えの上位5件に入った割合
- 回答に出た割合:回答のおすすめ3件に、攻撃した商品の題名が入った割合。題名が含まれるかを機械で判定し、人による評価はありません
7つの攻撃は、3つの型に分かれる
| 型 | 論文中の手法名 | ひとことで言うと | 元の論文の解説 |
|---|---|---|---|
| 指示で上書きする型 | IOA | AIのモデルに触れずに、文書に指示を付け足す | 順位づけの盲点 |
| AIに書き直させる型 | CORE-review、CORE-reason、TAP | 別のAIが、出力の反応を見ながら文面を繰り返し改良する | CORE、商品順位の操作 |
| 勾配を使う型 | RAF、SRP、STS | モデルの内部情報まで使って、短い文字列を最適化する | RAF、StealthRank、STS |
論文は各攻撃の設定値や文面の例も載せていますが、この記事では扱いません。
結果
並べ替え役は、攻撃を押し上げもし、切り落としもした
まず、検索は固定したまま並べ替え役だけを足しました(10位の文書を攻撃)。7つの攻撃すべてで、攻撃した文書の順位が上がりました。
並べ替え役もAIなので、仕込まれた文面の影響を受けます。
回答に出た割合は、並べ替えた10件をすべて回答AIに渡すと、並べ替えなしと比べて7つの平均で16.5上がり(勾配を使う型以外の4つは25.5、勾配を使う型は4.5)、上位5件に絞るとそこから4.6下がりました。
絞り込みで最も落ちたのはTAPの17.0です。これらの差は原文で「%」と書かれており、成功率どうしの差(ポイント)と読めます。
検索の段階で、約2割が落ちた
次に、索引を作り直して検索から通しました(表3)。10位を攻撃した場合、上位10件に残った割合は、2つの検索方式と7つの攻撃の平均で79.9%でした(固定文脈では前提として100%)。
残った文書も、並べ替え後の平均順位が1.95位下がりました。6位を攻撃した場合は、残った割合が88.5%、順位の悪化が1.23位と、落ち方が小さくなっています。
- 指示で上書きする型(IOA):残った割合は59.3%。付け足した指示が文書の中身を薄め、検索で拾われにくくなったと論文は分析しています
- AIに書き直させる型:CORE-reasonが94.8%、CORE-reviewが92.3%、TAPが88.3%。質問に関係する中身が残っていたため、と論文は述べています
- 勾配を使う型:STSが71.3%、SRPとRAFが76.8%で、約4分の1が落ちました
検索方式による差は、共通する55問で比べると、CORE-reasonを除いて目立ちませんでした。
回答まで届いた割合
回答のおすすめ3件に入った割合を、固定文脈と通しで比べました(表4、10位を攻撃)。各セルは「単語の一致で探す方式/意味の近さで探す方式」の順で、単位は%です。
| 攻撃(型) | 検索で残った割合(通し) | 回答に出た割合(固定文脈) | 回答に出た割合(通し) |
|---|---|---|---|
| IOA(指示で上書き) | 50.5/68.0 | 41.0/46.0 | 12.0/17.5 |
| CORE-review(書き直させる) | 89.5/95.0 | 51.5/58.5 | 46.5/47.0 |
| CORE-reason(書き直させる) | 91.0/98.5 | 44.5/54.5 | 48.0/59.0 |
| TAP(書き直させる) | 89.5/87.0 | 57.0/56.5 | 39.5/41.0 |
| SRP(勾配) | 74.0/79.5 | 2.0/2.5 | 1.0/1.0 |
| RAF(勾配) | 78.0/75.5 | 1.5/2.0 | 2.5/1.5 |
| STS(勾配) | 66.5/76.0 | 2.0/0.5 | 0.5/1.0 |
| 平均 | 77.0/82.8 | 28.5/31.5 | 21.4/24.0 |
- 通しで効果が残ったのは、AIに書き直させる型だけでした。2方式の平均で、CORE-reasonが約53.5%、CORE-reviewが約46.7%、TAPが約40.2%です
- 指示で上書きする型は、約14.7%まで下がりました。回答AIに渡った割合も、固定文脈の65.0/73.5%から、通しでは15.5/25.5%に落ちています
- 勾配を使う型は、固定文脈の時点で2%前後と弱く、通しでも2%前後以下(最大2.5%)でした。
- CORE-reasonだけは、通しのほうが約4ポイント高くなりました(2方式の平均)。書き直した文面が質問の内容に沿っていたため、検索がむしろ押し上げた、と論文は分析しています。検索は多くの攻撃には「ふるい」、質問に沿った攻撃には「増幅器」にもなる、というのが論文の見方です
付録には、6位を攻撃した場合の結果もあります(表11)。こちらは差が小さく、回答に出た割合の平均は、単語の一致の方式で34.3%から32.0%、意味の近さの方式では31.4%から34.1%と、通しのほうが高くなりました。
「3段に通せば攻撃が弱まる」は、主に10位を攻撃した場合の結果です。
見張り役のAIは、学習させると見分けられた
プロンプトインジェクションを見つける「見張り役」のAIも試しています。既製のLlama Guard 4(120億パラメータ)、Qwen3Guard(80億パラメータ)、Prompt Guard 2(8,600万パラメータ)と、Prompt Guard 2に攻撃例を追加学習させた版です。
追加学習には345問のうち104問を使い、半分は評価専用に分けています。条件は、攻撃ありと無しが半々の「釣り合った条件」と、上位10件に攻撃が1件だけの「実運用に近い比率(約1対9)」です。
| 攻撃 | Llama Guard 4 | Qwen3Guard | Prompt Guard 2 | 追加学習版(釣り合った条件) | 追加学習版(実運用に近い比率) |
|---|---|---|---|---|---|
| IOA | 21.0 | 1.5 | 95.6 | 98.6 | 79.2 |
| CORE-review | 11.3 | 1.0 | 0.5 | 98.1 | 84.4 |
| CORE-reason | 11.3 | 1.0 | 0.0 | 98.6 | 85.2 |
| TAP | 19.7 | 42.3 | 0.0 | 95.4 | 78.9 |
| SRP | 25.7 | 1.0 | 5.8 | 98.4 | 82.6 |
| RAF | 21.4 | 1.0 | 1.0 | 90.4 | 76.2 |
| STS | 73.8 | 1.5 | 80.6 | 98.6 | 82.1 |
数字は表5のF1(%)で、既製の3種は釣り合った条件の値です。
- 既製の見張りで、7種すべてに効くものはありませんでした。Prompt Guard 2は攻撃らしい目印が表に出るIOAとSTSは見つけましたが、書き直させる型の3つはほぼ見逃しました。通しで最も残ったCORE-reviewとCORE-reasonは、既製の3種すべてをすり抜けています
- Llama Guard 4とQwen3Guardは、実運用に近い比率で誤警報が大きく増えました。警告のうち無害だった割合は、最大で9割を超えます
- 追加学習版は、釣り合った条件でF1が平均96.9%でした。実運用に近い比率では平均81.2%で、警告のうち無害だった割合は平均約29.2%でした。論文は、これを無害な文書が9倍ある比率の影響だと説明しています
このほか論文は、並べ替え役と回答AIで反応しやすい入力の位置が逆だったことや、最後まで残った攻撃に共通する条件も報告しています。上で触れた「質問に沿った文面は検索に押し上げられる」という一般的な見方を超える具体は、攻撃の手引きになり得るため、この記事では紹介を控えます。
論文自身が書いている限界
- 流れの範囲:実際のサービスには、質問の書き換えや回答後の審査などが加わり得ます。この実験は最小限の構成です
- 分野:商品検索のデータだけです。医療や金融では、攻撃の残り方も影響の重さも変わり得ます
- 商品の表し方:題名と説明だけを使いました。実サービスは評価や口コミなど、攻撃者が偽りにくい情報も使うため、報告した効果も過大な可能性があると論文は認めています
- モデルが1系統だけ:並べ替えも回答もQwen3-8Bです。モデルを変えると攻撃前の順位が変わり、同じ商品で比べられなくなるため、モデル間の比較は行っていません
原文を読んで気づいた点
- 実際のAI検索サービスでは試していません。実サービスの検索や並べ替えが同じように攻撃を落とすとは、この論文からは言えません
- 日本語での検証はありません。データは米国向けの英語の商品検索です
- 攻撃なしで同じ商品が回答に出る割合は、表に示されていません。攻撃による上乗せ分は、表だけでは読み取れない点に注意が必要です
- 見張りの学習と評価には、同じ7種の攻撃が使われています。質問は分けていますが、学習していない新しい攻撃は試していません
- 原文の中に食い違いがあります。冒頭は追加学習版のF1を97.3%としていますが、本文と表5の平均は96.9%です。冒頭の「効果のある攻撃で成功率が平均13.8%下がった」も、表4からは再現できませんでした(上書き型と書き直させる型の4つで計算すると、約12.4ポイント)。並べ替え役に渡す件数も、本文は検索の上位10件、付録は上位40件と書いており、記事は本文に従いました
- 査読前のプレプリントです。結果は今後の改訂で変わる可能性があります
この論文から、言えること・言えないこと
| 言えること(論文の設定で確認された) | 言えないこと(論文では確認されていない) |
|---|---|
| 攻撃した文書を回答AIに直接渡す測り方は、3段に通した場合より攻撃を強く見せていた(10位を攻撃した場合) | 実際のAI検索サービスでも、同じ割合で攻撃が落ちること |
| 検索の段階で、10位を攻撃した文書の約2割が上位10件から外れた | 日本語のページや、商品以外の分野で同じ結果になること |
| 並べ替え役は、攻撃を押し上げる面と、上位5件への絞り込みで落とす面の両方を持っていた | AIの並べ替えを入れれば、攻撃が防げること |
| 通しで効果が残ったのは、AIに書き直させる型だった | その型が、評価や口コミも使う実サービスで効くこと |
| 同じ7種で追加学習した見張りは、高いF1で見分けた | 学習していない新しい攻撃も、同じ精度で見分けられること |
「約2割が落ちた」は、検索の上位10件に入った割合が平均79.9%だったという意味です。成功率の低下幅とは別の数字です。
中小企業の視点で、どう受け取るか
ここからは論文の主張とは別の、私の読み取りです。弊社は、ページに指示を仕込んでAIの推薦を操作することを勧めない立場で読んでいます。
- 「ページに一文仕込めばAIに推薦される」という話は、大きく割り引いて聞く。先行研究の高い成功率は、攻撃した文書が必ずAIに渡る前提の数字です
- 防御側から見た実質的な防壁は、「検索で拾われる段階」でした。並べ替え役そのものはAIで、むしろ攻撃に押し上げられています。上位5件への絞り込みは、その押し上げを一部打ち消しただけでした(+16.5に対して-4.6)
- 仕込みは、学習した見張りに見つかる方向にある。既製の見張りをすり抜けた攻撃も、少ない学習データで見分けられました。AI検索の運営側がこうした見張りを整えれば、仕込んだページは見つかる可能性が高いと考えます
- 自社でAIチャットや商品検索AIを入れるときの点検項目になる。AIに渡す件数を絞っているか、指示の混入を見張る仕組みがあるかは、導入先に確かめる価値があります
防ぐ仕組みそのものの提案は、並べ替えと回答生成の両方に手を入れる二段防御の論文の記事で読んでいます。
よくある質問
ページに仕込んだプロンプトインジェクションは、実際のAI検索サービスでも効くのですか
この論文は、実際のAI検索サービスでは試していません。研究者が公開モデルで組んだ3段の流れでは、10位の文書を攻撃した場合、多くの攻撃が大きく弱まりました。
実サービスでの効き方は、この論文からは分かりません。
固定文脈の実験で報告されたGEO攻撃の成功率は、間違いだったのですか
論文は、間違いとは呼んでいません。固定文脈は「回答AIに渡った後」の効果を測った数字で、そこまで届くかは測っていなかった、という指摘です。
プロンプトインジェクションの見張りAIを入れれば、GEO攻撃は防げますか
既製の見張り3種では防げませんでした。追加学習した見張りは、攻撃ありと無しが半々の条件では同じ7種の攻撃でF1が90%以上でしたが、新しい攻撃は試しておらず、実運用に近い比率では警告の約3割が無害な文書でした。
見張りは有力な手段の1つですが、単独で頼るのは早いと読めます。
まとめ:今日できる1つのこと
「AIに向けた指示をページに入れる」「AIの評価を操作する文面を足す」といった提案を受けたら採用しない、と今日のうちに社内で決めておいてください。
この研究の条件では、指示で上書きする型が回答まで届いた割合は約15%で、残った攻撃も学習した見張りに見分けられました。手間をかけるなら、自社のページが狙う質問に答える中身を持っているかを確かめるほうが、検索で拾われる1段目に正面から応えられます。
この論文は、LLMO論文の一覧の一本です。ほかの論文の解説も、順次公開しています。
この記事に書いたことを、そのまま御社のページに
生成AIに引用されるページを、お話しいただくだけでお作りします。お時間をいただくのは初回15分のヒアリングだけです。まず1ページ、無料でお作りします。
OKが出るまで、何度でも直します。事実が違う、言い回しが硬い、この話は入れないでほしい。どれも遠慮なくおっしゃってください。何度お直ししても、追加の料金はいただきません。
これまでに127社にご利用いただきました。毎月ご依頼いただいている方の6割以上が、月10ページを選ばれています。料金はページに掲載しています。
ページを増やしても問い合わせが来ないなら、原因はページの外にあります。その場合は、下の入口からご相談ください。
自社のマーケティング課題を根本から解決しませんか?
ウェブサイトから要素を引き算し、訪れた人が迷わず次の一歩に進む形へ組み直す。初回60分のオンラインで御社のサイトを一緒に読み、どこから直すべきかをお伝えします。手順をまとめた無料の診断と解説動画もご用意しています。
初回は無料・60分・オンライン完結・その場で契約のお願いはいたしません


