MENU
  • 料金
  • 会社案内
  • コンサル
  • お問い合わせ
  • 無料で1ページ頼む
AIO・LLMO・GEO対策の記事制作
合同会社謙虚
  • 料金
  • 会社案内
  • コンサル
  • お問い合わせ
  • 無料で1ページ頼む
  • 料金
  • 会社案内
  • コンサル
  • お問い合わせ
  • 無料で1ページ頼む
合同会社謙虚
  • 料金
  • 会社案内
  • コンサル
  • お問い合わせ
  • 無料で1ページ頼む
  1. ホーム
  2. LLMO
  3. LLMO論文
  4. 【LLMO論文解説】検索結果に紛れた攻撃文書を「文書同士の似かた」で外す防御GRADA|2つのデータで攻撃成功率を1割未満に(EMNLP 2025)

【LLMO論文解説】検索結果に紛れた攻撃文書を「文書同士の似かた」で外す防御GRADA|2つのデータで攻撃成功率を1割未満に(EMNLP 2025)

2026 9/30
2026年9月30日
中野輝規
検索結果に紛れた攻撃文書を文書同士の似かたで外す防御GRADA

AIが検索で集めた文書を読んで答える仕組みでは、攻撃用の文書を紛れ込ませると答えがゆがむことを、先行研究が示してきました。

この論文の実験でも、1件で攻撃の成功率が5割前後に達しました。今回読む「GRADA」は、これを防ぐ側の研究です。

2025年5月にarXivで公開され、同年11月のEMNLP 2025(自然言語処理の主要な国際会議)の本会議で発表されました。

考え方は単純で、検索で集めた文書同士の似かたを調べ、周りから浮いている文書を下に並べ替えます。この記事では、どの攻撃を、どのデータとAIモデルで、どこまで減らせたのか、正しい答えの精度がどれだけ保たれたのかを、原文の表から整理します。

合同会社謙虚は、3つのドメインを並行して運用し、何を変えると数字が動くかを測り続けています。AI検索の裏側でどんな文書が下げられる設計があり得るのかを知っておくことは、正当な記事づくりの方向を確かめる材料になるため、この論文を読みました。

目次

結論:3行で言うと

  • 検索で集めた10件の文書の「似ている度合いのつながり」を使って並べ替え、周りから浮いた文書をAIに渡す5件から外す防御を提案しています。追加のAI呼び出しや学習は要りません
  • GPT-3.5-Turboと質問集NQの組み合わせでは、最も強い版(質問への似すぎを割り引く版)で、攻撃成功率が55.7%から3.0%、98.0%から2.0%などに下がりました。攻撃下の正答率も33.3%から58.0%に戻りました
  • 一方で、複数の文書をつないで答える質問集(HotpotQA)では一部の攻撃が2割台残り、攻撃がないときの正答率も64.3%から50.0%に下がりました(最も強い版)。英語の研究用データでの実験で、実際のAI検索サービスでは試していません

この論文の基本情報

項目 内容
題名(原題) GRADA: Graph-based Reranking against Adversarial Documents Attack
著者 Jingjie Zheng、Aryo Pradipta Gema、Giwon Hong、Xuanli He、Pasquale Minervini、Youcheng Sun、Qiongkai Xu(7人。所属はメルボルン大学、エディンバラ大学、ユニバーシティ・カレッジ・ロンドン、モハメド・ビン・ザイード人工知能大学、マッコーリー大学)
公開日 初版は2025年5月12日。確認した版は2025年9月18日の第3版
arXiv番号 2505.07546(分野は情報検索)
掲載・採択状況 EMNLP 2025 本会議(2025年11月、中国・蘇州)。会議録の22244〜22266ページ。arXivのコメント欄に記載はなく、ACL Anthology(計算言語学の論文を収める公式の論文庫)の会議録で収録を確認しました
種類 防御手法の提案と、その効果を測った実験研究(大学の研究者による論文)
実験データとコード データは公開済みの質問集3つ。コードの公開先は論文に記載されています

論文はこちらで読めます。arXiv(2505.07546)、ACL Anthology(会議録)、DOI。

この論文が答えた問い

検索で集めた文書の中に攻撃用の文書が紛れ込んでいても、正しい答えの精度を落とさずに、その文書をAIに渡る前に外せるか。

対象は、RAG(検索拡張生成。AIが答える前に関連文書を検索し、それを読んで答える仕組み)です。

検索は「質問に似ている文書」を上位に拾うため、質問によく似せた攻撃文書が入り込むと、AIが誤った答えや不要な内容を出します。

論文によると、既存の対策には2つの限界がありました。

  • 検索結果を並べ替える既製の仕組み(リランカー)は、質問との関連を重視するため、質問に似せた攻撃文書を残してしまいます
  • 論文が「攻撃専用に設計された唯一の既存防御」と位置づけた方法は、攻撃をよく止める一方、正当な情報まで捨てて正答率が下がります

著者らは、攻撃文書が「質問には似ているが、ほかの正当な文書とは似ていない」点に目をつけました。論文が示した例では、似ている度合いは正当な文書同士で平均0.82前後、攻撃文書と正当な文書の間で0.35前後でした。

どうやって調べたのか

防御の仕組み

動き方を順に書きます。

  1. 質問に対して、AIに渡す件数(5件)の2倍にあたる10件を検索で集める
  2. 10件の文書を点に見立て、2つの文書が似ているほど太い線で結ぶ(点と線の図、グラフを作る)
  3. 検索エンジンのページランク(リンクの集まり方でページの重みを決める考え方)に着想を得て、多くの文書と太い線でつながる文書ほど点数が高くなるよう、点数を何度か受け渡す
  4. 点数の高い上位5件だけをAIに渡し、残りは捨てる

文書同士が「票を入れ合う」形で、内容の重なる正当な文書は票を集め、孤立した攻撃文書は票を集められません。2倍の件数を集めるのは、攻撃文書を少数派にしておくためだと論文は説明しています。

似ている度合いの測り方で、3つの版を試しています。

  • 文章の意味の近さで測る版
  • 共通する語の重なりで測る版
  • 語の重なりで測ったうえで、2つの文書がそろって質問に似すぎている場合は、その結びつきを割り引く版(論文の呼び名はHRSIM)

以下、「最も強い版」はこの3つ目です。

実験の舞台

項目 設定
質問集 英語の3種。NQ(一般知識を問う質問)、MS MARCO(検索エンジンに入力された質問をもとにした質問集)、HotpotQA(複数の文書をつないで答える質問)。答えが短く決まる質問を各100問、計300問
繰り返し 乱数を変えて3回。攻撃と防御の組み合わせ1つにつき900問分
検索の仕組み 文章の意味で文書を探す検索モデル(Contriever)。別の検索モデルでも追加で確認
答えを作るAIモデル 6つ。GPT-3.5-Turbo、GPT-4o、Llama3.1-8b-Instruct、Llama3.1-70b-Instruct、Qwen2.5-7b-Instruct、Qwen2.5-14b-Instruct
攻撃 先行研究の4種。検索の中身を知らない前提の2種(PoisonedRAG、PIA)と、知っている前提の2種(PoisonedRAGを強めた版、Phantom)。データベースに入れる攻撃文書は、1問につき1件
比べた相手 防御なし、既製のリランカー2種(HLATR、BGE-reranker)、攻撃専用の既存防御(文書ごとにAIに答えを出させ、その答えから語を集めて最終回答を作る方法)
指標 攻撃成功率(攻撃者が狙った答えが、AIの回答の中に含まれた割合)と、正答率(正解と完全に一致した割合)。どちらも機械による自動判定

攻撃の中身は種類の説明にとどめます。PoisonedRAGはAIに誤答を言わせる攻撃、PIAは紛れ込ませた指示で回答を誘導する攻撃、Phantomは質問に特定の条件がそろったときだけ働く攻撃です。

攻撃文書を1件にしたのは、元の研究の設定では検索結果が攻撃文書で埋まり、成功率が100%になって比べられなかったためです。数字はすべて「攻撃文書が少数派の状況」での結果です。

結果

質問集NQでは、攻撃成功率が数%まで下がった

論文の表1から、GPT-3.5-TurboとNQの結果を拾います。成功率は低いほど、正答率は高いほど良い数字です。

防御 PoisonedRAG 成功率 同 正答率 PIA 成功率 同 正答率
防御なし 55.7% 33.3% 98.0% 2.0%
既製リランカー(HLATR) 51.5% 35.5% 92.0% 4.0%
既製リランカー(BGE-reranker) 46.5% 43.5% 43.0% 35.7%
既存の攻撃専用防御 2.0% 54.0% 0.0% 48.0%
GRADA(意味の近さ) 26.1% 50.9% 2.0% 58.3%
GRADA(語の重なり) 13.5% 55.0% 12.0% 55.3%
GRADA(最も強い版) 3.0% 58.0% 2.0% 61.7%
  • 既製のリランカーは、BGE-rerankerのPIAへの効果を除き、攻撃をあまり止められませんでした
  • 既存の攻撃専用防御は、攻撃成功率では最も低い水準でした。ただし正答率はGRADAの最も強い版より約4〜14ポイント低く(差は私の計算)、論文は語を集める途中で情報が落ちるためと見ています
  • GRADAの最も強い版は、攻撃を止めつつ正答率も最も高くなりました(33.3%から58.0%)

質問集によって、効き方に差があった

最も強い版の攻撃成功率を、質問集ごとに並べます(GPT-3.5-Turbo、表1と表2。左が防御なし、右がGRADA適用後)。

攻撃 HotpotQA NQ MS MARCO
PoisonedRAG 59.0% → 10.0% 55.7% → 3.0% 46.5% → 8.5%
PoisonedRAGを強めた版 62.0% → 7.3% 55.0% → 4.0% 42.5% → 6.3%
PIA 100.0% → 27.0% 98.0% → 2.0% 88.0% → 1.0%
Phantom 99.0% → 23.0% 88.7% → 0.0% 67.7% → 0.0%
  • NQとMS MARCOでは、どの攻撃も10%未満まで下がりました
  • HotpotQAでは、PIAとPhantomが2割台残りました。論文は限界として、複数の文書をつなぐ問題でPIAとPhantomに弱いと書いています
  • HotpotQAでは、最も強い版以外の2つの版は、PoisonedRAGの成功率を59.0%から48.6%、45.0%までしか下げられませんでした。本文はこれを「約10%の低下」と書き、文書をまたいで推論する問題の性質によるものだろうと述べています

AIに渡す5件に攻撃文書が残った割合(付録の表7〜9)は、防御なしでNQとHotpotQAが94〜100%、MS MARCOが65〜99%でした。最も強い版では、NQで2〜13%、MS MARCOで1〜19%、HotpotQAで18〜26%に減っています。

ほかのAIモデルでも、同じ向きだった

付録の表11によると、PoisonedRAGとNQの組み合わせで、最も強い版の成功率はGPT-4oが29.3%から1.0%、Llama3.1-70b-Instructが56.7%から2.7%、Qwen2.5-7b-Instructが50.3%から5.3%、Qwen2.5-14b-Instructが43.3%から1.0%に下がりました。

検索モデルを替えた追加実験(表6)でも、PoisonedRAGの成功率は41.3%から5.3%に下がりました(この表には、使ったAIモデルと質問集の記載がありません)。

攻撃がないときの正答率は、質問集によって下がった

論文の表3から、攻撃がない普段の状態での正答率を拾います(GPT-3.5-Turbo)。

防御 HotpotQA NQ MS MARCO
防御なし 64.3% 58.6% 76.0%
既製リランカー(BGE-reranker) 68.0% 64.7% 78.3%
既存の攻撃専用防御 68.3% 48.0% 59.0%
GRADA(意味の近さ) 64.0% 61.0% 74.3%
GRADA(最も強い版) 50.0% 62.0% 75.3%
  • NQとMS MARCOでは、GRADAの正答率と防御なしとの差は、どちらの版も3.4ポイント以内でした(NQでは上がり、MS MARCOでは少し下がっています)
  • HotpotQAでは、最も強い版で64.3%から50.0%に下がりました。論文はこれを「大きな代償」と認め、防御の強さとの兼ね合いを今後の課題としています
  • 攻撃がない状態では、既製リランカーのほうがGRADAより正答率が高くなりました

処理の重さも比べています(表5)。1問あたりの防御だけの処理時間は、GRADAが0.02〜0.62秒、既存の攻撃専用防御が11.59秒でした。

GRADAは追加のAI呼び出しが要らないためです。

論文自身が書いている限界

  • 複数の文書をつないで答える問題に弱い:PIAやPhantomを十分に止められませんでした
  • 攻撃文書が少数派であることが前提:多数派を占めると効果は落ちます。検索のしかたを状況に応じて変える工夫が今後の課題とされています
  • 攻撃文書を増やすと効果が下がる:付録の実験(NQ、GPT-3.5-Turbo)で10件中の攻撃文書を増やすと、意味の近さで測る版は防御なしに近づきました。最も強い版は、半分が攻撃文書でも成功率を27%下げたと報告されています

原文を読んで気づいた点

  • 実際のAI検索サービスでは試していません。研究用の質問集から作った閉じたデータベースでの実験です
  • 日本語での検証はありません。質問集は3つとも英語です
  • 答えが1〜2語で決まる質問だけです。長い文章で答えるAI検索の回答とは形が違います
  • 判定はすべて自動です。人が回答を読んで確かめた評価はありません
  • 攻撃がないときの正答率の低下は、モデルによってもっと大きいことがあります。付録の表10では、最も強い版を使うと、Llama3.1-70b-InstructのHotpotQAで60.0%から32.0%、NQで66.7%から54.7%に下がっています。本文が触れたのはGPT-3.5-Turboの14ポイントだけです
  • 防御で成功率が上がった組み合わせもあります。PIAへの防御なしの成功率が5〜6%だったQwen2.5-7b-Instructでは、既製リランカーで14〜25%に上がり、GRADAの最も強い版もHotpotQAで8.7%でした(表13)
  • 要旨の「最大80%減」が、どの数字を指すのか特定できません。表には98.0%から2.0%のように80ポイントを超える組み合わせもあります。この記事では表の値をそのまま示しました
  • 表の転記に疑問のある箇所があります。表10は見出しが3モデルで中身は4モデル、うちQwen2.5-14b-InstructはHotpotQAとNQの列が全行同じ値です。表2でも、PoisonedRAGを強めた版の列で、既存の攻撃専用防御などの値が2モデルで同じです
  • 設定の選び方にも注意が要ります。割り引きの強さはNQとGPT-3.5-Turboの結果を見て選ばれ、同じ組み合わせが評価にも使われています
  • 査読を経た会議論文です。記事はarXivの第3版に基づきます。会議録版と表の数値が同じであることを確認しました

この論文から、言えること・言えないこと

言えること(論文の設定で確認された) 言えないこと(論文では確認されていない)
文書同士の似かたで並べ替えると、攻撃文書をAIに渡る前に外せる場合が多かった(攻撃文書が1件の条件) 実際のAI検索サービスで、同じように攻撃文書が外れること
NQとMS MARCOでは、4種の攻撃の成功率が10%未満まで下がった(最も強い版、GPT-3.5-Turbo) 攻撃文書が多数派になった状況でも守れること
既製のリランカーは、質問に似せた攻撃文書をあまり外せなかった 日本語の文書や、長い文章で答える形式でも同じ結果になること
攻撃を受けた状態の正答率は、防御なしより回復した 攻撃がない状態で、どのモデル・どの質問でも正答率が保たれること
追加のAI呼び出しなしで、防御部分の処理は1問あたり1秒未満だった(GPT-3.5-Turbo) 正当なウェブ記事が、この仕組みで不当に下げられないこと

「55.7%から3.0%」は、GPT-3.5-TurboとNQで狙った誤答が回答に含まれた割合の変化で、ほかの条件では数字が変わります。

中小企業の視点で、どう受け取るか

ここからは論文の主張とは別の、私の読み取りです。論文は、正当な企業サイトの記事がどう扱われるかまでは調べていません。

  • 「周りの正当な文書と内容が重なる」ことが、信頼の手がかりとして使われ得る。事実を正確に書いた記事は、同じ話題の信頼できる資料と自然に重なるので、こうした仕組みでは守られる側に入ると読めます(確度は中程度)
  • 正当でも、周りと食い違う記事は浮いて見える可能性がある。HotpotQAでは、答えに必要な文書まで下げられました。通説と違う主張を書くときは、違う理由の根拠と前提の説明を同じページに書くほうが伝わりやすいと考えます(論文は検証していません。確度は低め)
  • 検索語に寄せるだけの書き方は、防御の考え方と相性が悪い。最も強い版は、質問に似すぎた文書同士の結びつきを割り引きます。キーワードの詰め込みは、この種の設計の下では得にならないと読めます(確度は低め)
  • 自社でAIチャットを入れるときの確認項目になる。社内文書を読ませるAIチャットを導入するなら、AIに渡す前に怪しい文書を外す仕組みがあるかを確かめる価値があります。既製の並べ替えだけでは、攻撃文書は残りました

攻撃が実際に回答まで届くかを測り直した研究は、ページに仕込んだ指示はAIの回答まで届くかを3段で測った論文の記事で、並べ替えと回答生成の両方に手を入れる別の防御は、二段防御「GEO Defender」の論文の記事で読んでいます。

よくある質問

GRADAは、実際のAI検索サービスで使われている防御ですか

論文には、実際のサービスで使われているという記載はありません。実験も、研究用の質問集と研究者が組んだ検索の流れで行われています。

AI検索サービスがどんな防御を入れているかは、この論文の範囲外です。

GRADAのように文書同士の似かたで並べ替える防御で、正当な記事が下げられることはありますか

論文の実験では、起きています。攻撃がないHotpotQAの質問で、最も強い版を使うと正答率が64.3%から50.0%に下がりました。

答えに必要な文書まで下の順位に回されたためと読めます。論文もこの点を課題として認めています。

GRADAとGEO Defenderは、どちらも並べ替えの段階の防御ですが、何が違いますか

GRADAは、学習もAIの追加呼び出しもせず、文書同士の似かただけで並べ替えます。GEO Defenderは、並べ替え役のモデルに追加学習をし、回答を作る段階にも手を入れる二段構えです。

扱う攻撃も異なり、GRADAは誤った答えや指示を紛れ込ませる文書、GEO Defenderは見せ方を変えて引用を狙う文書が中心です。

まとめ:今日できる1つのこと

よく読まれている自社ページを1つ開き、書いてある事実が公的機関の資料や業界の一般的な説明と食い違っていないかを確かめてください。

誤りなら直し、意図した違いなら理由と根拠を書き足します。周りの信頼できる資料と話がかみ合う記事は、読者にとって信頼しやすく、この種の仕組みの下でも浮きにくいと考えられます(論文は正当な記事では検証していません)。

この論文は、LLMO論文の一覧の一本です。ほかの論文の解説も、順次公開しています。

この記事に書いたことを、そのまま御社のページに

生成AIに引用されるページを、お話しいただくだけでお作りします。お時間をいただくのは初回15分のヒアリングだけです。まず1ページ、無料でお作りします。

OKが出るまで、何度でも直します。事実が違う、言い回しが硬い、この話は入れないでほしい。どれも遠慮なくおっしゃってください。何度お直ししても、追加の料金はいただきません。

これまでに127社にご利用いただきました。毎月ご依頼いただいている方の6割以上が、月10ページを選ばれています。料金はページに掲載しています。

まず1ページ、無料で作らせてください

ページを増やしても問い合わせが来ないなら、原因はページの外にあります。その場合は、下の入口からご相談ください。

自社のマーケティング課題を根本から解決しませんか?

ウェブサイトから要素を引き算し、訪れた人が迷わず次の一歩に進む形へ組み直す。初回60分のオンラインで御社のサイトを一緒に読み、どこから直すべきかをお伝えします。手順をまとめた無料の診断と解説動画もご用意しています。

まず動画で詳しく見る(約30分)
無料診断を受ける

初回は無料・60分・オンライン完結・その場で契約のお願いはいたしません

LLMO論文
SEO対策 生成AI
よかったらシェアしてね!
  • URLをコピーしました!
  • 【LLMO論文解説】調べものAIは汚染された根拠を見抜けるか「HAE-GEO」|裏づけを装うほど見抜きにくい・10モデル(プレプリント)
  • 【LLMO論文解説】商品説明に紛れた順位操作を見抜けるか|既知の手口は大半を検出、新しい手口5種類は見抜けず(SCI-Defense・プレプリント)

この記事を書いた人

中野輝規のアバター 中野輝規

合同会社謙虚 代表社員。20代から、売る言葉だけを仕事にしてきました。電話営業で受話器を握っていた時代から、数千社のWEB集客に関わったいままで。詳しいプロフィールはこちら

この著者の記事一覧へ

関連記事

  • AIに買い物を任せる時代のサイト設計の枠組み
    【LLMO論文解説】AIに買い物を任せる時代のサイト設計の枠組み|試作の通販サイトで完全成功率49.3%→89.3%(ICEME 2026採択と記載)
  • 調べものAIは根拠のつながりで推薦を変えるか「EcoGEO」
    【LLMO論文解説】調べものAIは根拠のつながりで推薦を変えるか「EcoGEO」|1ページとの推薦率差は最大31.3ポイント(プレプリント)
  • 調べものAIは汚染された根拠を見抜けるか「HAE-GEO」
    【LLMO論文解説】調べものAIは汚染された根拠を見抜けるか「HAE-GEO」|裏づけを装うほど見抜きにくい・10モデル(プレプリント)
  • 報道の少ない紛争ほど、AIの答えは外れやすい
    【LLMO論文解説】報道の少ない紛争ほど、AIの答えは外れやすい|5つのAI・28の紛争・5,460件の回答を採点(プレプリント)
  • ChatGPT流入の伸びは施策の効果か、成長の追い風か
    【LLMO論文解説】ChatGPT流入の伸びは施策の効果か、成長の追い風か|対照ページで切り分けた1サイト分析(プレプリント)
  • AI検索の引用は、半分近くが出典で裏づけられていなかった
    【LLMO論文解説】AI検索の引用は、半分近くが出典で裏づけられていなかった|GEO登場前の初期監査(Findings of EMNLP 2023)
  • 中国語のAI検索4サービスは何を引用し、回答に何を出すか
    【LLMO論文解説】中国語のAI検索4サービスは何を引用し、回答に何を出すか|出典のブランドが回答に出たのは8.3%(プレプリント)
  • GEOの書き換えをBART微調整で自動化する試み
    【LLMO論文解説】GEOの書き換えをBART微調整で自動化する試み|旅行サイト限定・評価は50問(プレプリント、2025年7月)
最近の投稿
  • 温泉の集客は宿泊客と日帰り客の線引きで決まる 掲示ルールに沿うページの作り方
  • デザイナーの集客は作品集だけでは届かない 発注担当が社内で通せるサイトの作り方
  • 屋根の集客は見えない屋根を見せる会社が選ばれる 点検商法と疑われないサイトの作り方
  • 遺品整理の集客は遺族の迷いに先回りして決まる 広告頼みから指名へ移るサイトの作り方
  • 看板の集客は検索した先で決まる 見た人を来店につなぐ受け皿の作り方
最近のコメント
  • ホテルの集客は公式サイトで迷わせないことから 予約サイト頼みを抜ける直し方 に 温泉の集客は宿泊客と日帰り客の線引きで決まる 掲示ルールに沿うページの作り方 - 合同会社謙虚 より
  • 外壁塗装の集客は急がせない会社が選ばれる 下請けを抜けて直接の依頼を増やすホームページの作り方 に 屋根の集客は見えない屋根を見せる会社が選ばれる 点検商法と疑われないサイトの作り方 - 合同会社謙虚 より
  • 不用品回収の集客は料金の見せ方で決まる 当日の追加請求を疑われない業者のサイトの作り方 に 遺品整理の集客は遺族の迷いに先回りして決まる 広告頼みから指名へ移るサイトの作り方 - 合同会社謙虚 より
  • 外壁塗装の集客は急がせない会社が選ばれる 下請けを抜けて直接の依頼を増やすホームページの作り方 に 看板の集客は検索した先で決まる 見た人を来店につなぐ受け皿の作り方 - 合同会社謙虚 より
  • 【LLMO論文解説】回答が似ていても出典は重ならない|BaiduとGoogleのAI要約を英語と中国語の500問で監査(EMNLP 2026ワークショップ) に 【LLMO論文解説】海外のGEO・LLMO・AIO論文101本の一覧|原論文から最新研究まで、テーマ別に整理(随時更新) - 合同会社謙虚 より
  • 記事制作(KCW)
  • 売れるサイトはみな謙虚
  • サービス一覧
  • サイトの無料診断
  • 合同会社謙虚とは
  • 代表プロフィール
  • ブログ
  • お問い合わせ
  • プライバシーポリシー
  • 特定商取引法に基づく表記

© 合同会社謙虚

目次