AIに「この話は本当か」を確かめさせる使い方が広がっています。AIは検索で集めた複数の記事を読み比べ、最後に1つの判定を出します。
では、集めた記事の中に、わざと誤った方向へ導くように作られた文書が混ざっていたら、判定はどこまで持ちこたえるのでしょうか。
2026年7月にarXivで公開された「GPE」は、この問いを測るための試験の場を作った研究です。
この記事では、GPEの論文を原文から読み、どんな問題を、どの確かめ方とAIモデルで、どの程度の汚染を混ぜて試したのかを整理します。
数値は論文の表から拾いました。汚染の作り方の具体は省き、評価と防御の側から読みます。
合同会社謙虚は、3つのドメインを並行して運用し、何を変えると数字が動くかを測り続けています。AIが根拠をどう束ねて判断するかは、正しい情報を出す側の私たちにとっても前提になる話なので、この論文を読みました。
結論:3行で言うと
- 英語の事実確認の問題638件で、AIに渡す根拠3件のうち汚染された文書を0件・1件・2件・3件と増やすと、正解率は全体として下がり、すべて汚染すると大きく落ちました(一部の組み合わせでは、途中の割合で横ばいやわずかな上昇もありました)。汚染なしで最も良い方式でも、正解率は5割台(6段階の判定を完全に当てる基準)でした
- 4種類の汚染のうち、本物らしい記事の要所(数量・日付・関係など)を書き換える型が、平均で最も大きく崩しました。すべて汚染した条件の平均正解率は9.2%です
- どの汚染にも強い方式はありませんでした。指示文のような文書に強かった方式も、内容の改ざんには弱く、汚染なしの成績から頑健さは読み取れない、と論文は結論づけています
いずれも、研究者が用意した根拠をAIに渡す実験環境での結果です。実際のAI検索サービスでは試されていません。
問題は英語で、日本語での検証は報告されていません。
この論文の基本情報
| 項目 | 内容 |
|---|---|
| 題名(原題) | GPE: Evaluating Robust Evidence Aggregation for Fact Verification under Controllable GEO-Style Poisoning |
| 著者 | Zhaoqi Wang、Zijian Zhang(責任著者)、Xiaomei Yuan、Pengtao Kou、Jiamou Liu、Zhen Li、Liehuang Zhu(7人。所属は北京理工大学、オークランド大学) |
| 公開日 | 2026年7月22日(確認した版はv1) |
| arXiv番号 | 2607.20730(分野はコンピュータセキュリティ) |
| 掲載・採択状況 | arXivのプレプリント(査読前の公開原稿)。arXivの注記欄に学会採択の記載はありません |
| 種類 | 評価用の問題集と評価の枠組みの提案、および比較実験 |
| 実験データとコード | 論文には「実装はコードを整えた後に公開する」とあり、確認した版では公開先は示されていません |
論文はこちらで読めます。arXiv(2607.20730)、DOI。
この論文が答えた問い
検索で集めた根拠の一部が、誤った結論へ導くよう作られた文書に置き換わったとき、AIの事実確認の方式はどれだけ正しさを保てるのか。方式によって、その崩れ方は違うのか。
背景にあるのは、GEO(生成AIの回答に取り上げられやすくするための工夫)の広がりです。論文は、同じ仕組みが悪用されると「GEOポイズニング(汚染)」になり、誤った根拠がAIの判断に入り込みやすくなると述べています。
GEOそのものは、GEOの原論文の解説で扱っています。
根拠の中には、古いもの、不正確なもの、同じ出どころの焼き直し、意図的な作り話が混ざります。その中から信頼できる信号を組み合わせる力を、論文は「根拠の頑健な集約」と呼びます。
既存の問題集の多くは主張と正解の組だけで、汚染の割合を変えて同じ条件で比べる仕組みがありませんでした。これが出発点です。
どうやって調べたのか
| 項目 | 設定 |
|---|---|
| 問題(主張) | 638件。政治、芸能、科学、医療・健康、歴史、生活の常識の6分野。事実確認を専門に行うサイト、報道機関、公的機関(WHOや米国の疾病対策センターなど)が公表した主張から集めた英語の問題 |
| 正解の付け方 | AIが根拠を読んで下書きの判定と理由を作り、人が主張・元の文書・AIの説明を確かめて確定する。下書きの判定は正解として使わない(確認した人数は論文に記載なし) |
| 判定の選択肢 | 6段階。正しい、ほぼ正しい、半分正しい、ほぼ誤り、誤り、判断できない |
| 根拠 | 主張ごとに、AIがウェブ検索、百科事典、論文検索、SNSの投稿、掲示板、報道機関のサイトなどを何度も調べて集めた文書。実験では、そこから関連する3件を選んでAIに渡す |
| 汚染の割合 | 0%、33%、67%、100%。3件のうち0件・1件・2件・3件を汚染された文書に置き換える |
| 汚染の種類 | 4種類(下で説明)。種類ごとに別々に置き換える |
| 確かめ方の方式 | 4つ(下で説明)。すべての方式に同じ3件を渡す |
| AIモデル | DeepSeek-V4-FlashとGPT-5.4の2つ |
| 回数と指標 | 各条件を638件すべてで1回ずつ評価。主な指標は、6段階の判定が正解と完全に一致した割合(正解率)。ほかに、使った文字の量(トークン)あたりの効率、分野別、細かい主張ごとの成績も報告 |
主張と正解は、汚染の割合を変えても同じです。論文はこの設計によって、成績の差を問題の難しさではなく、汚染の量と種類のせいだと言えるようにしています。
付属データとして、主張638件を、人物や組織などの項目22,611件、出来事789件、根拠の文書11,313件、発信元4,120件とつないだ関係図もあります。根拠の使い回しや、汚染の波及を調べるための材料です。
比べた4つの確かめ方
- Direct:AIが根拠を読み、1回で判定する
- RAFTS:根拠から「支持する議論」と「否定する議論」を組み立て、判定役がまとめる
- SAFE:主張を最小単位の事実に分け、1つずつ確かめる
- STEEL:根拠を何段階かに分けて評価してから判定する
4種類の汚染(種類の説明だけにとどめます)
- 生成型(原文ではFakeGPT型):AIに読ませることを狙った、滑らかで説得力のある誤った文章
- 検索対象への注入型(PoisonedRAG型):検索対象に攻撃用の文書が入り込んだ状況を再現したもの
- 改ざん型(ATA型):本物の報道や公的機関の文書を元に、判定を左右する数量・日付・人物・因果などを書き換えたもの。見た目は本物らしいまま、中身が正解と食い違う
- 指示文型(Ignore Injection):公式文書を装い、AIへの指示のような文で判定を誘導しようとするもの
結果
汚染なしでも、6段階を当てるのは難しい
まず、汚染を混ぜない条件の正解率です。最も良かったのは、DeepSeek-V4-FlashではDirectの52.7%、GPT-5.4ではSTEELの53.9%でした。
論文は「汚染なしでも6段階の判定は難しい」と書いています。「ほぼ正しい」と「正しい」のように隣り合う判定を取り違えても不正解に数えるので、数字は低めに出ます。
すべて汚染したときの正解率
論文の表1から、汚染なしと、3件すべてを汚染した条件(100%)の正解率を拾いました。単位は%です。
| モデル・方式 | 汚染なし | 生成型 | 注入型 | 改ざん型 | 指示文型 |
|---|---|---|---|---|---|
| DeepSeek-V4-Flash・Direct | 52.7 | 11.6 | 14.7 | 8.8 | 1.9 |
| DeepSeek-V4-Flash・RAFTS | 49.8 | 21.6 | 23.4 | 12.2 | 21.9 |
| DeepSeek-V4-Flash・SAFE | 46.2 | 4.7 | 3.4 | 5.6 | 2.0 |
| DeepSeek-V4-Flash・STEEL | 52.5 | 17.7 | 19.4 | 9.4 | 29.2 |
| GPT-5.4・Direct | 50.2 | 4.2 | 8.9 | 18.2 | 1.9 |
| GPT-5.4・RAFTS | 51.7 | 15.4 | 13.5 | 9.1 | 14.6 |
| GPT-5.4・SAFE | 49.2 | 3.8 | 5.8 | 4.4 | 2.8 |
| GPT-5.4・STEEL | 53.9 | 13.8 | 8.2 | 6.3 | 42.8 |
太字は、汚染ありの各列での、モデル・汚染の種類ごとの最高値です。
- 勝つ方式が、汚染の種類で入れ替わりました。DeepSeek-V4-Flashでは、生成型・注入型・改ざん型でRAFTS、指示文型でSTEELが最も高くなりました。GPT-5.4では、改ざん型の首位がDirectに移っています
- 汚染1件(33%)のときの首位も、100%のときと一致しません。DeepSeek-V4-Flashの33%では、生成型と改ざん型でDirect、注入型でRAFTS、指示文型でSTEELが首位でした。論文は「ある割合や、ある汚染への強さは、別の条件に確実には持ち越せない」とまとめています
- 主張を細かく分けて1つずつ確かめる方式(SAFE)は、汚染への備えにはなりませんでした。100%の条件では、どの種類でも2.0%〜5.8%でした。論文は、分けた一つひとつの確認が汚れた根拠を見ている限り、分解だけでは守れないと述べています
- 指示文型には、段階的に評価する方式(STEEL)が強く出ました。GPT-5.4では、汚染なし53.9%から100%で42.8%まで下がるにとどまり、Directは50.2%から1.9%まで落ちています。論文は、段階を踏む流れの中で指示のような文を見分け、不確かな根拠を絞り、最終判定を生の文書から切り離せるためだと説明しています
汚染が増えるほど下がる(改ざん型の例)
DeepSeek-V4-Flashで改ざん型を増やしたときの正解率です(図4、数値は表1)。4方式とも下がり続けました。
| 方式 | 0%(0件) | 33%(1件) | 67%(2件) | 100%(3件) |
|---|---|---|---|---|
| Direct | 52.7 | 39.2 | 30.4 | 8.8 |
| RAFTS | 49.8 | 31.5 | 26.5 | 12.2 |
| SAFE | 46.2 | 27.1 | 16.6 | 5.6 |
| STEEL | 52.5 | 30.6 | 22.7 | 9.4 |
3件のうち1件が改ざんされただけで、Directは13.5ポイント、STEELは21.9ポイント下がっています(表の値からの引き算、概算)。
最も効いたのは、本物らしいまま要所を書き換える型
2つのモデル・4つの方式を平均すると、すべて汚染した条件の正解率は、改ざん型が9.2%、生成型が11.6%、注入型が12.2%、指示文型が14.6%でした。33%・67%・100%を平均しても、改ざん型19.4%、生成型25.9%、注入型24.3%、指示文型29.6%で、改ざん型が最も低くなっています。
論文は、改ざん型が作り話や露骨な指示と違い、元の記事らしさを残したまま決め手になる事実だけを変える点に注目しています。そのうえで、決め手になる事実の意味の食い違いを確かめる仕組みが必要だと述べています。
ほかに報告されていること
- 分野別:汚染なしでも、分野で首位の方式が違いました(表3)。DeepSeek-V4-Flashでは、芸能と医療でDirect、歴史・生活の常識・科学でSTEELが首位です
- 細かい主張ごとの成績:人が判定を付けた355件の細かい主張で見ると、汚染なしの正解率の最高はDeepSeek-V4-FlashのSTEELで74.4%、GPT-5.4のSAFEで77.7%でした。GPT-5.4で指示文型を100%にした条件では、STEELが49.3%を保ち、ほかの方式は最高でも20.6%でした(表4)
- 費用:正しい判定1件あたりに使った文字の量(トークン)は、DeepSeek-V4-Flashの汚染なしでDirectが2.00千、STEELが2.89千、RAFTSが4.28千、SAFEが8.43千でした(表2)。Directは指示文型100%で69.96千に増えます。安い方式も、正解が減ると割高になるという指摘です
- すべて汚染しても0%にならない理由:AIがもともと持つ知識で答えられる問題、食い違う文書を退けられた場合、改ざんしきれなかった部分があるためだと論文は説明しています
論文自身が書いている限界
この論文には、限界をまとめた独立の節がありません。本文と結論の中で、論文自身が結果の範囲を区切っている記述を拾います。
- 汚染なしでも6段階の判定は難しく、最も良い方式でも正解率は5割台だったと書いています
- STEELの強さは指示文型に限った話で、生成型・注入型・改ざん型には弱いままだと明記しています
- 頑健さは、汚染なしの成績からも、1種類の汚染の結果からも推し量れないと結論づけています
- すべて汚染しても残る正解は、AIがもともと持つ知識と、信頼性の見分け(食い違う文書を退けるなど)を反映すると説明しています
このほか、設定として、各条件の評価は1回ずつで根拠の選び方は乱数の種で固定していること、実装はコードを整えた後に公開する予定であることが書かれています(公開先の記載はまだありません)。
原文を読んで気づいた点
- 日本語での検証は報告されていません。問題は、英語圏の事実確認サイト・報道機関・公的機関から集めた英語の主張です
- 実際のAI検索サービスでは試されていません。研究者が用意した3件の根拠を直接AIに渡す設定です。論文の枠組みには外部検索につなぐ仕組みもありますが、報告された実験は、問題集に付いた根拠を使う設定だけです
- 汚染文書が検索で拾われるかどうかは、測られていません。汚染は「渡す3件のうち何件を置き換えるか」で直接決めています。題名にある「GEO風」は脅威の想定を指していて、GEOで検索に拾われやすくなる過程までは試していません
- 採点は機械的です。AIの判定と、人が確定した正解が一致するかを自動で数えています。正解作りには人が関わっていますが、確認した人数や一致の度合いは書かれていません
- 査読前のプレプリントです。arXivの注記欄に採択の記載はなく、確認した版はv1です。本文には誤字や文の乱れが残っています
- 6段階の判定を当てずっぽうで選ぶと、単純計算で約17%(6分の1、概算)です。すべて汚染した条件の多くはこれを下回っていますが、正解の判定がどの段階に何件あるかは書かれていないので、厳密な比較はできません
- 費用の表(表2)はDeepSeek-V4-Flashの値だけです。GPT-5.4も「同じ傾向」と書かれていますが、数値は示されていません。分野別の崩れ方(図5)も図だけで、数値の表はありません
この論文から、言えること・言えないこと
| 言えること(論文の設定で確認された) | 言えないこと(論文では確認されていない) |
|---|---|
| 渡す根拠3件のうち汚染された文書が増えるほど、全体として正解率が下がり、すべて汚染すると大きく落ちた(一部の組み合わせでは途中の割合で横ばい・わずかな上昇もあった) | 実際のAI検索サービスで、同じ割合で判定が崩れること |
| 本物らしい文書の要所を書き換える型が、平均で最も大きく崩した | 日本語の情報でも同じ順番になること |
| どの汚染にも強い方式はなく、首位は汚染の種類と割合で入れ替わった | ここで試していないAIモデルや確かめ方でも同じ結果になること |
| 段階的に評価する方式は、指示文型の汚染に比較的強かった | その方式が、内容の改ざんまで防げること |
| 汚染なしの成績が良くても、汚染への強さは保証されなかった | 汚染文書が検索でどれだけ拾われるか(この論文では測っていない) |
中小企業の視点で、どう受け取るか
ここからは論文の主張とは別の、私の読み取りです。論文は英語の実験環境での結果なので、日本の実務にはそのまま当てはめず、考え方の材料として使います。
1. AIで事実を確かめるときは、数字と日付を元の資料で見る
この実験で最も判定を崩したのは、本物らしい文書の数量や日付だけを書き換える型でした。見た目の信頼感と中身の正しさが別物になる場面です。
取引先の情報や制度の条件をAIに確かめさせたときは、示された出典を開き、決め手の数字と日付を一次資料と照らすのが、手間に見合う確認だと考えます。
2. 発信する側は、自社の決め手になる事実を自社サイトに正確に置く
論文の設定では、渡した根拠のうち正しい文書の割合が高いほど、正解率も高く残りました。検索で何が拾われるかはこの論文の範囲外ですが、正しい一次情報が見つかる状態を作っておくことは、AIが正しい根拠を手にする前提になると私は読んでいます。
価格、所在地、営業時間、資格、実績の数字などを、出典と更新日を添えて自社サイトに明記しておくことが、発信者にできる地道な備えです。
3. 判定を動かす操作は、検証の側が追いかけている
この論文は、汚染に強い事実確認を作るための評価の場です。誤った情報や誇張でAIの判断を動かそうとする手法は、検証の仕組みが整うほど通用しにくくなり、見つかったときの信用の損失も大きいと私は考えます。
私たちは、こうした操作を勧めない立場で書いています。
調べものAIが汚染ページを見抜けるかを試した研究はHAE-GEOの解説で、悪意あるGEOを防ぐ仕組みの提案はGEO Defenderの解説でまとめています。GPEは、複数の確かめ方を同じ条件で比べる「物差し」を作った点が、この2本と異なります。
よくある質問
GPEの実験結果は、実際のAI検索サービスにも当てはまりますか
論文は、実際のAI検索サービスでは試していません。用意した3件の根拠をAIモデルに直接渡す実験で、汚染文書が検索で拾われるかも測っていません。
数字の大きさは、実験環境のものとして読むのが適切です。
GEOポイズニング(GEO風の汚染)と、ふつうのGEO対策はどう違いますか
論文は、GEOを本来はページを見つけてもらい、要約や引用をされやすくする工夫だと位置づけています。一方で、誤った結論へ導く目的で、検索やAIに拾われやすい文章を意図的に大量に出すことを「GEOポイズニング」と呼び、脅威として扱っています。
違いは、正しい情報を届けるための工夫か、判定をゆがめるための工作か、という目的の側にあります。
GPEで比べた事実確認の方式のうち、どれが最も汚染に強かったですか
すべての汚染に強い方式はありませんでした。指示文型にはSTEELが強く、ほかの3種類ではRAFTSやDirectが首位になる条件がありました。
論文は、汚染の種類と割合ごとに頑健さを測る必要があると結論づけています。
まとめ:今日できる1つのこと
自社について、AIに誤って伝わると困る事実を5つ書き出してください。価格、所在地、営業時間、資格、実績の数字などです。
そのうえで、それぞれが自社サイトのどのページに、出典と更新日つきで書かれているかを確かめます。書かれていないものがあれば、1つだけ、今日のうちに正確な形で載せます。
この実験で最も判定を崩したのは、決め手の数字や日付を書き換えた文書でした。
この論文は、LLMO論文の一覧の一本です。ほかの論文の解説も、順次公開しています。
この記事に書いたことを、そのまま御社のページに
生成AIに引用されるページを、お話しいただくだけでお作りします。お時間をいただくのは初回15分のヒアリングだけです。まず1ページ、無料でお作りします。
OKが出るまで、何度でも直します。事実が違う、言い回しが硬い、この話は入れないでほしい。どれも遠慮なくおっしゃってください。何度お直ししても、追加の料金はいただきません。
これまでに127社にご利用いただきました。毎月ご依頼いただいている方の6割以上が、月10ページを選ばれています。料金はページに掲載しています。
ページを増やしても問い合わせが来ないなら、原因はページの外にあります。その場合は、下の入口からご相談ください。
自社のマーケティング課題を根本から解決しませんか?
ウェブサイトから要素を引き算し、訪れた人が迷わず次の一歩に進む形へ組み直す。初回60分のオンラインで御社のサイトを一緒に読み、どこから直すべきかをお伝えします。手順をまとめた無料の診断と解説動画もご用意しています。
初回は無料・60分・オンライン完結・その場で契約のお願いはいたしません


