MENU
  • 料金
  • 会社案内
  • コンサル
  • お問い合わせ
  • 無料で1ページ頼む
AIO・LLMO・GEO対策の記事制作
合同会社謙虚
  • 料金
  • 会社案内
  • コンサル
  • お問い合わせ
  • 無料で1ページ頼む
  • 料金
  • 会社案内
  • コンサル
  • お問い合わせ
  • 無料で1ページ頼む
合同会社謙虚
  • 料金
  • 会社案内
  • コンサル
  • お問い合わせ
  • 無料で1ページ頼む
  1. ホーム
  2. LLMO
  3. LLMO論文
  4. 【LLMO論文解説】汚染された根拠が混ざるとAIの事実確認はどこまで崩れるか「GPE」|638件・4方式で比較(プレプリント)

【LLMO論文解説】汚染された根拠が混ざるとAIの事実確認はどこまで崩れるか「GPE」|638件・4方式で比較(プレプリント)

2026 9/30
2026年9月30日
中野輝規
汚染された根拠が混ざるとAIの事実確認はどこまで崩れるか

AIに「この話は本当か」を確かめさせる使い方が広がっています。AIは検索で集めた複数の記事を読み比べ、最後に1つの判定を出します。

では、集めた記事の中に、わざと誤った方向へ導くように作られた文書が混ざっていたら、判定はどこまで持ちこたえるのでしょうか。

2026年7月にarXivで公開された「GPE」は、この問いを測るための試験の場を作った研究です。

この記事では、GPEの論文を原文から読み、どんな問題を、どの確かめ方とAIモデルで、どの程度の汚染を混ぜて試したのかを整理します。

数値は論文の表から拾いました。汚染の作り方の具体は省き、評価と防御の側から読みます。

合同会社謙虚は、3つのドメインを並行して運用し、何を変えると数字が動くかを測り続けています。AIが根拠をどう束ねて判断するかは、正しい情報を出す側の私たちにとっても前提になる話なので、この論文を読みました。

目次

結論:3行で言うと

  • 英語の事実確認の問題638件で、AIに渡す根拠3件のうち汚染された文書を0件・1件・2件・3件と増やすと、正解率は全体として下がり、すべて汚染すると大きく落ちました(一部の組み合わせでは、途中の割合で横ばいやわずかな上昇もありました)。汚染なしで最も良い方式でも、正解率は5割台(6段階の判定を完全に当てる基準)でした
  • 4種類の汚染のうち、本物らしい記事の要所(数量・日付・関係など)を書き換える型が、平均で最も大きく崩しました。すべて汚染した条件の平均正解率は9.2%です
  • どの汚染にも強い方式はありませんでした。指示文のような文書に強かった方式も、内容の改ざんには弱く、汚染なしの成績から頑健さは読み取れない、と論文は結論づけています

いずれも、研究者が用意した根拠をAIに渡す実験環境での結果です。実際のAI検索サービスでは試されていません。

問題は英語で、日本語での検証は報告されていません。

この論文の基本情報

項目 内容
題名(原題) GPE: Evaluating Robust Evidence Aggregation for Fact Verification under Controllable GEO-Style Poisoning
著者 Zhaoqi Wang、Zijian Zhang(責任著者)、Xiaomei Yuan、Pengtao Kou、Jiamou Liu、Zhen Li、Liehuang Zhu(7人。所属は北京理工大学、オークランド大学)
公開日 2026年7月22日(確認した版はv1)
arXiv番号 2607.20730(分野はコンピュータセキュリティ)
掲載・採択状況 arXivのプレプリント(査読前の公開原稿)。arXivの注記欄に学会採択の記載はありません
種類 評価用の問題集と評価の枠組みの提案、および比較実験
実験データとコード 論文には「実装はコードを整えた後に公開する」とあり、確認した版では公開先は示されていません

論文はこちらで読めます。arXiv(2607.20730)、DOI。

この論文が答えた問い

検索で集めた根拠の一部が、誤った結論へ導くよう作られた文書に置き換わったとき、AIの事実確認の方式はどれだけ正しさを保てるのか。方式によって、その崩れ方は違うのか。

背景にあるのは、GEO(生成AIの回答に取り上げられやすくするための工夫)の広がりです。論文は、同じ仕組みが悪用されると「GEOポイズニング(汚染)」になり、誤った根拠がAIの判断に入り込みやすくなると述べています。

GEOそのものは、GEOの原論文の解説で扱っています。

根拠の中には、古いもの、不正確なもの、同じ出どころの焼き直し、意図的な作り話が混ざります。その中から信頼できる信号を組み合わせる力を、論文は「根拠の頑健な集約」と呼びます。

既存の問題集の多くは主張と正解の組だけで、汚染の割合を変えて同じ条件で比べる仕組みがありませんでした。これが出発点です。

どうやって調べたのか

項目 設定
問題(主張) 638件。政治、芸能、科学、医療・健康、歴史、生活の常識の6分野。事実確認を専門に行うサイト、報道機関、公的機関(WHOや米国の疾病対策センターなど)が公表した主張から集めた英語の問題
正解の付け方 AIが根拠を読んで下書きの判定と理由を作り、人が主張・元の文書・AIの説明を確かめて確定する。下書きの判定は正解として使わない(確認した人数は論文に記載なし)
判定の選択肢 6段階。正しい、ほぼ正しい、半分正しい、ほぼ誤り、誤り、判断できない
根拠 主張ごとに、AIがウェブ検索、百科事典、論文検索、SNSの投稿、掲示板、報道機関のサイトなどを何度も調べて集めた文書。実験では、そこから関連する3件を選んでAIに渡す
汚染の割合 0%、33%、67%、100%。3件のうち0件・1件・2件・3件を汚染された文書に置き換える
汚染の種類 4種類(下で説明)。種類ごとに別々に置き換える
確かめ方の方式 4つ(下で説明)。すべての方式に同じ3件を渡す
AIモデル DeepSeek-V4-FlashとGPT-5.4の2つ
回数と指標 各条件を638件すべてで1回ずつ評価。主な指標は、6段階の判定が正解と完全に一致した割合(正解率)。ほかに、使った文字の量(トークン)あたりの効率、分野別、細かい主張ごとの成績も報告

主張と正解は、汚染の割合を変えても同じです。論文はこの設計によって、成績の差を問題の難しさではなく、汚染の量と種類のせいだと言えるようにしています。

付属データとして、主張638件を、人物や組織などの項目22,611件、出来事789件、根拠の文書11,313件、発信元4,120件とつないだ関係図もあります。根拠の使い回しや、汚染の波及を調べるための材料です。

比べた4つの確かめ方

  • Direct:AIが根拠を読み、1回で判定する
  • RAFTS:根拠から「支持する議論」と「否定する議論」を組み立て、判定役がまとめる
  • SAFE:主張を最小単位の事実に分け、1つずつ確かめる
  • STEEL:根拠を何段階かに分けて評価してから判定する

4種類の汚染(種類の説明だけにとどめます)

  • 生成型(原文ではFakeGPT型):AIに読ませることを狙った、滑らかで説得力のある誤った文章
  • 検索対象への注入型(PoisonedRAG型):検索対象に攻撃用の文書が入り込んだ状況を再現したもの
  • 改ざん型(ATA型):本物の報道や公的機関の文書を元に、判定を左右する数量・日付・人物・因果などを書き換えたもの。見た目は本物らしいまま、中身が正解と食い違う
  • 指示文型(Ignore Injection):公式文書を装い、AIへの指示のような文で判定を誘導しようとするもの

結果

汚染なしでも、6段階を当てるのは難しい

まず、汚染を混ぜない条件の正解率です。最も良かったのは、DeepSeek-V4-FlashではDirectの52.7%、GPT-5.4ではSTEELの53.9%でした。

論文は「汚染なしでも6段階の判定は難しい」と書いています。「ほぼ正しい」と「正しい」のように隣り合う判定を取り違えても不正解に数えるので、数字は低めに出ます。

すべて汚染したときの正解率

論文の表1から、汚染なしと、3件すべてを汚染した条件(100%)の正解率を拾いました。単位は%です。

モデル・方式 汚染なし 生成型 注入型 改ざん型 指示文型
DeepSeek-V4-Flash・Direct 52.7 11.6 14.7 8.8 1.9
DeepSeek-V4-Flash・RAFTS 49.8 21.6 23.4 12.2 21.9
DeepSeek-V4-Flash・SAFE 46.2 4.7 3.4 5.6 2.0
DeepSeek-V4-Flash・STEEL 52.5 17.7 19.4 9.4 29.2
GPT-5.4・Direct 50.2 4.2 8.9 18.2 1.9
GPT-5.4・RAFTS 51.7 15.4 13.5 9.1 14.6
GPT-5.4・SAFE 49.2 3.8 5.8 4.4 2.8
GPT-5.4・STEEL 53.9 13.8 8.2 6.3 42.8

太字は、汚染ありの各列での、モデル・汚染の種類ごとの最高値です。

  • 勝つ方式が、汚染の種類で入れ替わりました。DeepSeek-V4-Flashでは、生成型・注入型・改ざん型でRAFTS、指示文型でSTEELが最も高くなりました。GPT-5.4では、改ざん型の首位がDirectに移っています
  • 汚染1件(33%)のときの首位も、100%のときと一致しません。DeepSeek-V4-Flashの33%では、生成型と改ざん型でDirect、注入型でRAFTS、指示文型でSTEELが首位でした。論文は「ある割合や、ある汚染への強さは、別の条件に確実には持ち越せない」とまとめています
  • 主張を細かく分けて1つずつ確かめる方式(SAFE)は、汚染への備えにはなりませんでした。100%の条件では、どの種類でも2.0%〜5.8%でした。論文は、分けた一つひとつの確認が汚れた根拠を見ている限り、分解だけでは守れないと述べています
  • 指示文型には、段階的に評価する方式(STEEL)が強く出ました。GPT-5.4では、汚染なし53.9%から100%で42.8%まで下がるにとどまり、Directは50.2%から1.9%まで落ちています。論文は、段階を踏む流れの中で指示のような文を見分け、不確かな根拠を絞り、最終判定を生の文書から切り離せるためだと説明しています

汚染が増えるほど下がる(改ざん型の例)

DeepSeek-V4-Flashで改ざん型を増やしたときの正解率です(図4、数値は表1)。4方式とも下がり続けました。

方式 0%(0件) 33%(1件) 67%(2件) 100%(3件)
Direct 52.7 39.2 30.4 8.8
RAFTS 49.8 31.5 26.5 12.2
SAFE 46.2 27.1 16.6 5.6
STEEL 52.5 30.6 22.7 9.4

3件のうち1件が改ざんされただけで、Directは13.5ポイント、STEELは21.9ポイント下がっています(表の値からの引き算、概算)。

最も効いたのは、本物らしいまま要所を書き換える型

2つのモデル・4つの方式を平均すると、すべて汚染した条件の正解率は、改ざん型が9.2%、生成型が11.6%、注入型が12.2%、指示文型が14.6%でした。33%・67%・100%を平均しても、改ざん型19.4%、生成型25.9%、注入型24.3%、指示文型29.6%で、改ざん型が最も低くなっています。

論文は、改ざん型が作り話や露骨な指示と違い、元の記事らしさを残したまま決め手になる事実だけを変える点に注目しています。そのうえで、決め手になる事実の意味の食い違いを確かめる仕組みが必要だと述べています。

ほかに報告されていること

  • 分野別:汚染なしでも、分野で首位の方式が違いました(表3)。DeepSeek-V4-Flashでは、芸能と医療でDirect、歴史・生活の常識・科学でSTEELが首位です
  • 細かい主張ごとの成績:人が判定を付けた355件の細かい主張で見ると、汚染なしの正解率の最高はDeepSeek-V4-FlashのSTEELで74.4%、GPT-5.4のSAFEで77.7%でした。GPT-5.4で指示文型を100%にした条件では、STEELが49.3%を保ち、ほかの方式は最高でも20.6%でした(表4)
  • 費用:正しい判定1件あたりに使った文字の量(トークン)は、DeepSeek-V4-Flashの汚染なしでDirectが2.00千、STEELが2.89千、RAFTSが4.28千、SAFEが8.43千でした(表2)。Directは指示文型100%で69.96千に増えます。安い方式も、正解が減ると割高になるという指摘です
  • すべて汚染しても0%にならない理由:AIがもともと持つ知識で答えられる問題、食い違う文書を退けられた場合、改ざんしきれなかった部分があるためだと論文は説明しています

論文自身が書いている限界

この論文には、限界をまとめた独立の節がありません。本文と結論の中で、論文自身が結果の範囲を区切っている記述を拾います。

  • 汚染なしでも6段階の判定は難しく、最も良い方式でも正解率は5割台だったと書いています
  • STEELの強さは指示文型に限った話で、生成型・注入型・改ざん型には弱いままだと明記しています
  • 頑健さは、汚染なしの成績からも、1種類の汚染の結果からも推し量れないと結論づけています
  • すべて汚染しても残る正解は、AIがもともと持つ知識と、信頼性の見分け(食い違う文書を退けるなど)を反映すると説明しています

このほか、設定として、各条件の評価は1回ずつで根拠の選び方は乱数の種で固定していること、実装はコードを整えた後に公開する予定であることが書かれています(公開先の記載はまだありません)。

原文を読んで気づいた点

  • 日本語での検証は報告されていません。問題は、英語圏の事実確認サイト・報道機関・公的機関から集めた英語の主張です
  • 実際のAI検索サービスでは試されていません。研究者が用意した3件の根拠を直接AIに渡す設定です。論文の枠組みには外部検索につなぐ仕組みもありますが、報告された実験は、問題集に付いた根拠を使う設定だけです
  • 汚染文書が検索で拾われるかどうかは、測られていません。汚染は「渡す3件のうち何件を置き換えるか」で直接決めています。題名にある「GEO風」は脅威の想定を指していて、GEOで検索に拾われやすくなる過程までは試していません
  • 採点は機械的です。AIの判定と、人が確定した正解が一致するかを自動で数えています。正解作りには人が関わっていますが、確認した人数や一致の度合いは書かれていません
  • 査読前のプレプリントです。arXivの注記欄に採択の記載はなく、確認した版はv1です。本文には誤字や文の乱れが残っています
  • 6段階の判定を当てずっぽうで選ぶと、単純計算で約17%(6分の1、概算)です。すべて汚染した条件の多くはこれを下回っていますが、正解の判定がどの段階に何件あるかは書かれていないので、厳密な比較はできません
  • 費用の表(表2)はDeepSeek-V4-Flashの値だけです。GPT-5.4も「同じ傾向」と書かれていますが、数値は示されていません。分野別の崩れ方(図5)も図だけで、数値の表はありません

この論文から、言えること・言えないこと

言えること(論文の設定で確認された) 言えないこと(論文では確認されていない)
渡す根拠3件のうち汚染された文書が増えるほど、全体として正解率が下がり、すべて汚染すると大きく落ちた(一部の組み合わせでは途中の割合で横ばい・わずかな上昇もあった) 実際のAI検索サービスで、同じ割合で判定が崩れること
本物らしい文書の要所を書き換える型が、平均で最も大きく崩した 日本語の情報でも同じ順番になること
どの汚染にも強い方式はなく、首位は汚染の種類と割合で入れ替わった ここで試していないAIモデルや確かめ方でも同じ結果になること
段階的に評価する方式は、指示文型の汚染に比較的強かった その方式が、内容の改ざんまで防げること
汚染なしの成績が良くても、汚染への強さは保証されなかった 汚染文書が検索でどれだけ拾われるか(この論文では測っていない)

中小企業の視点で、どう受け取るか

ここからは論文の主張とは別の、私の読み取りです。論文は英語の実験環境での結果なので、日本の実務にはそのまま当てはめず、考え方の材料として使います。

1. AIで事実を確かめるときは、数字と日付を元の資料で見る

この実験で最も判定を崩したのは、本物らしい文書の数量や日付だけを書き換える型でした。見た目の信頼感と中身の正しさが別物になる場面です。

取引先の情報や制度の条件をAIに確かめさせたときは、示された出典を開き、決め手の数字と日付を一次資料と照らすのが、手間に見合う確認だと考えます。

2. 発信する側は、自社の決め手になる事実を自社サイトに正確に置く

論文の設定では、渡した根拠のうち正しい文書の割合が高いほど、正解率も高く残りました。検索で何が拾われるかはこの論文の範囲外ですが、正しい一次情報が見つかる状態を作っておくことは、AIが正しい根拠を手にする前提になると私は読んでいます。

価格、所在地、営業時間、資格、実績の数字などを、出典と更新日を添えて自社サイトに明記しておくことが、発信者にできる地道な備えです。

3. 判定を動かす操作は、検証の側が追いかけている

この論文は、汚染に強い事実確認を作るための評価の場です。誤った情報や誇張でAIの判断を動かそうとする手法は、検証の仕組みが整うほど通用しにくくなり、見つかったときの信用の損失も大きいと私は考えます。

私たちは、こうした操作を勧めない立場で書いています。

調べものAIが汚染ページを見抜けるかを試した研究はHAE-GEOの解説で、悪意あるGEOを防ぐ仕組みの提案はGEO Defenderの解説でまとめています。GPEは、複数の確かめ方を同じ条件で比べる「物差し」を作った点が、この2本と異なります。

よくある質問

GPEの実験結果は、実際のAI検索サービスにも当てはまりますか

論文は、実際のAI検索サービスでは試していません。用意した3件の根拠をAIモデルに直接渡す実験で、汚染文書が検索で拾われるかも測っていません。

数字の大きさは、実験環境のものとして読むのが適切です。

GEOポイズニング(GEO風の汚染)と、ふつうのGEO対策はどう違いますか

論文は、GEOを本来はページを見つけてもらい、要約や引用をされやすくする工夫だと位置づけています。一方で、誤った結論へ導く目的で、検索やAIに拾われやすい文章を意図的に大量に出すことを「GEOポイズニング」と呼び、脅威として扱っています。

違いは、正しい情報を届けるための工夫か、判定をゆがめるための工作か、という目的の側にあります。

GPEで比べた事実確認の方式のうち、どれが最も汚染に強かったですか

すべての汚染に強い方式はありませんでした。指示文型にはSTEELが強く、ほかの3種類ではRAFTSやDirectが首位になる条件がありました。

論文は、汚染の種類と割合ごとに頑健さを測る必要があると結論づけています。

まとめ:今日できる1つのこと

自社について、AIに誤って伝わると困る事実を5つ書き出してください。価格、所在地、営業時間、資格、実績の数字などです。

そのうえで、それぞれが自社サイトのどのページに、出典と更新日つきで書かれているかを確かめます。書かれていないものがあれば、1つだけ、今日のうちに正確な形で載せます。

この実験で最も判定を崩したのは、決め手の数字や日付を書き換えた文書でした。

この論文は、LLMO論文の一覧の一本です。ほかの論文の解説も、順次公開しています。

この記事に書いたことを、そのまま御社のページに

生成AIに引用されるページを、お話しいただくだけでお作りします。お時間をいただくのは初回15分のヒアリングだけです。まず1ページ、無料でお作りします。

OKが出るまで、何度でも直します。事実が違う、言い回しが硬い、この話は入れないでほしい。どれも遠慮なくおっしゃってください。何度お直ししても、追加の料金はいただきません。

これまでに127社にご利用いただきました。毎月ご依頼いただいている方の6割以上が、月10ページを選ばれています。料金はページに掲載しています。

まず1ページ、無料で作らせてください

ページを増やしても問い合わせが来ないなら、原因はページの外にあります。その場合は、下の入口からご相談ください。

自社のマーケティング課題を根本から解決しませんか?

ウェブサイトから要素を引き算し、訪れた人が迷わず次の一歩に進む形へ組み直す。初回60分のオンラインで御社のサイトを一緒に読み、どこから直すべきかをお伝えします。手順をまとめた無料の診断と解説動画もご用意しています。

まず動画で詳しく見る(約30分)
無料診断を受ける

初回は無料・60分・オンライン完結・その場で契約のお願いはいたしません

LLMO論文
SEO対策 生成AI
よかったらシェアしてね!
  • URLをコピーしました!
  • 【LLMO論文解説】商品説明に紛れた順位操作を見抜けるか|既知の手口は大半を検出、新しい手口5種類は見抜けず(SCI-Defense・プレプリント)
  • 【LLMO論文解説】誤情報を載せたGEOを既製の安全フィルターは止められるか|専用検出器は相対47.6%減(EMNLP 2026採択と記載)

この記事を書いた人

中野輝規のアバター 中野輝規

合同会社謙虚 代表社員。20代から、売る言葉だけを仕事にしてきました。電話営業で受話器を握っていた時代から、数千社のWEB集客に関わったいままで。詳しいプロフィールはこちら

この著者の記事一覧へ

関連記事

  • AI検索で「出典に出た」と「答えを変えた」を分けて測る
    【LLMO論文解説】AI検索で「出典に出た」と「答えを変えた」を分けて測る|CC-GSEO-Bench(プレプリント)
  • 本文だけ書き換えると検索で不利になる?構造情報まで測った実験
    【LLMO論文解説】本文だけ書き換えると検索で不利になる?構造情報まで測った実験|SAGEO Arena(KDD 2026)
  • 悪意あるGEO攻撃を無害化する二段防御「GEO Defender」
    【LLMO論文解説】悪意あるGEO攻撃を無害化する二段防御「GEO Defender」|攻撃成功率を50%から6%に低減(プレプリント)
  • 画像のキャプションを本文に差し込むと生成検索での見え方は上がるか
    【LLMO論文解説】画像のキャプションを本文に差し込むと生成検索での見え方は上がるか|多峰設定限定で効果あり(ECML PKDD 2026採択)
  • AI検索の回答は、中核の論点の約半分を落としていた
    【LLMO論文解説】AI検索の回答は、中核の論点の約半分を落としていた|下位の問いで網羅を測る指標(NAACL 2025)
  • AIの回答を出すと読者の共通の話題が増え、関心は広がった
    【LLMO論文解説】AIの回答を出すと読者の共通の話題が増え、関心は広がった|米国の新聞社サイト内検索で3.7万人の実験(プレプリント)
  • PinterestがVLMで画像に「使い道の検索語」を生成する仕組み
    【LLMO論文解説】大手画像共有サービスがVLMで画像に「使い道の検索語」を生成する仕組み|自社報告20%増の中身を検証(プレプリント)
  • AIが「説得力がある」と判断する証拠とは
    【LLMO論文解説】AIが「説得力がある」と判断する証拠とは|関連性重視・文体はほぼ無視(ACL 2024)
最近の投稿
  • 温泉の集客は宿泊客と日帰り客の線引きで決まる 掲示ルールに沿うページの作り方
  • デザイナーの集客は作品集だけでは届かない 発注担当が社内で通せるサイトの作り方
  • 屋根の集客は見えない屋根を見せる会社が選ばれる 点検商法と疑われないサイトの作り方
  • 遺品整理の集客は遺族の迷いに先回りして決まる 広告頼みから指名へ移るサイトの作り方
  • 看板の集客は検索した先で決まる 見た人を来店につなぐ受け皿の作り方
最近のコメント
  • ホテルの集客は公式サイトで迷わせないことから 予約サイト頼みを抜ける直し方 に 温泉の集客は宿泊客と日帰り客の線引きで決まる 掲示ルールに沿うページの作り方 - 合同会社謙虚 より
  • 外壁塗装の集客は急がせない会社が選ばれる 下請けを抜けて直接の依頼を増やすホームページの作り方 に 屋根の集客は見えない屋根を見せる会社が選ばれる 点検商法と疑われないサイトの作り方 - 合同会社謙虚 より
  • 不用品回収の集客は料金の見せ方で決まる 当日の追加請求を疑われない業者のサイトの作り方 に 遺品整理の集客は遺族の迷いに先回りして決まる 広告頼みから指名へ移るサイトの作り方 - 合同会社謙虚 より
  • 外壁塗装の集客は急がせない会社が選ばれる 下請けを抜けて直接の依頼を増やすホームページの作り方 に 看板の集客は検索した先で決まる 見た人を来店につなぐ受け皿の作り方 - 合同会社謙虚 より
  • 【LLMO論文解説】回答が似ていても出典は重ならない|BaiduとGoogleのAI要約を英語と中国語の500問で監査(EMNLP 2026ワークショップ) に 【LLMO論文解説】海外のGEO・LLMO・AIO論文101本の一覧|原論文から最新研究まで、テーマ別に整理(随時更新) - 合同会社謙虚 より
  • 記事制作(KCW)
  • 売れるサイトはみな謙虚
  • サービス一覧
  • サイトの無料診断
  • 合同会社謙虚とは
  • 代表プロフィール
  • ブログ
  • お問い合わせ
  • プライバシーポリシー
  • 特定商取引法に基づく表記

© 合同会社謙虚

目次