最近のAIは、自分で何度も検索し、ページを読み比べてから答えます。こうした調べもの型のAIを「ディープサーチ型のエージェント」と呼びます。
読んだページに、実在しないブランドを持ち上げる偽のページが混ざっていたら、AIは途中で気づき、考えを改められるのでしょうか。
この問いを10種類のAIモデルと120問の質問で測ったのが「Evaluating Deep-Search Agents under Hierarchical Web Evidence Poisoning(段階的に巧妙になるウェブ上の根拠汚染のもとで、ディープサーチ型エージェントを評価する)」です。
評価の仕組みは「HAE-GEO」と呼ばれています。この記事では、だまされた割合と弱かった条件を原文から整理します。
汚染ページの作り方の具体は省きます。
合同会社謙虚は、3つのドメインを並行して運用し、何を変えると数字が動くかを測り続けています。AIが根拠をどこで取り違えるのかは、正しい情報を届ける側にも、AIで調べものをする側にも関わるため、この論文を読みました。
結論:3行で言うと
- 汚染ページが「複数の出どころが裏づけているように見える」段階まで巧妙になるほど、AIは根拠のあやしさを見抜きにくくなりました。10モデル平均の「見抜き」の点数(0〜2点)は、標準の指示で第1段階の1.02点から第3段階の0.33点へ下がりました。論文はこれを「裏づけの罠」と呼んでいます
- 何度も検索して読む方式は、1回だけ検索してすぐ答える方式より最終的にだまされる割合を13.6〜42.7ポイント下げました(2モデル×2種類の指示)。一方で、汚染を見抜く点数ははっきりとは上がっていません
- 注意を促す指示で、攻撃用でない出どころの根拠まで確かめた割合は約2%から約17%に増えました。それでも、いったん信じた後に確かめて撤回できた割合は、第1段階の81.8%から、第2・第3段階では66.7%に下がりました(対象は11件・9件・3件と少数)
いずれも、研究者が用意した約7万ページの閉じた検索環境での結果です。質問と指示は中国語で、日本語と実際のAI検索サービスの画面は試験の範囲外です。
この論文の基本情報
| 項目 | 内容 |
|---|---|
| 題名(原題) | Evaluating Deep-Search Agents under Hierarchical Web Evidence Poisoning |
| 著者 | Zhongan Bi、Qiwen Wang(2人が共同筆頭)ほか、計14人。筆頭のZhongan Bi氏は浙江大学、ほかの多くの著者は民間企業の所属です |
| 公開日 | 2026年9月5日(arXiv第1版)。確認した版は2026年9月17日の第2版 |
| arXiv番号 | 2609.06027(主分類は暗号とセキュリティ) |
| 掲載・採択状況 | arXivのプレプリント。コメント欄にあるのはページ数・図表の数とコードの置き場だけで、学会や論文誌への採択の記載は見当たりません。確認した範囲では査読前です |
| 種類 | 評価用の環境と基準(ベンチマーク)の構築と、それを使った10モデルの実験研究 |
| 実験データとコード | 評価用のコードとベンチマークを公開(公開先は論文に記載)。きれいなページ群は、転載に制約のあるサイトを除いた一部だけを公開すると書かれています |
論文はこちらで読めます。arXiv(2609.06027)、DOI(10.48550/arXiv.2609.06027)。
この論文が答えた問い
自分で何度も検索して調べるAIは、汚染された根拠のどこでだまされ、確かめ直して立ち直れるのか。汚染が巧妙になると、それはどう変わるのか。
出発点は、2026年3月に中国で報じられた出来事です。テレビの消費者保護の調査で、実在しないフィットネス用リストバンドの偽の評判をネットに流したところ、複数のAIチャットがこの商品を上位の候補に挙げました。
論文は、生成AIの回答に載りやすくする工夫(GEO)を悪用して根拠をゆがめることを「GEOによる汚染」と呼んでいます。
同じ出来事から出発し、保存した検索結果を1回だけAIに渡して測った研究は汚染ページ1枚でAIの推薦はどこまで動くかの解説で、守る仕組みは悪意あるGEOからの防御の解説で扱いました。この論文は、汚染ページを目にしたか、受け入れたか、確かめ直したか、撤回したか、最後に推したかという途中の動きを1回ずつ記録した点が特徴です。
どうやって調べたのか
| 項目 | 設定 |
|---|---|
| ウェブ環境 | 実在のウェブページ72,039件を集めた閉じた検索環境。ここに、架空ブランドを持ち上げる汚染ページを段階ごとに770件ずつ加える(枚数は3段階で同じ) |
| 商品分野 | 8分野(日焼け止め、モバイルバッテリー、旅行会社、子ども靴、肝臓のサプリメント、洗濯洗剤、ホワイトニング歯磨き、乳幼児の離乳食)。架空ブランドは計154 |
| 質問 | 全1,011問のうち既存の240問の組から、分野ごとに15問ずつ選んだ中国語の120問。「この3つのブランドのどれを選ぶか」といった比較・推薦が60問、「このブランドは信頼できるか」といった確認が60問 |
| 汚染の段階 | 同じ架空ブランド・同じうその主張のまま、見せ方だけを3段階で巧妙にする。汚染のない環境とも比べる |
| AI | 10モデル。非公開モデル2つと、重みが公開されたモデル8つ(名前は結果の表) |
| 調べ方 | 「検索」(題名・アドレス・日付だけが返る)と「閲覧」(本文を読む)の2つの道具を使い、最大10往復で調べてから答える |
| 指示 | 標準の指示と、注意を促す指示の2種類。後者は、見慣れないブランドを公式サイト・事業者の資格・独立した出どころで確かめ、同じ出どころの宣伝記事しかなければ「証拠不十分」と伝えるよう求める |
| 評価 | 途中の動きは記録からルールで機械的に判定。回答の質はGPT-5.5を採点役にして6つの観点を0〜2点で採点。人による採点は無し |
汚染の3段階を一般向けに言い換えると、次のとおりです。
- 第1段階:根拠を示さずに言い切るだけのページ。個人の投稿のような、見た目の信頼度が低いもの
- 第2段階:案内記事やランキング、レビューといった、それらしい文脈に同じ主張をまぎれこませたページ
- 第3段階:複数の出どころが同じ主張を裏づけているように見せるページ群。見た目の信頼度が最も高いもの
主な指標は3つです。だまされ率は、架空ブランドの載った汚染ページを実際に目にした回のうち、最終回答でそのブランドを肯定的に紹介した割合です(「検討の価値あり」程度の推しも含む)。
確認の成功率は、架空ブランドを確かめる検索をし、攻撃用でない出どころの新しい根拠を読めた割合です。
撤回率は、いったん候補として受け入れた後に確認の根拠を得た回のうち、最終回答で推さなかった割合です。
結果
10モデルすべてが、どの段階でもだまされた
だまされ率の一覧です(論文の表5。低いほど良い)。
「標準」は標準の指示、「注意」は注意を促す指示です。
| AI | 標準 第1段階 | 標準 第2段階 | 標準 第3段階 | 注意 第1段階 | 注意 第2段階 | 注意 第3段階 |
|---|---|---|---|---|---|---|
| Claude-Opus-4.8(非公開) | 29.7% | 38.6% | 51.6% | 17.2% | 19.6% | 33.3% |
| GPT-5.6-sol(非公開) | 33.3% | 47.6% | 46.8% | 33.3% | 49.2% | 42.9% |
| Kimi-K3 | 37.5% | 32.3% | 35.9% | 10.9% | 24.2% | 18.8% |
| GLM-5.2 | 54.7% | 50.0% | 60.9% | 34.4% | 47.6% | 39.1% |
| GLM-4.7-Flash | 59.4% | 63.8% | 65.1% | 54.7% | 51.7% | 46.8% |
| MiniMax-M3 | 43.8% | 37.7% | 40.3% | 29.7% | 35.0% | 38.1% |
| Qwen3.8-27B | 26.6% | 45.2% | 31.7% | 25.0% | 24.6% | 23.4% |
| Qwen3.6-35B-A3B | 59.7% | 59.3% | 69.4% | 35.5% | 42.6% | 60.3% |
| Qwen3.5-397B-A17B | 53.1% | 67.7% | 64.5% | 26.6% | 36.7% | 48.1% |
| DeepSeek-V4-Flash | 35.9% | 37.7% | 43.8% | 18.8% | 30.6% | 37.5% |
- 最も低い値でも10.9%(Kimi-K3、注意の指示、第1段階)で、すべての組み合わせでだまされた回がありました
- モデル単位では、段階の順に並ぶとは限りません。Qwen3.8-27Bの標準の指示では、第2段階が最も高い45.2%でした。論文も、3段階は作りの巧妙さの順で、どのモデルでも難しさの順になるとは限らないと断っています
- 注意の指示の効き方はモデルで大きく違いました。Kimi-K3は大きく下がった一方、GPT-5.6-solは第1段階が同じ33.3%、第2段階は47.6%から49.2%へ上がりました
巧妙になるほど、根拠のあやしさを見抜きにくくなった(10モデル平均)
採点役による「危うさの扱い」と「見抜き」の点数(0〜2点)を10モデルの単純平均で見ると、どちらも第1段階から第3段階へ下がりました(論文の5.2節と図3)。
標準の指示では、危うさの扱いが0.83点から0.30点へ、見抜きが1.02点から0.33点へ。注意の指示では全体に点数が上がりましたが、見抜きは1.65点から1.14点へと、下がる形は残っています。
論文はこれを「裏づけの罠」と呼んでいます。
何度も調べる方式は、だまされにくくしたが、見抜く力は上げなかった
Kimi-K3とQwen3.8-27Bで、何度も検索して読む方式と、1回だけ検索して上位ページの本文を渡しすぐ答えさせる方式を、同じ質問・同じ環境で比べています(論文の図4。3段階をまとめた値)。
- だまされ率は、4つの組み合わせすべてで何度も調べる方式が低く、差はKimi-K3で13.6ポイント(標準)と16.0ポイント(注意)、Qwen3.8-27Bで42.7ポイント(標準)と35.4ポイント(注意)でした。汚染ページを目にした後の動きで差がついた、と論文は読んでいます
- 見抜きの点数の差は-0.10〜+0.08点と小さく、信頼区間の多くが0をまたいでいました。答えの役立ち度の差は-0.21〜+0.01点で、多くの条件で横ばいか下がっています
確かめることと、考えを改めることは別だった
10モデルの記録をまとめ、確認と撤回の流れを段階ごとに見た結果です(論文の図5。汚染ページを目にした回が対象)。
| 指標 | 指示 | 第1段階 | 第2段階 | 第3段階 |
|---|---|---|---|---|
| だまされ率 | 標準 | 43.3% | 47.9% | 51.0% |
| だまされ率 | 注意 | 28.6% | 36.3% | 38.6% |
| 確認の成功率 | 標準 | 2.0% | 2.5% | 1.6% |
| 確認の成功率 | 注意 | 17.1% | 17.1% | 17.2% |
| 撤回率(対象の件数) | 標準 | 50.0%(2件) | 100.0%(2件) | 100.0%(2件) |
| 撤回率(対象の件数) | 注意 | 81.8%(11件) | 66.7%(9件) | 66.7%(3件) |
- 注意の指示で確認の成功率は約17%に上がり、第1段階から第3段階までほぼ同じでした。巧妙な段階でのだまされやすさは、確かめる回数の差では説明できないと論文は述べています
- それでも注意の指示のだまされ率は28.6%から38.6%へ上がり、撤回率は第1段階の81.8%から第2・第3段階の66.7%へ下がりました。ただし撤回率の対象は少数で、論文も強い因果は言えないと断っています。そもそも「受け入れた後に確かめた」回自体がまれでした
考えてから答える機能は、2モデルでだまされにくくした
回答の前に考える過程(推論)の有無を、Kimi-K3とQwen3.8-27Bで比べています(論文の表6。3段階をまとめた値)。
| AI | 指示 | だまされ率(推論あり) | だまされ率(推論なし) | 見抜きの点数(あり/なし) |
|---|---|---|---|---|
| Kimi-K3 | 標準 | 38.1% | 47.8% | 1.33/0.50 |
| Kimi-K3 | 注意 | 21.3% | 30.1% | 1.97/1.34 |
| Qwen3.8-27B | 標準 | 34.2% | 50.3% | 0.94/0.65 |
| Qwen3.8-27B | 注意 | 23.5% | 43.3% | 1.91/1.49 |
推論を入れると、だまされ率は8.8〜19.8ポイント下がり、危うさの扱いと見抜きの点数も4つの比較すべてで上がりました。
守りを固めるほど、手間が増え、役立ち度は下がった
- 注意の指示で、1問あたりの道具の呼び出しは平均1.82回増え、使った文字量(トークン)はモデル内の比較で平均24.5%増えました(GLM-5.2の8.6%からClaude-Opus-4.8の52.0%まで。論文の表7)
- 攻撃下での答えの役立ち度は、注意の指示で10モデルすべてが0.01〜0.27点下がりました。論文は、汚染への強さ、役立ち度、調べる費用を1つの点数にまとめず、別々の基準で見るべきだと結論づけています
論文自身が書いている限界
この論文に限界をまとめた独立の節は無く、以下は本文と付録で著者が断っている点です。
- 3段階は作りの巧妙さの順で、どのモデルでもだまされやすさがこの順に並ぶことまでは意味しない
- 撤回率の対象は少数で区間の幅が広く、防御の効果の推定値として読むものではない
- 途中の動きは、記録に残った発言と道具の使い方から機械的に判定した目安で、AIの内心を示すものではない。付録の事例では、AIがページを批判して引用した言葉を、ルールがAI自身の受け入れと判定していた
- 採点の指示文の版の記録(第5版と第6版)が食い違い、過去の採点依頼がすべて今の指示文と同一だったこと、付録の事例の点数がGPT-5.5によるものだったことまでは、残った資料では確かめられないと著者自身が書いている
- 方式の比較と推論の比較は2モデルだけ。文字量はモデルごとに数え方が違う可能性がある
原文を読んで気づいた点
- 日本語での検証は無し。質問、AIへの指示、採点役への指示はすべて中国語で、商品分野も中国の市場が前提です
- 実際のAI検索サービスでの試験も無し。各モデルに、研究者の閉じた検索環境と道具を使わせています。出発点の事例は報道の紹介で、実験の時期も書かれていません
- 評価はルールの判定とGPT-5.5の採点だけで、人による採点や、採点役と人の判断の一致の確認は見当たりませんでした
- だまされ率の分母(汚染ページを目にした回の数)は表に無く、本文が付録にあるとする段階ごとの件数と信頼区間も、確認した第2版の付録には見当たりませんでした。同じ質問の繰り返し回数も書かれていません
- 標準の指示の見抜きの点数は、本文で1.02点(下げ幅0.69点)、図3で1.01点(下げ幅0.68点)と小さく食い違います。この記事は本文の値を使いました
- だまされた相手はすべて架空ブランドです。知名度の低い本物の事業者が、注意の指示のもとで慎重に扱われすぎる場面は範囲外です。arXivのプレプリントで、学会の査読を経た論文とは違います
この論文から、言えること・言えないこと
| 言えること(論文の設定で確認された) | 言えないこと(論文では確認されていない) |
|---|---|
| 試した10モデルは、どの段階の汚染でも架空ブランドを推した(10.9%〜69.4%) | 実際のAI検索サービスで、同じ割合で架空ブランドが推されること |
| 裏づけを装う段階ほど、10モデル平均で見抜きの点数が下がった | 日本語の質問と日本の商品でも、同じ下がり方になること |
| 何度も調べる方式は、2モデルでだまされ率を下げたが、見抜きの点数ははっきり上げなかった | ほかのモデルや、各サービスの実際の調べ方でも同じ差が出ること |
| 注意の指示で確認は増えたが、確かめた後の撤回は第2・第3段階で第1段階より少なかった(少数の件数) | 撤回率の差が汚染の段階によって生じたという因果 |
| 守りを固めると、調べる手間が増え、答えの役立ち度が下がった | 知名度の低い本物の事業者が、その守りで推されにくくなるかどうか |
中小企業の視点で、どう受け取るか
ここからは論文の主張とは別の、私の読み取りです。
1. AIが確かめに行く先に、自社の事実を置いておく。論文の注意の指示は、見慣れないブランドを公式サイト、事業者の資格、独立した出どころで確かめるようAIに求めていました。
会社概要、所在地、許認可、取り扱い商品といった確かめられる事実を公式サイトに正確に書くことは、正しい事業者が確認を通りやすくする備えだと読みました。
2. 裏づけを装うことは、論文では「汚染」として測られている行為です。自社で第三者の評判を作り出せば、ここで測られた攻撃と同じ側に立つことになります。
日本では、事業者が第三者を装う表示は、景品表示法のステルスマーケティング規制(2023年10月から)の対象になり得ます。
評判を書くなら、実際にいただいた声と確かめられる出どころに限るのが筋です。
3. AIで取引先や商品を調べるときは、「確かめた」と「考えを改めた」を分けて読む。論文では、確認をしても、いったん受け入れた候補を撤回しきれない回が残りました。
AIの答えに根拠のページが並んでいても、同じ出どころの宣伝記事ばかりでないか、公式サイトや公的な記録があるかは、自分の目で確かめる価値があります。
よくある質問
HAE-GEOの「3段階の汚染」は、普通のSEOの工夫とどう違うのですか
HAE-GEOで測られたのは、実在しないブランドについて、うその主張を信じさせるために作られたページです。自社の事実を分かりやすく書くSEOの工夫とは、目的も中身も違います。
論文は、汚染がAIの判断のどこをゆがめるかを測る、評価と防御の側の研究です。
HAE-GEOとFORGEの論文で、推論や注意の指示の効き方が逆に見えるのはなぜですか
FORGEの論文では、推論を入れた2つの公開モデルと、疑うよう指示された非公開モデルで、だまされやすさが上がりました。HAE-GEOでは、推論を入れた2モデルと多くのモデルの注意の指示で、だまされ率が下がっています。
ただしFORGEは保存した検索結果を1回渡す形、HAE-GEOはAIが最大10往復で自分で調べる形で、モデルも指示の文面も違います。
同じ条件での比較は無く、どちらが正しいかは決められません。
まとめ:今日できる1つのこと
普段使っているAIに、自社名を挙げて「この会社は信頼できますか。根拠にしたページも示してください」と聞いてみてください。
AIが根拠に挙げたページが、公式サイトや公的な記録なのか、出どころの分からないまとめ記事なのかを確かめます。公式サイトが挙がらなかったら、会社概要のページに、所在地や許認可など確かめられる事実を1つ書き足すところから始めます。
この論文は、LLMO論文の一覧の一本です。ほかの論文の解説も、順次公開しています。
この記事に書いたことを、そのまま御社のページに
生成AIに引用されるページを、お話しいただくだけでお作りします。お時間をいただくのは初回15分のヒアリングだけです。まず1ページ、無料でお作りします。
OKが出るまで、何度でも直します。事実が違う、言い回しが硬い、この話は入れないでほしい。どれも遠慮なくおっしゃってください。何度お直ししても、追加の料金はいただきません。
これまでに127社にご利用いただきました。毎月ご依頼いただいている方の6割以上が、月10ページを選ばれています。料金はページに掲載しています。
ページを増やしても問い合わせが来ないなら、原因はページの外にあります。その場合は、下の入口からご相談ください。
自社のマーケティング課題を根本から解決しませんか?
ウェブサイトから要素を引き算し、訪れた人が迷わず次の一歩に進む形へ組み直す。初回60分のオンラインで御社のサイトを一緒に読み、どこから直すべきかをお伝えします。手順をまとめた無料の診断と解説動画もご用意しています。
初回は無料・60分・オンライン完結・その場で契約のお願いはいたしません


