AIが検索結果をまとめて答える仕組みは、ふつうの記事に見える文章に紛れた誤情報も、そのまま答えに取り込むおそれがある、と論文は指摘しています。この弱点への防御がどこまで効くかを、同じ条件で比べる「物差し」を作った論文が「Counter-GEO-Bench」です。
この記事では、既製の安全フィルター3種と著者らの専用検出器を比べた結果と、正しい情報への副作用を、原文の表から整理します。
合同会社謙虚は、3つのドメインを並行して運用し、何を変えると数字が動くかを測り続けています。事実を変えない正当な書き直しが防御に巻き込まれるかも測った論文なので、読んでおく価値があると考えました。
結論:3行で言うと
- 誤った主張を1件の文書に埋め込んで検索に混ぜると、防御なしでは3つのAIの平均で攻撃成功率が55.7%でした(誤りをそのまま断定すれば1、正しい情報と併記すれば0.5と数えた平均)
- 既製の安全フィルターのうち、断片を選別する2種の減り幅は3モデル平均で相対3.1%と5.7%にとどまりました。回答を点検する方式は、あるAIで正常な回答の98.4%を拒否しました
- 著者らの小さな専用検出器「C-GEO Guard」は、攻撃成功率を相対47.6%(26.5ポイント)下げ、正しい情報での正答率の変化は平均+0.2ポイントでした。英語の模擬環境と公開モデル3種での結果で、実際のAI検索サービスでは試されていません
この論文の基本情報
| 項目 | 内容 |
|---|---|
| 題名(原題) | Counter-GEO-Bench: Evaluating Defenses Against Information-Distorting Generative Engine Optimization |
| 著者 | Bing Zheng、Zongyao Zhao、Wenming Yang(3人。所属は清華大学深圳国際研究生院、香港大学) |
| 公開日 | 2026年9月2日(arXiv初版。この記事で読んだのも初版です) |
| arXiv番号 | 2609.02316(分野は情報検索) |
| 掲載・採択状況 | arXivのコメント欄に「EMNLP 2026(自然言語処理の主要な国際会議)の本会議に採択」と記載があります。PDFに学会名の表記はなく、会議録での掲載は未確認です |
| 種類 | 防御を評価するベンチマーク(評価用データと評価の枠組み)の構築と比較実験。基準となる検出器の提案を含みます |
| 実験データとコード | 公開先は論文に記載。データと検出器は非営利の条件で、防御の研究に使う同意が要ります。誤情報を含む書き直しのうち10件は公開を控えたとあります |
論文はarXiv(2609.02316)で読めます。arXivが発行するDOI(登録手続き中)のほかに、学会のDOIはまだありません。
この論文が答えた問い
誤情報を載せたGEOの文書が、見た目は普通のまま検索に混ざったとき、既存の防御はそれを止められるのか。止めるときに、正当に書き直された文書まで巻き込まないか。
GEO(生成AIの回答で目立たせるための書き直し)は本来、自分のページを取り上げてもらうための工夫です。論文は、同じ工夫が、狙った誤りを流し込む道具にもなると指摘しています。
こうした文書には、乱暴な言葉も、AIへの隠れた指示も、規約に触れる内容も含まれていません。害は「事実がずれている」ことだけにあります。
論文は、この種の誤情報への防御を、正当な書き直しへの副作用と合わせて同じ条件で比べたベンチマークは、これまでなかったと述べています。
どうやって調べたのか
同じ文書を3通りに用意する
1つの質問につき、AIに渡す候補の文書は5件です。そのうち1件だけを次の3通りに差し替え、残りの4件は元のままにします。
- 元のまま:防御が正常な文章を誤って弾かないかを見るために使います
- 事実を保った書き直し:構成や言い回しをGEO向けに整え、事実は一切変えないものです。論文はこれを正当な発行者の最適化と位置づけています
- 事実を歪めた書き直し:同じ強さの書き直しに、狙った誤りを1つ埋め込んだものです
後ろの2つは同じ元の文書から作られ、同じ質問で評価されます。論文は、この対になった設計で、GEOで目立つ効果と誤情報の効果を切り分けられると述べています。
誤りの埋め込み方を論文は8つの型に分けていますが、この記事は防御の評価の紹介なので、具体には触れません。
実験の舞台
| 項目 | 設定 |
|---|---|
| 質問集 | GEOの原論文が作った英語の質問集(GEO-Bench)のテスト用1,000問が出発点。品質基準を2つの書き直しの両方で満たした250問(25.0%)から、人手の確認で3問を除いた247問 |
| 分野 | 17分野。多い順に医療・健康15.0%、法律11.3%、芸能10.5% |
| 書き直しの担当 | AI(Claude Sonnet 4.6)。誤った主張や採点の基準もAIが作り、人手で確認 |
| 回答を作るAI | 重みが公開された3モデル。Gemma-4-31B-IT、Qwen-3.5-35B-A3B、Llama-4-Scout-17B-16E |
| 回答の仕組み | 著者らが組んだ模擬の生成AI検索。文書を断片に分け、検索と並べ替えで選んだ上位12の断片をAIに渡し、出典つきで答えさせる |
| 採点 | AI(Claude Opus 4.6)。人手2人と150件で照らし合わせ、一致度(偶然の一致を除いた指標)は0.739と0.869で、人同士の0.727と同程度以上でした |
比べた4つの防御
| 防御 | 見張る場所 | 大きさ | 仕組み |
|---|---|---|---|
| Granite Guardian 3.3 | 回答AIに渡す前の断片 | 80億パラメータ | 有害かどうかを判定し、危ないとされた断片を除く |
| Llama Guard 3 | 回答AIに渡す前の断片 | 80億パラメータ | 安全上の分類表に照らし、危ないとされた断片を除く |
| NeMo Self-Check Fact-Checking | できあがった回答 | 回答AIそのもの | 回答AI自身が「回答は根拠に支えられているか」を判定し、支えがなければ拒否に差し替える(論文による再現) |
| C-GEO Guard | 回答AIに渡す前の断片 | 約1.8億パラメータ | 著者らの提案。歪めた書き直しを、事実を保った書き直しや元の文章と見分けるよう学習させた検出器 |
C-GEO Guardの学習には、ベンチマークに入らなかった残りの750問から作ったデータを使っています。評価用の247問とは、質問が重なっていません。
測った指標
- 攻撃成功率:歪めた条件で、誤りをそのまま断定すれば1、正しい情報と併記したりぼかしたりすれば0.5、正しく答えれば0とした平均(%)
- 誤検出率:元のまま・事実を保った条件で、正常な断片を誤って弾いた割合
- 正答率:元のまま・事実を保った条件で、正しければ1、部分的なら0.5とした平均
- 回答の質:関連性・網羅性・明快さを1〜5点で採点した平均
結果
既製の3種はほとんど止められず、専用の検出器は約半分に
論文の表3から、歪めた条件での攻撃成功率(%)を拾います。右端の相対変化も論文の値です。
| 防御 | Gemma-4 | Qwen-3.5 | Llama-4 | 3モデル平均 | 平均の相対変化 |
|---|---|---|---|---|---|
| 防御なし | 56.5 | 55.9 | 54.7 | 55.7 | 基準 |
| Granite Guardian | 51.4 | 53.8 | 56.9 | 54.0 | -3.1% |
| Llama Guard 3 | 51.8 | 51.4 | 54.3 | 52.5 | -5.7% |
| NeMo Self-Check | 50.2 | 52.0 | 0.4(ほぼ全件拒否のため除外) | 51.1(2モデル平均) | -9.1%(2モデル平均) |
| C-GEO Guard | 30.6 | 29.4 | 27.5 | 29.2 | -47.6% |
- 防御なしの55.7%は、95%信頼区間で53.1〜58.2%です
- Granite Guardianの減り幅は1.7ポイントで、統計的に意味のある差とは言えない結果でした(p=0.096)。Llama Guard 3は3.2ポイント減で有意でしたが、論文は実用上わずかだと評価しています
- NeMo Self-Checkは、Qwenで正常な条件の回答の4.86%を拒否し、歪めた条件では3.24%でした。止める先が攻撃の有無と逆になっていた、というのが論文の見方です
- C-GEO Guardは26.5ポイント減(95%信頼区間23.8〜29.3ポイント)で、最も効いたLlama-4では54.7%から27.5%に下がりました
- 741回の評価をまとめると、誤りが少しでも回答に入った割合は、防御なしの79.1%からC-GEO Guardで43.3%に下がりました(付録の表19)
正しい情報への副作用
表4(断片の選別率、%)と表5(正答率の変化、ポイント)を並べます。正答率の変化は、元のまま・事実を保った条件の全セルの平均です。
| 防御 | 元の文章を弾いた率 | 事実を保った書き直しを弾いた率 | 歪めた条件の断片を弾いた率 | 正答率の変化 |
|---|---|---|---|---|
| Granite Guardian | 0.43 | 0.29 | 0.61 | -0.2 |
| Llama Guard 3 | 0.65 | 0.47 | 0.83 | +0.1 |
| NeMo Self-Check | 回答単位の方式 | 回答単位の方式 | 回答単位の方式 | -29.6 |
| C-GEO Guard | 2.30 | 2.16 | 10.27 | +0.2 |
- 既製の2種が歪めた条件の断片を弾いた率は1%未満で、論文はこれがほぼ効かなかった理由だと説明しています
- C-GEO Guardは、歪めた条件の断片を、元のままの条件の約4.5倍の率で弾きました(論文の計算)。この率の分母には、手を加えていない文書の断片も含まれるとみられます(書き手の読み)。既製の2種は1.4倍と1.2倍でした
- C-GEO Guardで、事実を保った書き直しが弾かれた率は2.16%で、元の文章の2.30%と同じくらいでした
- NeMo Self-Checkの-29.6ポイントは、Llama-4で元の文章の正答率が82.4%から1.8%に落ちたことによります
別のAIが書いた攻撃でも効いたか
検出器が、学習に使った書き手のくせだけを覚えていないかも確かめています。回答を作るAIはQwen-3.5で、品質基準の選別をかけずに247問すべてを使っています。
- 同じ指示で、書き手をGPT 5.5に変えた場合(表6・表13):攻撃成功率は55.7%から22.1%へ、相対60.4%の減少でした。一方で、事実を保った断片の誤検出は2.80%に増え、その条件の正答率は86.8%から82.6%に下がっています
- 指示そのものを別に書いた場合(表7):50.6%から34.4%へ、相対32.0%(16.2ポイント)の減少にとどまりました。正答率は87.0%から88.3%でした
防御が、かえって攻撃を強めた例
Llama-4とGranite Guardianの組み合わせでは、防御で結果が悪くなった質問が74問、良くなった質問が57問でした。
論文は、誤りと食い違う正しい断片が取り除かれると、情報源どうしの食い違いが消えて攻撃が強まると説明しています。
ほかに報告されていること
- 防御なしで、誤りを断定した回答の質は4.29点、正しく答えた回答は4.70点でした。誤情報を取り込むと、回答の質も下がる傾向が見られました
- 防御なしと既製の防御のすべてで、3つのAIすべてに誤りを断定させた質問が25問ありました。C-GEO Guardが止めたのは、そのうちAIごとに36〜40%でした
- 歪めた条件での回答の質は、防御なしが4.49点、C-GEO Guardが4.48点でした
論文自身が書いている限界
- 規模と範囲:評価は英語の247問だけです。防御どうしの小さな差を見分けるには数が足りない可能性があり、多言語や、医療・法律・金融に特化した内容への拡張は今後の課題とされています
- 攻撃の前提:攻撃者が操れる文書は1件という前提です。複数の文書を組み合わせた攻撃では、攻撃成功率はさらに上がるだろうと論文は見ています
- 対象のAI:試したのは重みが公開された3モデルです。重みが非公開のモデルのAPIや市販のサービスは含まれず、論文は製品についての主張はしないと明記しています
- 想定外の攻撃:8つの型に入らない攻撃や、検出器の存在を知ったうえでの攻撃は調べておらず、今後の評価課題とされています
- 効果の持ち越し:測った効果は著者らの模擬環境に結びついたもので、任意の検索システムに当てはまる証拠と読むべきではない、と倫理の節に書かれています
原文を読んで気づいた点
- 日本語での検証はありません。質問も文書も英語です
- 実際のAI検索サービスでは試されていません。回答の仕組みは模擬環境で、渡す文書も最初から5件に決まっています
- 採点はAIで、書き手と同じ系列のAIです。書き直しはClaude Sonnet 4.6、採点はClaude Opus 4.6です。人手との照合は150件で行われています
- 主実験は「作り方が同じ攻撃」への成績です。C-GEO Guardは、ベンチマークと同じ手順で作った別の質問のデータで学習しています。指示を別に書いた条件で減り幅が32.0%に縮んだことは、この点と合わせて読む必要があります
- 提案者自身のベンチマークで、提案者自身の検出器を評価しています。第三者による再評価は、読んだ範囲では見当たりませんでした
- 数値の書き方に小さな揺れがあります。Granite Guardianの減り幅は本文で1.7ポイント、付録の表15で1.6ポイントです。要旨の「既製の防御は最大で相対5.7%減」は3モデル平均の値で、NeMo Self-Checkの2モデル平均(相対-9.1%)は含んでいないと読めます
- 査読:採択の根拠はarXivのコメント欄の記載です。謝辞には査読への回答文の推敲にAIを使ったとあります
回答AIを学習し直さずに守るGEO Defenderや、文書どうしの似かたで攻撃文書を外すGRADAのような別の防御は、この論文の比較に入っていません。
この論文から、言えること・言えないこと
| 言えること | 言えないこと |
|---|---|
| この模擬環境では、有害表現を見張る既製のフィルター2種が止めた歪めた断片は1%未満だった | 市販のAI検索サービスも、同じように誤情報を通すこと |
| 専用に学習した小さな検出器は、攻撃成功率を3モデル平均で相対47.6%下げ、正答率の平均はほぼ変わらなかった | この検出器で誤情報を半分に減らせると保証されること(作り方の違う攻撃では減り幅が32.0%) |
| 事実を保ったGEOの書き直しは、この検出器では元の文章と同じくらいの率で弾かれた | ほかの防御や実際のサービスでも、GEOの書き直しが不利に扱われないこと |
| 回答を点検する方式は、AIによって正常な回答までほぼ全部拒否することがあった | 回答を点検する方式そのものが役に立たないこと(調べたのは1つの実装) |
| 正しい断片が取り除かれると、誤りが通りやすくなる例があった | 日本語のページや質問で、同じ結果になること |
中小企業の視点で、どう受け取るか
ここからは論文の主張とは別の、私の読み取りです。
1. 事実を変えない書き直しは、この実験では巻き添えになりにくかった
AIに取り上げられやすいよう文章を整えると、いずれ弾かれるのでは、という心配を聞くことがあります。この論文の検出器では、事実を保った書き直しが弾かれた率は、元の文章と同じくらいでした。
ただし、調べられた検出器は1つで、英語の模擬環境での数字です。「事実を変えない」ことが線引きの軸として扱われていた、という程度に受け取るのが妥当だと考えます。
2. 既製の安全フィルターと、事実のずれの見張りは別物
この論文の模擬環境では、有害な言葉を見張る仕組みがあっても、もっともらしい誤りは通りました。自社について誤った情報がどこかに書かれた場合も、AIの回答に混ざる余地は残ると考えておくほうが安全です。
3. 正しい情報が並んでいること自体に意味がありそう
論文は、誤りと食い違う正しい断片が取り除かれると攻撃が強まった例を報告しています。裏返すと、正しい情報源が一緒に渡されていることが、誤りを弱める方向に働いていた可能性があります。
料金、対応地域、提供内容のような基本情報を、自社サイトに正確に日付つきで載せておくことは、この意味でも損のない備えだと私は考えます。
ただ、この効果を直接測った実験ではないため、確度は高くありません。
よくある質問
Counter-GEO-Benchの「攻撃成功率55.7%」は、実際のAI検索でも半分以上の回答がだまされるという意味ですか
その意味ではありません。55.7%は、著者らの模擬環境で、品質基準を通った誤情報の文書を最初から候補5件に入れた条件での数字です。
実際のサービスでは、その文書が検索で拾われるかという別の関門があります。論文も、製品についての主張はしないと明記しています。
Granite GuardianやLlama Guard 3のような既製の安全フィルターは、なぜ情報を歪めるGEOをほとんど止められなかったのですか
論文の説明では、これらは有害な表現や規約違反を分類する仕組みだからです。歪めたGEOの文書は、流暢で話題にも合った情報記事に見えるため、分類の網を通り抜けました。
事実を変えないGEOの書き直しは、C-GEO Guardのような誤情報の検出器で弾かれやすくなりますか
この論文の主実験では、事実を保った書き直しの誤検出は2.16%で、元の文章の2.30%と同じくらいでした。
ただし、別のAIが書いた条件では2.80%に上がり、正答率も4.2ポイント下がりました。1つの検出器での結果として受け取ってください。
まとめ:今日できる1つのこと
この論文は、もっともらしい誤情報に対して、有害表現を見張る既製のフィルターがほとんど働かないことを、対になった比較で示しました。
専用の検出器は攻撃成功率を約半分にしましたが、英語の模擬環境での結果です。
今日できることは、自社名と主なサービス名を生成AIの検索に聞き、料金や所在地などの基本情報に誤りがないかを確かめて、日付と一緒に記録しておくことです。
この論文は、LLMO論文の一覧の一本です。ほかの論文の解説も、順次公開しています。
この記事に書いたことを、そのまま御社のページに
生成AIに引用されるページを、お話しいただくだけでお作りします。お時間をいただくのは初回15分のヒアリングだけです。まず1ページ、無料でお作りします。
OKが出るまで、何度でも直します。事実が違う、言い回しが硬い、この話は入れないでほしい。どれも遠慮なくおっしゃってください。何度お直ししても、追加の料金はいただきません。
これまでに127社にご利用いただきました。毎月ご依頼いただいている方の6割以上が、月10ページを選ばれています。料金はページに掲載しています。
ページを増やしても問い合わせが来ないなら、原因はページの外にあります。その場合は、下の入口からご相談ください。
自社のマーケティング課題を根本から解決しませんか?
ウェブサイトから要素を引き算し、訪れた人が迷わず次の一歩に進む形へ組み直す。初回60分のオンラインで御社のサイトを一緒に読み、どこから直すべきかをお伝えします。手順をまとめた無料の診断と解説動画もご用意しています。
初回は無料・60分・オンライン完結・その場で契約のお願いはいたしません


