MENU
  • 料金
  • 会社案内
  • コンサル
  • お問い合わせ
  • 無料で1ページ頼む
AIO・LLMO・GEO対策の記事制作
合同会社謙虚
  • 料金
  • 会社案内
  • コンサル
  • お問い合わせ
  • 無料で1ページ頼む
  • 料金
  • 会社案内
  • コンサル
  • お問い合わせ
  • 無料で1ページ頼む
合同会社謙虚
  • 料金
  • 会社案内
  • コンサル
  • お問い合わせ
  • 無料で1ページ頼む
  1. ホーム
  2. LLMO
  3. LLMO論文
  4. 【LLMO論文解説】悪意あるGEO攻撃を無害化する二段防御「GEO Defender」|攻撃成功率を50%から6%に低減(プレプリント)

【LLMO論文解説】悪意あるGEO攻撃を無害化する二段防御「GEO Defender」|攻撃成功率を50%から6%に低減(プレプリント)

2026 9/30
2026年9月23日2026年9月30日
中野輝規
悪意あるGEO攻撃を無害化する二段防御「GEO Defender」

ページの文章に統計や引用を足すと、AIの回答に取り上げられやすくなる。この仕組み(GEO、生成エンジン最適化)は、もともと自社のページを正しく評価してもらうための工夫として研究が始まりました。

ところが同じ書き換えの仕組みは、事実を保ったまま他人のページを出し抜く「攻撃」にも使えます。2026年9月に公開された論文「When Optimization Becomes Manipulation: Defending Generative Search against Malicious Generative Engine Optimization」は、この悪意あるGEO(論文はGEO攻撃と呼びます)から、AIによる検索の回答をどう守るかを扱った研究です。

提案する仕組みの名前は「GEO Defender」といいます。

この記事は、論文の原文(PDF、本文と付録)を通読して要点を整理します。論文は、対策なしでは平均50.32%だった攻撃の成功率を、6.20%まで下げたと報告しています。

数値はすべて論文の表と本文から拾い、私が計算し直した比率や割合には「概算」と付けています。

合同会社謙虚は、3つのドメインを並行して運用し、何を変えると数字が動くかを測り続けています。この論文を読む理由は、AIに正しく評価してもらうための工夫と、AIを欺くための工夫が、技術としては地続きであることを、対策側の研究から確かめておくためです。

目次

結論:3行で言うと

  • 事実を書き換えずに文章の見せ方だけを変える「GEO攻撃」に対して、文書の並べ替え(リランキング)と、AIの回答生成の両方に手を入れる二段防御を提案し、攻撃の成功率を平均50.32%から6.20%まで下げたと報告しています
  • 対策の一方は、リランカー(検索結果を並べ替える役)に軽い追加学習を行う「Shield Reranker」、もう一方は回答を作る大規模言語モデル(LLM)自体は学習し直さず、外部の「経験則メモ」を育てて判断材料にする「TFSG」です
  • この二段防御は、本来使うべき正しい情報源の引用も94.12%は維持しており、攻撃を減らす代わりに情報源を丸ごと使わなくなる、という副作用は小さいと報告しています

この論文の基本情報

項目 内容
題名(原題) When Optimization Becomes Manipulation: Defending Generative Search against Malicious Generative Engine Optimization
著者 Haozhang Li、Yangguang Shao、Xinjie Lin(以上3人は共同筆頭)、Zhong Guan、Mi Zhou、Junzheng Shi(責任著者)。所属は中国科学院大学とZhongguancun Laboratory(中関村実験室)
公開日 2026年9月2日(v1、確認した版)
arXiv番号 2609.02964(分野はcs.CR、暗号・セキュリティ)
掲載・採択状況 arXivのプレプリント。要旨ページに学会や査読誌への採択を示す記載はなく、確認した範囲では査読を経ていません
種類 AIによる検索(生成エンジン)を、悪意あるGEOから守る二段防御の提案と実証実験
実験データ/コードの公開先 GitHub(Ccchi5ato/GEO-Defender)。論文に記載のURLで公開されています

論文はこちらで読めます。arXiv(2609.02964)、DOI。

この論文が答えた問い

事実を保ったまま文章の見せ方だけを変える「GEO攻撃」から、AIによる検索の回答を守るには、検索から回答生成までの一連の流れのどこに、どんな対策を入れればよいのか。

GEOの原論文は、引用や統計を足すとAIの回答での目立ち方が上がることを示しました。

この技術は自社のページを正しく評価してもらう工夫として広まっていますが、論文は同じ技術が悪用されうる点に注目します。書き換えられた文書は、事実としては元のページと変わらないため、嘘を見抜く仕組みや不自然な文章を見抜く仕組みでは検知できません。

実際に、Bing CopilotやPerplexityといった実サービスへの操作を確認した別の研究を、論文は根拠として挙げています。

論文はこの問題を、検索エンジンを提供する側の視点から、防御の手立てを提案する形で扱っています。

どうやって調べたのか

想定した攻撃者と防御側の条件

論文は、防御側に都合の良い前提を置きません。攻撃者は候補となる文書のうち1件だけを書き換えられますが、検索・並べ替え・回答生成の仕組みそのものは操作できません。

防御側は、並べ替えの仕組みと回答生成の指示文には手を入れられますが、回答を作るAI(ターゲットLLM)のパラメータは書き換えられないという制約を置いています。

これは、商用のAIが外部から中身を触れないブラックボックスで、頻繁に更新されるという実務上の事情を反映した設定です。

評価用データセット(GEO-DefenseBench)

論文は、この検証のために新しいデータセットを作りました。既存のベンチマーク(GEO-Bench)から100件の質問グループを選び、それぞれにTavily Searchで新たに10件の良質な文書を集め直したうえで、うち1件を7種類のGEO手法でそれぞれ書き換えて、攻撃つきの事例を作ります。

用途 質問グループ GEO手法 事例数
対策の学習用 12 3種(既知として扱う) 36
テスト用 88 7種(うち4種は学習に未使用) 616
合計 100 7 652

学習用とテスト用は、同じ質問グループが両方に混ざらないよう分けられています。学習で使う3手法(AgenticGEO、AutoGEO、MAGEO)は「見た手法」、残り4手法(GEOの原論文の手法、GEO-SFE、IF-GEO、RAID-GSEO)は学習で一度も見ていない「未知の手法」として、汎化の確認に使われます。

比較した相手と、測るものさし

比較対象は3つです。何も対策しない「Non-Defense」、文章の不自然さ(パープレキシティ)で怪しい文書を除く「PPL-Filter」、回答生成の指示文に「操作されていないか注意して」という一文を足すだけの「Static Safety Prompt」です。

ものさしは、攻撃文書が回答の根拠として使われた割合を示すASR(攻撃成功率、低いほど良い)、攻撃文書が回答の内容にどれだけ影響したかをAI(GPT-5.5)が0〜4点で採点し百分率にしたASI(攻撃の意味的影響、低いほど良い)、正しい文書がどれだけ使われ続けたかを無攻撃時と比べたBER(良質な根拠の維持率、高いほど良い)の3つです。

対象にした回答生成AIは、GPT-5.5とClaude Opus 4.8(非公開のAI)、DeepSeek-V4-Pro、Kimi K2.7 Code、GLM-5.2(公開されているAI)の5つです。

結果

単純な対策では、攻撃を見分けられない

PPL-Filterの中身を見ると、単純な対策がうまくいかない理由が分かります。テスト用616件のうち、対策なしの並べ替えだけで上位5件に入った攻撃文書は345件でした(概算で全体の56.0%)。

指標 値
テスト事例 616件
対策なしで上位5件に入った攻撃文書 345件
パープレキシティで検知された攻撃文書 15件
上位5件から実際に除けた攻撃文書 8件(差し引き4件の純減)
誤って怪しいと判定された良質な文書 252件/5,544件(4.55%)

616件中、検知できたのはわずか15件です。除いた分だけ他の攻撃文書が繰り上がるため、上位5件から実際に減った攻撃文書は差し引き4件にとどまりました。

それでいて、良質な文書まで252件を誤って怪しいと判定しています。書き換えられた文章は不自然さで見分けられない、という論文の指摘どおりの結果です。

主要な結果:攻撃成功率が50.32%から6.20%に

5つのAIの平均で見た結果です。

対策 ASR(攻撃成功率) ASI(攻撃の影響度) BER(良質な根拠の維持率)
Non-Defense(対策なし) 50.32% 35.95 87.80%
PPL-Filter 50.03% 36.57 87.74%
Static Safety Prompt 46.98% 32.23 83.31%
GEO Defender(提案手法) 6.20% 3.89 94.12%
  • ASRは50.32%から6.20%へ、比率にすると約8.1分の1(概算)まで下がりました。5つのAIすべてでASRは8%未満、ASIは6%未満だったと報告されています
  • Static Safety Promptは、指示文を一文足すだけの割にASRを下げていますが、BERは83.31%まで落ちました。GPT-5.5では89.66%から71.67%まで下がっています。論文はこれを、攻撃文書だけを狙い撃ちするのではなく、根拠となる文書全般を使いにくくして成功率を下げている兆候だと説明しています
  • GEO Defenderは、BERが94.12%と対策なしの87.80%より高く、根拠を全般的に減らさずに攻撃だけを退けられていることを示しています

2つの仕組みの役割分担

GPT-5.5だけを対象に、2つの仕組みを別々に効かせた結果です。

構成 ASR ASI BER
Non-Defense 45.45% 31.13 89.66%
Shield Rerankerのみ 10.06% 6.57 98.79%
TFSGのみ 10.39% 5.28 77.99%
GEO Defender(両方) 5.03% 3.13 86.68%

Shield Rerankerだけでも、攻撃文書を並べ替えの段階で退けることでASRを大きく下げ、BERも98.79%と高く保っています。

単独の対策どうしで比べると、TFSGだけの場合がASI(意味的な影響)を最も低く抑えていますが、BERは77.99%まで落ちました。

攻撃文書が並べ替えの段階で除かれずに残った分、回答生成の側で用心深くなり、良質な文書ごと使う量が減ったためと論文は説明しています。

両方を組み合わせることで、並べ替えで大半の攻撃を退け、生成の側で残りの影響を抑えるという役割分担が働き、ASR・ASIともに単独より低い値になっています。

見たことのない攻撃手法にも、経験則を使い回せた

学習時に見ていない4つの攻撃手法(GEOの原論文の手法、GEO-SFE、IF-GEO、RAID-GSEO)への防御成績は、学習時に見た3手法と大きくは変わらなかったと報告されています。

なかでもGEO-SFEとIF-GEOはばらつきが大きいものの、それでも十分な防御効果があったとしています。さらに、あるAI向けに育てた経験則メモを、別のAIにそのまま使わせる実験でも、25通りの組み合わせすべてでASRは4.06〜9.09%、ASIは2.23〜5.40%の範囲に収まりました。

DeepSeek-V4-Pro向けに育てた経験則メモをClaude Opus 4.8に使わせると、専用に育てた場合(ASR5.52%)より低い4.06%になった組み合わせもありました。

回答の質は、ほとんど変わらなかった

攻撃を防いだ分だけ回答が使いにくくなっていないかを、別のAI(GPT-5.5)に、攻撃のない状態で作った回答と比べさせています。

5つのAIの平均(マクロ平均)では、質の変化はマイナス0.01(マイナス2からプラス2の尺度で、0が同等)でした。同等かそれ以上と判定された割合は70.45〜76.79%です。

ただし、GPT-5.5だけは信頼区間がゼロをまたがず、マイナス0.12というわずかな低下が確認されています。

論文自身が書いている限界

この論文には、独立した「Limitations(限界)」という見出しはありません。ただし、本文と付録の中に、次のような留保が書かれています。

  • 並べ替え段階での対策(Shield Reranker)だけでは、攻撃文書を上位候補から完全に排除できるとは限りません。だからこそ、残った攻撃の影響を生成の段階で抑えるTFSGが要る、という2段構成になっています
  • TFSGが手がかりにするAIの「診断結果」や「推論の過程」は、モデル内部の演算を忠実に説明したものとして扱ってはいけない、と付録で2回にわたって注意書きされています。あくまでモデルが申告した参考情報として使っている、という位置づけです
  • TFSGだけを使い、Shield Rerankerを外した構成では、良質な文書の維持率(BER)が77.99%まで下がりました。攻撃文書が並べ替えで除かれずに残ると、回答生成の側がより用心深くなり、良質な文書ごと使う量が減る傾向がある、とアブレーションの節で述べられています

原文を読んで気づいた点

  • 評価する側もAI: ASI(攻撃の影響度)と、回答の質を比べる判定は、いずれもGPT-5.5という1つのAIが担っています。しかもGPT-5.5は、防御の効果を測る5つの対象AIの1つでもあります。人手による評価は、確認した範囲では見当たりませんでした
  • 実サービスでの検証ではない: 検索から回答生成までの一連の流れは、Tavily Searchと5つのAIを組み合わせて論文が独自に用意した実験環境です。実際に動いているPerplexityやAI Overviewsのような生成エンジンでの検証は、確認した範囲では報告されていません
  • 並べ替えの土台は1種類だけ: 実験はQwen3-Reranker-0.6Bという1つのリランカーを土台にしています。ほかの並べ替えの仕組みでも同じ効果になるかは、この論文だけでは分かりません
  • 候補の入れ替わりは検証していません: 各質問の候補文書10件のうち1件だけを攻撃文書に差し替える設定です。攻撃文書がそもそも検索の候補に入るかどうかや、複数の文書が同時に攻撃される場合は、対象外です
  • 言語は英語圏のデータ: 質問と文書はいずれも英語です。日本語での検証は、確認した範囲では報告されていません

この論文から、言えること・言えないこと

言えること(この実験の設定で確認された) 言えないこと(この実験では確認されていない)
文章の不自然さだけを見る対策は、事実を保った書き換えをほとんど見分けられなかった 実際に動いているAI検索サービスで、同じ下げ幅になること
並べ替えと生成の両方に手を入れる二段防御は、攻撃成功率を大きく下げた 日本語のページや質問でも、同じ効果になること
攻撃を減らしつつ、良質な根拠の利用量もほぼ保たれた ほかの並べ替えの仕組みや、より新しいAIでも同じ結果になること
学習時に見ていない攻撃手法や、別のAI向けに育てた経験則にも、ある程度使い回せた 複数の文書が同時に攻撃される場合や、検索の土俵に入る前の段階での効果

中小企業の視点で、どう受け取るか

ここからは論文の主張とは別の、私の読み取りです。

  • この論文が提案する対策は、検索を提供する側が使う仕組みです。記事を書く私たちが直接導入できるものではありませんが、AI検索の運営者が「事実として正しい書き換え」への対策を進めている、という前提を踏まえて記事を書く必要があります
  • 単純な不自然さの検知(PPL-Filter)が、良質な文書まで4.55%誤って怪しいと判定した結果は示唆的です。過剰に技巧を凝らした文章は、狙って書いたものでなくても、対策側の検知に引っかかる側に回りかねません
  • Static Safety Promptの結果、つまり「注意して」と一文足すだけの対策が根拠全般を使いにくくした、という結果は裏を返せます。やりすぎた最適化は、AIの回答から根拠として選ばれにくくなる方向に働く可能性があります
  • この対策が有効だということは、事実を伴わない誇張や、機械的に見せ方だけを整えた文章は、今後さらに見分けられやすくなる方向にあると読めます。裏づけのある内容を素直に書くことの重みは、下がるどころか増していきそうです

よくある質問

GEO Defenderは、記事を書く側が今日から使える対策ですか

いいえ、違います。GEO Defenderは、検索エンジンやAI検索サービスを提供する側が、自社のリランカーや回答生成の仕組みに組み込む対策です。

記事を書く側が直接インストールしたり設定したりするものではありません。

Shield RerankerとTFSGは、それぞれ何をしていますか

Shield Rerankerは、検索結果を並べ替える段階で、GEO攻撃を受けた文書を目立たない位置に下げる役目です。TFSGは、その後の回答生成の段階で、残ってしまった攻撃文書の影響を抑えるために、AI自体を学習し直さず、外部に置いた「経験則メモ」を判断材料として使わせる仕組みです。

GEO攻撃は、これまでのSEOの不正対策と同じ方法で防げますか

この論文が示したのは、同じ方法では防ぎにくいという結果です。GEO攻撃は事実を書き換えないため、嘘を見抜く仕組みや、文章の不自然さを見抜くパープレキシティ検知(PPL-Filter)は、ほとんど効果がありませんでした。

攻撃文書と良質な文書が同じような特徴(統計・引用・断定的な言い回し)を持つ点が、防御を難しくしていると論文は説明しています。

まとめ:今日できる1つのこと

自社の記事のうち、数字や引用を多く盛り込んだページを1つ選び、その数字と出典が実在するものかを、あらためて確かめてください。

この論文が示したのは、AIを欺く書き換えは事実の正しさでは見分けがつかないという難しさでした。裏を返せば、事実として正しい内容を書き続けることが、対策が進んだ先でも変わらず有効だという見方になります。

この論文は、LLMO論文の一覧の一本です。ほかの論文の解説も、順次公開しています。

この記事に書いたことを、そのまま御社のページに

生成AIに引用されるページを、お話しいただくだけでお作りします。お時間をいただくのは初回15分のヒアリングだけです。まず1ページ、無料でお作りします。

OKが出るまで、何度でも直します。事実が違う、言い回しが硬い、この話は入れないでほしい。どれも遠慮なくおっしゃってください。何度お直ししても、追加の料金はいただきません。

これまでに127社にご利用いただきました。毎月ご依頼いただいている方の6割以上が、月10ページを選ばれています。料金はページに掲載しています。

まず1ページ、無料で作らせてください

ページを増やしても問い合わせが来ないなら、原因はページの外にあります。その場合は、下の入口からご相談ください。

自社のマーケティング課題を根本から解決しませんか?

ウェブサイトから要素を引き算し、訪れた人が迷わず次の一歩に進む形へ組み直す。初回60分のオンラインで御社のサイトを一緒に読み、どこから直すべきかをお伝えします。手順をまとめた無料の診断と解説動画もご用意しています。

まず動画で詳しく見る(約30分)
無料診断を受ける

初回は無料・60分・オンライン完結・その場で契約のお願いはいたしません

LLMO論文
SEO対策 生成AI
よかったらシェアしてね!
  • URLをコピーしました!
  • 【LLMO論文解説】GEO対策済みページを見分ける検出器の精度と弱点|実サイトの8.90%で検出(プレプリント)
  • 【LLMO論文解説】大手画像共有サービスがVLMで画像に「使い道の検索語」を生成する仕組み|自社報告20%増の中身を検証(プレプリント)

この記事を書いた人

中野輝規のアバター 中野輝規

合同会社謙虚 代表社員。20代から、売る言葉だけを仕事にしてきました。電話営業で受話器を握っていた時代から、数千社のWEB集客に関わったいままで。詳しいプロフィールはこちら

この著者の記事一覧へ

関連記事

  • AI検索の引用は、すでに目立つ発信者に寄るのか
    【LLMO論文解説】AI検索の引用は、すでに目立つ発信者に寄るのか|Web3の44事業・132問を4つのAIで監査(プレプリント2026)
  • 会話型検索向けSEOは本当に効くか、6分野・4モデルで試した結果
    【LLMO論文解説】会話型検索向けSEOは本当に効くか、6分野・4モデルで試した結果|多くの手法は有意に効かなかった(NeurIPS 2025)
  • AI Overviewsの出典は検索上位と別物か
    【LLMO論文解説】AI Overviewsの出典は検索上位と別物か|4,706問で見た重なりと不安定さ(Findings of ACL 2026)
  • ChatGPT流入の伸びは施策の効果か、成長の追い風か
    【LLMO論文解説】ChatGPT流入の伸びは施策の効果か、成長の追い風か|対照ページで切り分けた1サイト分析(プレプリント)
  • AI検索で「出典に出た」と「答えを変えた」を分けて測る
    【LLMO論文解説】AI検索で「出典に出た」と「答えを変えた」を分けて測る|CC-GSEO-Bench(プレプリント)
  • 文章を直接書き換えず統計・出典・見出しの性質から作る仕組み
    【LLMO論文解説】文章を直接書き換えず統計・出典・見出しの性質から作る仕組み|宣伝ページの目立ち方が最大96%増(ACL 2026)
  • 調べものAIは汚染された根拠を見抜けるか「HAE-GEO」
    【LLMO論文解説】調べものAIは汚染された根拠を見抜けるか「HAE-GEO」|裏づけを装うほど見抜きにくい・10モデル(プレプリント)
  • 検索AIへの攻撃を「繰り返す囚人のジレンマ」で理論化
    【LLMO論文解説】検索AIへの攻撃を「繰り返す囚人のジレンマ」で理論化|防御を強めても攻撃が減らない条件(ICML 2026ワークショップ)
最近の投稿
  • 温泉の集客は宿泊客と日帰り客の線引きで決まる 掲示ルールに沿うページの作り方
  • デザイナーの集客は作品集だけでは届かない 発注担当が社内で通せるサイトの作り方
  • 屋根の集客は見えない屋根を見せる会社が選ばれる 点検商法と疑われないサイトの作り方
  • 遺品整理の集客は遺族の迷いに先回りして決まる 広告頼みから指名へ移るサイトの作り方
  • 看板の集客は検索した先で決まる 見た人を来店につなぐ受け皿の作り方
最近のコメント
  • ホテルの集客は公式サイトで迷わせないことから 予約サイト頼みを抜ける直し方 に 温泉の集客は宿泊客と日帰り客の線引きで決まる 掲示ルールに沿うページの作り方 - 合同会社謙虚 より
  • 外壁塗装の集客は急がせない会社が選ばれる 下請けを抜けて直接の依頼を増やすホームページの作り方 に 屋根の集客は見えない屋根を見せる会社が選ばれる 点検商法と疑われないサイトの作り方 - 合同会社謙虚 より
  • 不用品回収の集客は料金の見せ方で決まる 当日の追加請求を疑われない業者のサイトの作り方 に 遺品整理の集客は遺族の迷いに先回りして決まる 広告頼みから指名へ移るサイトの作り方 - 合同会社謙虚 より
  • 外壁塗装の集客は急がせない会社が選ばれる 下請けを抜けて直接の依頼を増やすホームページの作り方 に 看板の集客は検索した先で決まる 見た人を来店につなぐ受け皿の作り方 - 合同会社謙虚 より
  • 【LLMO論文解説】回答が似ていても出典は重ならない|BaiduとGoogleのAI要約を英語と中国語の500問で監査(EMNLP 2026ワークショップ) に 【LLMO論文解説】海外のGEO・LLMO・AIO論文101本の一覧|原論文から最新研究まで、テーマ別に整理(随時更新) - 合同会社謙虚 より
  • 記事制作(KCW)
  • 売れるサイトはみな謙虚
  • サービス一覧
  • サイトの無料診断
  • 合同会社謙虚とは
  • 代表プロフィール
  • ブログ
  • お問い合わせ
  • プライバシーポリシー
  • 特定商取引法に基づく表記

© 合同会社謙虚

目次