「GEO対策をしたページ」は、外から見分けられるのでしょうか。2026年8月に公開された論文「GEO-Flag: Detecting and Measuring GEO-Optimized Web Content」は、この問いに正面から取り組んでいます。
視点は、最適化する側から、見分ける側へ移ります。
この記事は、その論文を原文から読み、何を作り、何を測り、何が分かったのかを整理します。数値はすべて論文の表・本文から拾いました。
自分で計算し直した値には「概算」と書いています。
同じ論文は、「AI検索向けに整えたページは、94%の精度で見分けられる」という記事でも、要点だけを短くまとめています。本記事はLLMO論文シリーズの1本として、評価用データの作り方・手法ごとの弱点・実サイト調査の内訳まで、原文の数値を踏み込んで整理します。
合同会社謙虚は、3つのドメインを並行して運用し、何を変えると数字が動くかを測り続けています。この論文を読む理由は、こちらが記事に足す工夫が、AI側からはどう見えているのかを知っておくためです。
結論:3行で言うと
- GEO対策されたページを見分けるための評価用データ(3,200件)を作り、既存の検出手法を並べて調べたところ、見かけの成績が良い手法ほど「AIが書いた文章かどうか」を手がかりにしている疑いが強いことが分かりました
- その弱点を減らす新しい学習方法(IPT)を試したところ、ModernBERTというモデルのF1値が0.862から0.944に、最も苦手な条件での正答率が0.725から0.883に上がりました
- 実際に配信されたGoogle検索とGemini基盤検索の結果を調べたところ、ページの8.90%がGEO対策済みと判定され、その引用先の69.34%が「検証しにくい」に分類されました
ただし、これは著者らが作った検出器による推定です。ページの持ち主が本当に意図してGEO対策をしたかどうかまでは、検出器の判定からの推測にとどまります。
この点は後の章で整理します。
この論文の基本情報
| 項目 | 内容 |
|---|---|
| 原題 | GEO-Flag: Detecting and Measuring GEO-Optimized Web Content |
| 著者 | Junjie Chu、Ye Leng、Mingjie Li、Yun Shen、Xinyue Shen、Yang Zhang(6人。所属はCISPAヘルムホルツ情報セキュリティセンター、米国の大手IT企業、ウォータールー大学) |
| 公開日 | 2026年8月17日(v1)。確認した版はv2(2026年8月20日) |
| arXiv番号 | 2608.16824(分野はcs.LG、機械学習。cs.CR・cs.IRも併記) |
| 掲載・採択状況 | arXivのプレプリント。学会・論文誌への採択状況は、確認した範囲では不明です |
| 種類 | ベンチマーク構築+検出手法の評価+実サイトでの実測調査 |
| 実験データ・コードの公開先 | 本文中では確認できず、公開先は不明です |
論文はこちらで読めます。arXiv(2608.16824)。
GEO対策そのものを扱ったGEO原論文の解説記事と合わせて読むと、最適化する側とされる側の両方が見えてきます。
この論文が答えた問い
AIが検索結果をまとめて答える環境で、あるページがGEO対策を受けているかどうかを、機械的に見分けられるのか。見分けられるとして、その検出器はどれくらい信頼できるのか。
論文は、GEO対策そのものは「悪」ではないと述べています。問題は、被リンクなどの裏づけがない主張でも、生成エンジンの回答に混ざってしまうと、読者から見分けがつきにくくなることです。
論文は例として、ある事業者が自社サイトに根拠のない主張を載せ、別のページからそれを引用する、という手口を挙げています。引用のURL自体は本物でも、引用元の中身が結論に合わせて作られている場合、読者は出典の質を確かめにくくなります。
どうやって調べたのか
まず、見分けるための「教材」を作った
論文はまず、GEOFlagBenchという評価用データを作りました。健康・金融・技術・旅行の4分野で400の質問を用意し、質問1つにつき「人が書いた文章」「AIが手直しした文章」「AIが書き下ろした文章」の3種類の非GEO文章と、8種類の最適化方法を適用したGEO文章を作っています。
| 項目 | 内容 |
|---|---|
| 質問の数と分野 | 400問。健康・金融・技術・旅行の4分野に各100問 |
| 非GEOの文章 | 1,200件(人が書いた・AIが手直しした・AIが書き下ろした、の3種×400問) |
| GEO対策済みの文章 | 2,000件(8種類の最適化方法を適用) |
| データ全体 | 3,200件。学習用2,238件・評価用962件に分割(同じ質問由来の文章が両方に混ざらないよう分割) |
| 試した検出手法 | ファインチューニング済みモデル(ModernBERT、Qwen3-0.6B)、TF-IDFなどの古典的分類器、市販のAI文章検出API(Pangram、GPTZero)、AIへの直接質問(Gemini、Claude Haikuなど) |
8種類の最適化方法には、複数の手法を組み合わせて書き換える方法、学習済みの規則に沿って書き換える方法、権威付けの言葉を差し込む方法、そして人間の作業者が実際に手を動かして最適化する方法(Human GEO)まで含まれています。これによって「機械的な最適化」と「人が丁寧にやった最適化」の両方で、検出器の性能を比べられるようにしています。
結果
成績の良い検出手法ほど、実は「AI文章判定」をしていた疑いがある
評価用データ全体でのF1値(見分ける精度をまとめた指標)を見ると、単語のTF-IDF(単純な単語の出現頻度を使う手法)にロジスティック回帰を組み合わせた手法が最も高く0.880でした。ところが、質問の種類ごと・元の文章がAI由来か人由来かの組み合わせごとに分けて調べると、話は変わります。
| 手法 | 全体のF1 | 最も苦手な条件での正答率 | 人とAIで誤検出率がどれだけ違うか |
|---|---|---|---|
| 単語TF-IDF+ロジスティック回帰 | 0.880 | 0.375 | 0.558 |
| Pangram(市販API) | 0.876 | 0.192 | 0.767 |
| ModernBERT(8Kトークン) | 0.862 | 0.725 | 0.263 |
| Gemini 3.5 Flash(AIに直接質問) | 0.776 | 0.589 | 0.258 |
| GPTZero(市販API) | 0.782 | 0.583 | 0.154 |
「最も苦手な条件での正答率」は、論文が worst-group accuracy と呼ぶ指標です。全体のF1では上位2つだったTF-IDFとPangramが、この指標では0.375、0.192と大きく落ち込みます。
特にPangramは、人が書いた文章とAIが書いた文章とで、誤ってGEOと判定してしまう率に0.767もの差がありました。
論文は、これを「著者がAIか人かという手がかりに頼っている疑いがある」と解釈しています。
手法別に見ると、差はさらにはっきりする
- 複数の最適化を強くかけたPMAという方法は、多くの検出手法が高い再現率(見逃さない率)で検出できました
- ごく一部だけを書き換えるAutoGEO-Lightという方法は、TF-IDF手法の再現率が0.308〜0.423まで下がりました
- 人間の作業者が手作業で最適化したHuman GEOでは、GeminiとClaude Haikuの再現率がそれぞれ0.037、0.074まで下がりました。GPTZeroも0.074でした
新しい学習方法(IPT)で、弱点が縮んだ
論文は、この弱点を減らすための学習方法として、IPT(Intervention-Paired Training、介入の前後をペアで学習させる方法)を提案しています。「元の文章」と「GEO対策後の文章」のペアではGEOらしさの点数が上がるよう学習させ、「元の文章」と「AIが文法だけ直した文章」のペアでは点数が変わらないよう学習させる、という2つの制約を同時に課す方法です。
| モデル | 学習方法 | F1 | 最も苦手な条件での正答率 |
|---|---|---|---|
| ModernBERT | 通常の学習 | 0.862 | 0.725 |
| ModernBERT | IPT | 0.944 | 0.883 |
| Qwen3-0.6B | 通常の学習 | 0.833 | 0.325 |
| Qwen3-0.6B | IPT | 0.883 | 0.775 |
ModernBERTでは、人とAIとの誤検出率の差も0.263から0.108に縮みました。論文は、著作権侵害を防ぐための代替手法(GRL)も比較していますが、そちらは正答率0.783までの改善にとどまり、IPTのほうが効果が大きいと報告しています。
引用先のURLまで確かめるしくみも作った
論文は、ページ単位でGEOと判定するだけでなく、そのページが引用しているURLの信頼性まで自動で調べる仕組み(GEO-gated Agent)も作っています。
引用先を発行元の説明責任の強さで3段階(C1〜C3)に分け、実際にアクセスできるかどうかと組み合わせて、検証しやすさをHIGH・MEDIUM・LOWの3段階で判定します。
この仕組みをGLM 5.2というAIモデルで動かしたところ、引用先の格付けで84.75%、検証しやすさの判定で83.00%の正答率でした。
実際のGoogle検索・Gemini検索で調べると
論文は、実際のユーザーが検索した1,000件の質問(ORCASという公開データセット)を使い、2026年7月28日から31日にかけて配信されたGoogle検索とGemini基盤検索の結果ページを集めて調べています。集まった1万95件の実在ページに、著者らが作った検出器(ModernBERT-IPT)をかけた結果が次の表です。
| 調べた対象 | GEOと判定された割合 |
|---|---|
| Google検索のページ全体 | 8.14% |
| Gemini基盤検索のページ全体 | 9.09% |
| 両方をまとめた実ページ全体 | 8.90%(95%信頼区間 8.36〜9.47%) |
| 更新日が2024年と分かるページ | 7.02% |
| 更新日が2025年と分かるページ | 12.80% |
| 更新日が2026年と分かるページ | 16.36% |
更新日が分かったのは、1万95件のうち19.57%だけでした。それでも、更新日が新しいページほどGEO判定の割合が高くなる傾向は、Google・Gemini双方で見られています。
また、GEOと判定されたページが引用しているURL(6,663件)のうち、68.84%が説明責任の弱い発行元(C3)からのもので、69.34%が「検証しにくい」というLOW判定でした。
Gemini基盤検索経由のページは、Google検索経由のページに比べて、この検証しにくい引用の割合がさらに高くなっています(74.15%対45.88%)。
論文自身が書いている限界
論文は、自分で次の限界を挙げています。
- GEO対策そのものは、論文の言葉で言えば中立な手法です。GEOと判定されても、その内容の正誤や有害性とは別の話だと、論文は明記しています。
- ベンチマークは8種類の最適化方法をカバーしていますが、将来登場する新しい最適化方法への対応力は未検証です。控えめな書き換えや人間による最適化は、すでに検出が難しいことが示されています。
- 実サイトでの8.90%という数字は、検出器とエージェントの判定に基づく推定であり、ページの持ち主が本当に意図してGEO対策をしたかどうかを直接確かめたものとは異なります。
- 更新日が分かるページは全体の19.57%にとどまり、この日付欄はGEO対策が行われた時期の推測材料にとどまります。2024年から2026年にかけての増加傾向も、論文は確定した事実ではなく記述的な傾向として位置づけています。
- 引用URLの検証しやすさは、発行元の説明責任とアクセスのしやすさを測った指標です。引用されている主張が正しいかどうかは、別に確かめる必要があります。
加えて、この記事を書くために原文を読んで気づいた点があります。
- この論文はarXivのプレプリントの段階にとどまっています。確認した範囲では、査読を経たかどうかは不明です。査読の有無は研究の質そのものとは別の論点ですが、学会採択済みの研究とは、その点で立場が異なります。
- ベンチマークで使われた質問と非GEOの文章は英語圏のものです。健康・金融など分野の分け方も、英語の情報源を前提にしています。日本語のページでの検証は、この論文の範囲外です。
- ベンチマークの質問選びやドメイン分類には、Sonnet 4.6というAIモデルの判定が使われています。人手の確認も入っていますが、教材づくりの一部をAIが担っている点は押さえておく価値があります。
- 著者の1人は米国の大手IT企業に所属していますが、研究全体はCISPAという学術機関が主導し、GEOを見分ける側に立っています。自社のGEO対策サービスを宣伝する報告とは、性質が異なります。
- 実サイト調査でのGEO検出は、著者ら自身が学習させた検出器(ModernBERT-IPT)の予測に基づいています。この検出器はベンチマーク上でF1 0.944でしたが、実際のページはベンチマークの文章より多様なため、同じ精度が出るかどうかは未知数です。
この論文から、言えること・言えないこと
| 言えること(論文の設定で確認された) | 言えないこと(論文では確認されていない) |
|---|---|
| ベンチマーク上では、複数の検出手法がF1 0.86前後まで到達した | 今後登場する未知の最適化方法にも、同じ精度で通用すること |
| 全体の成績が良い手法ほど、著者がAIか人かという手がかりに頼っている疑いが見られた | 個別の検出結果が、日本語のページでも同じ精度になること |
| IPTという学習方法で、ModernBERTの弱点(最も苦手な条件での正答率)が0.725から0.883に上がった | ページの持ち主が本当に意図してGEO対策をしたかどうか |
| 実際のGoogle検索・Gemini検索の結果で、8.90%のページが検出器によりGEOと判定された | GEOと判定されたページの内容が、誤りや低品質であること |
| GEOと判定されたページの引用先の69.34%が、検証しにくいLOW判定になった | 引用されている主張そのものが正しいか、間違っているか |
中小企業の視点で、どう受け取るか
ここからは論文の主張とは別の、私の読み取りです。
- この論文が見分けようとしているのは、機械的な書き換えのパターンです。実在する数字や出典を、誠実に足す作業は、この論文が問題にしている書き換えとは別のものです。論文が問題視しているのは、根拠のない主張を「もっともらしく見せる」書き換えです。
- 「AIが書いた文章か」を手がかりにする検出手法は弱点を抱えていることが分かりました。裏を返せば、AIの手を借りて文章を整えること自体は、この論文が問題にしているGEO対策とは別の話です。文法や読みやすさを整える作業と、根拠のない主張を装う作業は、区別して考えられます。
- 控えめな書き換えほど検出が難しいという結果は、「小さな工夫を積み重ねる」やり方が、検出をかいくぐるためではなく、単に自然な改善として見えやすいことも示しています。過剰な最適化の痕跡を残さないことは、読者にとっても読みやすい文章につながります。
- 実サイトでの8.90%という数字は、業界の平均のようなものとして参考になりますが、自社のページがどちらに当てはまるかは、この数字とは別に、個別に確かめる必要があります。判断材料にするより、「引用や主張には、確かめられる根拠を付ける」という基本を続けるほうが、この論文の結果とも整合します。
よくある質問
GEO-Flagベンチマークは、日本語のページにも使えますか
論文が使った質問・文章はすべて英語圏のものです。健康・金融などの分野分けや、最適化の見分け方も、英語の情報源を前提に作られています。
日本語のページでの検出精度は、この論文の対象外です。
IPTという学習方法は、どんなツールでも使える改善策ですか
IPTは、検出器を学習させる側の工夫です。読者が自社のページに直接使えるものではなく、GEO対策を見分けるツールを作る立場の研究者・開発者向けの手法です。
ただし、控えめな書き換えほど見逃されやすいという知見は、検出器を使う側にも参考になります。
実サイトで検出されたGEOの割合が8.90%というのは、多いのでしょうか少ないのでしょうか
論文は、この数字を多い・少ないとは評価せず、更新日の新しいページほど割合が高くなる傾向を示すだけにとどめています。この数字は著者らが作った検出器による推定であり、同じ検出器を別の時期・別の検索サービスにかけた場合、数字は変わり得ます。
まとめ:今日できる1つのこと
自社のページで、最近まとめて手を入れた記事を1本開いてください。主張のうち、根拠となる出典や数字が「実在し、確かめられる」ものになっているかを見直します。
この論文が問題にしているのは、根拠を確かめられない主張を、もっともらしい体裁で並べることです。逆に言えば、確かめられる根拠を丁寧に積み重ねる作業は、この論文の指摘とは別の方向にあります。
この論文は、LLMOの出発点になったGEO対策を、見分ける側から検証した研究です。次に読む論文でも、測り方の前提を確かめる作業を続けます。
この論文は、LLMO論文の一覧の一本です。ほかの論文の解説も、順次公開しています。
この記事に書いたことを、そのまま御社のページに
生成AIに引用されるページを、お話しいただくだけでお作りします。お時間をいただくのは初回15分のヒアリングだけです。まず1ページ、無料でお作りします。
OKが出るまで、何度でも直します。事実が違う、言い回しが硬い、この話は入れないでほしい。どれも遠慮なくおっしゃってください。何度お直ししても、追加の料金はいただきません。
これまでに127社にご利用いただきました。毎月ご依頼いただいている方の6割以上が、月10ページを選ばれています。料金はページに掲載しています。
ページを増やしても問い合わせが来ないなら、原因はページの外にあります。その場合は、下の入口からご相談ください。
自社のマーケティング課題を根本から解決しませんか?
ウェブサイトから要素を引き算し、訪れた人が迷わず次の一歩に進む形へ組み直す。初回60分のオンラインで御社のサイトを一緒に読み、どこから直すべきかをお伝えします。手順をまとめた無料の診断と解説動画もご用意しています。
初回は無料・60分・オンライン完結・その場で契約のお願いはいたしません


