AIにおすすめの商品を聞くと、候補が順番つきで返ってきます。この順番を外から動かす手法は、ここ2年ほどで次々に発表されました。
ただ、論文ごとにデータも物差しも違い、どれが強いのか横に並べられずにいました。そこで8つの手法を同じ条件で採点し直したのが、南カリフォルニア大学とアリゾナ州立大学の研究者5人が2026年5月に公開した「GEO-Bench: Benchmarking Ranking Manipulation in Generative Engine Optimization」です。
先に名前の注意です。GEO原論文が作った1万問の質問集も「GEO-bench」ですが、この論文とは別物です。
原論文の質問集はAIの回答で目立つかを測る問題集で、こちらは順位を操作する手法どうしを比べる採点の仕組みです。この記事では、どの系統の手法が、どのAIとデータで、どれだけ効いたのかだけを書きます。
攻撃の研究なので、仕込む文字列、書き換えの指示文、最適化の手順や設定値は載せません。弊社はこうした操作を勧めない立場で、守る側として読んでいます。
合同会社謙虚は、3つのドメインを並行して運用し、何を変えると数字が動くかを測り続けています。論文ごとに報告されてきた「順位がこれだけ動いた」という数字が、条件をそろえるとどこまで残るのかを確かめるために、この論文を読みました。
結論:3行で言うと
- 8つの手法を、同じ公開モデル(Llama-3.1-8B-Instruct)と英語の5つのデータで比べると、順位の伸びの平均が最も大きかったのは、攻撃用のAIに文を何度も作り直させるTAP(0.53)でした。AIの内部の数値を使う3つの攻撃は中位から下位で、文章を書き換えるだけの手法が、5つのデータのうち3つで内部を使う攻撃と同等以上でした
- 攻撃は、押し上げる力と見つかりにくさを両立できませんでした。TAPは宣伝語の混入率が0.83以上、STSは文の不自然さが最大12.72倍です。例外は書き換えで、権威的な文体への書き換えが、1つのデータで強く押し上げながら、2つの見張りの目安をどちらもすり抜けました
- 手法の順位はデータごとに入れ替わり、同じ手法が0.83から0.00まで振れました。試したのは公開モデル1つだけで、実際のAI検索サービスと日本語は対象外です。査読前のプレプリントです
この論文の基本情報
| 項目 | 内容 |
|---|---|
| 題名(原題) | GEO-Bench: Benchmarking Ranking Manipulation in Generative Engine Optimization |
| 著者 | Ojas Nimase、Zhe Chen、Gengpei Qi、Yue Zhao、Xiyang Hu(5人。南カリフォルニア大学、アリゾナ州立大学) |
| 公開日 | 2026年5月27日(arXiv初版)。確認した版は5月30日の第2版 |
| arXiv番号 | 2605.29107(主分類は暗号とセキュリティ) |
| 掲載・採択状況 | arXivのプレプリント(査読前の論文)。コメント欄は空欄です。倫理の節に「投稿前に公開方針を確認する」という趣旨の一文が残っており、採択された版とは読めません |
| 種類 | 大学の研究。既存の手法を同じ条件で採点し直すベンチマーク(比較のための共通の試験) |
| 実験データとコード | 公開先は論文に記載。評価に必要なものだけを利用制限つきで公開し、実際のサービスを狙う手順は出さない方針と書かれています |
論文はこちらで読めます。arXiv(2605.29107)、arXivが発行したDOI。
この論文が答えた問い
AIの順位づけを動かす手法を、同じAI・同じデータ・同じ物差しで並べたとき、どれがどれだけ効き、どれが見つかりやすいのか。AIの内部を使える攻撃は、外から問い合わせるだけの手法より強いのか。
論文によると、これまでの研究はそれぞれ自前のデータと指標で評価してきました。そのため、1つのデータでの成功がほかでも通じるのか、高い成功率が見つかりやすさと引き換えになっていないかが、分からないままでした。
内部を使うかどうかの区別には、実務上の意味があります。論文は、外から問い合わせるだけの手法は市販のAIのAPIにも向けられると整理しています(効くかどうかは、この論文では試していません)。
内部の数値(勾配。どの語を変えると結果がどちらへ動くかを示す値)が要る手法は、使える相手が中身を公開しているモデルに限られます。
論文は、この区別が守る側にとって現実的な脅威を見分ける手がかりになると述べています。
どうやって調べたのか
| 項目 | 設定 |
|---|---|
| 順位をつけるモデル | Llama-3.1-8B-Instruct(中身を公開している80億パラメータ級)1つに固定 |
| データ(すべて英語) | Ragroll(399商品・50分類)、STSData(30商品・3分類)、RewriteToRank(1万商品から20分類×10商品を抜き出し)、LLM Rank Optimizer(40商品・4分類)、C-SEO Bench(16,360件・6分野を1行にまとめて報告) |
| 押し上げる対象 | 各分類の最初の商品 |
| 書き換え文を作るモデル | GPT-4o-mini |
| 不自然さを測るモデル | Vicuna-7B |
| 採点 | すべて自動の指標。人による評価はなし |
何件を何回評価したかは、本文にも付録にも明記されていません。比べた手法は、次の3系統8つです。
| 系統 | 手法 | 何をするか(一言) |
|---|---|---|
| 外から問い合わせる攻撃 | 単発の書き足し | 攻撃用のAIに1回だけ、説明文の末尾に足す短い文を作らせる |
| 外から問い合わせる攻撃 | TAP | 攻撃用のAIが候補を何度も作り、試しながら絞り込む |
| 正攻法とされる書き換え | 権威的な文体 | 権威と説得力のある文体に書き換える(GEO原論文の手法) |
| 正攻法とされる書き換え | 内容の総合改善 | 流暢さ・構成・出典などの書き換えを1回にまとめる |
| 正攻法とされる書き換え | LLMガイダンス | 文書の先頭に、内容の要約を足す |
| 内部の数値を使う攻撃 | STS | 末尾に足す短い文字列を、内部の数値を頼りに最適化する |
| 内部の数値を使う攻撃 | RAF | 順位と読みやすさの両方を見て、文字列を2段階で組み立てる |
| 内部の数値を使う攻撃 | StealthRank | 順位、文の自然さ、宣伝語を避けることを同時に狙う |
書き換えは10種類を試し、本文には上位3つが載っています。採点の物差しは5つです。
- 順位の伸び:操作の前後で動いた順位を、一覧の件数でそろえた値。1は最下位から1位、0は変化なし
- 上位10%到達率と、上位10%への押し上げ率:後者は、もともと圏外だった対象が入った割合だけを数えます。一覧が10件以下なら、上位10%は1位だけです(定義の式からの私の計算)
- 宣伝語の混入率:決めておいた宣伝の決まり文句を含む割合。低いほど見つかりにくい
- 不自然さの比:文の読みにくさ(当惑度)の、操作後÷元。1に近いほど元の自然さを保つ
後の2つは実際の検出器ではなく、見張りの簡易な目安です。
結果
外から問い合わせるだけの手法が上位を占めた
論文の表4から「順位の伸び」を拾います。平均は、5つの値を私が単純平均した概算です(TAPの0.53は本文にも同じ値があります)。
| 手法 | Ragroll | STSData | RewriteToRank | LLM Rank Optimizer | C-SEO Bench | 平均(概算) |
|---|---|---|---|---|---|---|
| TAP | 0.49 | 0.57 | 0.33 | 0.77 | 0.47 | 0.53 |
| 権威的な文体 | 0.60 | 0.37 | 0.22 | 0.00 | 0.83 | 0.40 |
| 内容の総合改善 | 0.69 | 0.33 | 0.43 | 0.03 | 0.50 | 0.40 |
| LLMガイダンス | 0.58 | 0.00 | 0.39 | 0.03 | 0.83 | 0.37 |
| STS | 0.45 | 0.60 | 0.06 | 0.42 | 0.18 | 0.34 |
| StealthRank | 0.43 | 0.43 | 0.05 | 0.26 | 0.08 | 0.25 |
| 単発の書き足し | 0.10 | 0.16 | 0.03 | 0.27 | 0.04 | 0.12 |
| RAF | 0.09 | 0.07 | -0.02 | 0.03 | -0.04 | 0.03 |
- 平均の上位3つは、どれも外から問い合わせるだけの手法でした。論文は「使える情報の多さは、攻撃の強さを予測しない」とまとめています
- 書き換えの上位が内部を使う攻撃と同等以上だったのは、Ragroll、RewriteToRank、C-SEO Benchの3つです。残る2つではSTSが上でした
- 論文は理由を、内部を使う手法は語のかけら単位の代わりの目標を最適化していて、AIの判断を追い切れていないためだろう、と推測しています
- 上位10%への押し上げ率(一覧が10件以下なら1位)でも、TAPは0.56〜0.92と高く、RAFは最大0.28、単発の書き足しは最大0.02でした
攻撃は「効く」と「目立たない」を両立できなかった
同じ表4から、見張りの2つの目安の幅(5つのデータの最小〜最大)を拾います。
| 手法 | 宣伝語の混入率 | 不自然さの比 |
|---|---|---|
| TAP | 0.83〜1.00 | 0.53〜1.35 |
| 権威的な文体 | 0.00〜0.67 | 0.30〜0.85 |
| 内容の総合改善 | 0.17〜1.00 | 0.21〜0.86 |
| LLMガイダンス | 0.00〜0.56 | 0.21〜0.74 |
| STS | 0.03〜0.20 | 1.54〜12.72 |
| StealthRank | 0.33〜0.77 | 1.41〜1.97 |
| 単発の書き足し | 0.08〜0.25 | 0.53〜1.02 |
| RAF | 0.01〜0.15 | 1.10〜6.42 |
TAPはよく押し上げる代わりに宣伝語を多く含み、STSは宣伝語が少ない代わりに文が不自然になりました。RAFは宣伝語が少なく、単発の書き足しは2つの目安のどちらにも引っかかりにくい一方で、順位の伸びは最大でもRAF 0.09、単発の書き足し0.27にとどまりました。
論文は、攻撃は押し上げ・宣伝語なし・自然な文の3つを同時に満たせない、とまとめています。
例外が書き換えです。C-SEO Benchのデータで、権威的な文体への書き換えは、LLMガイダンスと並ぶ最高の伸び(0.83)を出しながら、宣伝語の混入率0.00、不自然さの比0.74でした。
論文は、守る側にとって手ごわいのは、宣伝語を使わず自然に書かれた書き換えのほうだと述べています。
データが変わると、手法の順位が入れ替わる
平均で最強のTAPも、首位に立ったのは5つのデータのうち1つだけでした。権威的な文体はC-SEO Benchの0.83から、LLM Rank Optimizerの0.00まで振れ、STSは0.60から0.06まで下がりました。
論文は、1つのデータだけの結果は一般化できる度合いを大きく見せる、と注意しています。
付録の表3で書き換え10種を見ると、件数の少ないデータでは順位を下げたものもありました(STSDataで流暢さの改善と専門用語を足すが-0.67)。
5つのデータの平均(私の概算)では、GEO原論文で伸びが大きかった「引用を足す」と「出典を示す」が、どちらも-0.05前後で10種の最下位2つでした。
原論文は回答の中での目立ち方を、この論文は商品の順位を測っているので、物差しが異なります。
論文自身が書いている限界
- 順位をつけるモデルは公開モデル1つに固定しています。ほかのモデルへ広げるのは容易だとしていますが、今回は行っていません
- 見つかりにくさの物差しは自動で計算できる代わりの目安で、人の判断や訓練した検出器による評価ではありません
- データは英語の商品と文章の順位づけが中心で、ほかの言語や分野へ結論が移るとは限りません
- 手元で動かす公開モデルに対する実験で、実際に動いている商用のサービスは対象外です
原文を読んで気づいた点
- 日本語での検証はありません。実際のAI検索サービスでの確認もなく、採点はすべて自動の指標で、査読を経た版も確認できませんでした
- 表3の書き換えの到達率・押し上げ率・宣伝語の混入率は、STSDataで3分の1刻み、LLM Rank Optimizerで4分の1刻み、C-SEO Benchで6分の1刻みです。分類の数(3、4、6)と一致し、付録には押し上げる対象を各分類の最初の1件とする旨の記載があります。権威的な文体の「0.83±0.37」も、6件中5件で成功、1件で失敗とすると計算が合います。対象1件につき1回の評価だった可能性があります(私の推測)。そうであれば、「2つの見張りをすり抜けた」という看板の結果は、6件ほどの評価に基づきます
- 不自然さの比について、表の注は「1に近いほど自然」としていますが、書き換えの値は0.21〜0.86と1を大きく下回り、本文はこれを「より流暢」と扱っています。元の文よりAIにとって予測しやすい文という意味で、AIが書いた文の特徴とも重なります(ここは私の読み取りです)
- LLMガイダンスは、サイトに置くllms.txtという仕組みから着想したと書かれています。実験はAIに渡す文書の先頭に要約を足したもので、サイトにファイルを置いた効果を測った実験とは別物です
- 著者のうち2人はStealthRankの、1人はRAFの論文の著者でもあります。その2つの手法は、この比較では中位から下位でした
弊社の既存の解説記事との関係
- RAFの論文は、Llama-3.1-8Bを含む公開モデル4つと、STSData由来の3分野の計12の組み合わせすべてで、STSとStealthRankを上回ったと報告していました。この論文のSTSDataでは、RAF 0.07、STS 0.60、StealthRank 0.43で、順番が逆です
- StealthRankの論文は、8条件すべてでSTSを上回ったと報告していました。この論文では、5つのデータすべてでSTSが同等以上です
- C-SEO Benchの論文では、書き換えの多くが引用の順番を有意に動かしませんでした。元の論文は複数の文書から作った回答の中の引用順を、この論文は1つのモデルが並べる順位を測っています
順位の測り方、対象の選び方、一覧の並べ方が違うため、どちらが正しいとは判定できません。この論文も、元の論文との食い違いには触れていません。
TAPを使った論文が示した押し上げの強さは、この論文と同じ向きでした。
この論文から、言えること・言えないこと
| 言えること(論文の設定で確認された) | 言えないこと(論文では確認されていない) |
|---|---|
| 同じ公開モデルと英語の5つのデータでは、TAPの押し上げが平均で最も強かった | ChatGPTなど実際のAI検索サービスで、同じ順番になること |
| 内部を使う攻撃が、外から問い合わせるだけの手法より強いとは限らなかった | 中身を公開していない市販のAIで、どの手法がどれだけ効くか |
| 攻撃は、押し上げと2つの見張りの目安を両立できなかった | 人や本格的な検出器が、それぞれの手法を見つけられるかどうか |
| 書き換えは、1つのデータで両方の目安をすり抜けつつ強く押し上げた | 書き換えが一般に見つからないこと |
| 手法の優劣は、データによって大きく入れ替わった | 日本語の商品説明やページで、同じ傾向になること |
「順位の伸び0.83」は件数でそろえた値で、「83%の確率で1位になる」という意味とは違います。
中小企業の視点で、どう受け取るか
ここからは論文の主張とは別の、私の読み取りです。
1. 「順位が上がった」という数字は、条件を3つ聞いてから受け取る
同じ手法でも、データが変わると結果は大きく入れ替わりました。元の論文で他の手法に勝った攻撃が、条件をそろえると下位に回った例もあります。
AI検索の施策で「これで上がった」と聞いたら、どのAIで、どんなデータで、どの物差しで測ったのかを確かめてから判断するのが安全です。
2. 説得の言い回しだけを足す書き換えは、見張りの次の標的と見ておく
論文は、守る側の見張りを、語句や文の不自然さから、文の意味や意図を読む方向へ移す必要があると述べています。中身を変えずに権威や説得の調子だけを足した文章は、今後「操作」側に数えられる可能性があります。
自社のページに足すなら、確かめられる事実と数字を優先するほうが、長く使える文章になります。
3. AIに整えさせた文は、宣伝の決まり文句を人の目で削る
表3では、AIに「統計を足す」「内容を総合的に改善する」と書き換えさせた文の多くが、宣伝語の一覧に引っかかっていました(Ragrollで0.72と0.74、STSDataではどちらも1.00)。
頼んでいない宣伝の言い回しが混ざりやすいと読めます。公開前に、人が読んで削る手順を1つ入れておくと安心です。
よくある質問
順位操作のGEO-Benchと、GEO原論文の質問集「GEO-bench」は同じものですか
別物です。GEO原論文(KDD 2024)の「GEO-bench」は、AIの回答でページがどれだけ目立つかを測る1万問の質問集です。
この記事のGEO-Benchは、2026年5月に公開された、順位操作の手法を比べる採点の仕組みです。引用するときはarXiv番号(2311.09735と2605.29107)を添えると、取り違えを防げます。
GEO-Benchの順位操作の結果は、ChatGPTなど実際のAI検索サービスにも当てはまりますか
この論文からは分かりません。順位をつけたのは中身を公開している80億パラメータ級のモデル1つで、データはすべて英語でした。
論文自身も、商用サービスは対象外だと書いています。実験室の中で出た差として受け取るのが妥当です。
GEO-Benchで効いた「権威的な文体への書き換え」は、自社サイトでも効きますか
効くとは言い切れません。C-SEO Benchのデータでは0.83でしたが、LLM Rank Optimizerでは0.00で、評価の件数が少なかった可能性もあります。
GEO原論文でも、権威的な文体の伸びは9つの書き換えの中で小さいほうでした。文体を変えるより、ページに書く事実を確かにするほうが手堅い打ち手です。
まとめ:今日できる1つのこと
自社の主力商品の説明文を1本開き、「一番人気」「必ず」のような宣伝の決まり文句と、根拠を示していない権威づけの言い回しに印を付けてください。
印を付けた所は、価格、仕様、実績の数字など、読んだ人が確かめられる事実に置き換えます。見張りが意味を読む方向へ進んでも、事実で書いた説明文はそのまま残せます。
この論文は、LLMO論文の一覧の一本です。ほかの論文の解説も、順次公開しています。
この記事に書いたことを、そのまま御社のページに
生成AIに引用されるページを、お話しいただくだけでお作りします。お時間をいただくのは初回15分のヒアリングだけです。まず1ページ、無料でお作りします。
OKが出るまで、何度でも直します。事実が違う、言い回しが硬い、この話は入れないでほしい。どれも遠慮なくおっしゃってください。何度お直ししても、追加の料金はいただきません。
これまでに127社にご利用いただきました。毎月ご依頼いただいている方の6割以上が、月10ページを選ばれています。料金はページに掲載しています。
ページを増やしても問い合わせが来ないなら、原因はページの外にあります。その場合は、下の入口からご相談ください。
自社のマーケティング課題を根本から解決しませんか?
ウェブサイトから要素を引き算し、訪れた人が迷わず次の一歩に進む形へ組み直す。初回60分のオンラインで御社のサイトを一緒に読み、どこから直すべきかをお伝えします。手順をまとめた無料の診断と解説動画もご用意しています。
初回は無料・60分・オンライン完結・その場で契約のお願いはいたしません


