MENU
  • 料金
  • 会社案内
  • コンサル
  • お問い合わせ
  • 無料で1ページ頼む
AIO・LLMO・GEO対策の記事制作
合同会社謙虚
  • 料金
  • 会社案内
  • コンサル
  • お問い合わせ
  • 無料で1ページ頼む
  • 料金
  • 会社案内
  • コンサル
  • お問い合わせ
  • 無料で1ページ頼む
合同会社謙虚
  • 料金
  • 会社案内
  • コンサル
  • お問い合わせ
  • 無料で1ページ頼む
  1. ホーム
  2. LLMO
  3. LLMO論文
  4. 【LLMO論文解説】自然に見える短い文字列でAIの順位づけは動くか|4つの公開モデルで試した攻撃(ACL 2026)

【LLMO論文解説】自然に見える短い文字列でAIの順位づけは動くか|4つの公開モデルで試した攻撃(ACL 2026)

2026 9/30
2026年9月29日2026年9月30日
中野輝規
自然に見える短い文字列でAIの順位づけは動くか

商品の説明文の末尾に、ふつうの宣伝文にしか見えない短い文を足すだけで、AIが並べる商品の順番の上のほうへ、狙った商品を押し上げられるのか。

これを実験で調べた論文があります。2025年10月にarXivで公開され、2026年7月の自然言語処理の国際会議ACL 2026の本会議に採択された「Are LLMs Reliable Rankers? Rank Manipulation via Two-Stage Token Optimization(大規模言語モデルは信頼できる順位づけ役か。

2段階のトークン最適化による順位操作)」です。

この記事では、原文から、何を試し、順位がどれだけ動き、どんな条件で効いたのか・効き目が薄れたのか、人の目にどれほど自然に見えたのかを整理します。

扱うのは攻撃の研究です。仕込む文字列そのものや作り方の手順・設定は、悪用の手引きにならないよう載せず、結果だけを書きます。

弊社はこうした操作を勧めない立場で、守る側の視点から読んでいます。

合同会社謙虚は、3つのドメインを並行して運用し、何を変えると数字が動くかを測り続けています。AIの順位づけが「自然に読める文章」でどこまで動かされうるのかを知っておくことは、AIに比べさせた結果を読むときの判断の土台になるため、この論文を読みました。

目次

結論:3行で言うと

  • 書籍・カメラ・コーヒーメーカーの商品一覧で、対象の商品の説明に最適化した短い文字列を足すと、4つの公開モデルすべてで、平均順位が何もしない場合の想定値(5.5位)より上位でした。論文が「何もしなければ5.5位」とする想定値に対し2.36〜5.33位で、既存の2つの攻撃手法より、12の組み合わせすべてで上位でした
  • 足した文字列は人の目にも自然に見えました。既存の手法と見比べる評価で、自然さでは83.95%が論文の手法を選び、「作為的に見える」とされたのは5.56%でした。比べた相手は既存の攻撃の文字列で、元の商品説明ではありません
  • 内部を読める公開モデルで作った文字列は、ほかの公開モデルにもほぼそのまま効きました(カメラの分野で確認)。一方、商用の大型モデル(GPT-5.1)では平均5.76位にとどまり、論文自身が「商用モデルを確実に操作できるとは主張しない」と書いています

数値は英語の商品データを使った実験室の結果で、実際のAI検索サービスや日本語は対象外です。

この論文の基本情報

項目 内容
題名(原題) Are LLMs Reliable Rankers? Rank Manipulation via Two-Stage Token Optimization
著者 Tiancheng Xing、Jerry Li、Yixuan Du、Xiyang Hu(4人。シンガポール国立大学、南カリフォルニア大学、ジョージタウン大学、アリゾナ州立大学)
公開日 2025年10月8日(arXiv初版)。確認した版は2026年6月28日の第2版
arXiv番号 2510.06732(分類は計算言語学、人工知能、情報検索)
掲載・採択状況 ACL 2026(第64回年次大会)の本会議・長編論文。会議録(ACL Anthology)に掲載済みで、9120〜9132ページ。arXivのコメント欄にも「ACL 2026」とあります。会議録の版とarXiv第2版で数値が一致することを確認しました
種類 大学の研究。AIに商品一覧を直接渡して順位をつけさせる実験室の実験
実験データとコード コードは著者が公開していると論文に書かれています。この記事ではリンクを載せていません

論文はこちらで読めます。arXiv(2510.06732)、ACL Anthology(会議録)、会議録のDOI。

この論文が答えた問い

AIが候補の一覧を並べ替えるとき、対象の商品の説明に、人が読んでも不自然さのない短い文字列を足すだけで、その商品を狙って上位に押し上げられるのか。

背景には、検索や推薦の最後に、AIに候補の並べ替えを任せる使い方の広がりがあります。論文はこの役割を「リランカー(並べ替え役)」と呼びます。

候補と質問をまとめてAIに渡し、番号つきの一覧を返させる形です。

順位の操作は、これまでも研究されてきました。当シリーズで解説した商品情報に仕込んだ文字列の論文(2024年)は、その早い例です。

ただ、そこで使われた文字列は人が読むと意味の通らない並びでした。論文は、既存の手法には「よく効くが不自然で見つかりやすい」か「自然だが効きが弱い」かの板挟みがある、と指摘します。

この論文は、両方を満たす攻撃が作れるかを確かめ、弱点として示すことを目的にしています。

論文の手法は「Rank Anything First(RAF)」と名づけられています。内部の数値を読める公開モデルを相手に、「対象を1位に挙げさせる」狙いと「文章として自然に続く」狙いを同時に満たすよう、文字列を機械的に組み立てる方法です。

手順と設定値は、この記事では省きます。

どうやって調べたのか

項目 設定
データ 2024年の戦略的な文字列の論文に由来するデータ(論文の呼び名はSTSData)。書籍、カメラ、コーヒーメーカーの3分野。各商品は銘柄、価格、短い説明を持ち、文章に直して渡す
一覧の件数 本文に明記なし。本文に明記はありません。5.5位の計算からは10件と読めますが、付録には11位の例もあり、確定できません
並べ替えをさせたAI 公開モデル4つ。Llama-3.1-8B-Instruct、Mistral-7B-Instruct-v0.3、DeepSeek-LLM-7B-Chat、Vicuna-7B(いずれも70億〜80億パラメータ級)
比べた既存の手法 2つ。2024年の戦略的な文字列(STS)と、2025年の別の研究の手法(StealthRank、以下SRP)
仕込む場所と長さ 対象の商品の説明文の末尾だけ。長さはどの手法も30トークン(単語のかけら30個ほど)にそろえる
並び順 毎回ランダムに入れ替える。対象を常に一覧の最後に置いた先行研究の評価を、位置の偏りを避けるために改めた、と論文は説明しています
繰り返し 乱数の種を変えて10回。商品ごとに10回試した平均順位を報告する

評価の指標は3つです。

  • 平均順位:対象の商品が、AIの返した一覧で何位に来たか。小さいほど、操作が効いている
  • パープレキシティ(文章の不自然さの度合い):足した文字列と元の説明をつなげた文章の予想しにくさ。小さいほど自然
  • 禁止語の比率:順位や推薦をうたう露骨な語が、足した文字列に含まれる割合。小さいほど見つかりにくい

押さえておきたい点が2つあります。1つ目は基準です。

文字列を足さなかったときの実測の順位は表になく、論文は「何もしなければ直観的には5.5位のはずだ」という計算値と比べています。

2つ目は、評価が順位と文章の見た目だけだということです。足した文章の中身が事実かどうかは測っていません。

結果

4つのモデル、3つの分野のすべてで、平均順位が想定値の5.5位より上位だった

論文の表1の平均順位です。小さいほど上位で、基準は論文が想定する5.5位です。

並べ替えをさせたAI 書籍 カメラ コーヒーメーカー
Llama-3.1-8B 4.43(SRP 6.68、STS 6.70) 3.37(5.20、6.83) 3.26(7.34、5.85)
Mistral-7B 4.20(6.88、5.85) 2.54(4.37、5.61) 2.79(5.54、5.59)
DeepSeek-7B 5.33(5.90、6.09) 3.82(6.10、6.52) 2.36(5.87、6.52)
Vicuna-7B 4.13(4.70、6.30) 4.03(4.96、6.91) 3.57(4.34、6.04)

太字が論文の手法、かっこ内はSRP、STSです。

  • 12の組み合わせすべてで、論文の手法が3つの中で最も上位でした。最も効いたのはDeepSeek-7Bのコーヒーメーカーで2.36位、想定値5.5位より約3.1位上です(5.5から2.36を引いた概算)
  • 効き方には幅がありました。DeepSeek-7Bの書籍は5.33位で、想定値との差は約0.2位(概算)にとどまります
  • 既存の手法は、想定値より下になることもありました。SRPとSTSには6位台や7位台の値があります

文章の自然さと、露骨な語の少なさ

パープレキシティ(小さいほど自然)でも、論文の手法は12の組み合わせすべてで3手法の中で最も小さい値でした。たとえばLlama-3.1-8Bの書籍では、論文の手法が15.90、SRPが76.02、STSが92.41です。

禁止語の比率は、どの手法も0.0〜0.7の範囲で、差は小さいものでした。論文は「同程度か、より低い」と表現しています。

人の目には、どう見えたか

論文の図3は、人による評価の結果です。論文の手法とSRPの文字列を、手法名を伏せ、順番をランダムにして並べ、3つの観点でどちらかを選んでもらいました。

観点(質問) 論文の手法を選んだ SRPを選んだ どちらとも言えない
文の自然さ:どちらが文法的で自然か 83.95% 9.88% 6.17%
説得力:どちらが商品をうまく勧めていて魅力的か 72.84% 14.81% 12.35%
作為の見えやすさ:どちらが人工的・攻撃的に作られたように見えるか 5.56% 76.54% 17.90%

3つ目は、割合が低いほど作為に気づかれにくいことを示します。論文は、この手法の文字列が人にとってかなり自然で、攻撃らしく見えにくいと結論づけています。

付録の例でも、論文の手法の文字列は受賞歴や付属品を説明するふつうの宣伝文のように読め、SRPの文字列は単語が崩れた並びでした。

文字列の長さを変えると

図4では、Llama-3.1-8Bで、足す文字列の長さを10・20・30トークンと変えています。書籍(4.93→4.66→4.43位)とカメラ(4.79→3.84→3.37位)では、長いほど上位になりました。

コーヒーメーカーは20トークンの2.45位が最も上位で、30トークンでは3.26位に下がっています。論文の表現は「長いほうが概して効く」です。

10トークンでも、30トークンを使った既存の2手法より上位でした。

論文はさらに、順位を狙わずに文章の自然さだけを満たす文字列を足した場合も試しています(表2)。3分野をまとめた平均順位は5.81位で、想定値の5.5位より下でした。

両方を狙った場合は3.69位です。長さではなく、順位を狙った最適化が効いたのだと論文は述べています。

ほかのモデルに持っていくと

表3は、Llama-3.1-8Bのカメラで作った文字列を、ほかのモデルに使った結果です。

評価したモデル 論文の手法 SRP
Llama-3.1-8B(作ったモデル自身) 3.37 5.20
Mistral-7B 3.49 5.78
DeepSeek-7B 3.92 6.71
Vicuna-7B 3.32 5.26
GPT-5.1(商用モデル、APIで利用) 5.76 5.95
  • 公開モデルどうしでは、効き目がほぼ保たれました。作ったモデルとの差は、Mistral-7Bで+0.12、DeepSeek-7Bで+0.55、Vicuna-7Bでは-0.05でした。SRPはDeepSeek-7Bで+1.51でした
  • 商用のGPT-5.1では、効き目が大きく落ちました。5.76位は、想定値の5.5位より下です。論文は、2手法の差は小さく、どちらも公開モデルでの水準には届かなかったと明記し、「商用のリランカーを確実に操作できるとは主張しない」と書いています

効かなかった場面

論文は、攻撃が効かなかった場面を2つに分けて分析しています(4.7節)。

  1. 自然だが効かない。次に来る言葉が予想しやすい場面では、自然さが優先され、説明の自然な続きにはなっても、AIの判断を動かす言葉が入らないことがありました。見つかりにくさと効き目の引き換えだと論文は述べています
  2. 同じ決まり文句に集まる。別々の商品への攻撃が、似たようなありふれた言い回しに行き着くことがありました。1件ずつなら目立たなくても、掲載を並べると繰り返しが目につきます。掲載どうしで文言の重複を調べる単純な検査で見つけられるだろう、と論文は書いています。守る側の手がかりになる指摘です

論文自身が書いている限界

論文は、限界の節と本文で次の点を挙げています。

  • 実験は単純化した並べ替えの仕組みの上で行いました。実際のサービスには、より複雑な処理や防御がありうるため、実際の場面での効き目は今後さらに確かめる必要があります
  • 文字列は商品1件ごとに最適化するため、掲載をまたいだ言い回しの重複を防げず、横断的な検査で見つかりえます。その対策は今後の課題としています
  • 目的は信頼性の問題を示すことで、悪意ある使い方は強く戒めると倫理の節に書いています

原文を読んで気づいた点

  • 基準の5.5位は、実測値ではなく計算上の想定値です。推薦されにくい商品なら、何もしないときの順位は5.5位より下になりえます。対象にした商品とその件数も、本文からは確認できませんでした
  • GPT-5.1の5.76位は、想定値の5.5位より下です。論文は「部分的な効き目が残る」と書きますが、実測の基準がないため、この表だけでは効いたかどうかを判断できません
  • 人による評価は、攻撃どうしの比較です。比べた相手はSRPの文字列で、元の商品説明や人が書いた文は比較に入っていません。評価者の人数・属性も書かれていません
  • 比較相手のSRPは、この論文の責任著者も著者に入った先行研究です。
  • 本文と表に小さな食い違いがあります。本文は「DeepSeek-7BとVicuna-7Bでは、特定の設定でSRPが有利なこともある」と書きますが、表1の平均順位とパープレキシティでは、全組み合わせで論文の手法が上位です。SRPが有利なのは禁止語の比率の一部だけでした。Vicuna-7Bでは、どの指標でもSRPが有利なセルはありません
  • 日本語での検証はありません。商品データも質問も英語です。データは研究用のデータセットで、公開中の商品ページを集めたものとは違います
  • 実際のAI検索サービスでは試されていません。候補一覧を直接渡す形で、検索で拾われる段階は含みません
  • 統計的な検定や、10回の試行のばらつきの幅は示されていません

この論文から、言えること・言えないこと

言えること(論文の設定で確認された) 言えないこと(論文では確認されていない)
70億〜80億パラメータ級の公開モデル4つで、説明文の末尾に足した短い文字列が、対象の商品の平均順位を上げた 実際のAI検索サービスで同じように効くこと
露骨な語の比率は既存手法と同程度のまま、既存の攻撃より自然な文章で、順位を動かせた 人が元の説明文と見比べても、作為に気づけないこと
公開モデルで作った文字列は、ほかの公開モデルにも近い効き目で持ち込めた 商用の大型モデルを確実に操作できること(GPT-5.1では効き目が大きく落ちた)
効き目は分野とモデルの組み合わせで大きく違った(2.36〜5.33位) 日本語の商品ページや質問で効くこと
別々の商品の攻撃が、似た決まり文句に集まる場合があった 順位の変化が、実際の購入や問い合わせにつながること

「平均2.36位」は、1つのモデルと1つの分野で、計算上の想定値と比べた数字です。AIの順位づけ全般で3位ほど押し上げられる、と読むのは誤りです。

中小企業の視点で、どう受け取るか

ここからは論文の主張とは別の、私の読み取りです。

「自然に読める」は、「正しい」の証明になりにくい

この論文で人が自然だと選んだ文字列は、順位を動かすために機械で作られたものでした。仕入れ先や外注先の候補をAIに比べさせるとき、説明文そのものが順位の決め手になっている可能性があります。

上位の候補は、価格や仕様、実績を元の情報や第三者の情報で確かめてから採用するのが安全です。

自社でAIに並べ替えさせるなら、掲載を横断して見る

出品者や会員が説明文を書ける掲載の並べ替えにAIを使う場合、説明文は順位に効く入口になります。露骨な語の一覧で弾く方法だけでは足りない場面がある、と論文の結果から読めます。

説明文の重複を定期的に確かめ、並べ替えの結果を人が抜き取りで見る運用が、守りの第一歩になると考えます。論文は防御策を試しておらず、効果の大きさは未確認です。

操作する側には回らない

この手法は内部を読める公開モデルが前提で、商用のGPT-5.1では効き目が大きく落ちました。当シリーズで解説した選好操作攻撃の論文では、全員が攻撃すると全体の推薦がかえって減ることも示されました。

見つかれば信頼も失います。弊社は、順位を操作する文字列や隠し文を勧めていません。

よくある質問

この論文の順位操作は、今のAI検索サービスでも効きますか

分かるのは、公開モデル4つでの結果までです。商用のGPT-5.1では平均5.76位と効き目が大きく落ち、論文は「確実に操作できるとは主張しない」と明記しています。

実際のAI検索サービスは対象外でした。

RAFの論文と、2024年の戦略的な文字列(STS)の論文は何が違いますか

2024年の論文は、公開モデル1つと架空のコーヒーメーカー10台で、意味の通らない文字列で推薦1位が動くことを示しました。

この論文は、その論文に由来するデータを3分野・4モデルで使い、STSを比較相手にして、人の目にも自然に見える文字列でSTSより上位に押し上げられることを示しました。

並び順を毎回入れ替える評価を標準にした点も違います。詳しくは戦略的な文字列の論文の解説をご覧ください。

自然な文章に紛れた順位操作は、AIの順位づけを使う側でどう見分けられますか

論文は防御策を試していません。手がかりは、別々の商品への攻撃が似た決まり文句に集まる場合があり、掲載どうしで文言の重複を調べれば見つけられるだろう、という指摘です。

この手法の禁止語の比率は既存手法と同程度で、禁止語の一覧で弾くだけでは不十分な場面があると読めます。

まとめ:今日できる1つのこと

AIに候補を比べさせて決めたことが最近あれば、1つだけ選び、AIが上位に挙げた候補の価格・仕様・実績を、元のページや第三者の情報で確かめ直してください。この論文の実験では、人が「自然で魅力的」と選んだ文章が、順位を動かすために作られたものでした。

この論文は、LLMO論文の一覧の一本です。ほかの論文の解説も、順次公開しています。

この記事に書いたことを、そのまま御社のページに

生成AIに引用されるページを、お話しいただくだけでお作りします。お時間をいただくのは初回15分のヒアリングだけです。まず1ページ、無料でお作りします。

OKが出るまで、何度でも直します。事実が違う、言い回しが硬い、この話は入れないでほしい。どれも遠慮なくおっしゃってください。何度お直ししても、追加の料金はいただきません。

これまでに127社にご利用いただきました。毎月ご依頼いただいている方の6割以上が、月10ページを選ばれています。料金はページに掲載しています。

まず1ページ、無料で作らせてください

ページを増やしても問い合わせが来ないなら、原因はページの外にあります。その場合は、下の入口からご相談ください。

自社のマーケティング課題を根本から解決しませんか?

ウェブサイトから要素を引き算し、訪れた人が迷わず次の一歩に進む形へ組み直す。初回60分のオンラインで御社のサイトを一緒に読み、どこから直すべきかをお伝えします。手順をまとめた無料の診断と解説動画もご用意しています。

まず動画で詳しく見る(約30分)
無料診断を受ける

初回は無料・60分・オンライン完結・その場で契約のお願いはいたしません

LLMO論文
SEO対策 生成AI
よかったらシェアしてね!
  • URLをコピーしました!
  • 【LLMO論文解説】文書に仕込んだ指示でAIの順位づけは乗っ取られるか|8モデル・3方式で試した「順位づけの盲点」(EMNLP 2025)
  • 【LLMO論文解説】AIの偏りを突くと検索結果の説明文は要約に選ばれやすくなるか|選ばれる割合0.37→0.83の条件と限界(プレプリント・2026)

この記事を書いた人

中野輝規のアバター 中野輝規

合同会社謙虚 代表社員。20代から、売る言葉だけを仕事にしてきました。電話営業で受話器を握っていた時代から、数千社のWEB集客に関わったいままで。詳しいプロフィールはこちら

この著者の記事一覧へ

関連記事

  • 規制順守はAIに信頼されるか、英国ギャンブル分野の企業レポートを検証
    【LLMO論文解説】規制順守はAIに信頼されるか、英国ギャンブル分野の企業レポートを検証|独自測定は0件(技術レポート・2026)
  • AIが引用するのは自社サイトより第三者サイトが8割5分
    【LLMO論文解説】AIが引用するのは自社サイトより第三者サイトが8割5分|128ブランド・12市場・13言語の分析(プレプリント)
  • 通販専用のGEO試験環境
    【LLMO論文解説】通販専用のGEO試験環境|15の経験則のうち効果があったのは4つだけ(プレプリント、2025年11月)
  • PinterestがVLMで画像に「使い道の検索語」を生成する仕組み
    【LLMO論文解説】大手画像共有サービスがVLMで画像に「使い道の検索語」を生成する仕組み|自社報告20%増の中身を検証(プレプリント)
  • 見つかりにくい文字列でAIの商品順位は動くか
    【LLMO論文解説】見つかりにくい文字列でAIの商品順位は動くか|StealthRankを4つのAIで検証(ICML 2026ワークショップ)
  • 悪意あるGEO攻撃を無害化する二段防御「GEO Defender」
    【LLMO論文解説】悪意あるGEO攻撃を無害化する二段防御「GEO Defender」|攻撃成功率を50%から6%に低減(プレプリント)
  • 質問の裏の需要をAIで推し量り、生成AIの回答で目立つ文章に書き換える手法
    【LLMO論文解説】質問の裏の需要をAIで推し量り、生成AIの回答で目立つ文章に書き換える手法|Mind Reader(ACL 2026)
  • AIで作った100万人の買い手像と516万の質問でブランドの見え方を測る
    【LLMO論文解説】ブランドの見え方を測るための100万人の買い手像と516万の質問をAIで作る|実在の質問との一致は未検証(プレプリント)
最近の投稿
  • 温泉の集客は宿泊客と日帰り客の線引きで決まる 掲示ルールに沿うページの作り方
  • デザイナーの集客は作品集だけでは届かない 発注担当が社内で通せるサイトの作り方
  • 屋根の集客は見えない屋根を見せる会社が選ばれる 点検商法と疑われないサイトの作り方
  • 遺品整理の集客は遺族の迷いに先回りして決まる 広告頼みから指名へ移るサイトの作り方
  • 看板の集客は検索した先で決まる 見た人を来店につなぐ受け皿の作り方
最近のコメント
  • ホテルの集客は公式サイトで迷わせないことから 予約サイト頼みを抜ける直し方 に 温泉の集客は宿泊客と日帰り客の線引きで決まる 掲示ルールに沿うページの作り方 - 合同会社謙虚 より
  • 外壁塗装の集客は急がせない会社が選ばれる 下請けを抜けて直接の依頼を増やすホームページの作り方 に 屋根の集客は見えない屋根を見せる会社が選ばれる 点検商法と疑われないサイトの作り方 - 合同会社謙虚 より
  • 不用品回収の集客は料金の見せ方で決まる 当日の追加請求を疑われない業者のサイトの作り方 に 遺品整理の集客は遺族の迷いに先回りして決まる 広告頼みから指名へ移るサイトの作り方 - 合同会社謙虚 より
  • 外壁塗装の集客は急がせない会社が選ばれる 下請けを抜けて直接の依頼を増やすホームページの作り方 に 看板の集客は検索した先で決まる 見た人を来店につなぐ受け皿の作り方 - 合同会社謙虚 より
  • 【LLMO論文解説】回答が似ていても出典は重ならない|BaiduとGoogleのAI要約を英語と中国語の500問で監査(EMNLP 2026ワークショップ) に 【LLMO論文解説】海外のGEO・LLMO・AIO論文101本の一覧|原論文から最新研究まで、テーマ別に整理(随時更新) - 合同会社謙虚 より
  • 記事制作(KCW)
  • 売れるサイトはみな謙虚
  • サービス一覧
  • サイトの無料診断
  • 合同会社謙虚とは
  • 代表プロフィール
  • ブログ
  • お問い合わせ
  • プライバシーポリシー
  • 特定商取引法に基づく表記

© 合同会社謙虚

目次