商品の説明文の末尾に、ふつうの宣伝文にしか見えない短い文を足すだけで、AIが並べる商品の順番の上のほうへ、狙った商品を押し上げられるのか。
これを実験で調べた論文があります。2025年10月にarXivで公開され、2026年7月の自然言語処理の国際会議ACL 2026の本会議に採択された「Are LLMs Reliable Rankers? Rank Manipulation via Two-Stage Token Optimization(大規模言語モデルは信頼できる順位づけ役か。
2段階のトークン最適化による順位操作)」です。
この記事では、原文から、何を試し、順位がどれだけ動き、どんな条件で効いたのか・効き目が薄れたのか、人の目にどれほど自然に見えたのかを整理します。
扱うのは攻撃の研究です。仕込む文字列そのものや作り方の手順・設定は、悪用の手引きにならないよう載せず、結果だけを書きます。
弊社はこうした操作を勧めない立場で、守る側の視点から読んでいます。
合同会社謙虚は、3つのドメインを並行して運用し、何を変えると数字が動くかを測り続けています。AIの順位づけが「自然に読める文章」でどこまで動かされうるのかを知っておくことは、AIに比べさせた結果を読むときの判断の土台になるため、この論文を読みました。
結論:3行で言うと
- 書籍・カメラ・コーヒーメーカーの商品一覧で、対象の商品の説明に最適化した短い文字列を足すと、4つの公開モデルすべてで、平均順位が何もしない場合の想定値(5.5位)より上位でした。論文が「何もしなければ5.5位」とする想定値に対し2.36〜5.33位で、既存の2つの攻撃手法より、12の組み合わせすべてで上位でした
- 足した文字列は人の目にも自然に見えました。既存の手法と見比べる評価で、自然さでは83.95%が論文の手法を選び、「作為的に見える」とされたのは5.56%でした。比べた相手は既存の攻撃の文字列で、元の商品説明ではありません
- 内部を読める公開モデルで作った文字列は、ほかの公開モデルにもほぼそのまま効きました(カメラの分野で確認)。一方、商用の大型モデル(GPT-5.1)では平均5.76位にとどまり、論文自身が「商用モデルを確実に操作できるとは主張しない」と書いています
数値は英語の商品データを使った実験室の結果で、実際のAI検索サービスや日本語は対象外です。
この論文の基本情報
| 項目 | 内容 |
|---|---|
| 題名(原題) | Are LLMs Reliable Rankers? Rank Manipulation via Two-Stage Token Optimization |
| 著者 | Tiancheng Xing、Jerry Li、Yixuan Du、Xiyang Hu(4人。シンガポール国立大学、南カリフォルニア大学、ジョージタウン大学、アリゾナ州立大学) |
| 公開日 | 2025年10月8日(arXiv初版)。確認した版は2026年6月28日の第2版 |
| arXiv番号 | 2510.06732(分類は計算言語学、人工知能、情報検索) |
| 掲載・採択状況 | ACL 2026(第64回年次大会)の本会議・長編論文。会議録(ACL Anthology)に掲載済みで、9120〜9132ページ。arXivのコメント欄にも「ACL 2026」とあります。会議録の版とarXiv第2版で数値が一致することを確認しました |
| 種類 | 大学の研究。AIに商品一覧を直接渡して順位をつけさせる実験室の実験 |
| 実験データとコード | コードは著者が公開していると論文に書かれています。この記事ではリンクを載せていません |
論文はこちらで読めます。arXiv(2510.06732)、ACL Anthology(会議録)、会議録のDOI。
この論文が答えた問い
AIが候補の一覧を並べ替えるとき、対象の商品の説明に、人が読んでも不自然さのない短い文字列を足すだけで、その商品を狙って上位に押し上げられるのか。
背景には、検索や推薦の最後に、AIに候補の並べ替えを任せる使い方の広がりがあります。論文はこの役割を「リランカー(並べ替え役)」と呼びます。
候補と質問をまとめてAIに渡し、番号つきの一覧を返させる形です。
順位の操作は、これまでも研究されてきました。当シリーズで解説した商品情報に仕込んだ文字列の論文(2024年)は、その早い例です。
ただ、そこで使われた文字列は人が読むと意味の通らない並びでした。論文は、既存の手法には「よく効くが不自然で見つかりやすい」か「自然だが効きが弱い」かの板挟みがある、と指摘します。
この論文は、両方を満たす攻撃が作れるかを確かめ、弱点として示すことを目的にしています。
論文の手法は「Rank Anything First(RAF)」と名づけられています。内部の数値を読める公開モデルを相手に、「対象を1位に挙げさせる」狙いと「文章として自然に続く」狙いを同時に満たすよう、文字列を機械的に組み立てる方法です。
手順と設定値は、この記事では省きます。
どうやって調べたのか
| 項目 | 設定 |
|---|---|
| データ | 2024年の戦略的な文字列の論文に由来するデータ(論文の呼び名はSTSData)。書籍、カメラ、コーヒーメーカーの3分野。各商品は銘柄、価格、短い説明を持ち、文章に直して渡す |
| 一覧の件数 | 本文に明記なし。本文に明記はありません。5.5位の計算からは10件と読めますが、付録には11位の例もあり、確定できません |
| 並べ替えをさせたAI | 公開モデル4つ。Llama-3.1-8B-Instruct、Mistral-7B-Instruct-v0.3、DeepSeek-LLM-7B-Chat、Vicuna-7B(いずれも70億〜80億パラメータ級) |
| 比べた既存の手法 | 2つ。2024年の戦略的な文字列(STS)と、2025年の別の研究の手法(StealthRank、以下SRP) |
| 仕込む場所と長さ | 対象の商品の説明文の末尾だけ。長さはどの手法も30トークン(単語のかけら30個ほど)にそろえる |
| 並び順 | 毎回ランダムに入れ替える。対象を常に一覧の最後に置いた先行研究の評価を、位置の偏りを避けるために改めた、と論文は説明しています |
| 繰り返し | 乱数の種を変えて10回。商品ごとに10回試した平均順位を報告する |
評価の指標は3つです。
- 平均順位:対象の商品が、AIの返した一覧で何位に来たか。小さいほど、操作が効いている
- パープレキシティ(文章の不自然さの度合い):足した文字列と元の説明をつなげた文章の予想しにくさ。小さいほど自然
- 禁止語の比率:順位や推薦をうたう露骨な語が、足した文字列に含まれる割合。小さいほど見つかりにくい
押さえておきたい点が2つあります。1つ目は基準です。
文字列を足さなかったときの実測の順位は表になく、論文は「何もしなければ直観的には5.5位のはずだ」という計算値と比べています。
2つ目は、評価が順位と文章の見た目だけだということです。足した文章の中身が事実かどうかは測っていません。
結果
4つのモデル、3つの分野のすべてで、平均順位が想定値の5.5位より上位だった
論文の表1の平均順位です。小さいほど上位で、基準は論文が想定する5.5位です。
| 並べ替えをさせたAI | 書籍 | カメラ | コーヒーメーカー |
|---|---|---|---|
| Llama-3.1-8B | 4.43(SRP 6.68、STS 6.70) | 3.37(5.20、6.83) | 3.26(7.34、5.85) |
| Mistral-7B | 4.20(6.88、5.85) | 2.54(4.37、5.61) | 2.79(5.54、5.59) |
| DeepSeek-7B | 5.33(5.90、6.09) | 3.82(6.10、6.52) | 2.36(5.87、6.52) |
| Vicuna-7B | 4.13(4.70、6.30) | 4.03(4.96、6.91) | 3.57(4.34、6.04) |
太字が論文の手法、かっこ内はSRP、STSです。
- 12の組み合わせすべてで、論文の手法が3つの中で最も上位でした。最も効いたのはDeepSeek-7Bのコーヒーメーカーで2.36位、想定値5.5位より約3.1位上です(5.5から2.36を引いた概算)
- 効き方には幅がありました。DeepSeek-7Bの書籍は5.33位で、想定値との差は約0.2位(概算)にとどまります
- 既存の手法は、想定値より下になることもありました。SRPとSTSには6位台や7位台の値があります
文章の自然さと、露骨な語の少なさ
パープレキシティ(小さいほど自然)でも、論文の手法は12の組み合わせすべてで3手法の中で最も小さい値でした。たとえばLlama-3.1-8Bの書籍では、論文の手法が15.90、SRPが76.02、STSが92.41です。
禁止語の比率は、どの手法も0.0〜0.7の範囲で、差は小さいものでした。論文は「同程度か、より低い」と表現しています。
人の目には、どう見えたか
論文の図3は、人による評価の結果です。論文の手法とSRPの文字列を、手法名を伏せ、順番をランダムにして並べ、3つの観点でどちらかを選んでもらいました。
| 観点(質問) | 論文の手法を選んだ | SRPを選んだ | どちらとも言えない |
|---|---|---|---|
| 文の自然さ:どちらが文法的で自然か | 83.95% | 9.88% | 6.17% |
| 説得力:どちらが商品をうまく勧めていて魅力的か | 72.84% | 14.81% | 12.35% |
| 作為の見えやすさ:どちらが人工的・攻撃的に作られたように見えるか | 5.56% | 76.54% | 17.90% |
3つ目は、割合が低いほど作為に気づかれにくいことを示します。論文は、この手法の文字列が人にとってかなり自然で、攻撃らしく見えにくいと結論づけています。
付録の例でも、論文の手法の文字列は受賞歴や付属品を説明するふつうの宣伝文のように読め、SRPの文字列は単語が崩れた並びでした。
文字列の長さを変えると
図4では、Llama-3.1-8Bで、足す文字列の長さを10・20・30トークンと変えています。書籍(4.93→4.66→4.43位)とカメラ(4.79→3.84→3.37位)では、長いほど上位になりました。
コーヒーメーカーは20トークンの2.45位が最も上位で、30トークンでは3.26位に下がっています。論文の表現は「長いほうが概して効く」です。
10トークンでも、30トークンを使った既存の2手法より上位でした。
論文はさらに、順位を狙わずに文章の自然さだけを満たす文字列を足した場合も試しています(表2)。3分野をまとめた平均順位は5.81位で、想定値の5.5位より下でした。
両方を狙った場合は3.69位です。長さではなく、順位を狙った最適化が効いたのだと論文は述べています。
ほかのモデルに持っていくと
表3は、Llama-3.1-8Bのカメラで作った文字列を、ほかのモデルに使った結果です。
| 評価したモデル | 論文の手法 | SRP |
|---|---|---|
| Llama-3.1-8B(作ったモデル自身) | 3.37 | 5.20 |
| Mistral-7B | 3.49 | 5.78 |
| DeepSeek-7B | 3.92 | 6.71 |
| Vicuna-7B | 3.32 | 5.26 |
| GPT-5.1(商用モデル、APIで利用) | 5.76 | 5.95 |
- 公開モデルどうしでは、効き目がほぼ保たれました。作ったモデルとの差は、Mistral-7Bで+0.12、DeepSeek-7Bで+0.55、Vicuna-7Bでは-0.05でした。SRPはDeepSeek-7Bで+1.51でした
- 商用のGPT-5.1では、効き目が大きく落ちました。5.76位は、想定値の5.5位より下です。論文は、2手法の差は小さく、どちらも公開モデルでの水準には届かなかったと明記し、「商用のリランカーを確実に操作できるとは主張しない」と書いています
効かなかった場面
論文は、攻撃が効かなかった場面を2つに分けて分析しています(4.7節)。
- 自然だが効かない。次に来る言葉が予想しやすい場面では、自然さが優先され、説明の自然な続きにはなっても、AIの判断を動かす言葉が入らないことがありました。見つかりにくさと効き目の引き換えだと論文は述べています
- 同じ決まり文句に集まる。別々の商品への攻撃が、似たようなありふれた言い回しに行き着くことがありました。1件ずつなら目立たなくても、掲載を並べると繰り返しが目につきます。掲載どうしで文言の重複を調べる単純な検査で見つけられるだろう、と論文は書いています。守る側の手がかりになる指摘です
論文自身が書いている限界
論文は、限界の節と本文で次の点を挙げています。
- 実験は単純化した並べ替えの仕組みの上で行いました。実際のサービスには、より複雑な処理や防御がありうるため、実際の場面での効き目は今後さらに確かめる必要があります
- 文字列は商品1件ごとに最適化するため、掲載をまたいだ言い回しの重複を防げず、横断的な検査で見つかりえます。その対策は今後の課題としています
- 目的は信頼性の問題を示すことで、悪意ある使い方は強く戒めると倫理の節に書いています
原文を読んで気づいた点
- 基準の5.5位は、実測値ではなく計算上の想定値です。推薦されにくい商品なら、何もしないときの順位は5.5位より下になりえます。対象にした商品とその件数も、本文からは確認できませんでした
- GPT-5.1の5.76位は、想定値の5.5位より下です。論文は「部分的な効き目が残る」と書きますが、実測の基準がないため、この表だけでは効いたかどうかを判断できません
- 人による評価は、攻撃どうしの比較です。比べた相手はSRPの文字列で、元の商品説明や人が書いた文は比較に入っていません。評価者の人数・属性も書かれていません
- 比較相手のSRPは、この論文の責任著者も著者に入った先行研究です。
- 本文と表に小さな食い違いがあります。本文は「DeepSeek-7BとVicuna-7Bでは、特定の設定でSRPが有利なこともある」と書きますが、表1の平均順位とパープレキシティでは、全組み合わせで論文の手法が上位です。SRPが有利なのは禁止語の比率の一部だけでした。Vicuna-7Bでは、どの指標でもSRPが有利なセルはありません
- 日本語での検証はありません。商品データも質問も英語です。データは研究用のデータセットで、公開中の商品ページを集めたものとは違います
- 実際のAI検索サービスでは試されていません。候補一覧を直接渡す形で、検索で拾われる段階は含みません
- 統計的な検定や、10回の試行のばらつきの幅は示されていません
この論文から、言えること・言えないこと
| 言えること(論文の設定で確認された) | 言えないこと(論文では確認されていない) |
|---|---|
| 70億〜80億パラメータ級の公開モデル4つで、説明文の末尾に足した短い文字列が、対象の商品の平均順位を上げた | 実際のAI検索サービスで同じように効くこと |
| 露骨な語の比率は既存手法と同程度のまま、既存の攻撃より自然な文章で、順位を動かせた | 人が元の説明文と見比べても、作為に気づけないこと |
| 公開モデルで作った文字列は、ほかの公開モデルにも近い効き目で持ち込めた | 商用の大型モデルを確実に操作できること(GPT-5.1では効き目が大きく落ちた) |
| 効き目は分野とモデルの組み合わせで大きく違った(2.36〜5.33位) | 日本語の商品ページや質問で効くこと |
| 別々の商品の攻撃が、似た決まり文句に集まる場合があった | 順位の変化が、実際の購入や問い合わせにつながること |
「平均2.36位」は、1つのモデルと1つの分野で、計算上の想定値と比べた数字です。AIの順位づけ全般で3位ほど押し上げられる、と読むのは誤りです。
中小企業の視点で、どう受け取るか
ここからは論文の主張とは別の、私の読み取りです。
「自然に読める」は、「正しい」の証明になりにくい
この論文で人が自然だと選んだ文字列は、順位を動かすために機械で作られたものでした。仕入れ先や外注先の候補をAIに比べさせるとき、説明文そのものが順位の決め手になっている可能性があります。
上位の候補は、価格や仕様、実績を元の情報や第三者の情報で確かめてから採用するのが安全です。
自社でAIに並べ替えさせるなら、掲載を横断して見る
出品者や会員が説明文を書ける掲載の並べ替えにAIを使う場合、説明文は順位に効く入口になります。露骨な語の一覧で弾く方法だけでは足りない場面がある、と論文の結果から読めます。
説明文の重複を定期的に確かめ、並べ替えの結果を人が抜き取りで見る運用が、守りの第一歩になると考えます。論文は防御策を試しておらず、効果の大きさは未確認です。
操作する側には回らない
この手法は内部を読める公開モデルが前提で、商用のGPT-5.1では効き目が大きく落ちました。当シリーズで解説した選好操作攻撃の論文では、全員が攻撃すると全体の推薦がかえって減ることも示されました。
見つかれば信頼も失います。弊社は、順位を操作する文字列や隠し文を勧めていません。
よくある質問
この論文の順位操作は、今のAI検索サービスでも効きますか
分かるのは、公開モデル4つでの結果までです。商用のGPT-5.1では平均5.76位と効き目が大きく落ち、論文は「確実に操作できるとは主張しない」と明記しています。
実際のAI検索サービスは対象外でした。
RAFの論文と、2024年の戦略的な文字列(STS)の論文は何が違いますか
2024年の論文は、公開モデル1つと架空のコーヒーメーカー10台で、意味の通らない文字列で推薦1位が動くことを示しました。
この論文は、その論文に由来するデータを3分野・4モデルで使い、STSを比較相手にして、人の目にも自然に見える文字列でSTSより上位に押し上げられることを示しました。
並び順を毎回入れ替える評価を標準にした点も違います。詳しくは戦略的な文字列の論文の解説をご覧ください。
自然な文章に紛れた順位操作は、AIの順位づけを使う側でどう見分けられますか
論文は防御策を試していません。手がかりは、別々の商品への攻撃が似た決まり文句に集まる場合があり、掲載どうしで文言の重複を調べれば見つけられるだろう、という指摘です。
この手法の禁止語の比率は既存手法と同程度で、禁止語の一覧で弾くだけでは不十分な場面があると読めます。
まとめ:今日できる1つのこと
AIに候補を比べさせて決めたことが最近あれば、1つだけ選び、AIが上位に挙げた候補の価格・仕様・実績を、元のページや第三者の情報で確かめ直してください。この論文の実験では、人が「自然で魅力的」と選んだ文章が、順位を動かすために作られたものでした。
この論文は、LLMO論文の一覧の一本です。ほかの論文の解説も、順次公開しています。
この記事に書いたことを、そのまま御社のページに
生成AIに引用されるページを、お話しいただくだけでお作りします。お時間をいただくのは初回15分のヒアリングだけです。まず1ページ、無料でお作りします。
OKが出るまで、何度でも直します。事実が違う、言い回しが硬い、この話は入れないでほしい。どれも遠慮なくおっしゃってください。何度お直ししても、追加の料金はいただきません。
これまでに127社にご利用いただきました。毎月ご依頼いただいている方の6割以上が、月10ページを選ばれています。料金はページに掲載しています。
ページを増やしても問い合わせが来ないなら、原因はページの外にあります。その場合は、下の入口からご相談ください。
自社のマーケティング課題を根本から解決しませんか?
ウェブサイトから要素を引き算し、訪れた人が迷わず次の一歩に進む形へ組み直す。初回60分のオンラインで御社のサイトを一緒に読み、どこから直すべきかをお伝えします。手順をまとめた無料の診断と解説動画もご用意しています。
初回は無料・60分・オンライン完結・その場で契約のお願いはいたしません


