MENU
  • 料金
  • 会社案内
  • コンサル
  • お問い合わせ
  • 無料で1ページ頼む
AIO・LLMO・GEO対策の記事制作
合同会社謙虚
  • 料金
  • 会社案内
  • コンサル
  • お問い合わせ
  • 無料で1ページ頼む
  • 料金
  • 会社案内
  • コンサル
  • お問い合わせ
  • 無料で1ページ頼む
合同会社謙虚
  • 料金
  • 会社案内
  • コンサル
  • お問い合わせ
  • 無料で1ページ頼む
  1. ホーム
  2. LLMO
  3. LLMO論文
  4. 【LLMO論文解説】見つかりにくい文字列でAIの商品順位は動くか|StealthRankを4つのAIで検証(ICML 2026ワークショップ)

【LLMO論文解説】見つかりにくい文字列でAIの商品順位は動くか|StealthRankを4つのAIで検証(ICML 2026ワークショップ)

2026 9/30
2026年9月29日2026年9月30日
中野輝規
見つかりにくい文字列でAIの商品順位は動くか

AIに「おすすめのコーヒーメーカーは?」と聞くと、候補の商品が順番に並んで返ってきます。

この順番を商品説明に足した文字列で動かせることは、先行研究で示されてきました。ただ、その文字列は意味の通らない記号の並びや、露骨な宣伝の言い回しで、見つけやすいものでした。

そこで、順位を動かす力と見つかりにくさを同時に狙った論文があります。南カリフォルニア大学とアリゾナ州立大学の研究者6人が2025年4月にarXivに公開した「StealthRank: LLM Ranking Manipulation via Stealthy Prompt Optimization」です。

この記事では、論文を原文から読み、何を試し、順位がどれだけ動き、どんな条件で効いたのか・崩れたのか、「見つかりにくさ」をどう測ったのかを整理します。

攻撃の研究なので、仕込む文字列や作り方の手順・設定は載せず、結果だけを書きます。弊社はこうした操作を勧めない立場で、守る側として読んでいます。

合同会社謙虚は、3つのドメインを並行して運用し、何を変えると数字が動くかを測り続けています。読んでも違和感の少ない仕込みがどこまで可能で、どこまで見つけにくいのかを、守る側の前提として確かめるために、この論文を読みました。

目次

結論:3行で言うと

  • 内部を読める4つの公開AI(70億〜80億パラメータ規模)に8件または10件の商品一覧を渡す実験で、対象の商品説明に最適化した文字列を足すと、その商品の平均順位は1.46〜2.50位でした。先行する2つの攻撃と比べると、8条件のうち、意味の通らない文字列の手法(STS)にはすべてで上回り、露骨な指示文の手法(TAP)には5条件で上回り、1条件で並び、2条件で下回りました
  • 見つかりにくさの指標では、宣伝や順位を示す語句を含んだ文字列の割合が10〜48%で、TAPの50〜76%より低くなりました。人による比較では「操作のために作られた感じがするのはどちらか」でこの手法が選ばれたのは15.06%で、STSの69.82%を大きく下回りました。ただし、文の自然さの指標ではTAPのほうが上でした
  • 文字列を作るには、順位をつけるAIの内部の数値を使う前提があります。実際のAI検索サービス、日本語、見分ける仕組み(防御)は試されていません。1語の違いで1位から圏外へ落ちる不安定さも、論文自身が報告しています

表は攻撃どうしの比較で、文字列を足す前の順位は示されていません。

この論文の基本情報

項目 内容
題名(原題) StealthRank: LLM Ranking Manipulation via Stealthy Prompt Optimization
著者 Yiming Tang、Yi Fan、Chenxiao Yu、Tiankai Yang、Yue Zhao、Xiyang Hu(6人。南カリフォルニア大学、アリゾナ州立大学)
公開日 2025年4月8日(arXiv初版)。確認した版は2025年5月23日の第2版
arXiv番号 2504.05804(主分類は情報検索)
掲載・採択状況 arXivはプレプリント(査読前の論文)で、コメント欄は空欄です。論文の公開・査読の場であるOpenReviewで、ICML 2026(機械学習の国際会議)に併設されたワークショップ「AI4GOOD」の論文として登録されています(2026年9月29日確認)。ワークショップは本会議より小規模な発表の場で、本文がarXiv第2版と同じかは未確認です
種類 大学の研究。商品一覧をAIに直接渡して順位をつけさせる、実験室の実験
実験データとコード コードは公開していると論文に書かれています。この記事ではリンクを張りません

論文はこちらで読めます。arXiv(2504.05804)、arXivが発行したDOI。

この論文が答えた問い

商品説明に足した文字列でAIの順位づけを動かしつつ、その文字列を、文として自然で、露骨な宣伝の言葉を含まない、見つかりにくい形にできるのか。

論文が想定する仕組みはこうです。利用者が質問すると、検索で候補の商品が集められ、その一覧がAIに渡されます。

AIは一覧を読んで順位をつけ、答えを返します。攻撃する側が手を入れられるのは、自社の商品説明だけです。

論文は「見つかりにくさ」を3つの条件で定義しています。文法的に自然であること、商品説明の文脈とつながっていること、「一番のおすすめ」「必ず選ぶべき」のような露骨な宣伝の言い回しを避けていること、です。

先行研究の文字列は、意味の通らない並びなら文の不自然さを測る仕組みで、露骨な言い回しなら語句の一覧との照合で見つかりやすい、というのが論文の問題意識です。

近い論文との関係

比較相手の2つの手法は、当シリーズで解説済みです。1つは、意味の読めない文字列でAIの推薦1位を動かした研究です(商品情報に仕込んだ文字列の論文の解説。

この記事ではSTSと呼びます)。もう1つは、ページに仕込んだ指示文で商品の順位を押し上げた研究です(ページに仕込んだ指示の論文の解説。

この記事ではTAPと呼びます)。実験のデータも、この2本から借りています。

どうやって調べたのか

項目 設定
データ 2種類。STSの論文の商品データ(コーヒーメーカー、本、カメラなど。外部の対話型AIで自然な文章に直したもの)と、TAPの論文の小売ページ由来のデータ(長い文章を外部の対話型AIで短くしたもの。付録には食洗機、ノートパソコン、テントなど9分野の結果)。どちらも英語です
候補の数 1回の一覧は10件(STSの論文のデータ)または8件(TAPの論文のデータ)。そのうち1件を対象の商品にする。対象の選び方は本文に書かれていません
順位をつけるAI 4つの公開モデル。Llama-3.1-8B-Instruct、Vicuna-7B-v1.5、Mistral-7B-Instruct-v0.3、DeepSeek-LLM-7B-Chat
文字列の作り方 順位をつけるAIの内部の数値を使い、「順位が上がる」「文が自然」「宣伝の語句を避ける」を同時に満たすよう、文字列を自動で調整する。手順と設定は、この記事では省きます
並び順 作るときは対象を一覧の最後に置き、評価のときは一覧の中のランダムな位置に置く
指標1:順位 AIの答えの中で対象の商品が何位だったかの平均。小さいほど攻撃が効いた
指標2:不自然さ Vicuna-7B(順位をつけるAIの1つでもある)から見た文の読みにくさ(パープレキシティ)。小さいほど自然
指標3:宣伝語の割合 できあがった文字列のうち、宣伝や順位を示す英語の語句(7語と22の言い回し)を含むものの割合。小さいほど見つかりにくい
人による評価 3分野から3商品ずつ選び、この手法とSTSの文字列を匿名で並べて比べてもらう。判定は合計183件

注意点が2つあります。試行の回数は、宣伝語の割合について10回とある以外、はっきり書かれていません。

また、指標3の語句の一覧は、文字列を作るときに避けさせた一覧と同じものだと付録にあります。

結果

順位:先行する2つの攻撃と比べて上位に来ることが多かった

論文の表1から、対象の商品の平均順位を抜き出しました。数字が小さいほど上位です。

データ・AI この論文の手法 TAPの手法 STSの手法
STS論文のデータ(10件)・DeepSeek-7B 2.10 2.10 4.50
STS論文のデータ(10件)・Llama-3.1-8B 1.46 4.00 3.50
STS論文のデータ(10件)・Mistral-7B 1.46 4.30 5.40
STS論文のデータ(10件)・Vicuna-7B 2.50 2.40 5.80
TAP論文のデータ(8件)・DeepSeek-7B 2.15 2.44 3.64
TAP論文のデータ(8件)・Llama-3.1-8B 1.98 2.84 5.18
TAP論文のデータ(8件)・Mistral-7B 1.87 2.07 4.29
TAP論文のデータ(8件)・Vicuna-7B 2.39 2.21 4.59
  • STSとの差は、10件の一覧のMistral-7Bで3.94位分(5.40と1.46の差、概算)と最も大きくなりました。8件の一覧では1.49〜3.20位分(概算)です
  • TAPとは、Vicuna-7Bで2つのデータとも下回り、DeepSeek-7Bの10件の一覧では同じ値でした。論文の表の説明文は「すべてのモデルで最も強い順位の成績」としていますが、本文は「4モデル中3モデルで同等以上」と書いており、表の数字は本文のほうと合います
  • 付録の分野別の表では結果が揺れ、Vicuna-7Bの本では平均4.3位で、TAPの3.1位を下回りました

見つかりにくさ:宣伝語は減ったが、文の自然さはTAPが上

指標(表1、8条件の範囲) この論文の手法 TAPの手法 STSの手法
不自然さ(小さいほど自然) 51.05〜109.70 12.62〜35.11 1,725.85〜195,939.70
宣伝語を含む文字列の割合 0.10〜0.48 0.50〜0.76 0.01〜0.30
  • TAPは文として最も自然でしたが、宣伝の語句を含む割合が5〜8割でした
  • STSは宣伝語が少ない一方、不自然さが千を超えました。論文は、意味の通らない並びだから宣伝語が少ないと説明しています
  • この論文の手法はその中間で、宣伝語を減らしつつ、不自然さをSTSの約20分の1以下(概算)に抑えました。ただし、Llama-3.1-8Bでは2つのデータとも4割強(0.43と0.48)の文字列に宣伝語が残っています

人による比較:STSより自然で、操作っぽさは低いと判定された

質問(図3、判定183件) この論文の手法を選んだ STSを選んだ どちらとも言えない
文法的に正しく、自然なのはどちらか 70.67% 5.59% 23.74%
商品をより効果的に勧めているのはどちらか 62.96% 8.38% 28.66%
操作のために作られた感じがするのはどちらか 15.06% 69.82% 15.12%

3つ目の質問は、選ばれた割合が低いほど見つかりにくいという読み方になります。比べた相手は、意味の通らない文字列のSTSだけです。

文として自然なTAPとの比較は、人による評価には含まれていません。

効かなかった場面:1語の違いで圏外へ

論文は失敗の分析にも1節を割いています。文字列を作る途中の評価で、ある回は対象が1位になったのに、1語が入れ替わっただけの次の回では、対象の商品が答えに一度も出てこなかった例が2つ示されています。

また、同じ語のくり返しや崩れた文字の並びになってしまう回もあり、その場合は推薦から外れたり、4位にとどまったりしました。

論文は、AIが小さな違いに敏感で、結果が予測しにくい例だとしています。

1モデル・1分野の比較(表2、Llama-3.1-8B・コーヒーメーカー。表1とは測り方が違います)では、宣伝語を避ける条件を外すと、宣伝語を含む割合が0.6157になりました(全条件を入れた場合は0.0645)。

論文自身が書いている限界

  • 実験は、指示に従うよう調整された4つのAIと、短い商品説明に限られています
  • 商品の並び順が変わっても効くことが示唆されたとしつつ、より大きく多様なデータでは別の課題が出るかもしれないと述べています
  • 攻撃の経路を示した一方で、防御策は体系的に調べていないとし、防御の開発と評価が重要な課題だと書いています
  • 結論の節では、今後の課題として、より強い防御を相手にした評価、より複雑な用途への展開、検出の仕組みの変化に合わせて変わる攻撃の検討を挙げています
  • 倫理の節で、悪意ある利用を強く戒めています

原文を読んで気づいた点

  • 文字列を足す前の順位が、表にありません。比較はすべて攻撃どうしです。対象の商品が元々何位だったか、何位分上がったのかは、この論文からは読み取れません
  • 「見つかりにくさ」は、作るときに避けさせた基準で測られています。宣伝語の一覧は、作るときと測るときで同じものでした。実際に見分ける仕組みを置いて、見つかるかを試した実験はありません
  • 人による評価の比較相手はSTSだけです。参加者の人数と統計的な検定は書かれていません。本文の「有意に」という表現も、検定の結果は示されていません
  • 試したAIは、内部を読める70億〜80億パラメータ規模の公開モデル4つです。論文は「市販のモデル」と書いていますが、商用のAI検索サービスは対象外です。別のAIで作った文字列が効くか(転用)も試されていません
  • 日本語での検証はありません。質問も商品説明も英語です
  • TAPは、小さなモデルでは長い指示文をうまく扱えず、出力の形式が崩れやすかったため、正しい形式が出るまで実験をくり返したと付録にあります。比較の条件が完全に揃っていたかは、読み手として気になりました
  • 付録の分野別の表で、TAPの論文のデータの「ノートパソコン」「口紅」の列の一部が、STSの論文のデータの「カメラ」「コーヒーメーカー」の列と同じ数値でした。転記の誤りの可能性があります
  • 本文は8件の一覧でのSTSとの差を「1.5〜2.2位分」としていますが、表1から計算すると1.49〜3.20位分(概算)でした。なお、TAPの論文のデータ(RAGDOLL)は、説明を短くした版がRagrollという別の名前で使われています
  • 付録の回答例には、仕込みのある回答で、ほかの商品の価格が元と違う値で紹介されたものがありました(29ドルの商品が149ドルなど)。操作は順位だけでなく、競合の情報の正しさにも及びうることを示す例として読めます

この論文から、言えること・言えないこと

言えること(論文の設定で確認された) 言えないこと(論文では確認されていない)
4つの公開AIで、最適化した文字列を足した商品の平均順位は、8件・10件の一覧で1.46〜2.50位だった 文字列を足す前と比べて、何位分上がったか
意味の通らない文字列のSTSより、8条件すべてで上位に来た 実際のAI検索サービスで同じように効くこと
宣伝語を含む割合は、露骨な指示文のTAPより低かった 見分ける仕組みを置いたAIでも、見つからずに効くこと
人の判定では、STSより自然で、操作っぽさが低いと見られた 文として自然なTAPと比べても、人に見つかりにくいこと
1語の違いで、1位から圏外へ落ちることがあった 日本語の商品説明や質問で効くこと

「平均1.46位」は、特定のAI、英語の短い商品説明、10件の一覧という条件での数字です。AI検索全般の話に広げて読むのは誤りです。

中小企業の視点で、どう受け取るか

ここからは論文の主張とは別の、私の読み取りです。

「読んでも違和感の少ない仕込み」がありうると知っておく

これまでの攻撃は、記号の羅列や露骨な文言で、人が読めば気づける形でした。この論文は、宣伝の言葉を避けた文字列で順位が動いた例を示しています。

比較サイトやモールの商品説明、他社のページをAIが読む以上、自社が知らないうちに順位で不利になる構図はありうる、と考えておくのが守りの出発点です。

「宣伝語で探す」だけの見張りには頼りきらない

実験の文字列は、宣伝語の一覧を避けるよう作られていました。語句の一覧による照合は有効な網の1つですが、この論文の範囲では、それだけですり抜ける文字列も作れていました。

自社でAIの答えを点検するときは、文言の有無より、答えの中身が元の情報と合っているかを見るほうが確かです。

AIの比較結果は、元の情報と照らし合わせる

付録の回答例では、仕込みのある一覧で、他の商品の価格が違う値で紹介されていました。自社の主力商品について、AIが価格や仕様を正しく伝えているかを、ときどき確かめる習慣が役に立ちます。

おかしな答えは、日付と質問文、回答の画面を記録しておくと、後で相談する材料になります。

操作する側には回らない

この手法は、順位をつけるAIの内部を使える前提で作られ、1語の違いで結果が反転する不安定さも報告されています。見つかった場合に失う信用も大きい手法です。

弊社は、順位を狙った文字列や隠し文を勧めていません。AIが比べる材料である価格、仕様、向いている人を、正確な文章で公開しておくことが正攻法です。

よくある質問

StealthRank(見つかりにくい順位操作)は、実際のAI検索サービスでも効きますか

この論文で確かめられたのは、内部を読める4つの公開モデルに、商品一覧を直接渡した実験までです。実際のAI検索サービス、検索で候補が集められる段階、日本語は対象外でした。

別のAIで作った文字列が効くかも試されていません。2025年時点の実験室の結果として受け取るのが妥当です。

StealthRankと、戦略的な文字列(STS)やページに仕込んだ指示(TAP)の攻撃は何が違いますか

STSは意味の通らない文字の並びで、TAPは商品を優先させる露骨な指示文で順位を動かしました。StealthRankは、宣伝の語句を避けながら、文として読める形に近づけることを狙った点が違います。

順位ではTAPを上回る条件が多く、宣伝語の割合もTAPより低い一方、文の自然さの指標ではTAPのほうが上でした。

StealthRankのような見つかりにくい順位操作から、自社を守る方法はありますか

論文自身が、防御は体系的に調べていないと書いています。論文から言える対策の決め手はまだありません。

私の読み取りとしては、自社の商品情報を正確に保ち、主要な質問でAIの答えを定期的に確かめ、不自然な順位や誤った情報を見つけたら記録を残すことが、中小企業に現実的な守りです。

まとめ:今日できる1つのこと

自社の主力商品について、AI検索に「〇〇のおすすめは?」と1回だけ聞いてみてください。

答えに出た自社と他社の価格・仕様を、それぞれの元のページと見比べ、食い違いがあれば日付と画面を記録します。この論文の付録の回答例の1つでは、仕込みのある一覧で、他の商品の価格まで違う値で紹介されていました(仕込みが原因かは論文からは分かりません)。

答えの中身を元の情報で確かめる習慣が、見つかりにくい操作に対するいちばん身近な備えです。

この論文は、LLMO論文の一覧の一本です。ほかの論文の解説も、順次公開しています。

この記事に書いたことを、そのまま御社のページに

生成AIに引用されるページを、お話しいただくだけでお作りします。お時間をいただくのは初回15分のヒアリングだけです。まず1ページ、無料でお作りします。

OKが出るまで、何度でも直します。事実が違う、言い回しが硬い、この話は入れないでほしい。どれも遠慮なくおっしゃってください。何度お直ししても、追加の料金はいただきません。

これまでに127社にご利用いただきました。毎月ご依頼いただいている方の6割以上が、月10ページを選ばれています。料金はページに掲載しています。

まず1ページ、無料で作らせてください

ページを増やしても問い合わせが来ないなら、原因はページの外にあります。その場合は、下の入口からご相談ください。

自社のマーケティング課題を根本から解決しませんか?

ウェブサイトから要素を引き算し、訪れた人が迷わず次の一歩に進む形へ組み直す。初回60分のオンラインで御社のサイトを一緒に読み、どこから直すべきかをお伝えします。手順をまとめた無料の診断と解説動画もご用意しています。

まず動画で詳しく見る(約30分)
無料診断を受ける

初回は無料・60分・オンライン完結・その場で契約のお願いはいたしません

LLMO論文
SEO対策 生成AI
よかったらシェアしてね!
  • URLをコピーしました!
  • 【LLMO論文解説】ページに仕込んだ指示でAI検索の商品順位は動くか|最下位の商品を押し上げた攻撃(EMNLP 2024)
  • 【LLMO論文解説】文書に仕込んだ指示でAIの順位づけは乗っ取られるか|8モデル・3方式で試した「順位づけの盲点」(EMNLP 2025)

この記事を書いた人

中野輝規のアバター 中野輝規

合同会社謙虚 代表社員。20代から、売る言葉だけを仕事にしてきました。電話営業で受話器を握っていた時代から、数千社のWEB集客に関わったいままで。詳しいプロフィールはこちら

この著者の記事一覧へ

関連記事

  • AIが2つのページから先に引用する方を選ぶ条件を25万2千回の実験で調べた論文を原文から読む
    【LLMO論文解説】AIが2つのページから先に引用する方を選ぶ条件を25万2千回の実験で調べた論文を原文から読む|関連性・位置・価格・日付(SIGIR 2026)
  • AIの回答に残るのは評価の高い声、体験談の「私」は98%減
    【LLMO論文解説】AIの回答に残るのは評価の高い声、体験談の「私」は98%減|Reddit Answersを3万回の回答で監査(プレプリント)
  • AIでの見え方は時間で薄れるのか:確信度の減衰の数式と専門AIへの引き継ぎ案
    【LLMO論文解説】AIでの見え方は時間で薄れるのか:確信度の減衰の数式と専門AIへの引き継ぎ案|実験なしの理論提案(プレプリント2026)
  • ページに仕込んだ指示はAIの回答まで届くか
    【LLMO論文解説】ページに仕込んだ指示はAIの回答まで届くか|7つの攻撃を検索・並べ替え・回答の3段で測り直した研究(プレプリント)
  • Google検索とAI検索は、引用元がほとんど重ならない
    【LLMO論文解説】Google検索とAI検索は、引用元がほとんど重ならない|1,000問の実測で見る出典と鮮度の違い(EDBT/ICDT 2026ワークショップ)
  • AIエージェントが読めるサイトは明確に薦められる割合が1.9倍
    【LLMO論文解説】AIエージェントが読めるサイトは明確に薦められる割合が1.9倍|1,056社・37,927回の調べものを比較(プレプリント)
  • 上位の型に寄せる書き換えを20回重ねると、型と品質の結びつきが弱まる
    【LLMO論文解説】上位の型に寄せる書き換えを20回重ねると、型と品質の結びつきが弱まる|CHASE(COLM 2026)
  • AIの引用の奪い合いを共存に変える仕組み
    【LLMO論文解説】AIの引用の奪い合いを共存に変える仕組み|罰だけの防御は行き詰まりうる、確かめられる事実に加点(プレプリント)
最近の投稿
  • 温泉の集客は宿泊客と日帰り客の線引きで決まる 掲示ルールに沿うページの作り方
  • デザイナーの集客は作品集だけでは届かない 発注担当が社内で通せるサイトの作り方
  • 屋根の集客は見えない屋根を見せる会社が選ばれる 点検商法と疑われないサイトの作り方
  • 遺品整理の集客は遺族の迷いに先回りして決まる 広告頼みから指名へ移るサイトの作り方
  • 看板の集客は検索した先で決まる 見た人を来店につなぐ受け皿の作り方
最近のコメント
  • ホテルの集客は公式サイトで迷わせないことから 予約サイト頼みを抜ける直し方 に 温泉の集客は宿泊客と日帰り客の線引きで決まる 掲示ルールに沿うページの作り方 - 合同会社謙虚 より
  • 外壁塗装の集客は急がせない会社が選ばれる 下請けを抜けて直接の依頼を増やすホームページの作り方 に 屋根の集客は見えない屋根を見せる会社が選ばれる 点検商法と疑われないサイトの作り方 - 合同会社謙虚 より
  • 不用品回収の集客は料金の見せ方で決まる 当日の追加請求を疑われない業者のサイトの作り方 に 遺品整理の集客は遺族の迷いに先回りして決まる 広告頼みから指名へ移るサイトの作り方 - 合同会社謙虚 より
  • 外壁塗装の集客は急がせない会社が選ばれる 下請けを抜けて直接の依頼を増やすホームページの作り方 に 看板の集客は検索した先で決まる 見た人を来店につなぐ受け皿の作り方 - 合同会社謙虚 より
  • 【LLMO論文解説】回答が似ていても出典は重ならない|BaiduとGoogleのAI要約を英語と中国語の500問で監査(EMNLP 2026ワークショップ) に 【LLMO論文解説】海外のGEO・LLMO・AIO論文101本の一覧|原論文から最新研究まで、テーマ別に整理(随時更新) - 合同会社謙虚 より
  • 記事制作(KCW)
  • 売れるサイトはみな謙虚
  • サービス一覧
  • サイトの無料診断
  • 合同会社謙虚とは
  • 代表プロフィール
  • ブログ
  • お問い合わせ
  • プライバシーポリシー
  • 特定商取引法に基づく表記

© 合同会社謙虚

目次