内部を読める公開AIを相手に最適化した、人が読んでも意味の通らない文字の並びを商品ページに1つ足すと、実験ではAIのおすすめ1位が入れ替わった。
これを実験で示した論文があります。2024年4月にハーバード大学の研究者2人がarXivに公開した「Manipulating Large Language Models to Increase Product Visibility(大規模言語モデルを操作して、商品の見え方を高める)」です。
AIの商品推薦を外から動かせるかを扱った早い時期の研究です。当シリーズで解説したGEOの原論文や選好操作攻撃の論文にも引用されており、2025年の別の論文は「最も早い試みの一つ」と位置づけています。
この記事では、論文を原文から読み、何を試し、順位がどれだけ動き、どんな条件で効いたのか・効き目が薄れたのかを整理します。
扱うのは、推薦を操作する攻撃の研究です。論文が仕込んだ文字列そのものや、その作り方は、悪用の手引きにならないよう載せず、結果だけを書きます。
弊社はこうした操作を勧めない立場で読んでいます。
合同会社謙虚は、3つのドメインを並行して運用し、何を変えると数字が動くかを測り続けています。AIの推薦がどこまで外から動かされうるのか、その上限と条件を知っておくことが、正攻法で情報を整えるときの判断の土台になるため、この論文を読みました。
結論:3行で言うと
- 架空のコーヒーメーカー10台の一覧で、対象の商品情報に最適化した文字列を1つ足すと、AIが1位に挙げる割合が大きく上がりました。高すぎてほぼ推薦されていなかった商品が、図から読むと200回のうち約7割で1位になっています(商品の並び順を固定した条件)
- 効き方は条件に左右されました。商品の並び順を毎回入れ替えると、固定の順番で作った文字列は効き目が薄れ、2位によく来る商品では、順位が上がった回と下がった回がほぼ同じ割合でした。並び替えを想定して作り直すと、下がる回はほぼ消えています
- 試したAIは、内部を読める公開モデル(Llama-2)1つです。実験は英語の質問1種類に限られ、実際のAI検索サービスと日本語は対象外です。査読を経た学会・論文誌の版も確認できませんでした
数字の多くは、論文の図だけに示されています。この記事の割合は、図の点や棒から私が読み取った概算です。
この論文の基本情報
| 項目 | 内容 |
|---|---|
| 題名(原題) | Manipulating Large Language Models to Increase Product Visibility |
| 著者 | Aounon Kumar、Himabindu Lakkaraju(2人。ハーバード大学) |
| 公開日 | 2024年4月11日(arXiv初版)。確認した版は2024年9月2日の第2版(冒頭に、悪用を強く戒める但し書きが加わった版。実験の中身は初版と同じ) |
| arXiv番号 | 2404.07981(分類は情報検索) |
| 掲載・採択状況 | arXivのプレプリント(査読前の論文)。arXivのコメント欄は空欄で、題名で検索しても学会・論文誌の掲載版は見つかりませんでした(2026年9月28日時点)。2025年に公開された後続の論文も、arXiv番号で引用しています |
| 種類 | 大学の研究。架空の商品データを使い、AIに直接一覧を渡す実験室の実験 |
| 実験データとコード | 実験のコードは著者が公開していると論文に書かれています。この記事ではリンクを載せていません |
論文はこちらで読めます。arXiv(2404.07981)、arXivが発行したDOI。
この論文が答えた問い
販売者が自社の商品情報ページに、狙って作った文字列を埋め込めば、AIの商品推薦で自社の商品が1位に挙がる確率を上げられるのか。
背景にあるのは、AI検索の仕組みです。利用者が質問すると、検索でウェブや商品データベースから関連する情報を集め、それを質問と一緒にAIへ渡し、AIが答えをまとめます。
販売者が手を入れられるのは、自社の商品情報ページだけです。それでも、そのページがAIに渡る以上、そこからAIの答えを動かせる余地がある、と論文は考えました。
論文は、埋め込む文字列を「戦略的な文字列(strategic text sequence)」と呼んでいます。作り方には、もともとAIの安全装置をすり抜けるために研究されてきた攻撃の手法を転用しました。
論文はこの使い方を「悪意の目的ではない応用」と位置づける一方で、販売者に大きな競争上の有利をもたらし、公正な市場の競争を崩しうると警告しています。
近い論文との関係
同じ2024年の6月には、実際のAI検索サービスに対して、ページの文章の書き換えで推薦を動かした研究が公開されています(選好操作攻撃の論文の解説)。
その論文は、この論文を「同時期の研究」と紹介し、違いとして、AIの内部の数値を読める条件(ホワイトボックス)での研究である点、実サービスでは試していない点を挙げています。
人が読める説得の文言で推薦がどう動くかは、有名ブランドの有利さと説得の文言の解説で扱いました。
この記事の論文は、人には意味の読めない文字列を機械的に作って試した、という位置にあります。
どうやって調べたのか
| 項目 | 設定 |
|---|---|
| 商品 | 架空のコーヒーメーカー10台。名前、説明、価格、評価(星)、容量、向いている人、といった項目を持つ短い商品データ |
| 質問 | 「手頃なコーヒーメーカーを探しています。おすすめを教えてもらえますか」という英語の依頼1種類 |
| 使ったモデル | Llama-2(誰でも入手できる公開モデル)。モデルの大きさは本文に書かれていません |
| AIへの渡し方 | 役割を決める指示文、10台の商品データ、質問を1つにまとめて渡す。検索の段階は省き、対象の商品情報が必ずAIに渡る前提 |
| 対象の商品 | 2つ。価格199ドルで、ほとんど推薦されない商品(以下、商品A)。価格89ドルで、2位に来ることが多いとされる商品(以下、商品B)。どちらも架空の商品です |
| 文字列の作り方 | AIの内部の数値を読める前提で、対象の商品が1位に来るよう文字列を自動で少しずつ入れ替えていく(繰り返しは2,000回)。具体的な手順と文字列は、この記事では省きます |
| 評価の回数 | 文字列あり・なしのそれぞれで、AIに200回答えさせる |
| 順位の決め方 | 回答の中で、各商品の名前が最初に出てきた順番を順位とする。名前が出てこなければ「推薦なし」 |
| 並び順の条件 | 2通り。10台の並び順を毎回同じにする条件と、毎回ランダムに入れ替える条件 |
押さえておきたい点が3つあります。1つ目は、順位を機械的に数えていることです。
回答の中身の正しさや、利用者にとって良い推薦かどうかは、評価の対象外です。2つ目は、並び順を入れ替える条件での数え方です。
論文は、同じ並び順で文字列あり・なしを比べ、文字列ありのほうが順位が上なら「得」、同じなら「変化なし」、下なら「損」と分けています。
3つ目は、結果の数値がほぼすべて図で示されていることです。図の点は1つが約5%(200回のうち約10回)にあたると、論文の図の説明に書かれています。
結果
並び順を固定した条件:高すぎた商品が1位の常連になった
論文の図4bと図6bから、文字列の有無で順位の分布がどう変わったかを読み取りました。割合は、図の点を数えた私の概算です。
| 商品 | 文字列なし(200回) | 文字列あり(200回) |
|---|---|---|
| 商品A(199ドル) | すべて推薦なし | 1位が約70%、4位と5位が各約5%、推薦なしが約20% |
| 商品B(89ドル) | 2位が約45%、推薦なしが約55%。1位は0回 | 1位が約70%、2位が約30% |
文字列を作る途中の経過も示されています(図4a・図6a)。商品Aは、繰り返しの100回目までに推薦なしから1位へ移り、その後は1位のままでした。
商品Bは、はじめ2位で、途中で何度か推薦から外れたあと、1,000回目の前後から1位で安定しています。
論文は、文字列ありのときの回答例も載せています。「手頃な機種を」という依頼に対して、AIは199ドルの商品Aを1位に挙げ、締めの文では商品Aを「比較的安価な選択肢」と紹介しました。
同じ一覧には59ドルや29ドルの機種もありました。利用者の条件に合わない商品が、もっともらしい説明つきで1位に来たことになります。
並び順を入れ替えた条件:作り方しだいで効き目が変わった
実際のAI検索では、商品情報が渡る順番は毎回変わりえます。論文は、200回それぞれで並び順をランダムに入れ替え、文字列あり・なしを比べました(図5・図7)。
商品Aの「約40%」「約60%」は論文本文の数字で、それ以外は図の棒から私が読み取った概算です。
| 条件 | 得(順位が上がった) | 変化なし | 損(順位が下がった) |
|---|---|---|---|
| 商品A・固定の順番で作った文字列 | 約40% | 約60% | ごくわずか(約1%) |
| 商品A・並び替えを想定して作った文字列 | 約95% | 約2〜3% | ごくわずか |
| 商品B・固定の順番で作った文字列 | 約16% | 約65% | 約18% |
| 商品B・並び替えを想定して作った文字列 | 約48% | 約51% | ほぼ0% |
この表の「得」は、同じ並び順での文字列なしと比べて順位が上がった割合です。1位になった割合とは別の数字なので、上の表と並べて読むときは注意が要ります。
読み取れること
- 最適化した文字列は、利用者の条件と合わない商品でも1位に押し上げました。並び順を固定した文字列なしの200回では、AIは価格の高い商品Aを一度も挙げなかった、と図から読めます。論文も、商品Aがほとんど推薦されないのは価格が高いからだと説明しています
- 効き目は、商品の並び順という細かな条件に左右されました。固定の順番で作った文字列は、並びが変わると、商品Bでは得と損が打ち消し合いました
- 並び替えを想定して作り直すと、得の割合が上がり、損はほぼなくなりました。論文は、こうした揺らぎに強い文字列も作れることを示した、と述べています
- すべて、1つのAI、1つの質問、架空の10台という設定の中での数字です
論文自身が書いている限界
この論文では、限界が独立の節にまとめられておらず、実験設定と結論の節に散らばっています。そこに書かれている前提と課題を拾います。
- 対象の商品情報が検索で拾われ、AIに渡ることを前提にしています。販売者が操作できるのは自社のページだけなので、そこがAIに届くことが影響の条件だと論文は述べています
- 試すAIを公開モデル(Llama-2)に絞っています。内部を読めない商用のモデル(論文はGPT-4を例に挙げています)へこの種の文字列が転用できることは、先行する別の攻撃研究で示されている、と引用するにとどめています
- 実際のAI検索では並び順が変わりうるため、並び替えの条件を追加で試しています
- 今回扱ったのは弱点の1つで、事業者に不公正な有利を与える別の弱点の研究が必要だと述べています
- 今後の課題として、こうした文字列の使い方の倫理的な線引き、責任ある使い方の指針、不公正な操作を防ぐ対策の研究を挙げています
原文を読んで気づいた点
- 査読前のプレプリントです。本文は10ページ弱の短い論文で、学会・論文誌の版は確認できませんでした
- 実際のAI検索サービスでは試されていません。冒頭に実在のAI検索の回答画面が載っていますが、これは仕組みを説明する例です。実験は、公開モデルに一覧を直接渡す形だけです
- 規模は小さめです。AIは1つ、質問は1種類、分野はコーヒーメーカーだけ、商品は架空の10台、対象の商品は2つです。回答は条件ごとに200回です
- 日本語での検証はありません。質問も商品データも英語です
- 統計的な検定や、ばらつきの幅は示されていません。回答を作るときのランダムさの設定も、本文からは確認できませんでした
- 本文と図に食い違いがあります。本文は商品Bを「多くの場合2位に来る」と書きますが、図6bの文字列なしの200回では、推薦なしが約55%、2位が約45%と読めます。また、冒頭の図2では文字列ありの点がすべて1位ですが、実験の節の図4bでは約2割が推薦なしです。図2がどの条件の結果かは書かれていません
- 見分ける仕組みに対する効き目は試されていません。2025年の別の論文(認知バイアスと商品推薦の論文の解説)は、この論文の文字列を、不自然で見つかりやすく、実際の場面では使いにくい手法だと評価しています
- 文字列を作るには、AIの内部の数値を読めることが前提です。一般の事業者が、商用のAI検索サービスの内部を読める状況は想定しにくいと私は考えています
この論文から、言えること・言えないこと
| 言えること(論文の設定で確認された) | 言えないこと(論文では確認されていない) |
|---|---|
| 公開モデル1つと架空の10台の設定で、最適化した文字列は、対象の商品が1位に挙がる割合を大きく上げた | ChatGPTやGeminiなど、実際のAI検索サービスで同じように効くこと |
| 利用者の条件(手頃さ)に合わない高価格の商品でも、1位に挙がった | 日本語の商品ページや質問で効くこと |
| 並び順が変わると、固定の順番で作った文字列の効き目は薄れ、得と損が相殺する場合もあった | 検索でページが拾われる段階を含めても、推薦が動くこと |
| 並び替えを想定して作り直すと、得が増え、損はほぼ消えた | 見分ける仕組みを持つAIでも、見つからずに効くこと |
| AIの内部を読める条件なら、推薦を狙って動かす文字列を自動で作れた | 推薦の変化が、売上や問い合わせにつながること |
「約7割で1位」は、並び順を固定した1つの設定で、図の点を数えた概算です。AI検索全般で推薦を7割動かせる、と読むのは誤りです。
中小企業の視点で、どう受け取るか
ここからは論文の主張とは別の、私の読み取りです。
AIのおすすめは、条件と照らし合わせて読む
実験では、「手頃な機種を」と頼んだのに、199ドルの商品が「比較的安価」と紹介されて1位に来ました。自社で仕入れ先や道具をAIに比べさせるときも、1回の答えをそのまま採用せず、価格や仕様が質問の条件と合っているかを元の情報で確かめる習慣が役に立ちます。
操作する側には回らない
この論文の手法は、AIの内部を読めることが前提で、商用のAI検索にはそのまま使えない条件で試されています。後続の研究は、こうした意味の読めない文字列を、不自然で見つかりやすいと評価しています。
選好操作攻撃の論文では、全員が攻撃すると全体の推薦がかえって減ることも示されました。見つかれば取引先や顧客の信頼を失うおそれもあります。
弊社は、推薦を操作する文字列や隠し文を勧めていません。
AIが比べる材料を、正確な文章で置く
文字列を足す前のAIは、価格を見て、手頃な機種を上位に挙げていました。AIは本来、渡された商品情報の中身で選んでいたわけです。
正攻法としては、価格、容量、対象となる人といった比べる材料を、正確な文章で公開しておくことが素直な一手だと読めます。
論文の数字を、条件から切り離して使わない
この論文はよく引用されるため、「AIの推薦は文字列で操作できる」という話だけが一人歩きしがちです。1つの公開モデル、英語、架空の10台という条件を外して営業の材料に使うと、誇張になります。
紹介するときは、条件とセットで伝えるのが誠実です。
よくある質問
戦略的な文字列(STS)による推薦操作は、ChatGPTなど今のAI検索でも効きますか
この論文で分かるのは、公開モデルでの結果までです。実際のAI検索サービスは実験の対象外でした。
試したのは公開モデルのLlama-2だけで、内部を読めない商用モデルへの転用は、別の研究を引用して可能性を述べるにとどまります。
2024年当時の1つの公開モデルでの結果として受け取るのが妥当です。
戦略的な文字列による推薦操作と、選好操作攻撃の論文は何が違いますか
この論文は、AIの内部の数値を読める条件で、人には意味の読めない文字列を機械的に作り、架空の一覧で試しました。選好操作攻撃の論文は、内部を読めない条件で、人が読める文章の書き換えによって、実際のAI検索サービスの推薦を動かしています。
後者は、全員が攻撃したときに何が起きるかまで調べています。
商品ページに戦略的な文字列を入れれば、AI検索で1位になれますか
この論文から、その結論は引き出せません。実験は公開モデルに一覧を直接渡す設定で、検索で拾われる段階も、見分ける仕組みも含まれていません。
後続の研究は、この種の文字列を見つかりやすいと評価しています。弊社は、こうした操作を勧めない立場です。
まとめ:今日できる1つのこと
自社の主力商品かサービスのページを1つ開き、価格、仕様、向いている人など、AIが比べる材料が正確な文章で書かれているかを確かめてください。
画像の中にしかない情報や、古いままの価格があれば、事実どおりに1か所だけ直します。この論文の実験でも、細工のない状態のAIは、渡された商品情報の中身で選んでいました。
この論文は、LLMO論文の一覧の一本です。ほかの論文の解説も、順次公開しています。
この記事に書いたことを、そのまま御社のページに
生成AIに引用されるページを、お話しいただくだけでお作りします。お時間をいただくのは初回15分のヒアリングだけです。まず1ページ、無料でお作りします。
OKが出るまで、何度でも直します。事実が違う、言い回しが硬い、この話は入れないでほしい。どれも遠慮なくおっしゃってください。何度お直ししても、追加の料金はいただきません。
これまでに127社にご利用いただきました。毎月ご依頼いただいている方の6割以上が、月10ページを選ばれています。料金はページに掲載しています。
ページを増やしても問い合わせが来ないなら、原因はページの外にあります。その場合は、下の入口からご相談ください。
自社のマーケティング課題を根本から解決しませんか?
ウェブサイトから要素を引き算し、訪れた人が迷わず次の一歩に進む形へ組み直す。初回60分のオンラインで御社のサイトを一緒に読み、どこから直すべきかをお伝えします。手順をまとめた無料の診断と解説動画もご用意しています。
初回は無料・60分・オンライン完結・その場で契約のお願いはいたしません


