AIに「おすすめのカメラは?」と聞くと、候補の商品が順番に並んで返ってきます。
この順番を説明文で動かす研究は、これまでにもありました。今回の論文は、外から質問して答えを見ることしかできない商用のAI4つを相手に、読み手に自然に見える文章で同じことを試しています。
2026年2月にarXivで公開された「Controlling Output Rankings in Generative Engines for LLM-based Search(大規模言語モデルを使った検索で、生成エンジンの出力順位を制御する)」で、手法の名前はCOREです。
この記事では、原文から、何を試し、順位がどれだけ動き、どんな条件で効いたのか・効き目が落ちたのかを整理します。扱うのは攻撃の研究です。
足す文章の例や作り方の手順・設定値は、悪用の手引きにならないよう載せず、結果だけを書きます。弊社はこうした操作を勧めない立場で、守る側の視点から読んでいます。
合同会社謙虚は、3つのドメインを並行して運用し、何を変えると数字が動くかを測り続けています。購入体験を装った口コミ風の文章がAIの並べ替えにどれほど効き、どんな見張りをすり抜けやすいのかを、守る側の前提として確かめるために、この論文を読みました。
結論:3行で言うと
- 商品10件の一覧で最下位の商品の説明に文章を足すと、GPT-4o、Gemini 2.5 Pro、Claude 4、Grok 3の4つすべてで、その商品が1位に来た割合は、足さない場合の0%から、口コミ風や推論風の文章で76.5〜88.5%に上がりました(15の商品分野を通した範囲)
- 購入体験を装った口コミ風の文章は、人の目にも元の説明とほとんど見分けがつきませんでした。自然さは5点満点で4.6(元の説明は4.7)、「操作されている」と判定された割合は18.4%(元の説明でも12.0%)でした。試された3つの見張りのうち、不自然な文章を弾く方法もほぼすり抜けました
- 実験は、AIのAPIに候補の一覧を直接渡す形です。実際のAI検索サービスの画面や、検索で拾われる段階は対象外で、英語の商品データだけの、査読前のプレプリントです
この論文の基本情報
| 項目 | 内容 |
|---|---|
| 題名(原題) | Controlling Output Rankings in Generative Engines for LLM-based Search |
| 著者 | Haibo Jin、Ruoxi Chen、Peiyan Zhang、Yifeng Luo、Huimin Zeng、Man Luo、Haohan Wang(7人。イリノイ大学アーバナ・シャンペーン校、香港科技大学、独立の研究者、企業の研究所) |
| 公開日 | 2026年2月3日(arXiv第1版。2026年9月29日時点で版はこの1つ) |
| arXiv番号 | 2602.03608(分類は計算言語学、人工知能、情報検索) |
| 掲載・採択状況 | arXivのプレプリント。コメント欄は「23ページ」だけで、表紙にも「Preprint」とあり、採択の記載は見当たりません |
| 種類 | 大学を中心とした研究。商用AIのAPIに商品一覧を渡して順位をつけさせる実験室の実験 |
| 実験データとコード | 論文で作った商品データ(ProductBench)とコードの公開先は、論文に記載がありません |
論文はこちらで読めます。arXiv(2602.03608)、arXivのDOI。
この論文が答えた問い
AIの内部を読めず、質問して答えを見ることしかできない条件でも、商品の説明に文章を足すだけで、AIが最後に出すおすすめの順位を狙って動かせるのか。
論文はまず、AIのおすすめの順番は検索で拾われた順番に強く縛られ、最後に拾われた商品は上位に来る見込みがほぼゼロだと指摘します。論文はこれを、小さな事業者や個人の作り手の商品が埋もれる原因だと位置づけています。
当シリーズでは、ページに仕込んだ指示の論文、戦略的な文字列の論文、見つかりにくい順位操作の論文、自然に見える短い文字列の論文を解説しました。
この論文は、この4つを比較相手にしています。内部を読めない条件で商用のAIを試した研究も、すでにあります。
この論文の違いは、内部を読めない条件と、読み手に自然に見える長めの文章を組み合わせた点です。
どうやって調べたのか
| 項目 | 設定 |
|---|---|
| データ | 論文が作ったProductBench。15の商品分野(家庭・キッチン、電子機器、美容、ペット用品、食品など)に各200商品。商品ごとに、大手通販サイトの検索結果の上位10件を集め、名前・価格・説明・評価などを取り出したもの |
| 順位をつけさせたAI | 4つ。GPT-4o、Gemini 2.5 Pro、Claude 4、Grok 3。公式のAPIを初期設定のまま使用 |
| AIへの渡し方 | 質問と候補10件の情報をまとめて渡し、「渡した情報だけを使って、質問に合う順に並べる」よう指示する |
| 押し上げる対象 | 毎回、10件の一覧の最後の商品 |
| 主な指標 | 押し上げ成功率。対象が上位5位・上位3位・1位以内に入った割合 |
| 自然さの測り方 | 機械の指標(パープレキシティ)と、20人による評価 |
足す文章は3種類です。
- 文字列型:意味の通らない文字の並び。内部を読める公開モデルを相手の代わりに使って、機械的に作ります
- 推論型:推薦の理由を論じる体裁の文章
- 口コミ型:購入者の体験談の体裁の文章
推論型と口コミ型は、AIに下書きを書かせ、相手のAIが返した順位を見ながら書き直しを繰り返して作ります。返ってくる順位だけを手がかりにする点が、この論文の中心です。
書き直しの指示文や回数などの設定は省きます。パープレキシティは「文章の予想しにくさ」を表す数値で、小さいほど自然とされます。
結果
何もしなければ0%、文章を足すと1位に来る割合が8割前後に
何も足さない場合、最下位の商品が上位5位以内に入った割合は、4つのAI、15分野のすべてで0%でした。文章を足したときの結果が、論文の表1です。
15分野の値から、最小と最大を抜き出しました。
| 順位をつけたAI | 文字列型(1位の割合) | 推論型(1位の割合) | 口コミ型(1位の割合) | 口コミ型(上位5位以内の割合) |
|---|---|---|---|---|
| GPT-4o | 32.5〜37.0% | 81.0〜84.0% | 79.0〜85.0% | 89.5〜96.0% |
| Gemini 2.5 Pro | 31.0〜36.5% | 77.0〜82.0% | 82.0〜85.5% | 93.0〜97.5% |
| Claude 4 | 33.5〜38.5% | 81.0〜85.5% | 82.0〜88.5% | 93.5〜100.0% |
| Grok 3 | 30.0〜35.0% | 76.5〜81.0% | 77.0〜85.5% | 88.0〜96.5% |
- 推論型と口コミ型は、どのAI・どの分野でも1位の割合が76.5%以上でした。最高はClaude 4の口コミ型(事務用品)で、上位5位以内100.0%、1位88.5%です
- 文字列型は、1位の割合が30.0〜38.5%にとどまりました。
手法全体を通して、論文はClaude 4が最もよく反応し、Grok 3は反応が鈍いと書いています。
論文の要旨は、最も効いた方法での平均として「上位5位以内91.4%、上位3位以内86.6%、1位80.3%」を挙げています。この値は表1からは再現できませんでした(後述)。
既存の4つの手法より、順位が大きく動いた
論文の表2は、家庭・キッチンの分野で既存の4つの手法と比べた結果です。既存の手法は、元の論文の設定に従って公開モデル(Llama-3.1-8B)で作り、4つのAIに持ち込んでいます。
| 順位をつけたAI(1位の割合) | 推論型 | 口コミ型 | 戦略的な文字列(STS) | 仕込んだ指示(TAP) | 見つかりにくい順位操作(SRP) | 自然に見える短い文字列(RAF) |
|---|---|---|---|---|---|---|
| GPT-4o | 81.0% | 79.0% | 32.5% | 34.0% | 42.0% | 44.0% |
| Gemini 2.5 Pro | 77.5% | 83.5% | 31.5% | 29.5% | 40.0% | 46.0% |
| Claude 4 | 83.5% | 82.0% | 33.5% | 34.5% | 43.5% | 48.5% |
| Grok 3 | 77.0% | 78.5% | 30.0% | 29.5% | 38.5% | 41.0% |
工具と電子機器の分野(付録)でも傾向は同じでした。
口コミ型は、機械にも人にも見分けにくかった
- 機械の指標(表3):パープレキシティは、元の説明が29.95〜31.11、口コミ型が31.23〜32.65とほぼ同じでした。推論型は68.22〜75.11、文字列型は1,488.32〜1,572.15で、文字列型は数値だけで簡単に見つかる水準です
- 人による評価(表4):20人に見本を読んでもらい、5点満点の自然さと、操作されたものかどうかを判定してもらいました。自然さは元の説明4.7、口コミ型4.6、推論型3.7、文字列型1.2。「操作されている」と判定された割合は、元の説明12.0%、口コミ型18.4%、推論型62.1%、文字列型98.5%でした
口コミ型と元の説明の差は6.4ポイント(概算、18.4-12.0)です。
置き場所、ほかのAIへの持ち込み、商品以外
- 置き場所(表5):上位3件に3種類の文章を1つずつ足して競わせると、先頭に置いた口コミ型が1位を取った割合は71.0〜75.0%、先頭の推論型は62.0〜68.0%でした
- 持ち込み(表16):GPT-4oを相手に作った文章を作り直さずに使うと、口コミ型の1位の割合はGemini 2.5 Proで68.0%、Claude 4で67.5%、Grok 3で58.0%でした。作り込んだ場合より15.5〜20.5ポイント下がりますが、家庭・キッチンの分野での既存の手法の値(29.5〜48.5%)を上回っています
- 商品以外(表15):文章の検索(研究用データの200の質問)と旅行プランの並べ替え(200の都市に関する質問)でも、推論型と口コミ型の1位の割合は68.5〜81.0%でした
3つの見張りを試した結果
論文は付録Jで、守る側の方法を3つ試しています。家庭・キッチンの分野の結果です(表14)。
| 見張りの方法(1位の割合) | 文字列型 | 推論型 | 口コミ型 |
|---|---|---|---|
| 見張りなし | 30.5〜35.0% | 77.0〜82.0% | 78.5〜83.5% |
| 不自然な文章を弾く | 0.0% | 3.0〜3.5% | 72.0〜78.0% |
| 推論の筋道によく出る決まった言い回しを含む欄を除く | 30.5〜35.0%(変化なし) | 14.0〜18.5% | 56.0〜61.0% |
| 長すぎる欄を除く | 30.5〜35.0%(変化なし) | 29.0〜33.0% | 62.0〜68.0% |
- 不自然な文章を弾く方法は、文字列型をすべて、推論型をほぼすべて止めました。口コミ型は、1位の割合が5.5〜7.5ポイント下がっただけでした
- 言い回しや長さで除く方法は、推論型と口コミ型の両方を大きく下げました。それでも口コミ型は、どの見張りの下でも3種類の中で最も高い値が残りました
論文は、3つとも一定の効果はあるものの不十分だと結論づけています。付録Lによると、推論型の文章を作るAPIの費用は、対象の商品1件あたり0.0110〜0.0549ドルで、論文は実用的な水準だと書いています。
少ない費用で数多く作られうる、というのは私の読みです。
論文自身が書いている限界
限界をまとめた節は、この論文にはありません。影響について述べた節と付録から、論文自身が認めている点を挙げます。
- 試した3つの見張りは効き目を下げるものの不十分で、実際の検索の仕組みでは責任ある運用が必要だと書いています
- 公開モデルを相手の代わりに使う方法では、相手のAIと答えの傾向が少しずれます(付録G。10件の見本での比較)
- 別のAIで作った文章を持ち込むと、推論型と口コミ型の効き目は下がりました(付録K)
原文を読んで気づいた点
- 実際のAI検索サービスは対象外です。題名は「検索」をうたいますが、実験はAPIに候補10件を直接渡し、「渡した情報だけを使う」よう指示する形です。検索エンジンで拾われる段階や、サービス側の画面・防御は含まず、実験の時期も書かれていません
- 押し上げる対象は、常に10件中の最後の商品でした。効き目が最も大きく見える出発点です。途中の順位の商品や、ほかの商品も手を加えている場面は、表5の実験を除いて試されていません
- 要旨の平均値が、表1から再現できませんでした。表1から私が単純平均を計算すると(概算)、推論型は上位5位以内92.0%・1位81.0%、口コミ型は94.3%・83.2%で、要旨の「91.4%・80.3%」と一致しません。集計の方法は原文に書かれていません
- 本文と表に小さな食い違いがあります。本文は「GPT-4oとClaude 4は推論型によく反応する」と書きますが、15分野の単純平均(概算)では、GPT-4oは両者がほぼ同じ、Claude 4は口コミ型がわずかに上でした。表14の「見張りなし」のClaude 4の値も、表1の同じ分野の値と1.0〜1.5ポイント違います
- 既存の手法との比較は、条件がそろっていません。既存の手法は公開モデルで作って持ち込み、推論型と口コミ型は評価する当のAIを相手に作り込んでいます。ただ、持ち込みで使った推論型と口コミ型(表16)でも、1位の割合は55.0〜68.0%で既存の手法を上回っていました
- 口コミ型の中身は、架空の購入体験です。論文の評価は順位と文章の自然さだけで、内容が事実かどうかは評価の外です
- 試行回数とばらつきの記載がありません。繰り返しや統計的な検定は示されず、20人の評価者の属性も不明です
- 日本語での検証はありません。商品データも質問も英語です。Claude 4とGrok 3は、使ったモデルの版が不明です
- 著者7人のうち1人は企業の研究所の所属で、ほかは大学などの所属です
この論文から、言えること・言えないこと
| 言えること(論文の設定で確認された) | 言えないこと(論文では確認されていない) |
|---|---|
| 候補一覧をAPIで渡す形なら、内部を読めない商用AI4つでも、最下位の商品の説明に文章を足すだけで1位に来る割合を大きく上げられた | 実際のAI検索サービスの画面で、同じように順位が動くこと |
| 購入体験を装った口コミ風の文章は、人にも機械にも元の説明と見分けにくかった | 事実と異なる口コミ風の文章が、実際のサービスで見逃されること |
| 不自然な文章を弾く見張りは、意味の通らない文字列をほぼ完全に止めた | 試した3つ以外の見張り(投稿者の確認、重複の検査など)での効き目 |
| 作り込んだAIとは別のAIに持ち込んでも、効き目の多くが残った | 日本語の商品ページや質問で効くこと |
| 商品以外(文章の検索、旅行プラン)でも近い水準で順位が動いた | 順位の変化が、実際の購入や問い合わせにつながること |
「1位に来る割合が8割」は、最下位の1件だけに手を加え、ほかの9件は元のままという条件の数字で、AI検索全般に当てはまる確率とは別物です。
中小企業の視点で、どう受け取るか
ここからは論文の主張とは別の、私の読み取りです。
「口コミ風の文章」は、いちばん見張りをすり抜けやすかった
最も見張りに強かったのは、体験談の体裁をとった文章でした。出品者や会員の文章を集めてAIに並べ替えさせる仕組みを自社で持つなら、「文章が自然かどうか」で弾くだけでは足りないと読めます。
投稿者が実際に購入したかの確認や、似た言い回しの文章の抜き取り確認など、文章の外側の情報と組み合わせるのが守りの考え方になると考えます。
論文はこれらの方法を試しておらず、効果の大きさは未確認です。
AIが最初に挙げた候補は、元の情報で確かめる
仕入れ先や外注先、備品をAIに比べさせるとき、上位の候補が説明文に足された文章で押し上げられている可能性があります。価格・仕様・実績を、元のページや第三者の情報で確かめてから採用するのが安全です。
「使って比べた結果」のような体験談が推薦の根拠になっているときは、その出どころまで確かめる価値があります。
操作する側には回らない
論文は、この手法が小さな事業者の見え方を良くする仕組みにもなりうると書いています。ただ、口コミ型は買っていない体験を装う文章です。
日本では、事業者の宣伝を第三者の感想に見せる表示は、景品表示法のステルスマーケティング規制の対象になりえます。当シリーズで解説した選好操作攻撃の論文では、全員が攻撃すると推薦全体がかえって減ることも示されました。
弊社は、順位を動かすための文章や隠し文、架空の口コミを勧めない立場です。自社の説明に価格・仕様・実績を事実のまま書くことが、土台になると考えます。
よくある質問
COREの順位操作は、今のAI検索サービスでも効きますか
論文で確認されたのは、4つの商用AIのAPIに候補一覧を直接渡した場合の結果までです。検索で拾われる段階や、サービスの画面・防御は含まれず、実験の時期も不明です。
今のサービスで同じように効くかは、この論文の範囲の外にあります。
COREと、ページに仕込んだ指示や戦略的な文字列による順位操作は何が違いますか
先行研究の多くは、相手のAIの内部の数値を読める前提か、露骨な指示文や意味の通らない文字列を使っていました。COREは、相手の返す順位だけを見て文章を書き直す方法で、読み手に自然に見える推論風・口コミ風の文章を使います。
論文の比較表では、既存の4つの手法より1位に来る割合が高くなりました。
口コミ風の文章によるAIの順位操作は、どう見分けられますか
論文が試した3つの見張りのうち、不自然な文章を弾く方法は口コミ型にほとんど効かず、決まった言い回しや長さで除く方法で1位の割合が56.0〜68.0%まで下がりました。
3つとも不十分だと論文は結論づけています。文章の中身だけで判定せず、投稿者や購入の事実など文章の外側の情報と合わせて確かめるのが、私の考える現実的な方向です。
まとめ:今日できる1つのこと
AIに候補を比べさせて決めたことが最近あれば、1つだけ選び、AIが推薦の理由に挙げた「使ってみた感想」や比較の根拠が、元のページや第三者の情報で裏づけられるかを確かめてください。この論文の実験では、購入体験を装った文章が、人にも機械にもほとんど見分けられないまま、最下位の商品を1位へ押し上げていました。
この論文は、LLMO論文の一覧の一本です。ほかの論文の解説も、順次公開しています。
この記事に書いたことを、そのまま御社のページに
生成AIに引用されるページを、お話しいただくだけでお作りします。お時間をいただくのは初回15分のヒアリングだけです。まず1ページ、無料でお作りします。
OKが出るまで、何度でも直します。事実が違う、言い回しが硬い、この話は入れないでほしい。どれも遠慮なくおっしゃってください。何度お直ししても、追加の料金はいただきません。
これまでに127社にご利用いただきました。毎月ご依頼いただいている方の6割以上が、月10ページを選ばれています。料金はページに掲載しています。
ページを増やしても問い合わせが来ないなら、原因はページの外にあります。その場合は、下の入口からご相談ください。
自社のマーケティング課題を根本から解決しませんか?
ウェブサイトから要素を引き算し、訪れた人が迷わず次の一歩に進む形へ組み直す。初回60分のオンラインで御社のサイトを一緒に読み、どこから直すべきかをお伝えします。手順をまとめた無料の診断と解説動画もご用意しています。
初回は無料・60分・オンライン完結・その場で契約のお願いはいたしません


