論文の冒頭に、1枚の画面が載っています。2026年5月、ChatGPTに「良い保湿クリームを買いたい。
どれがいちばん?」と聞いたところ、既存の大手ブランドの商品が「総合1位」に挙がった実際の回答です。
では、AIは有名ブランドを最初からひいきしているのでしょうか。後から参入した新しいブランドは、AIの推薦で勝てないのでしょうか。
この問いを実験で調べたプレプリント(査読前の論文)を、原文から読みます。題材はスキンケア商品で、3つのAI(GPT-4o-mini、Claude Sonnet、Gemini 3 Flash)に、既存の有名ブランドと架空の新ブランドを並べて推薦させています。
あわせて、臨床試験をうたう文言のような「説得の手口」を商品説明に足すと、推薦がどれだけ動くかも測っています。
合同会社謙虚は、3つのドメインを並行して運用し、何を変えると数字が動くかを測り続けています。知名度で劣る中小企業がAIの推薦で何を材料に選ばれるのかを、実験の数字で確かめるために読みました。
結論:3行で言うと
- 商品の仕様がまったく同じなら、AIは670回の試行すべてで有名ブランドを選びました。ただし、架空ブランドの評価を星0.075個分だけ上げると、半分の確率で逆転しました(論文はこれを「条件つきの独占」と呼んでいます)
- 商品説明に権威づけの文言(実験では実在しない臨床試験の主張を含む)を足すと、有名ブランドとの1対1の比較で、仕様が同じままでも架空ブランドが73.3%の確率で選ばれました。数量限定や値ごろ感を強調する売り込み文言は、10〜13%でした
- 競合の架空ブランド9社がそろって同じ文言を使うと、効果はほぼ消え、有名ブランドが93.8%の確率で選ばれる状態に戻りました。文言を使わなかった架空ブランドは、一度も推薦されていません
いずれも、商品リストをAIに直接渡した実験室の設定での結果です。英語と中国語で試しており、日本語では試されていません。
この論文の基本情報
| 項目 | 内容 |
|---|---|
| 題名(原題) | Incumbent Advantage: Brand Bias and Cognitive Manipulation Dynamics in LLM Recommendation Systems |
| 著者 | シー・チュー(トライン大学)、ユーペン・ホウ(テキサスA&M大学)の2人 |
| 公開日 | 2026年6月16日(arXiv初版)。確認した版は2026年8月21日の第2版 |
| arXiv番号 | 2606.17443(分類は人工知能) |
| 掲載・採択状況 | arXivのプレプリント。コメント欄はページ数と図表の数だけで、学会・論文誌への採択の記載は確認できませんでした |
| 種類 | 大学の研究者による実験研究(3つの実験と、補足の確認実験2つ) |
| 実験データとコード | 公開先の記載は見当たりません。詳しい表と指示文のひな形は「補足資料にある」と書かれています |
論文はこちらで読めます。arXiv(2606.17443)、DOI(10.48550/arXiv.2606.17443)。
この論文が答えた問い
AIが商品を薦めるとき、有名ブランドはどれだけ有利なのか。その有利さは、品質の差や、説明文の書き方でひっくり返せるのか。そして、全社が同じ書き方をしたら何が起きるのか。
スキンケアを選んだ理由を、論文は次のように説明しています。使ってみるまで品質が分からず、同じ分類の商品は有効成分も濃度もほぼ同じなので、ブランドの評判が決め手になりやすい。
ブランドの影響を調べる出発点に向いた分野だというわけです。
論文は背景として、ChatGPTが2026年2月に米国で広告の試験を始めたことを挙げ、回答そのものに載る価値は、回答の下の広告枠より大きくなり得ると見ています。
どうやって調べたのか
共通の設定から整理します。
- AI:GPT-4o-mini、Claude Sonnet(論文記載の型番は4.6)、Gemini 3 Flash(プレビュー版)の3つ。いずれも中身が非公開の商用モデルです
- 言語:英語と中国語。日本語は含まれていません
- 商品:保湿、角質ケア、日焼け止め、洗顔料の4分類。各分類で、3つのAIが最も多く薦めた実在の定番品を「有名ブランド」にしました
- 架空ブランド:AIに名前を作らせ、ウェブ検索で100件を超えて見つかる名前と、AIが商品知識を語り出す名前を除いて、各分類9つずつ用意しました
- 質問の形:商品リストを指示文に書いてAIに渡し、1つ選ばせるか順位をつけさせます。質問者は「25歳男性、脂性でニキビができやすい肌」という1人の設定に固定しています
- 回数:回答のゆらぎの設定(温度)は0.7、条件ごとに20〜30回繰り返しています
そのうえで、次の実験を順に行っています。
| 実験 | 何を変えたか | 規模(有効な試行) |
|---|---|---|
| 1a:名前だけの差 | 10商品(有名1+架空9)の仕様をすべて同じにする | 670回 |
| 1b:品質を入れ替え | 有名と架空に、良い仕様と悪い仕様を入れ替えて割り当てる | 2,769回 |
| 1c:差の大きさ | 架空ブランドの評価・価格・口コミ数・成分の優位を5段階で変える | 9,220回 |
| 1d:要因の分解 | 品質・並び順・ブランドが順位をどれだけ左右するかを分ける | 14,395回 |
| 2:説得の手口 | 仕様は同じまま、架空ブランドの説明に5種類の文言を3段階の強さで足す(2商品の比較) | 4,080回 |
| 3:全社が最適化 | 文言を足す架空ブランドを0・1・3・6・9社と増やす | 4,745回 |
補足として、仕様を比べやすい商品(USBケーブルと乾電池)での再現確認(3,840回)と、検索で商品を絞り込んでからAIに渡す仕組みでの確認(1,080回)もあります。
主な指標は3つです。先行者優位指数(IAI)は、有名ブランドの推薦率を、公平なら得られるはずの10%で割った値で、最大は10です。
文言の品質換算値(BSV)は、ある文言の効果が「評価の星いくつ分の品質改善」に当たるかを換算した値です。
有名ブランドの残存率は、有名ブランドが選ばれた割合です。数えているのはAIが最後の行に書いた選択だけで、採点は機械的に行われています。
結果
実験1:名前が効くのは、比べる材料がないときだけ
| 条件 | 結果 |
|---|---|
| 10商品の仕様がすべて同じ(1a) | 有名ブランドが670回すべてで選ばれた(IAI=10.0。3モデル・2言語・4分類のどの組み合わせでも同じ) |
| 架空ブランドのほうが仕様が良い(1b) | それでも有名ブランドが選ばれたのは、分類別に1.7〜4.6% |
| 架空ブランドの優位が最小の段階(1c) | 架空ブランドの勝率が、差のない段階の3.6〜6.0%から、64.3〜79.7%に跳ね上がった |
| 勝率が50%になる境目(1c、補間) | 評価で星0.075個、口コミ数で1.6倍、価格で7.3%の値下げ |
| 順位への影響の大きさ(1d) | 品質の仕様が82.4%、並び順が6.5%、ブランドが1.2% |
- 仕様が同じなら独占、少しでも差があれば逆転という、階段のような変化でした
- ブランドの効き目は、品質が中くらいで判断しにくいときに最も大きく、平均順位は有名1.70位、架空5.49位でした。論文は、ブランドを「引き分けのときの決め手」と表現しています
- モデルの差も大きく、評価で最小の優位をつけたときの架空ブランドの勝率は、Claudeが11%、GPTが94%、Geminiが88%でした。Claudeは有名ブランドを手放しにくい傾向です
- 有名ブランドが仕様で劣るのに選ばれた21件を読むと、指示文にない商品知識を持ち出した回答は0件でした。論文はここから、AIが記憶だけで答えたわけではないと判断しています。ただし付録では、表に出ない記憶の影響までは、この確認だけでは否定できないとしています
- USBケーブルと乾電池でも、仕様が同じなら有名ブランドが全試行で選ばれ、最小の優位で勝率が43〜84%に跳ねる同じ形が再現しました
実験2:説得の手口は、2つのグループに分かれた
表は、中くらいの強さの文言を足したときに、架空ブランドが選ばれた割合です(論文の表2)。文言がないときは約4%です。
| 文言の種類 | Claude | GPT | Gemini | 全体 |
|---|---|---|---|---|
| 権威づけ(臨床試験や専門家の関与をうたう) | 55% | 69% | 99% | 73.3% |
| 社会的証明(利用者の評判や満足度を示す) | 7% | 69% | 81% | 50.7% |
| 値ごろ感の強調(高価格帯と比べてみせる) | 0% | 34% | 3% | 12.9% |
| 希少性(数量限定・品切れ間近) | 0% | 32% | 1% | 11.7% |
| 損失回避(使わないと損をすると訴える) | 0% | 25% | 2% | 9.6% |
- 根拠らしく見える文言が効き、売り込みの圧をかける文言はほぼ効きませんでした。繰り返しの偏りを考慮した再計算でも、権威づけの95%信頼区間の下限(58.9%)は、値ごろ感の強調の上限(21.1%)を上回っています
- 権威づけの効果を品質に換算すると、評価で星0.17個分、価格で15.3%の値下げ、口コミ数で1.9倍に当たりました(BSV)。社会的証明は星0.08個分で、残りの3種はほぼ0です
- 強さへの反応はモデルで違い、Claudeは中くらいが最も効いて強すぎると逆効果、GPTは強いほど効き、Geminiはどの強さでも100%近くでした
- 権威づけと社会的証明を重ねると、Claudeでは55.0%から21.2%に下がり、GPTでは91.2%に上がりました。論文は、Claudeが「話がうますぎる」と受け取った可能性を挙げています
- 補足の分析では、中国語のほうが文言の効果が小さく出ています(有意)
権威づけの文言には、実在しない臨床試験を名乗る架空の主張が使われています。論文はこれを「効果の上限を測るための刺激」と位置づけ、実務の提言は、実在する根拠を示す文言と、出典を示さない曖昧な権威づけ(論文はグレーゾーンと表現)を対象にしていると断っています。
私の読み取りでは、後者のグレーゾーンの文言も勧められません。
実験3:全社が同じ文言を使うと、効果は消えた
| 文言を足した架空ブランドの数 | 有名ブランドの残存率(全体) | 1社あたりの得(論文の代理指標) |
|---|---|---|
| 0社 | 100.0% | なし |
| 1社 | 19.8% | +0.802 |
| 3社 | 19.4% | +0.269 |
| 6社 | 73.1% | +0.036 |
| 9社(全社) | 93.8% | +0.007 |
「1社あたりの得」は、文言を使った場合と使わなかった場合の推薦される確率の差です(論文の付録Eの値)。
- 1社だけが文言を使うと、有名ブランドの独占は崩れました。ところが使う社が増えるほど文言が目印にならなくなり、全社がそろうと有名ブランドがほぼ元の地位に戻りました
- 得は1社目の+0.802から全社の+0.007へ、およそ100分の1に縮んでいます(私の概算:0.007÷0.802)。それでも常にプラスなので、各社は使い続けるしかありません。論文はこれを「囚人のジレンマに似た構造」(各社が得を求めて全社が使い、1社あたりの得がほぼ0まで縮む構図)と呼んでいます
- 文言を使わなかった架空ブランドは、4,745回で一度も推薦されませんでした。競合が使い始めた時点で、使わない側は見えなくなっています
- 全社がそろったときの残存率は、Claudeが99.4%、GPTが96.2%、Geminiが84.9%で、モデル間の差は有意でした。英語と中国語の差は有意ではありませんでした
補足:検索で絞り込む仕組みでは、有名ブランドが落ちた
質問と似た商品説明を検索で選んでからAIに渡す簡易な仕組みでは、実在ブランドの説明が質問との近さで10件中平均8.50位に沈み、上位5件だけを渡す条件では推薦がほぼなくなりました。
権威づけの文言は、この検索段階でも近さを押し上げています。論文は、最小限の仕組みでの結果なので「方向性を示すもの」と位置づけています。
論文自身が書いている限界
- 主な実験はスキンケアの1分野だけです。USBケーブルと乾電池で確認したのは実験1の一部で、説得の手口(実験2)と全社の最適化(実験3)は確認していません
- 質問者の設定は1通り、回答のゆらぎの設定も1通りで、1回ごとの再現性は保証されません。同じモデルへの繰り返しは独立な標本とは言えないため、まとまりごとに再計算して確かめています
- 試したAIは中身が非公開の3つだけで、公開モデルでは違う振る舞いの可能性があります
- 検索で絞り込む確認は、1種類の埋め込みモデル(文章を数値に変える仕組み)で、並べ替えや質問の言い換えは入れていません。商用の検索つきAIに一般化はしていません
- 「ブランド」の要因には、名前の知名度だけでなく、AIが学習で覚えた商品ラインや評判もまとめて入っています。どの部分が効いたのかは分けていません
- 実験2・3では実在しない根拠をうたう文言を使っており、虚偽広告になり得ること、消費者をだます用途にも使えることを、論文自身が認めています
原文を読んで気づいた点
- 日本語での検証はありません。英語と中国語で、実験2では中国語のほうが効果が小さく出ています。言語で結果が変わり得ることを示しており、日本語にそのまま当てはまるかは分かりません
- 商品リストと仕様を指示文でAIに直接渡しており、AIが自分でウェブを検索する実際の使われ方とは条件が違います
- 架空ブランドは、ウェブにもAIの記憶にもほぼ存在しない名前です。実在の中小ブランドは多少の情報がネット上にあるため、この「新ブランド」とは立場が違います
- 採点は、AIが最後の行に書いた選択を機械で数えたものです。人が読んだ評価や、実際の購入は測っていません
- 条件を操作して比べる実験なので、この設定の中では「文言や仕様を変えたことが推薦を変えた」と言えます。一方、実際の市場で有名ブランドが推薦される理由を特定した研究ではありません
- 数値に食い違いがあります。1社あたりの得は、付録Eの本文では3社で+0.269、6社で+0.036ですが、図4では+0.150と+0.041です。この記事は付録Eの値を使いました。実験1の設定(2章)は検証済みの架空名を「120個」と書きますが、付録B.2では各分類9つの計36個です(120は各分類30個の候補の合計と一致します)
- arXivのプレプリントで、査読を経たかどうかは確認できません
この論文から、言えること・言えないこと
| 言えること(論文の設定で確認された) | 言えないこと(論文では確認されていない) |
|---|---|
| 仕様が同じなら、3つのAIはすべての試行で有名ブランドを選んだ | 実際のChatGPTやGeminiが、ウェブ検索を使うときも同じように振る舞うこと |
| わずかな品質の差(評価で星0.075個分)で、半分の確率で逆転した | 日本語の質問で同じ境目になること |
| 根拠らしく見える文言は推薦を動かし、売り込みの圧をかける文言はほぼ動かさなかった | 実在する認証や試験を正しく示した場合の効果の大きさ(実験は架空の主張で上限を測った) |
| 全社が同じ文言を使うと、効果はほぼ消えた | 推薦の変化が、売上や問い合わせにつながること |
| モデルによって反応の大きさが大きく違った | スキンケア以外の分野で、説得の手口が同じ大きさで効くこと |
73.3%は、2商品を比べる形式で、仕様を同じにしたまま文言だけを足したときの架空ブランドの勝率です。実際のAI検索で推薦される確率が73%になる、という意味ではありません。
中小企業の視点で、どう受け取るか
ここからは論文の主張とは別の、私の読み取りです。
負けているのは知名度より「比べる材料の少なさ」
実験1で有名ブランドが勝ち続けたのは、仕様がまったく同じで、ほかに決め手がないときだけでした。評価、価格、口コミ数、成分のどれか1つでも差が読み取れると、AIはそちらを重く見ています。
新しいブランドや中小企業にとっては、自社の商品を競合と比べられる数値や事実を、AIが読める文章として公開しておくことが最初の一手になると読めます。
権威づけは、本物の根拠でだけ使う
権威づけの文言が最も効いたのは確かです。ただし実験で使われたのは実在しない根拠で、論文自身が虚偽広告になり得ると書いています。
化粧品の効能の表現には、日本でも法令上の制約があります。使うなら、実在する試験や認証を、出典を添えて正確に書く形に限るのが筋です。
論文が指摘するとおり、AIの側が根拠を確かめる仕組みを持てば、架空の主張は通りにくくなる可能性があります。
「今だけ」「残りわずか」を足しても、AIにはほぼ届かない
数量限定や値ごろ感の強調は、全体で10〜13%と、文言なしの約4%から少し上がる程度で、Claudeではどれも0%でした。売り場向けの文言をAI向けに増やしても、手間に見合う効果は期待しにくいと読めます。
同じ手を皆が使えば、差はまた品質と知名度に戻る
実験3では、文言による有利さは競合が追いつくと急速に縮み、最後は知名度の差に戻りました。文言の工夫は一時的な先行にとどまり、長く効くのは比べられる中身の差だと受け取っています。
よくある質問
「条件つきの独占」とは、無名の新興ブランドでもAIに推薦されうるという意味ですか
この論文の設定では、そうなりました。仕様がまったく同じなら有名ブランドが全試行で選ばれましたが、評価で星0.075個分の差があれば、架空ブランドが半分の確率で逆転しています。
ただし商品情報をAIに直接渡した実験での話で、実際のAI検索では、自社の情報がAIの目に届くかどうかが先に問われます。
臨床試験をうたう権威づけの文言でAIの推薦が動くなら、自社の商品説明にも書くべきですか
実在する試験や認証があるなら、出典を添えて正確に書くことは、読み手にとっても有益です。一方、この論文の実験で効果の上限を出した文言は、実在しない根拠をうたうものでした。
根拠のない権威づけは広告の法令に触れるおそれがあり、論文も虚偽広告になり得ると書いています。なお、GEO原論文の解説で扱った実験では、断定的な文体に書き換えるだけの方法の効果は小さめでした。
有名ブランドが有利になる先行者優位の実験結果は、日本語のChatGPTやGeminiにも当てはまりますか
日本語では試されていません。英語と中国語では、仕様が同じときの独占は同じでしたが、説得の文言の効き方は中国語のほうが小さく出ました。
ウェブ検索を使う実際のサービスとも条件が違うため、自社の分野では日本語で実際に質問し、回答を記録して確かめるのが確実です。
まとめ:今日できる1つのこと
自社の主力商品のページを1つ開き、競合と比べられる情報(価格、容量、評価、口コミ件数、成分や仕様)が文章で書かれているかを確かめてください。
画像の中にしかない数値や、書かれていない項目があれば、根拠のあるものを1つ文章で足します。比べる材料をAIに渡すことが、この論文から素直に引き出せる一手です。
この論文は、LLMO論文の一覧の一本です。ほかの論文の解説も、順次公開しています。
この記事に書いたことを、そのまま御社のページに
生成AIに引用されるページを、お話しいただくだけでお作りします。お時間をいただくのは初回15分のヒアリングだけです。まず1ページ、無料でお作りします。
OKが出るまで、何度でも直します。事実が違う、言い回しが硬い、この話は入れないでほしい。どれも遠慮なくおっしゃってください。何度お直ししても、追加の料金はいただきません。
これまでに127社にご利用いただきました。毎月ご依頼いただいている方の6割以上が、月10ページを選ばれています。料金はページに掲載しています。
ページを増やしても問い合わせが来ないなら、原因はページの外にあります。その場合は、下の入口からご相談ください。
自社のマーケティング課題を根本から解決しませんか?
ウェブサイトから要素を引き算し、訪れた人が迷わず次の一歩に進む形へ組み直す。初回60分のオンラインで御社のサイトを一緒に読み、どこから直すべきかをお伝えします。手順をまとめた無料の診断と解説動画もご用意しています。
初回は無料・60分・オンライン完結・その場で契約のお願いはいたしません


