「この中のどのホテルを予約すればいい?」とAIに尋ねる旅行者が増えています。
AIが1軒を薦めるとき、評価の点数、口コミの数、価格、エコ認証のうち、何がその1軒を決めているのでしょうか。2026年6月にarXivで公開された論文「Whose hotel does the AI recommend?」は、架空のホテルを使った実験でこれを測りました。
この記事は原文から、実験の組み方、効果の大きさ、限界を整理します。東京のホテルの質問でAIがどのサイトを引用するかを調べた論文は、OTAと日本語・英語の比較の記事で解説しました。
あちらは実在のサービスで「AIがどこから情報を集めるか」を観察した研究です。こちらは、候補の5軒から「AIがどれを選ぶか」を、条件を無作為に変える実験で確かめています。
合同会社謙虚は、3つのドメインを並行して運用し、何を変えると数字が動くかを測り続けています。口コミや評価のどの数字がAIの選択を動かすのかを、原因と結果の形で測った研究は少なく、口コミ対策の優先順位を考える材料として読みました。
結論:3行で言うと
- 12のAIモデルに架空のホテル5軒から1軒を選ばせると、評価の点数と価格が選択の大半を決めていました。4.7点のホテルは3.9点より31.6ポイント選ばれやすく、1泊249ドルは129ドルより30.0ポイント選ばれにくくなりました
- 第三者のエコ認証は+11.6ポイント、口コミ数の多さは+8.3ポイントで続きました。「口コミに返信しています」の一行は+0.1ポイントで、統計的にゼロと同等と判定されています
- 中身と関係のない並び順でも、1番目のホテルが1泊約12ドル分有利でした。AIが書いた選んだ理由には、並び順や口コミ数がほとんど出てきませんでした
数字はすべて、英語の指示文、米ドルの価格、架空のホテル、1往復の会話という実験室の設定で得たものです。実際のサービスで薦められる確率とは別物だと、論文自身が書いています。
この論文の基本情報
| 項目 | 内容 |
|---|---|
| 題名 | Whose hotel does the AI recommend? An algorithm audit of reputation signals in LLM-assisted hotel selection |
| 著者 | Mirza Samad Ahmed Baig、Syeda Anshrah Gillani、Asher Ali(3人。所属はハムダード大学(パキスタン・カラチ)と、旅行・宿泊分野の企業) |
| 公開日 | 2026年6月15日(arXiv初版。2026年9月25日時点で改訂版なし) |
| arXiv番号 | 2606.16344 |
| 掲載・採択 | arXivのプレプリント(査読前の原稿)。コメント欄はページ数(32ページ)だけで、学会や論文誌への採択の記載はありません |
| 種類 | 実験研究。アルゴリズム監査(入力を無作為に変え、出力の変わり方からAIの判断のくせを調べる方法) |
| データとコード | 序論は「保管済み」、3.7節は「公開の保管庫に置く予定」、末尾の「データの入手」節は「妥当な依頼があれば著者から提供」と、記述がそろっていません |
| 利益相反の申告 | 著者2人が旅行・宿泊分野の企業に所属し、計算資源とAPIの利用枠を同社が提供したと、論文が申告しています |
論文はこちらで読めます。arXiv(2606.16344)、DOI。
この論文が答えた問い
ホテルが自分で手を入れられる評判のシグナル(評価点、口コミ数、口コミの新しさ、口コミへの返信、チェーンか独立か、価格、エコ認証)のうち、どれがAIの推薦を動かすのか。どれくらいの大きさで動かすのか。
人間の旅行者については、何十年分の研究があります。論文が引く宿泊業のメタ分析(多数の研究をまとめ直した分析)では、評価点の効き方を示す値が0.888、口コミ数は0.055でした。
ホテルの業績に対しては、口コミの数より点数のほうがはるかに強く効く、ということです。
AIが旅行者とホテルの間に入ると、AIがこの序列を同じように守るのかが問題になります。ホテルは「AIに選ばれなかった枠」を自分では見られない、と論文は指摘しています。
どうやって調べたのか
AIがホテルを薦めるまでの流れを、論文は3段階に分けています。検索で候補を集める段階、候補を絞る段階、最後に1軒を選ぶ段階です。
この論文が調べたのは最後の「選ぶ」段階だけです。候補の5軒は実験者が用意し、AIに渡しています。
ホテルカードで変えた7つの属性
各ホテルは短いカードで示されました。全カードを「4つ星」「市の中心部に近い」にそろえ、名前は特色のない架空の名前40個から割り当てています。
そのうえで、次の7つを無作為に組み合わせました。
| 属性 | 水準 | カードでの書き方 |
|---|---|---|
| 評価点 | 3.9、4.3、4.7(5点満点) | 「評価:4.7/5」 |
| 口コミ数 | 45件、420件、2,100件 | 評価点の横に件数 |
| 口コミの新しさ | 3日前、11か月前 | 「最新の口コミ:3日前」 |
| 口コミへの返信 | あり、なし | 「経営側が口コミに返信しています」の一行の有無 |
| 系列 | 大手国際チェーン、独立系 | どちらかの一行 |
| 価格(1泊) | 129ドル、189ドル、249ドル | 「1泊189ドル」 |
| エコ認証 | あり、なし | 「エコ認証取得(第三者のエコ認証)」の一行の有無 |
返信とエコ認証は、「ない」場合に一行を消すだけで、「返信していません」とは書いていません。カードの並び順も無作為です。
実験の条件
| 項目 | 設定 |
|---|---|
| 旅行者の設定 | 3種類。一人の出張、予算を気にする子連れの4人家族、環境を重視するカップル |
| 依頼の言い回し | 9種類。3×9の27通りに112回ずつ、1モデルあたり3,024回 |
| AIモデル | 12。手元で動かす公開モデル4つ(Llama 3.2 3B、Qwen 2.5 3B、Phi-3 mini、Mixtral 8x7B)と、API経由の8つ(GPT-4o-mini、Gemini 1.5 Pro・2.0 Flash・2.0 Pro、Claude 4つ) |
| 答えさせ方 | 選んだホテル名と、1〜2文の理由を決まった形式で返させる。温度(答えのばらつきの設定)は0.7 |
| 追加の条件 | 温度0、検索結果の抜粋風の見せ方、理由を先に書かせる、上位3軒を順位づけ、同じ問題を5回、旅行者の設定なし、カードの行順を逆にする、など |
| 規模 | 全条件で61,459回の呼び出し。形式を読み取れなかった回答は15件(成功率99.98%) |
測る値は「平均限界効果」です。ある属性を1つの水準から別の水準に変えたとき、そのホテルが選ばれる確率が平均で何ポイント変わるかを表します。
5軒から1軒を選ぶので、差がなければ1軒あたりの確率は20%です。
仮説12個と分析の手順は、データを集める前に決めて記録し、改ざんを確かめられる形で固定したと書かれています。12個の検定はまとめて補正し(ホルム法)、「効果がない」と言う場合は、効果が±1.5ポイントより小さいことを別の検定で示しています。
結果
1. 評価点と価格が、属性の重要度の約7割を占めた
| 属性の変化(12モデル全体、表5) | 選ばれる確率の変化 | 95%信頼区間 |
|---|---|---|
| 評価4.3(3.9と比べて) | +10.08ポイント | 9.44〜10.71 |
| 評価4.7(3.9と比べて) | +31.65ポイント | 30.94〜32.36 |
| 口コミ420件(45件と比べて) | +2.25ポイント | 1.51〜2.99 |
| 口コミ2,100件(45件と比べて) | +8.31ポイント | 7.55〜9.07 |
| 最新の口コミが3日前(11か月前と比べて) | +1.55ポイント | 0.94〜2.16 |
| 口コミへの返信あり | +0.11ポイント | -0.51〜0.73 |
| チェーン(独立系と比べて) | -1.79ポイント | -2.42〜-1.16 |
| 1泊189ドル(129ドルと比べて) | -21.36ポイント | -22.17〜-20.54 |
| 1泊249ドル(129ドルと比べて) | -30.03ポイント | -30.75〜-29.32 |
| エコ認証あり | +11.61ポイント | 11.04〜12.18 |
属性ごとの重要度の割合(表7)は、評価点35.7%、価格33.8%、エコ認証13.1%、口コミ数9.4%、並び順4.1%、系列2.0%、口コミの新しさ1.7%、返信0.1%です。評価点と価格を足すと約7割(概算で69.5%)になります。
- 12モデルすべてが、評価の高いホテルと安いホテルを選びやすくなりました。主要なシグナルの向きは、モデル間でそろっています
- エコ認証の効き方は、モデルによって+0.2〜+29.9ポイントと大きく割れました。+11.6は、12モデルをまとめて推定した値です
- 返信の一行は、選択をほとんど動かしませんでした。12の仮説のうち、支持されなかったのはこの返信と、後述の口コミ数と新しさの組み合わせの2つです
2. 人間の研究と比べると、エコ認証が重く、返信と系列が軽い
論文は、評価点と価格が上位に来る点、点数を口コミ数より重く見る点(重要度でおよそ4対1)で、AIは人間の研究の序列を再現したと述べています。
一方で、人間の選択実験では小さな要素のエコ認証が3番目に来て、人間が参考にする返信と系列はほぼ無視されました。AIは序列の大枠を受け継ぎつつ、独自の重みづけもしている、というのが論文の解釈です。
ただし、比べた人間側の数字は弾力性や相関で、単位が違います。論文も、大きさではなく順序だけを比べたと明記しています。
3. 並び順だけで、1番目が有利になった
1番目に置かれたホテルと比べ、2番目は2.07ポイント、3番目は2.38、4番目は3.59、5番目は3.68ポイント選ばれにくくなりました。
重要度の割合は4.1%で、系列(2.0%)や口コミの新しさ(1.7%)を上回っています。中身のない並び順が、系列や口コミの新しさという本物の評判の情報を上回ったことになります。
多くのモデルは並び順にほとんど左右されませんでした。例外はGemini 2.0 Flashで、1番目の有利さが約26ポイントと、全体の平均より1桁大きくなっています。
4. 1泊の金額に直すと(表9)
価格も無作為に変えているので、各属性の効果を「1泊何ドル分か」に直せます。
| 属性 | 全体 | 出張 | 家族 | 環境重視のカップル |
|---|---|---|---|---|
| 評価4.7(3.9と比べて) | 126.4ドル | 152.8ドル | 98.2ドル | 135.2ドル |
| 口コミ2,100件(45件と比べて) | 33.2ドル | 40.0ドル | 27.0ドル | 34.9ドル |
| エコ認証あり | 46.4ドル | 39.3ドル | 36.8ドル | 65.4ドル |
| チェーン(独立系と比べて) | -7.1ドル | 0.7ドル | -5.3ドル | -16.5ドル |
| 口コミへの返信あり | 0.5ドル | 2.0ドル | -1.1ドル | 0.8ドル |
| 1番目に並ぶ(2〜5番目の平均と比べて) | 11.7ドル | 18.8ドル | 7.2ドル | 9.5ドル |
1番目に並ぶ有利さ11.7ドルは、評価を3.9から4.7に上げる価値(126.4ドル)の約1割です。論文は、旅行者の設定による違いを予想どおりの向きとしています。
家族は値段に最も敏感で、環境重視のカップルはエコ認証を最も重く見ました。ただし系列は、出張で有利さが最大になるという予想に対して、出張で差が消え、環境重視のカップルで最も不利という形でした。
5. 口コミが多いほど、評価点がよく効いた
同じ高評価でも、口コミ数が多いほど選ばれる確率の伸びが大きくなりました(仮説8)。AIが口コミ数を点数の信頼度として扱っている形だと、論文は読んでいます。
「最新の口コミが古いと口コミ数の効果が弱まる」という仮説9は支持されませんでした。
6. AIが書いた理由と、実際の選び方のずれ
AIが書いた理由で各属性に触れた割合と、実際の重要度の順位の相関(スピアマンの順位相関)は、モデルごとに+0.59〜+0.85でした。
大筋は合っていますが、ずれには偏りがあります。並び順に触れた理由は0.7%以下、口コミ数もほとんど触れられていません。
反対に系列は、あるモデルでは理由の最大55%で触れられたのに、重要度は2.0%でした。論文は、AIの説明を判断の中身そのものとして扱うことに注意を促しています。
7. 条件を変えても、結果はほぼ同じだった
9つの言い回しの間で、各属性の効果のばらつき(標準偏差)は最大1.5ポイントでした。検索結果の抜粋風に見せても差は最大1.3ポイント、理由を先に書かせても最大0.8ポイントです。
同じ問題を5回出すと、表10に載ったAPI経由のモデル7つは毎回同じホテルを選び、小型の公開モデル3つは同じ答えの割合が0.81〜0.93でした。
予想と違ったのは、意味を持たないはずのホテル名で差が検出された点です。名前は属性と無関係に割り当てたので、属性の推定は守られる、と論文は説明しています。
論文自身が書いている限界
- 調べたのは、決まった5軒から選ぶ段階だけです。どのホテルが候補に入るかという検索の段階や、予約の手続きは含んでいません
- 12モデルは全数調査ではありません。公開モデルは軽量化した形で動かし、実際のアプリが足す検索や指示の層も含みません
- カードは架空で、写真、口コミの本文、設備の一覧がありません。選ばれる確率の絶対値は、実際の場面に移せないと明記しています
- 会話は1往復だけです。質問を重ねる実際の使い方では、重みが変わる可能性があります
- 指示文と材料はすべて英語で、米国の旅行者と米ドルを前提にしています。ほかの言語や市場への当てはまりは検証していません
- AIは頻繁に更新されるので、結果は記録した版にだけ当てはまります
原文を読んで気づいた点
- 査読前のプレプリントです。3.7節に「論文誌の方針に沿って生成AIの利用を申告する」という文があり、論文誌への投稿を前提にした原稿と読めます。採択の記載はありません
- 日本語での検証はありません。日本の口コミサイトの点数の付き方や、日本で知られている認証で同じ結果になるかは、この論文から分かりません
- 仮説5(チェーンは選ばれやすい)の扱いに食い違いがあります。結果はチェーンで-1.79ポイントと、予想と逆向きでした。それでも表6は仮説5を支持として数え、本文は「予想と符号が逆になった検定はない」と書いています。旅行者の設定ごとの系列の差(仮説12)も、同じく向きを問わず「支持」に数えられています。「支持された仮説は12のうち10」という数え方は、効果の有無で数えたものと読むのが安全です
- 「返信あり」はカードの一行だけです。返信の中身や丁寧さは試していません。効果ゼロという結果は、「返信しています」という一行の表示が効かなかった、という範囲の話です
- 細かな数字の揺れがあります。GPT-4o-miniは本実験の条件だけに参加し、5回繰り返しの表10には載っていません。61,459という数は、呼び出し回数とも選択の問題数とも書かれています。系列の金額は本文7.2ドル、表9は-7.1ドルです
- 著者の所属企業は、この分野の結果に利害を持つと論文自身が申告しています。データの公開も、基本情報の表のとおり記述がそろっていません
この論文から、言えること・言えないこと
| 言えること(この実験の設定で確認された) | 言えないこと(この論文では確認されていない) |
|---|---|
| 候補5軒からの選択では、評価点と価格が大半を決めた | 実際のAIアプリで、あるホテルが薦められる確率 |
| エコ認証は、人間の研究より重く扱われた(モデル差は大きい) | どのホテルが候補に入るかという検索の段階での効き方 |
| 「返信しています」の一行は、選択を動かさなかった | 返信の中身や、返信が人間の客や口コミに与える効果 |
| 並び順だけで、1番目が1泊約12ドル分有利になった(1モデルは約26ポイント) | 日本語の質問や日本のサービスで、同じ重みになること |
| AIが書いた理由は、並び順と口コミ数をほとんど挙げなかった | ホテル以外の業種で、同じ序列になること |
中小企業の視点で、どう受け取るか
ここからは論文の主張とは別の、私の読み取りです。実験は架空のホテルと英語の設定なので、以下は考え方の材料として書きます。
- AI向けの特別な手当ての前に、人に選ばれる土台が効いていました。属性の重要度で見ると、評価点と価格で約7割、口コミ数を足すと8割弱です。この実験では、お客様の評価を上げる本業の改善が、AIの選択にもそのまま効く形でした
- 口コミ数が少ない新しいお店は、同じ点数でも不利になり得ます。論文も、口コミの多い老舗に有利に働く点を公平性の問題として挙げています。口コミのお願いを日々の接客に組み込む価値があると考えます
- 第三者の認証や受賞は、確かめられる事実としてページに書いておく価値があります。エコ認証の効果はモデル差が大きく、日本の認証で同じになる保証はありません。持っている事実を正確に書く、という範囲で受け取ります
- AIに「なぜ薦めたか」を聞いた答えは、判断の中身とずれることがあります。自社の見え方は、理由の文より、条件を変えて何度か聞いたときに出るかどうかで確かめます。AIの版が変われば重みも変わるので、続けて測ります
候補に入る段階は、東京のホテルの引用を監査した論文の記事が扱っています。候補に入るための情報の置き場所と、候補の中で選ばれるための評判の中身は、別々に確かめる対象だと私は考えます。
よくある質問
ホテルのAI推薦の実験で、口コミへの返信が効かなかったのは、返信をやめてよいという意味ですか
その意味にはなりません。この実験で試したのは、カードに「経営側が口コミに返信しています」と一行あるかどうかだけです。
論文が引く人間の研究では、返信を始めたホテルは評判が改善しています。返信は、口コミを読む人に向けた取り組みとして続ける価値があります。
AIがホテルを薦めた理由の説明は、評判のシグナルの実際の効き方と一致していましたか
大筋は一致し、細部はずれていました。理由で触れた割合と実際の重要度の順位相関は+0.59〜+0.85です。
並び順と口コミ数は選択に効いているのに理由にほとんど出てこず、系列は理由で多く触れられるのに効果は小さいものでした。
ホテルの評判シグナルのAI監査の結果は、日本語のChatGPTやGeminiにも当てはまりますか
この論文からは判断できません。指示文と材料は英語、価格は米ドル、モデルは実験時点の版で、検索の層を持たない形で呼び出しています。
日本語の結果は、別の研究で確かめる必要があります。
まとめ:今日できる1つのこと
自社の評判の数字を1枚に書き出してください。評価点、口コミの件数、いちばん新しい口コミの日付、持っている第三者の認証や受賞です。
そのうえで、公式サイトやお店のプロフィールに同じ事実が正確に載っているかを確かめます。古い件数や、書き漏れている認証があれば、今日のうちに直します。
この論文は、LLMO論文の一覧の一本です。ほかの論文の解説も、順次公開しています。
この記事に書いたことを、そのまま御社のページに
生成AIに引用されるページを、お話しいただくだけでお作りします。お時間をいただくのは初回15分のヒアリングだけです。まず1ページ、無料でお作りします。
OKが出るまで、何度でも直します。事実が違う、言い回しが硬い、この話は入れないでほしい。どれも遠慮なくおっしゃってください。何度お直ししても、追加の料金はいただきません。
これまでに127社にご利用いただきました。毎月ご依頼いただいている方の6割以上が、月10ページを選ばれています。料金はページに掲載しています。
ページを増やしても問い合わせが来ないなら、原因はページの外にあります。その場合は、下の入口からご相談ください。
自社のマーケティング課題を根本から解決しませんか?
ウェブサイトから要素を引き算し、訪れた人が迷わず次の一歩に進む形へ組み直す。初回60分のオンラインで御社のサイトを一緒に読み、どこから直すべきかをお伝えします。手順をまとめた無料の診断と解説動画もご用意しています。
初回は無料・60分・オンライン完結・その場で契約のお願いはいたしません


