お客様の声や口コミは、AIの回答にどう残るのでしょうか。2026年9月にarXivで公開された論文「The Wisdom of the Loudest」は、米国の大規模掲示板Redditが提供するAI検索「Reddit Answers」に1万問を3回ずつ投げ、3万件の回答と、出典のスレッドに含まれる約1,468万件のコメントを突き合わせました。
題名は「いちばん声の大きい人たちの知恵」という意味です。
この記事では、論文を原文から読み、調べた規模、「声の大きさ」を何で測ったのか、結果の大きさを整理します。先に位置づけを書いておきます。
この論文の結果は、すべて観察データから見つかった相関(一緒に動いていたこと)です。「票を集めれば回答に載る」という因果は、論文自身が読み取らないよう求めています。
合同会社謙虚は、3つのドメインを並行して運用し、何を変えると数字が動くかを測り続けています。この論文を読むのは、利用者の声をページに載せるとき、その声がAIの回答でどう扱われうるかを、根拠のある範囲で知っておきたいからです。
結論:3行で言うと
- Reddit Answersが回答に使ったコメントは、スレッドの中ですでに評価が高く、早く書かれた、投稿への直接の返信に大きく偏っていました(スレッド内の評価の順位が、標準的なばらつき1つ分高いと、選ばれるオッズが2.88倍)
- 文体では、形式ばった文と「〜すべき」型の文が選ばれやすく、体験談の語り口は選ばれにくい傾向でした。回答文では、「私は」にあたる一人称の割合が、元のコメントの3.3%から0.06%に下がっています
- 対象は英語の相談系コミュニティ20か所です。因果として読まないよう論文自身が求めています。日本語での検証もありません
この論文の基本情報
| 項目 | 内容 |
|---|---|
| 題名 | The Wisdom of the Loudest: A Large-Scale Audit of Generative Search on Reddit |
| 著者 | Agam Goyal、Wang Claire、Eshwar Chandrasekharanの3人(いずれもイリノイ大学アーバナ・シャンペーン校) |
| 公開日 | 2026年9月13日(arXiv第1版) |
| arXiv | 2609.14575(分野は情報検索) |
| 掲載・採択 | 査読前のプレプリントです。arXivのコメント欄は「23ページ、図7、表2」だけで、学会や論文誌への採択の記載はありません。書式は計算機学会(ACM)系の様式です |
| 種類 | 実際に動いているAI検索に外から質問を繰り返し、出てきた回答を調べる「監査」型の観察研究 |
| 実験データとコード | 論文中に公開先の記載は見当たりませんでした(2026年9月28日確認) |
論文はこちらで読めます。arXiv(2609.14575)、arXivが発行したDOI。
この論文が答えた問い
掲示板の会話を1つの回答にまとめるAI検索は、どのコミュニティの、どのコメントの、どんな語り口を回答に残し、どれを落としているのか。
Reddit Answersは、質問を受けるとReddit内の投稿とコメントを探し、見出しつきの1つの回答にまとめます。回答の中ではコメントを引用し、元のコメントへのリンクを付けます。
論文によると、相談の場の価値は、答えそのものに加えて、同じ経験をした人の話を本人の言葉で読めることにあります。会話が1つの回答にまとまると、利用者は多くの人の声の代わりに、1人の語り手の声を受け取ることになります。
そこで何が残り、何が消えるのかを、4つの問いに分けて調べました。
- 同じ質問への回答は、毎回同じか
- 回答は、どのコミュニティから材料を取っているか
- スレッドの中の、どのコメントが選ばれるか
- まとめる過程で、コメントの語り口はどう変わるか
どうやって調べたのか
| 項目 | 内容 |
|---|---|
| 調べたサービス | Reddit Answers(Reddit内の会話だけを材料に答えるAI検索) |
| コミュニティ | 相談系の20か所。お金、心身の悩み、悩みの支え(心の健康・パソコンの困りごと)、専門的な助言(医療・法律)、人生の選択(仕事・夫婦・子育て)の4分野。大規模な10か所(登録者の中央値350万人)と、小規模な10か所(同21万人) |
| 質問 | 2025年8月〜2026年7月の実際の投稿を、AI(GPT-5.4 nano)で短い質問1つに書き直した1万問。各コミュニティ500問。英語以外の投稿は除外 |
| 繰り返し | 同じ1万問を、約5時間おきに3回。回答は計3万件 |
| 集めたデータ | 回答文、引用されたコメント、出典の投稿。出典の投稿はスレッドごと取得し、合計33万7,690スレッド、1,468万件のコメント、8,590のコミュニティ |
| 比較相手 | 1,000問について、ウェブ検索つきの汎用AI(GPT-4o-mini、GPT-5)の回答 |
質問を短く書き直したのは、元の投稿(中央値162語)をそのまま入れると約75%で回答を断られたためです。論文はもう1つ、より根本的な理由として、利用者が実際に打ち込む検索語は短いことを挙げています。
入力の上限は500文字で、実際には約100語より短い入力にしか答えませんでした。書き直しの妥当性は、人手で抜き取り確認しています。
「声の大きさ」は何で測ったのか
題名の「声の大きい」に対応するものとして論文が中心に調べたのは、コメントがスレッドの中ですでにどれだけ目立っていたかです。
書き方と投稿者は、別の物差しとして比べています。物差しは次の通りです。
| 物差し | 中身 |
|---|---|
| 評価の順位 | 同じスレッドの中で、コメントの評価点(利用者の投票で決まる点数)が何番目か。0〜1で表し、1がスレッドの最高 |
| 位置 | 投稿への直接の返信(最上位のコメント)か、返信への返信か。返信の深さ |
| 早さ | 投稿から何時間後に書かれたか |
| 書き方 | 形式ばった度合い、「〜すべき」型の指示、体験談の語り口(「私」、過去形、感覚・知覚の語)など言葉の特徴10項目(長さやリンクの有無は、構造の変数として別に扱う) |
| 投稿者 | 投稿者の累計評価点(これまでに集めた票の合計)、アカウントの年数、管理役か、有料会員か |
比べたのは、同じスレッドの中の、選ばれたコメントと選ばれなかったコメントです。話題やスレッド自体の人気の差は、この比べ方で打ち消されます。
結果は「オッズ比」で示されます。1より大きければ選ばれやすく、1より小さければ選ばれにくいという意味です。
結果
回答は毎回同じとは限らず、ぶれの元は「拾う段階」
- 大規模なコミュニティの質問では、2回の回答で出典の投稿が完全に一致したのは41.8%、3回とも一致したのは27.2%でした。小規模では24.6%と11.6%に下がります
- 出典が同じなら、大規模なコミュニティでは89.6%でほぼ同じ回答文になり、出典が違えば同じ文になったのは8,657組中1組だけでした。ぶれのほとんどは、文章を作る段階より前の、投稿を拾う段階で生まれています
- 回答を断った割合は3回とも約1%で、断る質問は毎回ほぼ同じでした
材料の多くは、質問が出たコミュニティの外から
- 1つの回答は、およそ7つのコミュニティから材料を集めていました。質問が出たコミュニティの投稿は、大規模で17.7%、小規模で15.7%です
- 小規模なコミュニティの質問では、材料の約3分の2が、より大きなコミュニティの投稿でした
- 質問の元になった投稿そのものが出典に入ったのは、大規模で35.7%、小規模で42.6%です。元の投稿の評価点が約2.7倍になるごとに、拾われるオッズは24.1%(大規模)、16.4%(小規模)上がりました
- 似た投稿が多いほど元の投稿は拾われにくく(ばらつき1つ分でオッズ0.851倍、小規模で0.842倍)、コミュニティの中で質問にいちばんはっきり合う投稿ほど拾われやすい傾向でした(2.044倍、小規模で1.869倍)
- 拾われた投稿の多くは、元の投稿より質問から遠いものでした。589問で確かめると、質問との近さは元の投稿が0.79、拾われた投稿の平均が0.60でした。元の投稿より近い投稿が1件も拾われなかった質問は79.3%です
選ばれるのは、すでに目立っていたコメント
論文の図6と本文から、主なオッズ比を拾います。「1SD」は、標準的なばらつき1つ分の差を指します。
| 物差し | 選ばれるオッズの倍率 | 補足 |
|---|---|---|
| 評価の順位(1SD) | 2.88 | 論文が「モデルで最大の関連」とする項目 |
| 最上位のコメント | 1.97 | 返信の深さは1SDで0.50 |
| 投稿からの経過時間(1SD) | 0.73 | 早いほど選ばれやすい |
| 長さ(1SD) | 1.79 | 長いほど選ばれやすい |
| リンクあり | 2.25 | 最上位のコメントだけで比べると1.591 |
| 形式ばった度合い(1SD) | 1.488 | 言葉の特徴で最大 |
| 「〜すべき」型の指示(1SD) | 1.070 | 選ばれやすい |
| 体験談の語り口(1SD) | 0.789 | 選ばれにくい |
| 思いやり・つながりの語(1SD) | 0.924 | 選ばれにくい |
| 投稿者の累計評価点(1SD) | 1.071 | 統計的に意味のある差はなし |
| 有料会員 | 0.280 | 選ばれにくい |
- 選ばれたコメントの評価の順位は中央値0.91、選ばれなかったコメントは0.45でした。選ばれたものの92%が最上位のコメントで、全体では53%です
- 選ばれたコメントは、投稿から中央値1.2時間で書かれていました。残りは5.9時間です
- 評価点が0以下のコメントは、全体の5.1%に対して、選ばれたものでは0.53%でした。論文はこれを「約10分の1」と表現しています
- 評価の順位、位置、早さをそろえて比べても、体験談の語り口は0.860倍、形式ばった度合いは1.213倍の関連が残りました。体験談の関連のうち、これらで説明がつくのは37%です
- 選ばれた投稿者の累計評価点は、同じスレッドの相手の約2倍でした。ただしその差の多くは、コメント自体の目立ち方で説明がつく、と論文は分析しています
題名の「声の大きい人」は、投稿者の活動量より、そのコメントがスレッドの中で得ていた票と位置を主に指している、と読むのが原文に近いと考えます。
まとめる段階で「私は」が消える
論文の表1から、1,000問で比べた語の割合を拾います。汎用AIは検索を必須にした条件です。
かっこ内は元のコメントとの増減です。
| 指標 | 元のコメント | Reddit Answersの回答 | GPT-4o-miniの回答 | GPT-5の回答 |
|---|---|---|---|---|
| 一人称単数(私) | 3.3% | 0.06%(-98%) | 0.3%(-92%) | 0.9%(-72%) |
| 人称代名詞の全体 | 9.5% | 3.8%(-61%) | 4.1%(-57%) | 4.8%(-50%) |
| 過去の出来事の語 | 2.7% | 0.9%(-68%) | 0.8%(-72%) | 0.9%(-65%) |
| 形式ばった度合い(0〜1) | 0.652 | 0.821(+26%) | 0.902(+38%) | 0.537(-18%) |
- 一人称が減る向きは3つのAIで共通で、減り方はReddit Answersが最も大きい結果でした。体験談を材料にするサービスが、一人称の手がかりを最も多く消していたことになります
- 論文はこれを、体験の「証言」が一般的な「助言」に書き換わる現象として扱っています。1人の体験に基づく文が、多くのコメントに支えられた文と同じ語り手の声で出てくる点を、「証拠の平板化」と呼んでいます
- 汎用AIはRedditをほとんど引用しませんでした。検索を必須にしても、GPT-4o-miniの2,105件の引用で0件、GPT-5の2,065件で7件です。全条件で4,932件中18件(0.4%)で、税務や保健の公的機関、医療機関のサイトが多く引用されていました
- 付録では、回答文の主張2,000件を2種類の自動判定で確かめています。両方が「引用元で裏づけられない」としたのは8.7%、少なくとも一方がそう判定したのは31.1%でした。2つの判定の一致は低く、正確な割合は定まらないとされています
論文自身が書いている限界
- 観察研究であり、因果として読まないよう求めています。因果を確かめるには、評価や位置、文体を1つずつ変えて比べる必要があり、実際のサービスではそれができない、という説明です
- 約5時間おきの短期の繰り返しで、長期の変化(票の積み上がり、仕組みの更新)は見ていません
- 利用者が回答をどう受け取り、判断や信頼が変わるかは測っていません
- 1つのサービスと相談系のコミュニティだけの結果で、ほかのAI検索や分野に一般化できるとは限らない、としています
- 質問から年齢・性別・国籍などを取り除いたため、実際の相談に含まれる個人の事情は抜けています
- 付録の、最上位のコメントだけでの再分析では、確信・ぼかし・具体性の関連と、投稿者本人のコメントの選ばれにくさは再現せず、主な解釈から外しています
原文を読んで気づいた点
- 日本語での検証はありません。英語の投稿だけを使い、コミュニティには英国、ニュージーランド、インド、オーストラリア向けのものも含まれます
- 査読前のプレプリントです。採択先の記載はありません
- 回答を集めた日付は本文に見当たりませんでした。投稿の期間から、2026年7月以降と推測できる程度です。仕組みが更新されれば結果は変わりえます
- 問い4の比較は1,000問の部分集合で、3回のうちどの回の回答を使ったかは明記されていません
- 回答文の裏づけの確認は2種類の自動判定だけで、人手の確認は含まれていません。人手の確認は、質問の選別(100件・2人)と書き直し(60件)の抜き取りだけです
- 汎用AIとの比較は、開発者向けの接続口(API)でウェブ検索を使わせた条件で、一般の利用者が画面から使う場合と同じとは限りません
- 私の検算では、「質問元が10倍大きいと、材料を取る先のコミュニティは約1.6倍大きい」(10の0.21乗で約1.62)、「約10分の1」(5.1%÷0.53%で約9.6倍)、「0.4%」(18÷4,932で約0.37%)は、いずれも論文の表現と合っていました
この論文から、言えること・言えないこと
| 言えること(論文の設定で確認された) | 言えないこと(論文では確認されていない) |
|---|---|
| Reddit Answersは、評価が高く、早く、最上位のコメントを選びやすかった | 票を増やせば、そのコメントが回答に載るようになること |
| 形式ばった文は選ばれやすく、体験談の語り口は選ばれにくかった | 文体を変えたときに、選ばれ方が変わること |
| 回答文では、一人称が元のコメントの3.3%から0.06%に減った | 読み手の信頼や判断が、それで変わること |
| 同じ質問でも、拾う投稿が毎回かなり入れ替わった | 日本語の掲示板や口コミサイトでも同じになること |
| 汎用AIは、この相談系の質問でRedditをほとんど引用しなかった | 企業のサイトに載せたお客様の声が、AI検索でどう扱われるか |
中小企業の視点で、どう受け取るか
ここからは論文の主張とは別の、私の読み取りです。論文が調べたのは掲示板のAI検索で、企業のサイトは対象外です。
そのうえで、当てはめられそうな点を4つ挙げます。
1. お客様の声は、体験談と整理した説明を並べて載せる
この論文では、体験談の語り口は選ばれにくく、選ばれても一人称が消えていました。お客様の声をページに載せるときは、ご本人の言葉に加えて、事業者の側で「どんな相談が多く、どう対応したか」を整理した文を添えておくと、AIが要点を拾いやすい形になると考えます。
声そのものには、時期、立場、利用したサービスといった出どころを書き添えます。人の読者が「誰の話か」を確かめられる形は、AIに言い換えられたあとでも価値が残ります。
2. 声を大きく見せる工作には手を出さない
評価や早さと選ばれやすさの関連を見ると、票を集める、自作自演で書き込む、サクラを頼むといった発想が浮かびがちです。この論文は関連を示しただけで、票を動かせば選ばれるとは示していません。
日本では2023年10月から、広告であることを隠した宣伝(ステルスマーケティング)が景品表示法の規制対象です。事業者として答える場面では、名乗ったうえで答えます。
3. 1つの問いに、はっきり1つの答えのページを置く
似た投稿が多いコミュニティでは、元の投稿は拾われにくく、いちばんはっきり質問に合う投稿は拾われやすい傾向でした。自社のサイトで似た記事が何本もあると、どれも決め手を欠く可能性があります。
1つの問いには1つのページで、はっきり答える形が合っていると考えます。ただしこれはReddit内の検索の結果で、企業サイトでは未確認です。
4. AIでの見え方は、1回の確認で決めつけない
同じ質問でも、拾う投稿は毎回かなり入れ替わり、規模の小さいコミュニティほど不安定でした。中小企業のように情報の量が少ない側ほど、1回の確認結果は偶然に左右されやすいと考えられます。
自社名がAIの回答に出るかを確かめるときは、同じ質問を日を変えて何度か試し、出た回数で見るのが安全です。
よくある質問
Reddit Answersの監査結果は、AI OverviewsやChatGPTなど、ほかのAI検索にも当てはまりますか
そのままは当てはめられません。論文が調べたのはReddit Answersです。
ただ、一人称が減る傾向は、比較したGPT-4o-miniとGPT-5でも同じ向きに出ていました。一方で汎用AIはRedditをほとんど引用しておらず、材料の集め方は大きく違います。
AI検索が掲示板やSNSを後ろに回す傾向は、AI検索と第三者の媒体を比べた論文の解説でも扱っています。
Reddit Answersで評価の高いコメントが選ばれたのは、票を集めれば回答に載るという意味ですか
その意味にはなりません。論文が示したのは、評価の高さと選ばれやすさが一緒に動いていたという相関です。
論文自身が因果として読まないよう書いています。票を操作する行為は、掲示板の規約で禁じられていることが一般的です。
体験談の一人称がAI検索で薄まるなら、お客様の声は載せなくてよいですか
載せる価値は残ります。お客様の声を読んで判断するのは、まず人の読者です。
この論文が示したのは、AIがまとめる段階で体験談らしさが薄まりやすいことでした。出どころを添え、整理した説明と並べておけば、人にもAIにも読みやすいページになります。
GEOのサーベイ論文の解説でも、捏造した口コミは正当な改善に入らないと整理されています。
まとめ:今日できる1つのこと
自社サイトのお客様の声を1つ選び、「いつ、どんな立場の方が、何に困って、何を利用し、どうなったか」の5点が書かれているかを確かめてください。
欠けている所は、ご本人に確認できた事実だけで補います。確認できない所は、空けたままにします。
この論文は、LLMO論文の一覧の一本です。ほかの論文の解説も、順次公開しています。
この記事に書いたことを、そのまま御社のページに
生成AIに引用されるページを、お話しいただくだけでお作りします。お時間をいただくのは初回15分のヒアリングだけです。まず1ページ、無料でお作りします。
OKが出るまで、何度でも直します。事実が違う、言い回しが硬い、この話は入れないでほしい。どれも遠慮なくおっしゃってください。何度お直ししても、追加の料金はいただきません。
これまでに127社にご利用いただきました。毎月ご依頼いただいている方の6割以上が、月10ページを選ばれています。料金はページに掲載しています。
ページを増やしても問い合わせが来ないなら、原因はページの外にあります。その場合は、下の入口からご相談ください。
自社のマーケティング課題を根本から解決しませんか?
ウェブサイトから要素を引き算し、訪れた人が迷わず次の一歩に進む形へ組み直す。初回60分のオンラインで御社のサイトを一緒に読み、どこから直すべきかをお伝えします。手順をまとめた無料の診断と解説動画もご用意しています。
初回は無料・60分・オンライン完結・その場で契約のお願いはいたしません


