AI検索の回答には、文の末尾に[1][2]のような番号が付き、根拠にしたページへ飛べるものが増えました。出典が付いていると、「事実に基づいていて、いつでも確かめられる回答」に見えます。
その見え方が本当に守られているのかを、専門家21人に実際に使ってもらって確かめた論文があります。2025年6月のFAccT(AIの公平性・説明責任・透明性を扱う国際会議)で発表された研究です。
この記事は、その論文を原文から読み、参加者が何につまずき、どう受け止めたのかを整理します。人数や数値は、すべて論文の本文と表から拾いました。
インタビュー中心の研究なので、「何割の人がそう感じる」という一般化は避けます。
合同会社謙虚は、3つのドメインを並行して運用し、何を変えると数字が動くかを測り続けています。AIの回答に自社の記事が引用されたとき、それを読者がどう扱うのかを知っておくことが、報告の書き方を決める土台になるため、この論文を読みました。
結論:3行で言うと
- 専門家21人が、3つのAI検索とGoogle検索を使い比べ、出典付きの回答に16の問題を挙げました。全員が指摘したのは、回答の詳しさの不足と、文を支えていない出典に引用が付く「付け違い」です
- AI検索の利用時は、Google検索より開いて確かめる出典がずっと少なく、クリックは平均1回前後(Googleは3.80回)でした。自分の考えに沿う質問では、確かめる回数がさらに減りました
- 著者らはこの結果から、出典付き回答の「事実で、検証できる」という約束は現状では守られていないと論じ、16の設計提言を示しています
ただし、参加者は博士課程の学生や研究者が中心で、論文は結果を2024年10月時点の米国中心のサービスの状態としています。
日本語での検証は、この論文の対象外です。この点は後の章で整理します。
この論文の基本情報
| 項目 | 内容 |
|---|---|
| 題名 | Search Engines in the AI Era: A Qualitative Understanding to the False Promise of Factual and Verifiable Source-Cited Responses in LLM-based Search |
| 著者 | Venkit、Laban、Zhou、Mao、Wu(5人。筆頭著者はペンシルベニア州立大学、ほかの4人は民間企業の研究部門) |
| 発表 | FAccT 2025(2025年6月23〜26日、ギリシャ・アテネ)の会議録、1325〜1340ページ。査読を経た研究論文として、ACMの電子図書館に2025年6月23日に掲載 |
| arXiv | 会議版には番号の記載がありません。題名が少し違う前の版が2410.22349(2024年10月15日)として公開されています |
| 種類 | 利用者調査(1人90分の個別セッション)を中心にした質的研究。一部に回数の集計と統計検定を含む |
| データとコード | 会議版の本文には公開先の記載がありません。参加者一覧は匿名化して付録に掲載 |
論文はこちらで読めます。会議録(DOI)、前の版(arXiv 2410.22349)。
前の版には、自動採点による評価も入っていました。会議版ではその部分が外れているため、この記事は会議版の内容だけを扱います。
この論文が答えた問い
出典付きで答えるAI検索を、専門知識のある人が実際に使うと、どこに問題を感じ、出典をどう扱うのか。
論文は、AIが検索結果を読んで回答文を作り、文ごとに根拠のページを添える仕組みを「回答エンジン」と呼んでいます。引用は回答と出典をつなぐ役割を持ち、クリックすれば根拠を確かめられる、というのが売り文句です。
一方で、AIがもっともらしい誤りを作ることや、引用の正確さに限界があることは、これまでの研究で指摘されてきました。ただ、その多くは技術的な採点による評価でした。
著者らは、毎日多くの人が使う道具である以上、利用者がどう受け止め、限界にどう向き合うのかを社会的な視点から調べる必要がある、と述べています。
引用の正確さを人手で調べた初期の研究は、AI検索の引用の裏づけを監査した論文の解説でまとめています。
どうやって調べたのか
| 項目 | 内容 |
|---|---|
| 参加者 | 24人を募集(22〜38歳、平均29.3歳)。うち3人は予備調査で、本調査は21人 |
| 参加者の属性(24人) | 3年目以上の博士課程学生11人、研究職4人、産業界の専門家8人、その他1人。専門は人とコンピュータの関わり6人、AI・計算科学6人、医療5人、応用科学4人、教育・社会科学3人 |
| 進め方 | 1人90分のビデオ会議。録画して文字に起こす。所属機関の倫理審査で承認済み。謝礼は60ドル分のギフトカード |
| 第1部(5分) | 事前アンケート。自分の専門分野の質問を3〜4個用意してもらう |
| 第2部(40分) | 専門の質問を、AI検索とGoogle検索で交互に調べる。考えたことを声に出しながら操作する。1問5〜10分、平均6問 |
| 第3部(40分) | 「動物園はあるべきか」のような賛否の分かれる話題で、本人の立場に沿う質問と逆らう質問を交互に調べる |
| 使ったサービス | 21人を7人ずつ3組に分け、YouChat、Bing Copilot、Perplexityのどれか1つを使う。比べる相手はGoogle検索 |
| 分析 | 著者らが発言記録を1行ずつ分類し、話し合って16の問題にまとめる(質的研究でよく使われる手法) |
事前アンケートでは、24人のうち9人が生成AIを毎日使い、17人がAI検索を知っていました。AI検索に不慣れな人の調査とは言えない点に注意が要ります。
論文は、結果を2024年10月時点のサービスの状態としています。
結果
参加者が挙げた16の問題
論文は、回答エンジンを「回答文」「引用」「出典」「画面」の4つの部品に分け、問題を整理しました。右の列は、その問題をはっきり口にした参加者の人数です(分母は21人。
1つだけ20人)。
| 部品 | 問題 | 指摘した人数 |
|---|---|---|
| 回答文 | 回答に、主張を裏づける具体的な中身が足りない | 21/21 |
| 回答文 | 意見の分かれる質問に、片側の見方だけで答える | 19/21 |
| 回答文 | 主張を、自信に満ちた断定の言い方で示す | 16/21 |
| 回答文 | 文章が単純で、批判的な検討が見られない | 14/21 |
| 引用 | 文を支えていない出典に引用が付く(付け違い) | 21/21 |
| 引用 | 質問者が求めていそうな部分だけを、出典から拾う | 19/21 |
| 引用 | 主張の文に、引用が付いていない | 18/21 |
| 引用 | どの出典をなぜ選んだのかが見えない | 15/21 |
| 出典 | 回答に使われる出典が少ない(平均3件) | 19/21 |
| 出典 | 表示された出典の一部しか、回答に使われていない | 13/21 |
| 出典 | 掲示板の投稿や古い記事など、出典の種類が信用しにくい | 12/20 |
| 出典 | 別の出典に見えて、中身が同じ | 12/21 |
| 画面 | 出典を自分で選んだり外したりできない | 17/21 |
| 画面 | 文脈を聞き返さずに推測して答える | 17/21 |
| 画面 | 確かめる手間がかえって増える | 14/21 |
| 画面 | [1]のような番号式の引用が、ふだん論文を読まない人にはなじみにくい | 12/21 |
この表の人数は、発言として出てきた数です。21人の中での頻度なので、世の中の利用者の何割がそう感じるかを表す数字としては読めません。
読み取れること
- 引用の付け違いは、全員が指摘しました。ある参加者は、文の内容は正しいのに出典にその記述が見当たらないと話しています。参加者は、引用が回答をもっともらしく見せていると感じており、論文は、その見せかけに気づいたのは出典を確かめた一部の人だけだったと述べています
- 引用が付いているだけで信じてしまう、という声もありました。別の参加者は、引用を見れば有効な出典だと思い込み、確かめない、と振り返っています
- 出典の中身が賛否両論でも、回答は片側だけになることがありました。質問の言い回しに合わせた要約になり、元の記事の意図とずれる例が報告されています
- 表示の工夫で差が出た点もあります。番号にマウスを重ねると出典が表示されるBing Copilotでは、出典の出どころが分かりやすかったという声がありました
表示された出典と、実際に引用された出典
論文の表2から、1回の回答あたりの出典の件数(平均)を拾います。かっこ内は、表示された出典のうち回答で引用されたものの割合で、論文の表に載っている値です。
| サービス | 表示された出典 | 回答で引用された出典 |
|---|---|---|
| 3サービス全体 | 4.31件 | 3.00件(69%) |
| Perplexity | 5.00件 | 2.58件(51%) |
| Bing Copilot | 4.46件 | 2.80件(62%) |
| YouChat | 3.57件 | 3.57件(100%) |
参加者は、出典がたくさん並ぶのに一部しか使われていない状態を「水増し」に近いと受け止め、信頼が下がったと話しています。YouChatは、表示した出典をすべて引用していました。
利用者は、出典をどれだけ確かめたか
論文の表3から、参加者が出典にマウスを重ねた回数と、クリックした回数(平均)を拾います。1回の検索あたりの平均と読める値ですが、論文は数える単位を明記していません。
| サービス | マウスを重ねた回数 | クリックした回数 |
|---|---|---|
| Perplexity | 2.12回 | 1.29回 |
| Bing Copilot | 2.10回 | 0.76回 |
| YouChat | 2.00回 | 1.07回 |
| Google検索 | 11.81回 | 3.80回 |
論文は、Google検索とそれぞれのAI検索の差を統計検定(2つの群の平均を比べる検定。有意水準は1%)で調べ、どの組み合わせでも差は偶然では説明しにくい大きさだったと報告しています。
Google検索では上位5件より下まで見ることが多かった一方、AI検索では上位2〜3件の中身に頼る形になっていた、とも述べています。
自分の立場に沿う質問と、逆らう質問でも差が出ました。表5では、逆らう質問のときはマウスを重ねた回数が平均2.95回、クリックが1.72回でした。
沿う質問のときは1.08回と0.48回で、確かめる行動がはっきり減っています。この差も統計的に有意だったと論文は述べています。
論文自身が書いている限界
- 調査は西洋中心です。調べたサービスは主に米国で開発・提供されたもので、参加者の募集にもその影響があります
- 回答エンジンは地域ごとのデータに頼るため、ほかの地域、特に文化や技術環境の違う地域の利用者に、結果がそのまま当てはまるとは限りません
- 16の設計提言は倫理面の指針として役立つものの、決定版の基準とは位置づけていません。今後、提言を自動で測れる形にしていくとしています
- 結果は2024年10月時点のサービスの動作を反映したもので、その後の更新で変わり得ます
原文を読んで気づいた点
- 日本語での検証はありません。調べたのは米国中心のサービスで、付録では、国を指定しない質問に米国を前提とした回答が返ったという指摘(21人中12人)も報告されています
- 参加者は専門家で、年齢も22〜38歳に偏っています。自分の専門分野の質問だから付け違いに気づけた、という面があります。一般の利用者なら、さらに確かめない可能性もあれば、問題に気づかない可能性もあり、どちらもこの研究では測られていません
- サービスの比較は、使う人が組ごとに違います。7人ずつの組なので、サービスの差と参加者の差を切り分けにくい設計です
- 統計検定の数え方が本文に書かれていません。21人の調査にしては値が極端に小さい(例: p=8.14e-53)ため、1人の複数回の操作を別々に数えている可能性があります。ここは私の推測です
- 本文と表で数字が入れ替わっている箇所があります。立場に逆らう質問の回数を、本文はマウス1.72回・クリック2.95回と書き、表5は2.95回・1.72回です。クリックがマウスを重ねた回数を上回るのは不自然なので、この記事では表の値を使いました。性別の割合(男性7人を33.34%と表記)や、提言と問題の対応表の番号にも、ずれが見られます
- 学会の査読を経た論文です。FAccTの会議録にACMの研究論文として掲載されています。5人中4人は民間企業の研究部門に所属しています
この論文から、言えること・言えないこと
| 言えること(この調査で観察された) | 言えないこと(この調査では確かめていない) |
|---|---|
| 専門家21人全員が、出典の付け違いを指摘した | AI検索の引用の何割が付け違いか |
| AI検索の利用時、出典のクリックは平均1回前後で、Google検索の3.80回より少なかった | 一般の利用者や日本の利用者でも同じ差が出ること |
| 自分の立場に沿う質問では、出典を確かめる行動が減った | いまのChatGPTやGoogleのAI検索で、同じ問題が残っていること |
| 表示された出典の一部しか回答に使われていないサービスがあった | 記事の書き方を変えると、付け違いが減ること |
| 著者らは、この結果から16の設計提言をまとめた | 提言を採り入れたサービスで、利用者の確認行動が増えること |
中小企業の視点で、どう受け取るか
ここからは論文の主張とは別の、私の読み取りです。
- 「AIに引用された」と「読者が来た」は、分けて考える。この調査では、AI検索を使った人が出典を開いたのは、平均で1回前後でした。自社の記事が引用されても、読者が回答だけで満足して終わる場面は多いと見ておくのが無難です。お客様への報告では、引用された事実と、サイトへの来訪を別の項目にして書くのが誤解の少ない形です
- 引用されたら、引用された文と自社ページを突き合わせる。全員が付け違いを指摘したということは、自社のページが、そこに書いていない内容の根拠として表示されることもあり得ます。引用を成果として報告する前に、回答の文がページのどこに書かれているかを確かめ、書かれていなければその旨も添えます
- 1つの段落だけ抜き出されても、意味が変わらない書き方にする。参加者は、賛否両論の出典から片側だけが拾われる例を挙げていました。条件や例外を別の段落に離さず、主張と同じ段落に置いておくと、切り取られたときのずれを小さくできると考えます。ただし、この効果は論文では確かめられていません
よくある質問
出典付きのAI検索の回答は、出典を開けば事実だと確かめられますか
確かめられる場合もありますが、この論文では、専門家21人全員が「文を支えていない出典に引用が付いている」例を指摘しています。引用が付いていることと、その出典に同じ内容が書いてあることは、別に確かめる必要があります。
AI検索の利用者は、引用元のページをどのくらい開いていますか
この調査では、出典のクリックは平均0.76〜1.29回(1回の検索あたりと読める値、単位は論文に明記なし)で、Google検索の3.80回を下回りました。
参加者は専門家21人で、論文は結果を2024年10月時点の米国中心のサービスの状態としています。日本の一般の利用者にそのまま当てはめるのは控えてください。
回答エンジンへの16の設計提言は、記事を書く側の対策ですか
提言は、AI検索を作る側に向けたものです。偏らない回答を出す、出典の付け違いを確かめ直す、表示した出典と使った出典を一致させる、情報が見つからないときは答えない、といった内容です。
記事を書く側が直接取り組むものとは位置づけられていません。
まとめ:今日できる1つのこと
自社の主力のテーマでAI検索に1回質問し、回答に付いた引用を1つだけ開いてください。回答の文が、そのページのどこに書かれているかを探します。
見つかれば問題なし、見つからなければ付け違いです。質問、日付、サービス名、見つかったかどうかを1行で残しておくと、次に同じ確認をするときの比較材料になります。
この論文は、LLMO論文の一覧の一本です。ほかの論文の解説も、順次公開しています。
この記事に書いたことを、そのまま御社のページに
生成AIに引用されるページを、お話しいただくだけでお作りします。お時間をいただくのは初回15分のヒアリングだけです。まず1ページ、無料でお作りします。
OKが出るまで、何度でも直します。事実が違う、言い回しが硬い、この話は入れないでほしい。どれも遠慮なくおっしゃってください。何度お直ししても、追加の料金はいただきません。
これまでに127社にご利用いただきました。毎月ご依頼いただいている方の6割以上が、月10ページを選ばれています。料金はページに掲載しています。
ページを増やしても問い合わせが来ないなら、原因はページの外にあります。その場合は、下の入口からご相談ください。
自社のマーケティング課題を根本から解決しませんか?
ウェブサイトから要素を引き算し、訪れた人が迷わず次の一歩に進む形へ組み直す。初回60分のオンラインで御社のサイトを一緒に読み、どこから直すべきかをお伝えします。手順をまとめた無料の診断と解説動画もご用意しています。
初回は無料・60分・オンライン完結・その場で契約のお願いはいたしません


