生成AI検索が回答に添える「出典」は、本当にその主張を裏づけているのでしょうか。この問いに、GEO(Generative Engine Optimization、生成エンジン最適化)という言葉が生まれる半年以上前に、人手評価で答えた論文があります。
スタンフォード大学のNelson F. Liu氏、Tianyi Zhang氏、Percy Liang氏による「Evaluating Verifiability in Generative Search Engines」(生成検索エンジンにおける検証可能性の評価)です。
この記事は、その論文を原文から読み、要点を整理します。対象はBing Chat・NeevaAI・perplexity.ai・YouChatの4サービスで、2023年2月末から3月末にかけて集めた回答です。
2023年当時の生成AI検索が、どれだけ出典どおりに書いていたかが分かります。あわせて、サーベイ解説で引用されていた「51.5%」「74.5%」という数字の出どころも、この記事で確認できます。
合同会社謙虚は、3つのドメインを並行して運用し、何を変えると数字が動くかを測り続けています。この論文は、AI検索の「引用」という機能そのものが、当初からどれだけ信頼できたのかを知るための出発点になります。
結論:3行で言うと
- 4つの生成AI検索を人手で監査したところ、生成された文のうち、出典で完全に裏づけられていたのは平均51.5%でした。半分近くの文は、根拠が不十分でした
- 逆方向でも、引用が自分の付いた文を正しく支えていた割合は平均74.5%にとどまりました。引用が付いているからといって、その主張が正しいとは限りません
- 読みやすさや「役に立ちそう」という印象の評価は高く(5点満点で平均4.48〜4.50)、文章の質の高さと、出典の正しさは別の話だと論文は指摘しています
そして、この論文はGEOという言葉が生まれる前の2023年4月に発表され、Findings of EMNLP 2023という査読つき国際会議に採択されました。AI検索の「見え方」を測る研究が広がる前から、その回答の中身がどれだけ裏づけられているかを、独自に測っていた研究です。
この論文の基本情報
| 項目 | 内容 |
|---|---|
| 題名(原題) | Evaluating Verifiability in Generative Search Engines |
| 著者 | Nelson F. Liu、Tianyi Zhang、Percy Liang(スタンフォード大学 計算機科学科) |
| 公開日 | 2023年4月19日(第1版)。2023年10月23日に改訂した第2版が公開されています |
| arXiv番号 | arXiv:2304.09848(分野はcs.CL・計算言語学、cs.IR・情報検索) |
| 掲載/採択状況 | Findings of EMNLP 2023に採択(arXivのコメント欄「to appear in Findings of EMNLP 2023」に基づく) |
| 種類 | クラウドワーカーによる人手評価を使った、商用サービスの監査研究 |
| 実験データ/コードの公開先 | GitHub(github.com/nelson-liu/evaluating-verifiability-in-generative-search-engines)で、人手評価の注釈データを公開 |
論文はこちらで読めます。arXiv(2304.09848)。
この論文が答えた問い
生成AI検索は、生成した文をどれだけ漏れなく出典で支え(引用の再現率)、付けた引用をどれだけ正しく使っているか(引用の適合率)。
当時、Bing Chatは公開初月に4,500万件のチャットに応答したと報じられており、生成AI検索は急速に利用者を増やしていました。
論文は、こうしたサービスが情報探索の主要な手段になりつつある一方で、生成される回答が常に正確とは限らないと指摘します。ウィキペディアの用語を借りて、生成された主張はすべて出典で裏づけられるべきだという「検証可能性」の考え方を、評価の軸に据えています。
どうやって調べたのか
論文は、2023年2月末から3月末にかけて、4つの商用生成AI検索から回答を収集しました。各システムには複数ターンの対話をさせず、最初の完全な回答だけを保存しています。
ChatGPTとGoogleのBard(いずれも当時の名称)は、回答に引用を付けないため、評価の対象から外されています。
| サービス | 回答を拒否した割合 | 備考 |
|---|---|---|
| Bing Chat | 0.5%未満 | 会話形式で、ほぼすべての質問に応答 |
| NeevaAI | 22.7% | 通常の検索結果ページに表示する設計のため、回答を保留する質問が多い |
| perplexity.ai | 0.5%未満 | 会話形式で、ほぼすべての質問に応答 |
| YouChat | 0.5%未満 | 会話形式で、ほぼすべての質問に応答 |
評価に使った質問は、各システムにつき合計1,450件です。内訳は、Oxford大学AllSoulsカレッジの入試小論文の設問、text-davinci-003で生成した討論の論題、Reddit「ELI5」の質問(過去の投稿と、収集と同時に新規投稿を拾う方式の2種類)、WikiHow記事から作った検索語という5種類がそれぞれ150件ずつ、そして過去のGoogle検索クエリを集めたNaturalQuestionsの7つの下位分類(段落型・箇条書き型・表型の回答があるかないかで分かれる)が各100件です。
あわせて12種類の質問分布から、出典の裏づけ方の傾向を幅広く見ています。
評価は自動採点ではなく、Amazon Mechanical Turkの34名の作業者による人手評価です。作業者は事前の資格試験を通過した人だけが参加し、引用ありの回答1件につき1.00ドル、引用なしの回答1件につき0.38ドル(時給換算でおよそ15ドル)を支払っています。
評価は3段階に分かれ、まず文章の流暢さと役に立ちそうかを5段階で評価し、次に検証が必要な文を選び、最後に各文とその引用の関係を「完全に支持」「部分的に支持」「支持しない」の3段階で判定します。
この判定には、Rashkin氏らが提案したAIS(attributable to identified sources、特定できる出典に基づいているかを判定する枠組み)という評価手法を使っています。
250件の回答について3人ずつ重ねて評価した結果、一致率は82.0%を上回り、判定全体のF1スコアは91.0でした。
結果
まず、文章としての質は総じて高く評価されました。全システム・全回答を平均すると、流暢さは5点満点で4.48、役に立ちそうかという評価は4.50でした。
| サービス | 流暢さ(5点満点) | 役に立ちそうか(5点満点) |
|---|---|---|
| Bing Chat | 4.40 | 4.34 |
| NeevaAI | 4.43 | 4.48 |
| perplexity.ai | 4.51 | 4.56 |
| YouChat | 4.59 | 4.62 |
一方、出典の裏づけは大きく見劣りしました。全システムを平均すると、生成された文のうち出典で完全に裏づけられていたのは51.5%(引用の再現率)、引用が自分の付いた文を正しく支えていたのは74.5%(引用の適合率)でした。
| サービス | 引用の再現率 | 引用の適合率 |
|---|---|---|
| Bing Chat | 58.7 | 89.5 |
| NeevaAI | 67.6 | 72.0 |
| perplexity.ai | 68.7 | 72.7 |
| YouChat | 11.1 | 63.6 |
この表から読み取れることは、次のとおりです。
- 再現率が最も高いperplexity.ai(68.7)と最も低いYouChat(11.1)の差は、論文の表現でおよそ58ポイントです
- 適合率が最も高いBing Chat(89.5)と最も低いYouChat(63.6)の差は、論文の表現でおよそ25ポイントです
- Bing Chatは適合率で最上位ですが、再現率では4サービス中3番目でした。ひとつの指標だけでは、システムの優劣を判断できません
質問の種類によっても差がありました。オープンエンドな小論文形式のAllSoulsの質問では、再現率の平均が44.3と、全体の中でも低い水準でした。
抽出しやすい短い答えを持つNaturalQuestionsの質問では、再現率が63.4、適合率が77.4と、いずれも相対的に高くなっています。
論文は、取得したウェブページに質問へ直接答える記述がない場合ほど、根拠のない文が増える傾向があると分析しています。
さらに論文は、引用の適合率と「役に立ちそう」という評価が、システム間でr = -0.96という強い逆相関を示すことを見つけました。適合率が最も高いBing Chatは、役に立ちそうかの評価が最も低く、逆に適合率が最も低いYouChatは、その評価が最も高かったのです。
なぜ「正確なほど役に立たなく見える」のか
論文はこの逆相関の背景として、生成された文と引用元ページの類似度を、BLEUとBERTScoreという指標で調べています。
| サービス | BLEU | BERTScore(F1) |
|---|---|---|
| Bing Chat | 44.1 | 78.8 |
| NeevaAI | 30.0 | 72.9 |
| perplexity.ai | 22.3 | 69.2 |
| YouChat | 28.6 | 72.0 |
類似度が高いBing Chatほど、引用元ページの文をそのまま近い形で使っている傾向があります。論文は、この類似度と平均適合率の間にr = 0.80という強い相関があると報告し、コピーや言い換えに近い生成ほど適合率が上がりやすい一方、質問への当てはまりが悪くなり、役に立ちそうという評価を下げるのではないかと考察しています。
ただし、これは論文自身も「仮説」と位置づけている解釈で、因果関係を直接検証したものではありません。
論文自身が書いている限界
論文は、限界の章で次の2点を明確に述べています。
- 検証可能性は、正しさ(事実性)そのものではありません。この研究が測ったのは、生成された文が引用元に支えられているかどうかであり、その文の内容が客観的に真実かどうかは評価していません
- 評価の単位は文であり、文の中の個々の主張ではありません。1つの文が複数の検証すべき内容を含む場合(例えば「猫と犬はよく飼われる」)もありますが、論文は「主張」を厳密に定義する言語学的な基準がまだ確立していないとして、再現性を優先して文単位の評価を選んだと説明しています
加えて、この記事を書くために原文を読んで気づいた点があります。
- 評価方法は自動採点ではなく、資格試験を通過したクラウドワーカー34名による人手評価です。専門家による評価ではありません
- この論文はarXivのプレプリントですが、コメント欄に「Findings of EMNLP 2023に掲載予定」と明記されており、査読つき国際会議のFindingsに採択された論文です。このシリーズで扱う論文の中では、査読の経過が確認しやすい部類に入ります
- 原文に日本語や日本市場への言及はありませんでした。質問の出所(Oxfordの入試問題、Reddit、WikiHow、Google検索のNaturalQuestions)は、いずれも英語圏のものです
- 評価対象の4サービスのうち、NeevaAIは本論文のデータ収集からおよそ2か月後の2023年6月2日にコンシューマー向け検索を終了し、Snowflake社に買収されています(この事実は論文には書かれておらず、本記事の執筆時点での一般的な報道に基づく補足です)。当時のBing Chatも、その後Microsoft Copilotへと製品名や仕組みが変わっています。ここで示された数字は、2023年当時の特定バージョンについての結果であり、現在のサービスに当てはまるとは限りません
- 論文の分析(適合率とBLEU・BERTScoreの相関)は、相関関係であって、コピーが役に立たなさを引き起こすという因果関係を直接示したものではありません
この論文から、言えること・言えないこと
| 言えること(論文が確かめた範囲) | 言えないこと |
|---|---|
| 2023年当時の4サービスで、生成文の半分近くが出典で完全には裏づけられていなかった | 現在のBing ChatやPerplexityなど、2026年時点のサービスでも同じ割合になること |
| 引用が付いていても、その引用が主張を正しく支えているとは4件に1件は言えなかった | 日本語での質問・日本語のウェブページでも、同じ結果になること |
| 文章の流暢さや役に立ちそうという印象と、出典の正しさは別の軸で動く | 役に立ちそうに見える回答ほど、事実として間違っていること |
| 適合率が高いシステムほど、引用元の文言に近い生成をする傾向があった | その傾向が、役に立たなさの直接の原因であること(相関のみ確認) |
中小企業の視点で、どう受け取るか
ここからは論文の主張とは別の、私の読み取りです。
- AI検索の回答に「出典」が付いていても、鵜呑みにしない。2023年時点の調査でも、引用の4件に1件は主張を正しく支えていませんでした。自社の情報がAIにどう扱われているかも、実際に確認する価値があります
- 自社ページの記述は、単独で読んでも裏づけが取れる書き方にする。この論文が測ったのは、AI側の引用精度ですが、裏づけが取りやすい一次情報(具体的な数値や出典)を載せておくことは、AIに正しく引用される側にとっても無駄になりません
- 「流暢で読みやすい」ことと「内容が正確」なことを、別の基準で見る癖をつける。この論文は、両者が必ずしも一致しないことを、2023年の時点ですでに示していました
- AI検索まわりの数字は、いつの時点の、どのサービスの結果かを必ず確認する。この論文の51.5%や74.5%は、2023年2月末から3月末に集めたデータの平均です。3年近く前の特定サービスの数字を、今のGEO対策の根拠としてそのまま使うのは無理があります
GEO原論文の解説記事とあわせて読むと、AI検索の「見え方」を測る研究が、引用の正しさを測る研究から、どのように広がっていったかが分かります。
よくある質問
この論文は、AI検索が信用できないと言っているのですか
論文は「信用できない」とは述べていません。生成された回答は流暢で、役に立ちそうだと評価される一方、出典による裏づけが不十分な文が一定数あると述べています。
論文自身も、こうした「信頼できそうな見た目」が、逆に利用者を誤解させる可能性があると懸念を示しています。
51.5%と74.5%は、それぞれ何を指す数字ですか
51.5%は、生成された文のうち出典で完全に裏づけられていた割合(引用の再現率)です。74.5%は、付けられた引用のうち、実際にその文を正しく支えていた割合(引用の適合率)です。
どちらも4サービスの平均で、2023年2月末から3月末に集めたデータに基づきます。
この数字は、今のAI検索にもそのまま当てはまりますか
そのまま当てはめるべきではありません。評価対象の4サービスのうち、NeevaAIはすでにサービスを終えており、Bing Chatも当時から名称や仕組みが変わっています。
この論文は、生成AI検索の初期段階の一時点を記録したものとして読むのが適切です。
まとめ:今日できる1つのこと
自社の代表的な情報について、ChatGPTやPerplexityなど普段お使いのAI検索に質問し、回答に出典が付いているか、その出典が本当に主張を裏づけているかを、1件だけ実際に開いて確かめてください。2023年の調査で4件に1件は裏づけが不十分だったのと同じことが、今も起きているかもしれません。
この論文は、LLMO論文の一覧の一本です。ほかの論文の解説も、順次公開しています。
この記事に書いたことを、そのまま御社のページに
生成AIに引用されるページを、お話しいただくだけでお作りします。お時間をいただくのは初回15分のヒアリングだけです。まず1ページ、無料でお作りします。
OKが出るまで、何度でも直します。事実が違う、言い回しが硬い、この話は入れないでほしい。どれも遠慮なくおっしゃってください。何度お直ししても、追加の料金はいただきません。
これまでに127社にご利用いただきました。毎月ご依頼いただいている方の6割以上が、月10ページを選ばれています。料金はページに掲載しています。
ページを増やしても問い合わせが来ないなら、原因はページの外にあります。その場合は、下の入口からご相談ください。
自社のマーケティング課題を根本から解決しませんか?
ウェブサイトから要素を引き算し、訪れた人が迷わず次の一歩に進む形へ組み直す。初回60分のオンラインで御社のサイトを一緒に読み、どこから直すべきかをお伝えします。手順をまとめた無料の診断と解説動画もご用意しています。
初回は無料・60分・オンライン完結・その場で契約のお願いはいたしません


