ChatGPTやPerplexityに「これは本当ですか」と聞くと、回答に出典のリンクが付いてきます。では、その出典はそもそも信頼できるサイトなのでしょうか。
回答の中身は、その出典に本当に書いてあることなのでしょうか。2025年10月にarXivで公開され、2026年3月のEACL(計算言語学の欧州の国際会議)の本会議に採択された論文「Assessing Web Search Credibility and Response Groundedness in Chat Assistants」は、この2つを同時に測りました。
この記事では、論文を原文から読み、どのAIをどんな問いで調べ、出典の信頼性と回答の裏づけ(出典に書いてあるかどうか)をどう測ったのかを整理します。数値はすべて論文の表と本文から拾い、私が計算した値には「概算」と書きました。
合同会社謙虚は、3つのドメインを並行して運用し、何を変えると数字が動くかを測り続けています。この論文を読むのは、お客様の記事に「確かめられる根拠」を書くとき、そして納品した記事を確かめ直すときに、どこを見ればよいかの物差しを、実測の研究から借りておきたいからです。
結論:3行で言うと
- 4つのチャット型AI(ChatGPTのGPT-4oとGPT-5、Perplexity、Qwen Chat)に、ファクトチェック団体が検証した100の主張について検索つきで質問すると、格付けのある出典のうち信頼できるサイトの割合は71〜86%で、Perplexityが最も高く、GPT-5が最も低い結果でした
- 回答を小さな事実に分けて出典と照合すると、74〜86%が出典で裏づけられていました。ところが「信頼できる出典で」裏づけられた割合に絞ると、72〜81%に下がります。出典どおりに書いてあることと、出典が確かなことは別の話でした
- 主張を信じている人の聞き方にすると、一部のAIで信頼性の低い出典がわずかに増えました。ただし裏づけの判定はAIによる自動判定で、英語だけの調査です。AIが最終的に正しい結論を出したかどうかは、測っていません
この論文の基本情報
| 項目 | 内容 |
|---|---|
| 題名 | Assessing Web Search Credibility and Response Groundedness in Chat Assistants |
| 著者 | Vykopal、Pikuliak、Ostermann、Simko の4人(所属はチェコのブルノ工科大学と、スロバキアとドイツの非営利の研究機関) |
| 公開日 | arXiv初版は2025年10月15日。確認した版は2026年2月19日のv2 |
| arXiv番号 | 2510.13749 |
| 掲載・採択 | EACL 2026の本会議(長い論文の部)。ACL Anthologyで、2026年3月のモロッコ・ラバトの会議録(2539〜2560ページ)に収録されていることを確認しました |
| 種類 | 実サービスを使った監査と、その評価手法の提案。資金はEUや各国の公的な研究費です |
| 実験データとコード | 論文の脚注にある公開ページで、研究目的に限って公開されています |
論文はこちらで読めます。arXiv(2510.13749)、ACL Anthology(会議録)、DOI。
コードとデータの公開ページは、論文から辿れます。
この論文が答えた問い
検索機能つきのチャット型AIは、事実の確認を頼まれたとき、信頼できる出典を引いているのか。そして回答の中身は、その出典で本当に裏づけられているのか。
背景には、偽情報を大量にネットへ流し、AIが検索で拾う材料を汚そうとする動きがある、という懸念があります。論文は、ロシアのプロパガンダが欧米のAIに偽情報を紛れ込ませたという報告を引いています。
出典が文を裏づけているかどうかは、2023年の研究が人手で測っています(生成AI検索の引用を監査した初期の論文の解説)。
この論文は、そこに「その出典は信頼できるサイトか」という軸を重ねました。論文の言葉でいえば、出典とは一貫しているのに、出典そのものが信頼できない回答という失敗を見つけるための方法です。
どうやって調べたのか
対象と問いの作り方
| 項目 | 設定 |
|---|---|
| 調べたAI | ChatGPT(GPT-4o、のちにGPT-5)、Perplexity、Qwen Chat(Qwen3 235B-A22B、2025年7月25日版)。検索機能は必ずオンにした |
| 使い方 | 開発者向けの接続口ではなく、利用者と同じウェブ画面を、ブラウザの自動操作で人のように入力して使った。画面側の安全対策も含めて測るため |
| 主張 | 健康、気候変動、ロシア・ウクライナ戦争、米国政治、各国の地域の話題の5つ。各20件、計100件。デューク大学の報道研究所の一覧に載るファクトチェック団体の記事から人手で選んだ |
| 主張の書き換え | 元のファクトチェック記事をそのまま拾わせないよう、AI(Llama 3.3 70B)で言い換え、人手で意味を確認した |
| 聞き方 | 「確かめたい人」の型が3つ、「信じている人」の型が2つと疑問文が1つ(論文は疑問文も信じている人の側に数える) |
| 時期 | 2025年後半の状態(論文の限界の節による) |
聞き方の例を訳しておきます。確かめたい人の型は「〜は本当ですか」「次の主張をファクトチェックしてください」などです。
信じている人の型は「ある発見で〜と分かっています。裏づける詳細を教えてください」のように、主張が正しい前提で聞きます。
誤った前提を含む質問ほどAIが誤情報を受け入れやすい、という先行研究を受けた設計です。
論文はGPT-5について「600会話のうち58会話」と書いています。100件の主張に6通りの聞き方をかけると600なので、各AIとも600会話を集めたと読めます(掛け算は私の確認です)。
何を測ったか
- 信頼率:引用されたドメインのうち、格付けが「非常に高い・高い・おおむね事実」だった割合
- 非信頼率:同じく「低い・非常に低い・風刺」だった割合
- 裏づけ率:回答から取り出した事実の単位のうち、引用された出典のどれかで支持された割合
- 信頼できる出典での裏づけ率と信頼できない出典での裏づけ率:支持した出典の格付けで分けた割合
ドメインの格付けには、約8,000のドメインを評価している米国の民間のメディア評価サイトと、ファクトチェック団体の一覧を使いました。
行政機関のサイトや研究論文は信頼できる側、SNSは中間、偽情報サイトは低い側に分けています。格付けのないドメインは、信頼率の計算から外しています。
裏づけの判定は、既存の評価手法(VERIFY)を作り替えた手順で、すべてAIが行いました。
- 回答を、それ以上分けられない小さな事実の単位に分ける。「ネットで〜という主張が出回っている」のような伝聞は、照合の対象から外す新しい区分を設けた
- 代名詞などを補い、単位を1文で意味が通る形に直す
- AIが実際に引用した出典の本文だけを500字ずつに区切り、単位ごとに関係の深い5か所を取り出す
- 判定役のAI(Llama 3.3 70Bの軽量版)が「支持」「矛盾」「確認できない」の3つに分ける
つまり、正誤をウェブで調べ直したのとは違い、AIが自分で選んだ出典の中に、その文が書いてあるかだけを見ています。
結果
出典の信頼性は、AIごとに差があった
論文の表1と表2から、全体の数字を拾います。
| AI | 信頼率 | 非信頼率 | 引用の総数 | 1会話あたりの出典数 | 偽情報サイトを含む会話 | 引用のうちファクトチェック団体の割合 |
|---|---|---|---|---|---|---|
| GPT-4o | 75.2% | 2.27% | 8,416 | 14 | 14% | 27.0% |
| GPT-5 | 71.4% | 2.03% | 12,103 | 20 | 15% | 23.6% |
| Perplexity | 86.3% | 0.69% | 3,592 | 6 | 3.5% | 35.3% |
| Qwen Chat | 80.0% | 1.07% | 4,587 | 8 | 4% | 15.8% |
- Perplexityは出典の数が少なく、信頼率が最も高い結果でした。論文は、引く出典を絞る慎重な検索の仕方と読んでいます
- GPT-4oとGPT-5は、幅広いドメインから引きます(異なるドメインは1,863と2,425)。論文は、話題の網羅が広がる代わりに、信頼性の低い出典に触れる機会も増えると解釈しています
- どのAIもファクトチェック記事をよく引き、GPT-4oとGPT-5では約89%の会話で1件以上を引用していました
- Qwen Chatは格付けのないドメインを引く割合が最も高く、回答を断った会話も20件ありました
話題によって、弱いところが違った
表1の話題別の数字と、付録の表15(4つのAIが引用した偽情報サイトの件数の合計)を並べます。信頼率と非信頼率は、4つのAIのうち最も低い値と最も高い値を拾いました。
| 話題 | 信頼率の幅 | 非信頼率の最大 | 偽情報サイトの引用件数 |
|---|---|---|---|
| 健康 | 77.3〜91.8% | 1.26%(GPT-4o) | 33 |
| 気候変動 | 73.3〜92.3% | 3.44%(GPT-5) | 88 |
| 米国政治 | 67.8〜83.0% | 1.31%(GPT-4o) | 38 |
| 地域の話題 | 65.6〜79.0% | 2.50%(Qwen Chat) | 49 |
| ロシア・ウクライナ戦争 | 69.8〜85.5% | 4.55%(GPT-4o) | 129 |
ロシア・ウクライナ戦争の話題では、4つのAI全体で約130件の偽情報サイトが引用され、その約75%は論文が「ロシアのプロパガンダ系」と分類したサイトでした。
4つのAIの最低値で比べると、信頼率が最も低かったのは地域の話題(Qwen Chatの65.6%)でした。出典の信頼性について、論文は、地域の主張でQwen Chatが最も苦戦したと書いています。
「出典どおり」と「確かな出典どおり」は、数字が違った
表4から、裏づけの数字を拾います。右端の列は、回答の中で事実の確認対象にならなかった単位(意見、質問、前置きなど)の割合で、本文に書かれた値です。
| AI | 裏づけ率 | 信頼できる出典での裏づけ率 | 信頼できない出典での裏づけ率 | 確認対象外の単位 |
|---|---|---|---|---|
| GPT-4o | 82.8% | 77.3% | 1.16% | 17% |
| GPT-5 | 84.5% | 75.5% | 1.43% | 18% |
| Perplexity | 86.0% | 81.1% | 0.13% | 11% |
| Qwen Chat | 74.1% | 71.6% | 1.01% | 24% |
- 裏づけ率と、信頼できる出典での裏づけ率の差は、GPT-5で約9ポイント、GPT-4oとPerplexityで約5ポイント、Qwen Chatで約2ポイントです(表の値からの概算)。この差は、主に信頼できる出典以外で支えられた単位を示すと読めます。ただし出典の区分ごとに別に判定しているため、Qwen Chatの健康の話題のように、信頼できる出典での裏づけ率の方が高くなる場合もあります
- 論文はこの差を根拠に、回答が出典に基づいているように見えても、周辺的な出典や確かめようのない出典に頼っていることがあると述べています
- 信頼できる出典での裏づけ率は、4つのAIすべてで地域の話題が5つの話題のうち最も低く、Qwen Chatは52.75%でした。論文は、信頼できる情報が見つけにくい地域の話題ほど、裏づけが弱くなると読んでいます
- Qwen Chatは、ふだんは信頼性の低い出典を避けます。ただし1件でも引いた回答では、事実の単位の約60%がその出典に支えられていました。論文は、失敗したときの崩れ方が大きい検索の仕方だと指摘しています
聞き方と「考える」機能による違い
信じている人の聞き方にすると、非信頼率はGPT-4oで1.81%から2.73%、GPT-5で1.87%から2.20%に上がりました。
Perplexityは0.76%から0.63%と、むしろ下がっています。論文は、聞き方の影響はAIの違いより小さいとまとめています。
表1でも、聞き方による差は最大2.9ポイントでした。
GPT-5は、必要に応じて自動で「考える」モードに切り替わります。600会話のうち58会話(10%)でこのモードが使われ、その会話では信頼率が69.8%から85.8%に上がり、非信頼率は2.2%から0.4%に下がっていました(表3)。
論文自身が書いている限界
- 結果は2025年後半のAIの状態で、AIは変わり続けます
- 再現しやすいよう、長く出回っている主張を中心に選びました。新しく出てきた主張でのふるまいは十分に測れていません
- 調べたのは、当時検索機能を使えた3つの提供元と、5つの話題だけです
- 主張も質問も回答も英語だけです
- 格付けに使った資料には、地域や文化による偏りが含まれ得ます
- 裏づけの判定は1つのAIだけで行いました。規模が大きく人手での判定は無理で、AIどうしの相対的な差を見るには一貫した自動判定で足りる、という立場です
- 利用者は決まった型の質問で模擬しており、聞き返しを含む複数回のやり取りは再現していません
原文を読んで気づいた点
- 日本語での検証はありません。日本語の質問で、日本語の出典を引いたときに同じ差が出るかは分かりません
- 裏づけの判定は、人手で確かめた結果が報告されていません。人の判断とよく合うという根拠は、元の評価手法(VERIFY)の論文から借りたものです
- AIの最終的な結論が正しかったかは、評価の対象外です。測ったのは、出典の格付けと、回答が出典に書いてあるかの2つです
- 格付けのないドメインは信頼率の分母から外れます。格付けのないドメインを多く引いたQwen Chatの信頼率は、この扱いの影響を受けやすいと読めます
- 出典の付いていない文は、その会話の全出典と照合されました。裏づけ率を高めに出す方向に働き得る扱いです(私の読み取り)
- 付録の表11と表14の「聞き方の違い」の行には、同じ表のAI比較の行と同じ数値が並んでいます。表4では聞き方による差が各AIで2.5ポイント以内なのに、表14のこの行は信頼できる出典での裏づけ率に約8.7ポイントの差を示しています。転記の誤りの可能性があるため、この記事では表1と表4の値を使いました
- 論文は、GPT-5の「考える」モードが信頼性を高めると示唆しています。ただし、このモードはAI自身がどの会話で使うかを決めており、質問の種類が違う会話どうしの比較なので、このモードが信頼性を上げたとまで言えるかは、私の読みでは慎重に見たほうがよいと考えます
- 付録で、同じ回答を3つの評価手法で採点した比較があります。GPT-4oの米国政治では、事実の精度が62%、82%、86%と、手法によって大きく違いました。「何%が正確か」という数字は、測り方の決め方でかなり動くということです
- arXivのコメント欄に「EACL 2026本会議に採択」とあり、会議録での収録も確認しました。査読を経た論文です
この論文から、言えること・言えないこと
| 言えること(論文の設定で確認された) | 言えないこと(論文では確認されていない) |
|---|---|
| 2025年後半の英語の事実確認で、出典の信頼率はPerplexityが最も高かった | いまのChatGPTやPerplexityで同じ順位になること |
| 出典に書いてあることと、出典が信頼できることは、別々に測る必要があった | 裏づけられた回答の結論が正しいこと |
| 戦争と気候変動の話題で信頼性の低い出典が多く、地域の話題では信頼率が低かった | 日本語の質問や日本の地域の話題で同じ傾向が出ること |
| 信じている人の聞き方で、一部のAIの非信頼率がわずかに上がった | 聞き方だけで偽情報を引き出せること |
| GPT-5が「考える」モードを使った会話では、信頼率が高かった | そのモードを使えば信頼性が上がるという因果 |
中小企業の視点で、どう受け取るか
ここからは論文の主張とは別の、私の読み取りです。論文は企業の記事制作を扱っていません。
1. 出典を付けることと、確かめられることを分けて考える
この論文でいちばん実務に効くのは、「出典どおりに書いてある」と「出典が確かである」を別の物差しで測った点です。記事でも、リンクを付けただけでは根拠として足りません。
根拠は、行政機関の資料、研究論文、業界団体の統計のように、論文の分類で信頼できる側に入る種類に寄せます。
2. 納品後の確認は、論文の手順を小さく真似る
論文の手順は、回答を小さな事実に分け、引用した出典の中にその文があるかを1つずつ照らし合わせるものでした。記事の確認にもそのまま使えます。
主張の文を1つずつ取り出し、出典のページに同じことが書いてあるかを見て、出典の種類を記録します。論文でも自動判定の数字は手法で大きく動いたので、最後は人の目で確かめます。
3. 地域の情報は、確かな出典が薄い分野になりやすい
論文では、地域の話題で信頼できる出典での裏づけ率が最も低くなりました。確かな情報がネット上に少ない分野では、AIも弱くなります。
地域の会社が、自社の地域や業界の事実を出典つきで書いておく意味はここにあります。ただし論文の「地域」は各国の時事の主張で、日本の中小企業の情報とは性質が違うため、確度は弱めです。
4. AIへの聞き方を変えて、自社の業界の誤解を確かめる
自社の業界でよく出回る誤解を1つ選び、「〜は本当ですか」と「〜と聞きました。詳しく教えてください」の2通りでAIに聞いてみると、どんな出典が引かれるかが見えます。
信頼性の低い出典しか出てこないなら、正確な解説記事が求められている場所かもしれません。論文の設計を借りた確認方法で、引用されやすくなる効果は測られていません。
よくある質問
チャット型AIの出典の信頼性を比べたEACL 2026の論文で、最も信頼できる出典を引いたAIはどれですか
この論文の設定では、Perplexityでした。信頼率は86.3%、非信頼率は0.69%です。
ただし2025年後半の英語での調査で、今の順位を示すものとは読めません。
回答が出典に裏づけられている(グラウンデッドネスが高い)ことは、回答が正しいという意味ですか
同じ意味にはなりません。裏づけ率は、AIが自分で選んだ出典にその文が書いてあるかどうかを測った数字です。
出典そのものの信頼性や、結論の正しさは別に確かめる必要があります。
主張を信じている人の聞き方をすると、チャット型AIは信頼性の低い出典を引きやすくなりますか
この論文では、GPT-4oとGPT-5でわずかに増えました(GPT-4oの非信頼率は1.81%から2.73%)。Perplexityでは逆に下がっています。
影響はAIどうしの差より小さい、というのが論文のまとめです。
まとめ:今日できる1つのこと
自社でいちばん読まれている記事を1つ開き、出典を付けている主張を3つ選んでください。それぞれの出典のページを開き、その主張が本当に書いてあるかを確かめます。
続けて、出典が行政機関、研究機関、業界団体、報道機関、個人のサイトのどれかをメモします。書いていなかった主張は出典を探し直し、見つからなければ断定をやわらげます。
AI Overviewsを長期で監査した論文でも、出典で裏づけられない主張が約1割ありました。
この論文は、LLMO論文の一覧の一本です。ほかの論文の解説も、順次公開しています。
この記事に書いたことを、そのまま御社のページに
生成AIに引用されるページを、お話しいただくだけでお作りします。お時間をいただくのは初回15分のヒアリングだけです。まず1ページ、無料でお作りします。
OKが出るまで、何度でも直します。事実が違う、言い回しが硬い、この話は入れないでほしい。どれも遠慮なくおっしゃってください。何度お直ししても、追加の料金はいただきません。
これまでに127社にご利用いただきました。毎月ご依頼いただいている方の6割以上が、月10ページを選ばれています。料金はページに掲載しています。
ページを増やしても問い合わせが来ないなら、原因はページの外にあります。その場合は、下の入口からご相談ください。
自社のマーケティング課題を根本から解決しませんか?
ウェブサイトから要素を引き算し、訪れた人が迷わず次の一歩に進む形へ組み直す。初回60分のオンラインで御社のサイトを一緒に読み、どこから直すべきかをお伝えします。手順をまとめた無料の診断と解説動画もご用意しています。
初回は無料・60分・オンライン完結・その場で契約のお願いはいたしません


