MENU
  • 料金
  • 会社案内
  • コンサル
  • お問い合わせ
  • 無料で1ページ頼む
AIO・LLMO・GEO対策の記事制作
合同会社謙虚
  • 料金
  • 会社案内
  • コンサル
  • お問い合わせ
  • 無料で1ページ頼む
  • 料金
  • 会社案内
  • コンサル
  • お問い合わせ
  • 無料で1ページ頼む
合同会社謙虚
  • 料金
  • 会社案内
  • コンサル
  • お問い合わせ
  • 無料で1ページ頼む
  1. ホーム
  2. LLMO
  3. LLMO論文
  4. 【LLMO論文解説】メンタルヘルスの質問で3つのAIは何を出典にしたか|7言語・1万5,942件の引用を監査(プレプリント2026)

【LLMO論文解説】メンタルヘルスの質問で3つのAIは何を出典にしたか|7言語・1万5,942件の引用を監査(プレプリント2026)

2026 9/30
2026年9月25日2026年9月30日
中野輝規
メンタルヘルスの質問で3つのAIは何を出典にしたか

AIに健康のことを尋ねると、答えの横に出典のリンクが並びます。どのサイトを見せるかを、いまはAIの側が決めています。

その出典がどんな組織のページなのかを、メンタルヘルスの質問で数えた論文が2026年8月末に公開されました。ハーバード大学医学大学院の関連病院の研究者らによる「Sources of Truth」です。

対象はChatGPT、Perplexity、GoogleのAI Overviewの3つ。英語の20問に加え、3問を日本語を含む6言語に訳し、1万5,942件の引用を記録しています。

この記事では原文を付録の表まで読み、日本語の結果も拾いました。

合同会社謙虚は、3つのドメインを並行して運用し、何を変えると数字が動くかを測り続けています。この論文を読むのは、AIが「どの種類の組織を出典に選ぶか」を、サービス別・言語別に並べて数えた実測だからです。

目次

結論:3行で言うと

  • 英語の質問では、引用のおよそ4分の3(論文の表現。私の概算では78.4%)が政府・学術・営利の健康情報・非営利の医療機関の4種類に集まり、上位10ドメインだけで43.6%を占めました
  • 3つのAIは、先頭に来る出典の種類がそれぞれ違いました。質問に「出典を挙げて」と付けても、種類の割合は本文の値で最大2.1ポイント(付録の表では2.83ポイント)しか動きませんでした
  • 英語以外では引用が減り、現地の言語のページへの案内も言語で大きく差がありました。日本語は、英語以外の6言語の中で最も国内のページに案内されていた一方、ChatGPTは日本語の回答の23%で出典を示していません

2026年6〜7月に、無料版・ログアウト状態で集めた一時点の記録で、査読前のプレプリントです。

この論文の基本情報

項目 内容
題名(原題) Sources of Truth: A Multi-Platform, Multilingual Audit of Citations in AI Mental Health Information Queries
著者 Nguyen、Noorily、Flathers、Notsu、Ospina-Pinillos、Torousほか計10人。所属はベス・イスラエル・ディーコネス医療センターのデジタル精神医学部門(ハーバード大学医学大学院)、コロンビアのハベリアナ大学、タフツ大学
公開日 2026年8月31日(確認した版はv1)
arXiv番号 2609.00319
掲載・採択 arXivのコメント欄に「審査中」と記載。採択は確認できず、プレプリントとして扱います
種類 実サービスの監査(観察研究)。本文16ページと付録
データとコード 引用のデータと、分類器・分析コードを公開したと記載

論文はこちらで読めます。arXiv(2609.00319)、公開データ(DOI 10.57967/hf/10067)、分類器と分析コード。

この論文が答えた問い

メンタルヘルスの情報を探す人に、消費者向けのAIはどんな種類の出典を見せているのか。それはサービス、質問の種類、出典を求める一言、質問の言語で、どう変わるのか。

検索結果の一覧では、どれを信じるかを利用者が選んでいました。AIの回答では、出典の選別をサービスが先に済ませます。

これまでの評価は自殺リスクの検知のような危機対応に集中していた、と論文は整理し、症状や治療についての日常的な調べものを中心に調べています。

健康の質問でChatGPTが引用したページ615件を、著者名や監修の記載などページ側の特徴から調べた研究は、健康の質問で引用されたページの権威の手がかりを調べた論文の解説で扱いました。今回はページの特徴には踏み込まず、3つのサービスと7つの言語を並べて、出典の組織の種類を数えた研究です。

どうやって調べたのか

対象と規模

項目 設定
調べたAI ChatGPT(無料版)、Perplexity(無料版)、GoogleのAI Overview(Google検索に入力)。ログアウトし、履歴のない画面から、可能な限りシークレットモードで質問
質問 英語20問。用途で8種類(重なりあり):症状・兆候4、診断3、治療の効果3、薬3、薬の副作用1、治療ガイドライン2、危機のときの支援先3、信頼できる情報源1
言語 7言語を、ネット上の言語資源の多さで3段階に分類。多い:英語、スペイン語、日本語。中程度:ウクライナ語、ヒンディー語。少ない:ネパール語、トウィ語(ガーナの言語)
英語以外の質問 3問(うつ病の診断、自殺を考えたときの支援先、信頼できる情報源)を母語話者が翻訳
質問の出し方 質問だけ/末尾に「出典を挙げてください」に当たる一文を付ける、の2通り
繰り返し 各条件5回。7人の担当者が出典を手で記録
回答と引用 回答1,140件、引用1万5,942件、ドメイン1,713種類。英語は回答600件・引用1万972件、英語以外は回答540件(各言語90件)・引用4,970件
期間 2026年6月25日〜7月20日

この記事はAIの出典の選び方を扱うもので、心の不調についての助言ではありません。つらい状態が続くときは、AIの回答だけで判断せず、医療機関や、自治体・公的機関の相談窓口に相談してください。

出典を9つの種類に分けた基準

引用先のドメイン名とホスト名に、決まった順番で規則を当てはめる自動の分類器で、9種類に分けています。

種類 原文の定義(要約)
1. 政府・公的な保健機関 各国政府のドメイン、世界保健機関のような国際機関、国の保健サービス
2. 学術・論文 医学文献データベース(PubMedなど)、大学、学術出版社
3. 非営利の医療機関 非営利・大学系の病院の患者向け解説(例:メイヨー・クリニック、クリーブランド・クリニック)
4. 営利の健康情報 営利の健康情報サイト、遠隔診療、製薬会社や薬の銘柄のサイト、民間の病院、個人のクリニック
5. 非営利団体・支援団体 非政府組織、支援団体、専門職の団体(例:米国精神医学会)
6. 百科事典 Wikipediaなど
7. ニュース・メディア 報道機関など
8. SNS・動画 SNS、掲示板、動画サイト
9. その他 上のどれにも当たらないもの

判定は人の判定と照合されています。引用の大半を占める上位100ドメインは著者2人が全件確認し、残りから無作為に選んだ200ドメインは2人が別々に判定しました。

一致度のカッパ係数(1に近いほど一致)は、判定者どうしで0.88、各判定者と分類器で0.89と0.86です。

英語以外の質問では、「現地の言語に合った出典」を2つの物差しで測りました。引用先がその言語の国の国別ドメイン(日本語なら「.jp」)にあるか。

アドレスに言語コードや現地の文字など、現地語のページの印があるか、です。

結果

引用は少数の組織に集まった

英語の質問の引用を9種類に分けた割合です。サービス別の数字は、付録の表A2(サービスの画面側の列)から拾いました。

出典の種類 全体 ChatGPT Perplexity AI Overview
政府・公的な保健機関 22.6% 26.4% 20.9% 14.2%
営利の健康情報 22.6% 22.7% 18.0% 25.7%
学術・論文 21.6% 22.3% 24.3% 18.0%
非営利団体・支援団体 13.3% 10.0% 19.0% 17.4%
非営利の医療機関 11.6% 9.1% 15.1% 15.4%
百科事典 3.9% 6.3% 0.5% 0.3%
SNS・動画 3.0% 1.5% 1.0% 8.2%
ニュース・メディア 0.7% 0.6% 1.0% 0.6%
その他 0.7% 1.1% 0.2% 0.1%
  • 論文が挙げる4種類(政府・学術・営利・非営利の医療機関)の合計は、私の概算で78.4%です(22.6+22.6+21.6+11.6)。論文の結論は「およそ4分の3」と表現しています
  • 上位10ドメインで、英語の引用1万959件の43.6%を占めました。付録では、医学文献データベース群が12.06%、メイヨー・クリニックが5.51%、米国食品医薬品局が4.44%、米国国立衛生研究所が4.36%です
  • 先頭の種類は、ChatGPTが政府・公的、Perplexityが学術・論文、AI Overviewが営利の健康情報でした
  • ChatGPTはWikipediaを多く引用し(本文では6.1%、他は0.5%以下)、AI OverviewはSNS・動画を8.2%引用しました。その大半は動画サイト(7.7%)です

質問の種類で、出典の種類が変わった

  • 治療の効果の質問では学術・論文が56.9%、危機の支援先の質問では非営利団体・支援団体が41.6%でした
  • 薬の質問では営利の健康情報が33.7%と、どの種類の質問より高い割合でした。論文は、商業的な動機が最も強い質問で営利のサイトへの依存が最も大きかった点を、懸念として挙げています

引用の数は、中央値がそろい、ばらつきが大きく違った

英語の600回答で、1回答あたりの引用数の中央値は3つとも10〜12件でした。平均はChatGPTが32.29件(標準偏差60.50)、AI Overviewが12.85件(同6.63)、Perplexityが9.7件(同1.69)です。

引用の多い回答の上位10件は、すべてChatGPTの薬か治療ガイドラインの回答でした。出典が1件もない回答は、全1,140件中83件(7.3%)で、ChatGPTが380件中55件(14.5%)、AI Overviewが27件(7.1%)、Perplexityが1件(0.3%)です。

「出典を挙げて」の一言は、ほとんど効かなかった

  • 英語の回答全体で、引用数の平均は16.6件から19.9件に増えました。増えた分のほとんどはChatGPT(27.3件→37.2件)で、Perplexity(9.2件→10.3件)とAI Overview(13.4件→12.3件)はほぼ同じです
  • 種類の割合は、政府・公的が+2.1ポイント、営利の健康情報が+1.6ポイント、学術・論文が+0.8ポイント、非営利の医療機関が-1.6ポイント、非営利団体・支援団体が-1.3ポイントでした。いずれも、一言を付けない質問との割合の差(絶対差)です

言語によって、案内される先が大きく違った

3問を7言語で比べた結果です。引用数は付録の表D2、割合は付録の表A3(サービスの画面側の列)から拾いました。

言語(資源の段階) 1回答あたりの引用数(平均) 国別ドメインの割合 現地語のページを含めた割合
英語(多い) 12.27件 対象外 対象外
スペイン語(多い) 11.16件 11.3% 46.2%
日本語(多い) 7.62件 77.3% 78.4%
ウクライナ語(中程度) 9.00件 31.1% 42.6%
ヒンディー語(中程度) 10.43件 11.8% 35.9%
ネパール語(少ない) 9.92件 3.9% 24.9%
トウィ語(少ない) 7.09件 2.5% 37.6%
  • 英語以外の平均は9.2件(540回答)で、同じ3問の英語の12.3件(90回答)より少なくなりました
  • ChatGPTは英語で平均17.5件、トウィ語で4.3件でした。出典なしの回答は、ChatGPTがトウィ語で33%、日本語で23%、AI Overviewがヒンディー語で30%です。Perplexityは7言語すべてで8.6〜10.2件でした
  • スペイン語は、国外のドメインにある現地語のページを含めると11.3%から46.2%に上がりました。その多くは米国政府の医療情報サイトのスペイン語版です

論文は日本語を「データの中で最も現地化されていた言語」と書き、国内の機関のウェブが充実している、と添えています(原因として検証したものではありません)。全体の解釈は、現地化の度合いは言語資源の段階よりも、その言語で書かれた信頼できる資料の量に沿っている、というものです。

名前が似ているだけの、無関係なページが混ざった

不安の薬を尋ねた質問で、12件ほどのメイヨー・クリニックへのリンクと並んで、マヨネーズのWikipediaの項目が出た例があります。

精神疾患の診断基準と同じ略称を持つ香料メーカーのページや、うつ病の評価尺度と同じ名前のミュージカルのチケットのページも出ました。

論文はこれを綴りの近さで照合している兆候と見て、紛らわしいドメインを使った悪用の余地を指摘しています。この調査では、誤った健康情報を載せた紛らわしいページは見つかっていません。

付録では、同じ質問を3社の開発者向けの窓口(API)にも送っています。営利の健康情報は12.2%で、画面側の22.6%より低い値でした。

ただし無料版の裏のモデルは公表されておらず、比較は示唆にとどまると論文は書いています。

論文自身が書いている限界

  • 2026年6〜7月の一時点の記録で、サービスの動きは変わり得ます
  • 無料版・ログアウト状態だけで、ログイン時や有料版では違う可能性があります
  • 無料版で使われたモデルを特定できず、再現性に課題があります
  • リンクは書式の正しさだけを確認し、実際に開けるか、正しいページかは確認していません
  • 英語以外は各言語3問だけで、翻訳の言い回しの揺れも入り得ます
  • 担当者は全員米国在住で、IPアドレスなどから米国の利用と見える状態でした。国外のリンクの出方に影響した可能性があります

原文を読んで気づいた点

  • 日本語での検証は含まれています。3問×2通り×3サービス×5回の90回答です。米国から送った質問なので、日本国内から尋ねた場合と同じになるかは未確認です
  • 日本語の質問文は「うつ病と診断される基準は何?」のような話し言葉で、「出典を挙げて」の条件は末尾に「情報源は?」を付ける形でした。1問には「挙げて」を「上げて」と書いた誤字もあります
  • 評価は、人が記録した引用を規則で分類したもので、AIによる自動採点は使っていません。引用先の内容の正しさや、回答の文を裏づけているかは測定の対象外です
  • 本文と付録で数字が少しずれる箇所があります。出典を求めたときの変化は、政府・公的が本文で+2.1ポイント、付録の表D2で+2.83ポイント、営利の健康情報が本文で+1.6ポイント、表D2で+0.40ポイントと、本文と付録で食い違います。英語の引用数も1万972件と1万959件の2通りがあります
  • 担当者の手順書には「出典が出なければ最大5回まで質問し直す」とあり、本文の「出典なし」の割合との対応は読み取れませんでした
  • arXivで「審査中」のプレプリントです。分類器の初稿と原稿の校正に生成AIを使ったことが明記されています

この論文から、言えること・言えないこと

言えること(論文の設定で確認された) 言えないこと(論文では確認されていない)
2026年6〜7月、無料・ログアウトの3サービスは、英語のメンタルヘルスの質問で引用のおよそ4分の3を4種類の組織に集めていた ログイン時や有料版、今のサービスでも同じ割合になること
3つのサービスは、多く引用する出典の種類が違った 引用された情報の中身が正しいこと
「出典を挙げて」と付けても、種類の割合は本文の値で最大2.1ポイント(付録の表では2.83ポイント)しか動かなかった 健康・医療以外の業種でも同じ傾向が出ること
日本語の質問は、英語以外の6言語の中で最も国内のドメインに案内されていた 日本国内から質問した場合や、3問以外の日本語の質問でも同じになること
名前が似ているだけの無関係なページが、引用に混ざることがあった 紛らわしいページが実際に悪用されたこと
画面から「出典を挙げて」と付けても、種類の割合はほとんど動かなかった 開発者向けの窓口(API)経由でも同じく効かないこと(付録では、APIで出典を求めると政府・公的が+11.6ポイント動いた)

表の割合は引用全体に占める「種類」の比率で、特定のサイトが引用される確率とは別の数字です。

中小企業の視点で、どう受け取るか

ここからは論文の主張とは別の、私の読み取りです。論文が調べたのは医療の分野で、他の業種への当てはめは確かめられていません。

1. 専門性の高い分野ほど、出典の席は大きな組織で埋まりやすい

健康や法律、お金のような分野の一般的な質問では、小さな事業者のページが出典に入る余地は狭い、と私は受け取っています。一方で営利のサイトが最も多く引用されたのは薬の質問でした。

ただし、ここでの営利サイトは大手の健康情報・薬の情報サイトです。

2. 1つのAIだけで、自社の見え方を判断しない

3つのサービスは、同じ質問でも好む出典の種類が違いました。自社の見え方は、複数のサービスで同じ質問を試して確かめるのが安全です。

3. 日本語の出典は、日本語で書かれた資料の量に沿っていた、と論文は解釈

論文の解釈に沿えば、日本語の質問で出典に選ばれる前提は、日本語で出どころの確かな情報を公開しておくことだと私は考えています。公開すれば引用される、という保証にはなりません。

4. 紛らわしい名前は、ページの中ではっきり説明する

自社名や商品名が有名な組織名・略語と紛らわしい場合は、正式な社名、所在地、事業の内容をページに書いておくと、取り違えを減らす手がかりになると私は見ています。論文が効果を測った点ではありません。

よくある質問

AIに「出典を挙げて」と頼めば、メンタルヘルスの情報の出典は信頼できるものに変わりますか

この論文の設定では、ほとんど変わりませんでした。英語で種類の割合の動きは、本文の値で最大2.1ポイントです(付録の表では2.83ポイント)。

ChatGPTは引用の数が平均27.3件から37.2件に増えました。英語全体では、種類の割合の変化は小さいものでした。

心身の不調については、医療機関に相談してください。

「Sources of Truth」論文で、日本語の質問の結果はどうでしたか

引用の77.3%が日本の国別ドメインにあり、現地語のページを含めると78.4%で、英語以外の6言語の中で最も国内に案内されていました。

一方、1回答あたりの引用数は平均7.62件と英語の12.27件より少なく、ChatGPTは日本語の回答の23%で出典を示していません。

質問は3問で、米国から送られています。

メンタルヘルスの質問でのAIの引用監査の結果は、健康以外の業種にも当てはまりますか

論文は健康以外の業種を調べていません。出典が少数の大きな組織に集まる傾向が他の業種でも出るかは、別に確かめる必要があります。

まとめ:今日できる1つのこと

お客様がAIに聞きそうな質問を1つ選び、ChatGPT、Perplexity、GoogleのAI Overviewに日本語で尋ねてみてください。

出てきた出典を、この論文の9つの種類で書き出すと、自社の分野の出典の席がどんな組織で埋まっているかが見えてきます。結果は揺れるので、日を変えて何度か記録しておくと比べやすくなります。

この論文は、LLMO論文の一覧の一本です。ほかの論文の解説も、順次公開しています。

この記事に書いたことを、そのまま御社のページに

生成AIに引用されるページを、お話しいただくだけでお作りします。お時間をいただくのは初回15分のヒアリングだけです。まず1ページ、無料でお作りします。

OKが出るまで、何度でも直します。事実が違う、言い回しが硬い、この話は入れないでほしい。どれも遠慮なくおっしゃってください。何度お直ししても、追加の料金はいただきません。

これまでに127社にご利用いただきました。毎月ご依頼いただいている方の6割以上が、月10ページを選ばれています。料金はページに掲載しています。

まず1ページ、無料で作らせてください

ページを増やしても問い合わせが来ないなら、原因はページの外にあります。その場合は、下の入口からご相談ください。

自社のマーケティング課題を根本から解決しませんか?

ウェブサイトから要素を引き算し、訪れた人が迷わず次の一歩に進む形へ組み直す。初回60分のオンラインで御社のサイトを一緒に読み、どこから直すべきかをお伝えします。手順をまとめた無料の診断と解説動画もご用意しています。

まず動画で詳しく見る(約30分)
無料診断を受ける

初回は無料・60分・オンライン完結・その場で契約のお願いはいたしません

LLMO論文
SEO対策 生成AI
よかったらシェアしてね!
  • URLをコピーしました!
  • 【LLMO論文解説】報道の少ない紛争ほど、AIの答えは外れやすい|5つのAI・28の紛争・5,460件の回答を採点(プレプリント)
  • 【LLMO論文解説】質問の裏の需要をAIで推し量り、生成AIの回答で目立つ文章に書き換える手法|Mind Reader(ACL 2026)

この記事を書いた人

中野輝規のアバター 中野輝規

合同会社謙虚 代表社員。20代から、売る言葉だけを仕事にしてきました。電話営業で受話器を握っていた時代から、数千社のWEB集客に関わったいままで。詳しいプロフィールはこちら

この著者の記事一覧へ

関連記事

  • AIの要約は検索エンジンの得になるのか、作り手の意欲から理論で試算
    【LLMO論文解説】AIの要約は検索エンジンの得になるのか、作り手の意欲から理論で試算|引用と支払いの設計(NeurIPS 2026と記載)
  • LLMO論文の一覧
    【LLMO論文解説】海外のGEO・LLMO・AIO論文101本の一覧|原論文から最新研究まで、テーマ別に整理(随時更新)
  • AI検索に社名が出る割合は知名度で73%・44%・11%
    【LLMO論文解説】AI検索に社名が出る割合は知名度で73%・44%・11%|5つのAIで102ブランドを測った計測企業の自社報告(プレプリント)
  • AI検索の回答は、中核の論点の約半分を落としていた
    【LLMO論文解説】AI検索の回答は、中核の論点の約半分を落としていた|下位の問いで網羅を測る指標(NAACL 2025)
  • 戦略と評価役を、AIが自分で育て続ける仕組み
    【LLMO論文解説】戦略と評価役を、AIが自分で育て続ける仕組み|AgenticGEOは14手法に勝ち、少ないフィードバックで学習(プレプリント、2026年3月)
  • 画像のキャプションを本文に差し込むと生成検索での見え方は上がるか
    【LLMO論文解説】画像のキャプションを本文に差し込むと生成検索での見え方は上がるか|多峰設定限定で効果あり(ECML PKDD 2026採択)
  • AIの回答を出すと読者の共通の話題が増え、関心は広がった
    【LLMO論文解説】AIの回答を出すと読者の共通の話題が増え、関心は広がった|米国の新聞社サイト内検索で3.7万人の実験(プレプリント)
  • ページに仕込んだ指示はAIの回答まで届くか
    【LLMO論文解説】ページに仕込んだ指示はAIの回答まで届くか|7つの攻撃を検索・並べ替え・回答の3段で測り直した研究(プレプリント)
最近の投稿
  • 温泉の集客は宿泊客と日帰り客の線引きで決まる 掲示ルールに沿うページの作り方
  • デザイナーの集客は作品集だけでは届かない 発注担当が社内で通せるサイトの作り方
  • 屋根の集客は見えない屋根を見せる会社が選ばれる 点検商法と疑われないサイトの作り方
  • 遺品整理の集客は遺族の迷いに先回りして決まる 広告頼みから指名へ移るサイトの作り方
  • 看板の集客は検索した先で決まる 見た人を来店につなぐ受け皿の作り方
最近のコメント
  • ホテルの集客は公式サイトで迷わせないことから 予約サイト頼みを抜ける直し方 に 温泉の集客は宿泊客と日帰り客の線引きで決まる 掲示ルールに沿うページの作り方 - 合同会社謙虚 より
  • 外壁塗装の集客は急がせない会社が選ばれる 下請けを抜けて直接の依頼を増やすホームページの作り方 に 屋根の集客は見えない屋根を見せる会社が選ばれる 点検商法と疑われないサイトの作り方 - 合同会社謙虚 より
  • 不用品回収の集客は料金の見せ方で決まる 当日の追加請求を疑われない業者のサイトの作り方 に 遺品整理の集客は遺族の迷いに先回りして決まる 広告頼みから指名へ移るサイトの作り方 - 合同会社謙虚 より
  • 外壁塗装の集客は急がせない会社が選ばれる 下請けを抜けて直接の依頼を増やすホームページの作り方 に 看板の集客は検索した先で決まる 見た人を来店につなぐ受け皿の作り方 - 合同会社謙虚 より
  • 【LLMO論文解説】回答が似ていても出典は重ならない|BaiduとGoogleのAI要約を英語と中国語の500問で監査(EMNLP 2026ワークショップ) に 【LLMO論文解説】海外のGEO・LLMO・AIO論文101本の一覧|原論文から最新研究まで、テーマ別に整理(随時更新) - 合同会社謙虚 より
  • 記事制作(KCW)
  • 売れるサイトはみな謙虚
  • サービス一覧
  • サイトの無料診断
  • 合同会社謙虚とは
  • 代表プロフィール
  • ブログ
  • お問い合わせ
  • プライバシーポリシー
  • 特定商取引法に基づく表記

© 合同会社謙虚

目次