AIに質問すると、回答の下に出典のリンクが並びます。その出典のページ自体が、AIで書かれたものだったらどうでしょうか。
ノースウェスタン大学の研究者2人が2026年5月に公開した論文は、ChatGPT、Copilot、Gemini、Perplexityの4つに712の質問を投げ、引用されたページの本文をAI文章の検出ツールにかけました。
この記事では原文をもとに、AIが書いたページをどう判定したか(使った検出ツール、誤判定の率、人の目による確認の範囲)、調査の規模、何が分かって何が分かっていないかを整理します。とくに「AIで書いた記事は引用されやすいのか、されにくいのか」という問いに、この論文がどこまで答えているかを確かめます。
合同会社謙虚は、3つのドメインを並行して運用し、何を変えると数字が動くかを測り続けています。私たちもAIを使って記事を作っているので、AI検索がAIの書いたページをどの程度引用しているのか、そしてその数字がどこまで確かなのかを、原文で確かめておく必要がありました。
結論:3行で言うと
- 4つのAI検索が引用し、本文を取得できた1万9,154件のページのうち、約16%(3,056件)を検出ツールが「AI生成」と判定しました。4つのAIすべてで見つかっています
- この16%は、検出ツール1種類だけで判定した値です。論文は、AI生成と報じられたサイトの記事で約3割を見逃した点を踏まえ、実際より少なめに出る「下限の目安」として扱うよう求めています
- 論文が測ったのは「引用された出典の中の割合」までです。AI生成のページが引用されやすいか、されにくいかの比較は、対象外です。相関も因果も、この論文の範囲の外にあります
この論文の基本情報
| 項目 | 内容 |
|---|---|
| 題名(原題) | Synthetic Sources?: Auditing Generative Search Engine Citations for Evidence of AI-Generated Sources |
| 著者 | モワファク・アラハム、ニコラス・ディアコプロス(2人ともノースウェスタン大学) |
| 公開日 | 2026年5月22日(arXiv初版) |
| arXiv番号 | 2605.23684(分類は情報検索) |
| 掲載・採択状況 | arXivのプレプリント。コメント欄は「本文11ページと付録」だけで、学会・論文誌への採択の記載は確認できず、査読前の段階と読めます。書式は人工知能の学会の様式ですが、それだけで採択されたと判断するのは早計です |
| 種類 | 大学の研究者による監査(実際のAIサービスの回答と引用を集めて分析する観察研究) |
| 実験データとコード | 公開先の記載は本文に見当たりませんでした |
論文はこちらで読めます。arXiv(2605.23684)、DOI(10.48550/arXiv.2605.23684)。
この論文が答えた問い
AI検索は、どんなサイトのページを出典にしているのか。そして、その出典にAIが生成したページはどれだけ含まれているのか。
背景には、ウェブ上にAIで作られた文章が急に増えたことがあります。AI検索が回答の根拠として示すページがAIの書いたものなら、利用者は、公的機関の資料と同じ重みでそれを受け取ってしまうおそれがあります。
論文は、AIの文章がすべて低品質だとは限らないと断ったうえで、AIには偏りや作り話(ハルシネーション)の問題があるため、まず「どれだけ混ざっているか」を測る必要があると述べています。
どうやって調べたのか
調査の規模
| 項目 | 内容 |
|---|---|
| AI検索 | 4つ。ChatGPT(ウェブ検索を有効にした状態)、Copilot、Gemini、Perplexity。いずれも利用者と同じ画面から質問した |
| 質問 | 712問。政治175、健康257、環境280。すべて英語で、米国に関係する内容に絞った |
| 質問の出どころ | 政治と健康は、複数のAI検索を比べる公開の場で実際の利用者が送った質問の記録(2025年3〜5月に収集)から選んだ。環境は、気候の質問に答えるチャットボットに寄せられた質問の記録から選んだ |
| 回答 | 2,848件(712問×4つのAI、1問1回) |
| 引用されたページ | 2万6,266件(重複を除いたURL)、7,675のサイト |
| 本文を取得できたページ | 1万9,154件(72.9%)、6,258のサイト。PDF、画像、動画、削除済みのページなどは取得できず、分析から外れた |
| 調査の時期 | 質問を投げた時期は、本文に記載がなく不明です |
画面から質問したのは、プログラム向けの接続口(API)から聞いた回答と、画面に出る回答が違うという先行研究があるためです。回答が出きるのを待ち、出典のボタンを押して、表示された引用だけを集めています。
AIが書いたページの判定方法
判定には、市販のAI文章検出ツールを使いました。この記事では、本調査で使ったものを「検出ツールA」、比較に使ったものを「検出ツールB」と呼びます。
Aは大量の人間とAIの文章で学習させた判定モデル、Bは階層型の判定モデルと説明されています。
論文は、どちらを使うかを決める前に、3つの性能テストをしています。
| テスト | 中身 | 結果 |
|---|---|---|
| 1. 人間の文章 | AIが普及する前(2022年より前)に公開された200件。研究の要約、ウィキペディア、掲示板の投稿、ニュース記事を50件ずつ | A・Bとも全件を「人間」と判定。誤ってAIと判定した率は0% |
| 2. AIの文章 | 新しいAIモデル3つ(GPT-5.3、Gemini-3、Claude Haiku 4.5)に、同じ4種類の文章を書かせた200件 | A・Bとも全件を「AI」と判定 |
| 3. 実際のウェブ記事 | 記者や専門家が「AIで量産している」と報じた7つのサイトから、直近6か月の記事を15件ずつ、計105件 | AI判定は(「混在」を点数でAIか人間に振り分けた後)Aが72件(振り分け前は58件)、Bが73件。すべてAI生成と仮定すると、見逃し率はA 31.4%、B 約30.4%。2つの判定の一致は82%(105件中19件で不一致) |
ツールの提供元は、人間の文章を誤ってAIと判定する率を「約1万件に1件」と公表しており、テスト1の結果はこれと大きく矛盾しないと論文は書いています。
本調査にはAを選びました。理由は、見逃し率がわずかに高いほうを使えば、AI生成の割合を多めに見積もる心配が減り、「少なくともこれだけはある」という下限として示せるからです。
ここで注意したいのは、テスト3の「105件すべてがAI生成」という前提です。論文自身が、この前提は報道にもとづく妥当な仮定であって、それ以上は確かめられないと書いています。
判定の区分と、数え方
本調査では、ツールAが各ページを4つの区分に分けました。「AIの可能性が非常に高い」「AIの可能性が高い」「AIの可能性あり」「AIの可能性は低い」です。
論文は、上の2つを「AI生成」として数えました。「AIの可能性あり」は、AIとの共同執筆なのか、判定の迷いなのかが読み取れないため、分析から外しています。
人の目による確認は、AI生成と判定された200件のページについて、「AIを使った」という表示があるかを調べた範囲です。表示のあるページは1件もありませんでした。
一方で、判定そのものの正しさを人が1件ずつ確かめる工程は、論文の手順に書かれていない点に注意が要ります。
結果
引用元の約16%が「AI生成」と判定された
| ツールAの判定 | 件数 | 割合 |
|---|---|---|
| AIの可能性は低い | 15,815 | 82.5% |
| AIの可能性が非常に高い | 2,916 | 15.2% |
| AIの可能性あり(分析から除外) | 283 | 1.4% |
| AIの可能性が高い | 140 | 0.7% |
| 合計(本文を取得できたページ) | 19,154 | 100% |
「非常に高い」と「高い」を合わせた3,056件が、論文のいう約16%です(3,056÷19,154で、私の計算では概算16.0%)。分母は本文を取得できたページで、引用された全ページ(2万6,266件)の72.9%にあたります。
AIごと、話題ごとの割合
| 区分 | AI生成と判定された件数 | 論文が示した割合 |
|---|---|---|
| Copilot | 1,614 | 27.8% |
| Gemini | 782 | 14.7% |
| Perplexity | 472 | 9.4% |
| ChatGPT | 765 | 7.3% |
| 健康の質問 | 1,408 | 16.3% |
| 環境の質問 | 1,633 | 13.3% |
| 政治の質問 | 592 | 11.1% |
- AIごとの割合は、論文の説明では、それぞれのAIが引用したページ数に対する比率です。Copilotは、健康・環境・政治のどの話題でも、4つの中で最も多くAI生成のページを引用していました
- 話題ごとの割合は、その話題で引用された全ページ(本文を取得できなかったものも含む)が分母です。全体の16%とは分母が違うので、横に並べて比べるときは注意が要ります
- 件数を足すと3,633件になり、全体の3,056件より多くなります。複数のAIが同じページを引用した場合に、重ねて数えていると読めます
引用は一部のサイトに集まり、AI生成のページは「その他大勢」の側にあった
- 引用されたサイトの偏りを示す指数(ジニ係数、0なら均等、1なら一極集中)は、4つのAI全体で0.68でした。ChatGPTが0.648で最も偏り、Copilotが0.492で最も分散していました
- よく引用された上位25サイトで、引用全体の23.8%を占めました。上位にはウィキペディア、米国の政府機関、国際機関、学術出版のサイトが並び、政府系だけで上位25サイトの引用の33.0%でした
- 一方で、引用されたサイトの59.1%は1回だけ、16.5%は2回だけの引用でした。回答の根拠の多くは、ほとんど名前の知られていない多数のサイトから来ています
- AI生成と判定されたページの97.1%は、上位25サイト以外から来ていました
- AI生成のページを1件以上引用されたサイトは1,754で、分析対象のサイトの28.0%です。そのうち66.2%は1件だけでした
付録の表には、引用されたページがすべてAI生成と判定されたサイトが多く並びます。環境や健康を扱う小規模なサイトが中心で、1つのサイトから62件が引用され、そのすべてがAI生成と判定された例もありました。
自らを「AIを使った調査ツール」と名乗り、「完璧か?いいえ」とトップページに書いているサイトも、政治の質問で引用されていました。
公的なサイトでもAI生成の判定は出ています。米国の国立衛生研究所が運営する論文アーカイブでは、引用された1,078件のうち44件(4.1%)でした。
論文は、これが質の高いAIの文章なのか低いものなのかは分からないと書いています。
出典を付けない回答もあった
2,848件の回答のうち252件(8.8%)には出典が付いていませんでした。健康の質問では11.6%で、論文はAIが検索せずに学習済みの知識だけで答えている可能性を指摘しています。
論文自身が書いている限界
- 判定は検出ツールA1つだけによるもので、別のツールを使えば割合は変わり得ます。研究者は結果を下限として示すか、複数のツールを組み合わせるべきだと論文は勧めています
- ツールの性能テストは、報道で確認されたニュース系のサイトが中心です。学術系のブログや政府のサイトなど、ほかの種類の文章での性能確認は、今後の課題としています
- ウェブ上のページにはAI利用の表示がほとんどないため、完全にAIが書いたのか、人が誤字の修正などにAIを使っただけなのかを見分けるのは難しいとしています
- 質問は英語だけで、米国に関係するものに絞りました。ほかの地域や言語には、その地域の情報環境の専門知識が要るとしています
- 質問は1回きりのやりとりだけです。会話を続けたときの引用の調査は、今後の課題です
- 元の質問データには偏りがあり、環境の質問は別のデータから補いました
- PDF、画像、動画などの出典(取得できなかったページ)は分析の対象外です
- 調べた4つのAIには政治的に左寄りの傾向が指摘されており、価値観の違う別のAIには、そのまま当てはまらない可能性があるとしています
原文を読んで気づいた点
- 日本語での検証はありません。質問も判定も英語だけです。日本語の文章に対する検出ツールの精度も、この論文の範囲外です
- 「引用されやすさ」との関係は、測定の対象外です。比べる相手(検索で候補に挙がったが引用されなかったページや、ウェブ全体でのAI生成の割合)がないので、AI生成だと引用されやすい、されにくいのどちらも言えない設計です
- 本文には16%のほか、限界の節に「出典のおよそ5件に1件がAI生成」という表現があります。16%はおよそ6件に1件にあたり、数字の間で食い違いがあります
- 序論と結果の節の文章は「環境の質問で最も多かった」としていますが、結果の数字では健康16.3%、環境13.3%で、健康のほうが高くなっています。件数では環境が最多です
- AIごとの割合の分母があいまいです。表1の引用数で割って本文の割合と合うのはChatGPT(1万453件で7.3%)だけで、Copilot(6,007件で概算26.9%、本文27.8%)、Gemini(概算15.1%、本文14.7%)、Perplexity(概算8.4%、本文9.4%)はずれます
- 性能テストでは「混在」の区分を点数でAIか人間に振り分けたのに対し、本調査では「AIの可能性あり」を除外しています。テストと本調査で、中間の区分の扱い方が違います
- ページ本文の抽出は自動のツールで行っているため、ページのメニューや定型文が混ざった状態で判定された可能性があります。論文にはこの点の検討がなく、私の推測にとどまります
- arXivのプレプリントで、査読を経たかどうかは原文から確認できない段階です。調査した時期も書かれていないので、いまのAI検索で同じ割合になるかは未確認です
この論文から、言えること・言えないこと
| 言えること(論文の設定で確認された) | 言えないこと(論文では確認されていない) |
|---|---|
| 4つのAI検索すべてが、AI生成と判定されたページを出典にしていた | AI生成のページのほうが引用されやすい、または引用されにくいこと |
| 英語・米国向けの政治、健康、環境の質問で、取得できた引用元の約16%がAI生成と判定された | 日本語の質問や、日本のサイトでも同じ割合になること |
| AI生成と判定されたページの大半は、引用の少ない多数のサイトから来ていた | AI生成と判定されたページの中身が、実際に誤っていたこと(正確さは評価していない) |
| 判定したページに、AI利用の表示は見つからなかった(200件を確認) | 判定の1件1件が正しいこと(人による判定の検証はしていない) |
| AIによって、AI生成のページを引用する割合に差があった | その差が、AIの仕組みの違いによるものだという因果 |
中小企業の視点で、どう受け取るか
ここからは論文の主張とは別の、私の読み取りです。論文の提言は、AI検索の開発者と、そのリスクを評価する人に向けたものです。
AIで書いた記事が引用されるかどうかは、この論文の範囲外
英語圏の調査では、AI生成と判定されたページもふつうに出典になっていました。かといって、AIで書けば有利だという根拠として使うのも誤りです。
この論文は割合を数えただけで、引用のされやすさを比べていないからです。記事の作り方を決めるときは、この論文を「どちらの証拠にもならない」ものとして扱うのが妥当だと考えます。
この先、AI生成のページが絞り込まれる可能性
論文は、この調査結果が、AI生成の出典を見つけ、場合によっては外すような管理の取り組みに役立ち得ると述べています。結論の節で明示している方策は、透明性を高めることです。
これは提案であって、いま起きていることの観察とは別です。ただ、その方向に進んだ場合でも残りやすいのは、自社でしか書けない事実(価格、手順、実績の数字、現場の写真の説明など)を人が確かめて載せたページだろう、と私は読んでいます。
検出ツールの判定は、品質の証明とは別物
実際のウェブ記事のテストでは、検出ツールは約3割を見逃しました。判定は「AIが書いたか」を推定するもので、内容の正しさは判定の対象外です。
AIを使って書いた記事は、検出ツールの結果より、書かれている数字や固有名詞を元の資料と照らす作業のほうに時間をかけるべきだと考えます。
小さなサイトも出典になっている
引用されたサイトの6割近くは1回だけの引用でした。英語圏では、名の知れた大サイトでなくても出典に入る余地があることを示しています。
同時に、そこはAIで量産されたページと並ぶ場所でもあります。
よくある質問
AI検索の出典の約16%がAI生成という数字は、日本語の検索にも当てはまりますか
分かりません。この論文は、英語で、米国に関係する政治・健康・環境の質問だけを調べています。
日本語の文章に対する検出ツールの精度も、この論文の範囲外です。日本語での割合を知るには、別の調査が必要です。
AI文章の検出ツールで、生成検索の出典がAI製かどうかを正確に見分けられるのですか
論文のテストでは、2022年より前の人間の文章200件を誤ってAIと判定することはありませんでした。一方、AIで量産していると報じられたサイトの記事では約3割を見逃しています。
論文は、16%を「少なくともこれだけ」という下限の目安として読むよう求めています。
AIで書いた記事は、生成検索に引用されにくくなりますか
この論文からは判断できません。引用された出典の中の割合を数えた研究で、引用されなかったページとの比較をしていないためです。
AI生成の出典を見つけて場合によっては外す取り組みに役立ち得る、という論文の記述はありますが、実際に外されているという観察結果とは別の話です。
まとめ:今日できる1つのこと
AIを使って書いた自社の記事を1本開き、数字、日付、固有名詞に印を付けてください。それぞれを元の資料と照らし、確かめられたものだけを残します。
自社でしか書けない事実が1つもなければ、担当者に聞いて1つ足します。AI検索がこの先どんな出典を選ぶようになっても、人が確かめた一次情報は、読者にとって価値のある部分として残ります。
この論文は、LLMO論文の一覧の一本です。ほかの論文の解説も、順次公開しています。
この記事に書いたことを、そのまま御社のページに
生成AIに引用されるページを、お話しいただくだけでお作りします。お時間をいただくのは初回15分のヒアリングだけです。まず1ページ、無料でお作りします。
OKが出るまで、何度でも直します。事実が違う、言い回しが硬い、この話は入れないでほしい。どれも遠慮なくおっしゃってください。何度お直ししても、追加の料金はいただきません。
これまでに127社にご利用いただきました。毎月ご依頼いただいている方の6割以上が、月10ページを選ばれています。料金はページに掲載しています。
ページを増やしても問い合わせが来ないなら、原因はページの外にあります。その場合は、下の入口からご相談ください。
自社のマーケティング課題を根本から解決しませんか?
ウェブサイトから要素を引き算し、訪れた人が迷わず次の一歩に進む形へ組み直す。初回60分のオンラインで御社のサイトを一緒に読み、どこから直すべきかをお伝えします。手順をまとめた無料の診断と解説動画もご用意しています。
初回は無料・60分・オンライン完結・その場で契約のお願いはいたしません


