MENU
  • 料金
  • 会社案内
  • コンサル
  • お問い合わせ
  • 無料で1ページ頼む
AIO・LLMO・GEO対策の記事制作
合同会社謙虚
  • 料金
  • 会社案内
  • コンサル
  • お問い合わせ
  • 無料で1ページ頼む
  • 料金
  • 会社案内
  • コンサル
  • お問い合わせ
  • 無料で1ページ頼む
合同会社謙虚
  • 料金
  • 会社案内
  • コンサル
  • お問い合わせ
  • 無料で1ページ頼む
  1. ホーム
  2. LLMO
  3. LLMO論文
  4. 【LLMO論文解説】AI検索の出典の約16%はAI生成と判定|4つのAI・712問の引用を検出ツールで監査(プレプリント2026)

【LLMO論文解説】AI検索の出典の約16%はAI生成と判定|4つのAI・712問の引用を検出ツールで監査(プレプリント2026)

2026 9/30
2026年9月25日2026年9月30日
中野輝規
AI検索の出典の約16%はAI生成と判定

AIに質問すると、回答の下に出典のリンクが並びます。その出典のページ自体が、AIで書かれたものだったらどうでしょうか。

ノースウェスタン大学の研究者2人が2026年5月に公開した論文は、ChatGPT、Copilot、Gemini、Perplexityの4つに712の質問を投げ、引用されたページの本文をAI文章の検出ツールにかけました。

この記事では原文をもとに、AIが書いたページをどう判定したか(使った検出ツール、誤判定の率、人の目による確認の範囲)、調査の規模、何が分かって何が分かっていないかを整理します。とくに「AIで書いた記事は引用されやすいのか、されにくいのか」という問いに、この論文がどこまで答えているかを確かめます。

合同会社謙虚は、3つのドメインを並行して運用し、何を変えると数字が動くかを測り続けています。私たちもAIを使って記事を作っているので、AI検索がAIの書いたページをどの程度引用しているのか、そしてその数字がどこまで確かなのかを、原文で確かめておく必要がありました。

目次

結論:3行で言うと

  • 4つのAI検索が引用し、本文を取得できた1万9,154件のページのうち、約16%(3,056件)を検出ツールが「AI生成」と判定しました。4つのAIすべてで見つかっています
  • この16%は、検出ツール1種類だけで判定した値です。論文は、AI生成と報じられたサイトの記事で約3割を見逃した点を踏まえ、実際より少なめに出る「下限の目安」として扱うよう求めています
  • 論文が測ったのは「引用された出典の中の割合」までです。AI生成のページが引用されやすいか、されにくいかの比較は、対象外です。相関も因果も、この論文の範囲の外にあります

この論文の基本情報

項目 内容
題名(原題) Synthetic Sources?: Auditing Generative Search Engine Citations for Evidence of AI-Generated Sources
著者 モワファク・アラハム、ニコラス・ディアコプロス(2人ともノースウェスタン大学)
公開日 2026年5月22日(arXiv初版)
arXiv番号 2605.23684(分類は情報検索)
掲載・採択状況 arXivのプレプリント。コメント欄は「本文11ページと付録」だけで、学会・論文誌への採択の記載は確認できず、査読前の段階と読めます。書式は人工知能の学会の様式ですが、それだけで採択されたと判断するのは早計です
種類 大学の研究者による監査(実際のAIサービスの回答と引用を集めて分析する観察研究)
実験データとコード 公開先の記載は本文に見当たりませんでした

論文はこちらで読めます。arXiv(2605.23684)、DOI(10.48550/arXiv.2605.23684)。

この論文が答えた問い

AI検索は、どんなサイトのページを出典にしているのか。そして、その出典にAIが生成したページはどれだけ含まれているのか。

背景には、ウェブ上にAIで作られた文章が急に増えたことがあります。AI検索が回答の根拠として示すページがAIの書いたものなら、利用者は、公的機関の資料と同じ重みでそれを受け取ってしまうおそれがあります。

論文は、AIの文章がすべて低品質だとは限らないと断ったうえで、AIには偏りや作り話(ハルシネーション)の問題があるため、まず「どれだけ混ざっているか」を測る必要があると述べています。

どうやって調べたのか

調査の規模

項目 内容
AI検索 4つ。ChatGPT(ウェブ検索を有効にした状態)、Copilot、Gemini、Perplexity。いずれも利用者と同じ画面から質問した
質問 712問。政治175、健康257、環境280。すべて英語で、米国に関係する内容に絞った
質問の出どころ 政治と健康は、複数のAI検索を比べる公開の場で実際の利用者が送った質問の記録(2025年3〜5月に収集)から選んだ。環境は、気候の質問に答えるチャットボットに寄せられた質問の記録から選んだ
回答 2,848件(712問×4つのAI、1問1回)
引用されたページ 2万6,266件(重複を除いたURL)、7,675のサイト
本文を取得できたページ 1万9,154件(72.9%)、6,258のサイト。PDF、画像、動画、削除済みのページなどは取得できず、分析から外れた
調査の時期 質問を投げた時期は、本文に記載がなく不明です

画面から質問したのは、プログラム向けの接続口(API)から聞いた回答と、画面に出る回答が違うという先行研究があるためです。回答が出きるのを待ち、出典のボタンを押して、表示された引用だけを集めています。

AIが書いたページの判定方法

判定には、市販のAI文章検出ツールを使いました。この記事では、本調査で使ったものを「検出ツールA」、比較に使ったものを「検出ツールB」と呼びます。

Aは大量の人間とAIの文章で学習させた判定モデル、Bは階層型の判定モデルと説明されています。

論文は、どちらを使うかを決める前に、3つの性能テストをしています。

テスト 中身 結果
1. 人間の文章 AIが普及する前(2022年より前)に公開された200件。研究の要約、ウィキペディア、掲示板の投稿、ニュース記事を50件ずつ A・Bとも全件を「人間」と判定。誤ってAIと判定した率は0%
2. AIの文章 新しいAIモデル3つ(GPT-5.3、Gemini-3、Claude Haiku 4.5)に、同じ4種類の文章を書かせた200件 A・Bとも全件を「AI」と判定
3. 実際のウェブ記事 記者や専門家が「AIで量産している」と報じた7つのサイトから、直近6か月の記事を15件ずつ、計105件 AI判定は(「混在」を点数でAIか人間に振り分けた後)Aが72件(振り分け前は58件)、Bが73件。すべてAI生成と仮定すると、見逃し率はA 31.4%、B 約30.4%。2つの判定の一致は82%(105件中19件で不一致)

ツールの提供元は、人間の文章を誤ってAIと判定する率を「約1万件に1件」と公表しており、テスト1の結果はこれと大きく矛盾しないと論文は書いています。

本調査にはAを選びました。理由は、見逃し率がわずかに高いほうを使えば、AI生成の割合を多めに見積もる心配が減り、「少なくともこれだけはある」という下限として示せるからです。

ここで注意したいのは、テスト3の「105件すべてがAI生成」という前提です。論文自身が、この前提は報道にもとづく妥当な仮定であって、それ以上は確かめられないと書いています。

判定の区分と、数え方

本調査では、ツールAが各ページを4つの区分に分けました。「AIの可能性が非常に高い」「AIの可能性が高い」「AIの可能性あり」「AIの可能性は低い」です。

論文は、上の2つを「AI生成」として数えました。「AIの可能性あり」は、AIとの共同執筆なのか、判定の迷いなのかが読み取れないため、分析から外しています。

人の目による確認は、AI生成と判定された200件のページについて、「AIを使った」という表示があるかを調べた範囲です。表示のあるページは1件もありませんでした。

一方で、判定そのものの正しさを人が1件ずつ確かめる工程は、論文の手順に書かれていない点に注意が要ります。

結果

引用元の約16%が「AI生成」と判定された

ツールAの判定 件数 割合
AIの可能性は低い 15,815 82.5%
AIの可能性が非常に高い 2,916 15.2%
AIの可能性あり(分析から除外) 283 1.4%
AIの可能性が高い 140 0.7%
合計(本文を取得できたページ) 19,154 100%

「非常に高い」と「高い」を合わせた3,056件が、論文のいう約16%です(3,056÷19,154で、私の計算では概算16.0%)。分母は本文を取得できたページで、引用された全ページ(2万6,266件)の72.9%にあたります。

AIごと、話題ごとの割合

区分 AI生成と判定された件数 論文が示した割合
Copilot 1,614 27.8%
Gemini 782 14.7%
Perplexity 472 9.4%
ChatGPT 765 7.3%
健康の質問 1,408 16.3%
環境の質問 1,633 13.3%
政治の質問 592 11.1%
  • AIごとの割合は、論文の説明では、それぞれのAIが引用したページ数に対する比率です。Copilotは、健康・環境・政治のどの話題でも、4つの中で最も多くAI生成のページを引用していました
  • 話題ごとの割合は、その話題で引用された全ページ(本文を取得できなかったものも含む)が分母です。全体の16%とは分母が違うので、横に並べて比べるときは注意が要ります
  • 件数を足すと3,633件になり、全体の3,056件より多くなります。複数のAIが同じページを引用した場合に、重ねて数えていると読めます

引用は一部のサイトに集まり、AI生成のページは「その他大勢」の側にあった

  • 引用されたサイトの偏りを示す指数(ジニ係数、0なら均等、1なら一極集中)は、4つのAI全体で0.68でした。ChatGPTが0.648で最も偏り、Copilotが0.492で最も分散していました
  • よく引用された上位25サイトで、引用全体の23.8%を占めました。上位にはウィキペディア、米国の政府機関、国際機関、学術出版のサイトが並び、政府系だけで上位25サイトの引用の33.0%でした
  • 一方で、引用されたサイトの59.1%は1回だけ、16.5%は2回だけの引用でした。回答の根拠の多くは、ほとんど名前の知られていない多数のサイトから来ています
  • AI生成と判定されたページの97.1%は、上位25サイト以外から来ていました
  • AI生成のページを1件以上引用されたサイトは1,754で、分析対象のサイトの28.0%です。そのうち66.2%は1件だけでした

付録の表には、引用されたページがすべてAI生成と判定されたサイトが多く並びます。環境や健康を扱う小規模なサイトが中心で、1つのサイトから62件が引用され、そのすべてがAI生成と判定された例もありました。

自らを「AIを使った調査ツール」と名乗り、「完璧か?いいえ」とトップページに書いているサイトも、政治の質問で引用されていました。

公的なサイトでもAI生成の判定は出ています。米国の国立衛生研究所が運営する論文アーカイブでは、引用された1,078件のうち44件(4.1%)でした。

論文は、これが質の高いAIの文章なのか低いものなのかは分からないと書いています。

出典を付けない回答もあった

2,848件の回答のうち252件(8.8%)には出典が付いていませんでした。健康の質問では11.6%で、論文はAIが検索せずに学習済みの知識だけで答えている可能性を指摘しています。

論文自身が書いている限界

  • 判定は検出ツールA1つだけによるもので、別のツールを使えば割合は変わり得ます。研究者は結果を下限として示すか、複数のツールを組み合わせるべきだと論文は勧めています
  • ツールの性能テストは、報道で確認されたニュース系のサイトが中心です。学術系のブログや政府のサイトなど、ほかの種類の文章での性能確認は、今後の課題としています
  • ウェブ上のページにはAI利用の表示がほとんどないため、完全にAIが書いたのか、人が誤字の修正などにAIを使っただけなのかを見分けるのは難しいとしています
  • 質問は英語だけで、米国に関係するものに絞りました。ほかの地域や言語には、その地域の情報環境の専門知識が要るとしています
  • 質問は1回きりのやりとりだけです。会話を続けたときの引用の調査は、今後の課題です
  • 元の質問データには偏りがあり、環境の質問は別のデータから補いました
  • PDF、画像、動画などの出典(取得できなかったページ)は分析の対象外です
  • 調べた4つのAIには政治的に左寄りの傾向が指摘されており、価値観の違う別のAIには、そのまま当てはまらない可能性があるとしています

原文を読んで気づいた点

  • 日本語での検証はありません。質問も判定も英語だけです。日本語の文章に対する検出ツールの精度も、この論文の範囲外です
  • 「引用されやすさ」との関係は、測定の対象外です。比べる相手(検索で候補に挙がったが引用されなかったページや、ウェブ全体でのAI生成の割合)がないので、AI生成だと引用されやすい、されにくいのどちらも言えない設計です
  • 本文には16%のほか、限界の節に「出典のおよそ5件に1件がAI生成」という表現があります。16%はおよそ6件に1件にあたり、数字の間で食い違いがあります
  • 序論と結果の節の文章は「環境の質問で最も多かった」としていますが、結果の数字では健康16.3%、環境13.3%で、健康のほうが高くなっています。件数では環境が最多です
  • AIごとの割合の分母があいまいです。表1の引用数で割って本文の割合と合うのはChatGPT(1万453件で7.3%)だけで、Copilot(6,007件で概算26.9%、本文27.8%)、Gemini(概算15.1%、本文14.7%)、Perplexity(概算8.4%、本文9.4%)はずれます
  • 性能テストでは「混在」の区分を点数でAIか人間に振り分けたのに対し、本調査では「AIの可能性あり」を除外しています。テストと本調査で、中間の区分の扱い方が違います
  • ページ本文の抽出は自動のツールで行っているため、ページのメニューや定型文が混ざった状態で判定された可能性があります。論文にはこの点の検討がなく、私の推測にとどまります
  • arXivのプレプリントで、査読を経たかどうかは原文から確認できない段階です。調査した時期も書かれていないので、いまのAI検索で同じ割合になるかは未確認です

この論文から、言えること・言えないこと

言えること(論文の設定で確認された) 言えないこと(論文では確認されていない)
4つのAI検索すべてが、AI生成と判定されたページを出典にしていた AI生成のページのほうが引用されやすい、または引用されにくいこと
英語・米国向けの政治、健康、環境の質問で、取得できた引用元の約16%がAI生成と判定された 日本語の質問や、日本のサイトでも同じ割合になること
AI生成と判定されたページの大半は、引用の少ない多数のサイトから来ていた AI生成と判定されたページの中身が、実際に誤っていたこと(正確さは評価していない)
判定したページに、AI利用の表示は見つからなかった(200件を確認) 判定の1件1件が正しいこと(人による判定の検証はしていない)
AIによって、AI生成のページを引用する割合に差があった その差が、AIの仕組みの違いによるものだという因果

中小企業の視点で、どう受け取るか

ここからは論文の主張とは別の、私の読み取りです。論文の提言は、AI検索の開発者と、そのリスクを評価する人に向けたものです。

AIで書いた記事が引用されるかどうかは、この論文の範囲外

英語圏の調査では、AI生成と判定されたページもふつうに出典になっていました。かといって、AIで書けば有利だという根拠として使うのも誤りです。

この論文は割合を数えただけで、引用のされやすさを比べていないからです。記事の作り方を決めるときは、この論文を「どちらの証拠にもならない」ものとして扱うのが妥当だと考えます。

この先、AI生成のページが絞り込まれる可能性

論文は、この調査結果が、AI生成の出典を見つけ、場合によっては外すような管理の取り組みに役立ち得ると述べています。結論の節で明示している方策は、透明性を高めることです。

これは提案であって、いま起きていることの観察とは別です。ただ、その方向に進んだ場合でも残りやすいのは、自社でしか書けない事実(価格、手順、実績の数字、現場の写真の説明など)を人が確かめて載せたページだろう、と私は読んでいます。

検出ツールの判定は、品質の証明とは別物

実際のウェブ記事のテストでは、検出ツールは約3割を見逃しました。判定は「AIが書いたか」を推定するもので、内容の正しさは判定の対象外です。

AIを使って書いた記事は、検出ツールの結果より、書かれている数字や固有名詞を元の資料と照らす作業のほうに時間をかけるべきだと考えます。

小さなサイトも出典になっている

引用されたサイトの6割近くは1回だけの引用でした。英語圏では、名の知れた大サイトでなくても出典に入る余地があることを示しています。

同時に、そこはAIで量産されたページと並ぶ場所でもあります。

よくある質問

AI検索の出典の約16%がAI生成という数字は、日本語の検索にも当てはまりますか

分かりません。この論文は、英語で、米国に関係する政治・健康・環境の質問だけを調べています。

日本語の文章に対する検出ツールの精度も、この論文の範囲外です。日本語での割合を知るには、別の調査が必要です。

AI文章の検出ツールで、生成検索の出典がAI製かどうかを正確に見分けられるのですか

論文のテストでは、2022年より前の人間の文章200件を誤ってAIと判定することはありませんでした。一方、AIで量産していると報じられたサイトの記事では約3割を見逃しています。

論文は、16%を「少なくともこれだけ」という下限の目安として読むよう求めています。

AIで書いた記事は、生成検索に引用されにくくなりますか

この論文からは判断できません。引用された出典の中の割合を数えた研究で、引用されなかったページとの比較をしていないためです。

AI生成の出典を見つけて場合によっては外す取り組みに役立ち得る、という論文の記述はありますが、実際に外されているという観察結果とは別の話です。

まとめ:今日できる1つのこと

AIを使って書いた自社の記事を1本開き、数字、日付、固有名詞に印を付けてください。それぞれを元の資料と照らし、確かめられたものだけを残します。

自社でしか書けない事実が1つもなければ、担当者に聞いて1つ足します。AI検索がこの先どんな出典を選ぶようになっても、人が確かめた一次情報は、読者にとって価値のある部分として残ります。

この論文は、LLMO論文の一覧の一本です。ほかの論文の解説も、順次公開しています。

この記事に書いたことを、そのまま御社のページに

生成AIに引用されるページを、お話しいただくだけでお作りします。お時間をいただくのは初回15分のヒアリングだけです。まず1ページ、無料でお作りします。

OKが出るまで、何度でも直します。事実が違う、言い回しが硬い、この話は入れないでほしい。どれも遠慮なくおっしゃってください。何度お直ししても、追加の料金はいただきません。

これまでに127社にご利用いただきました。毎月ご依頼いただいている方の6割以上が、月10ページを選ばれています。料金はページに掲載しています。

まず1ページ、無料で作らせてください

ページを増やしても問い合わせが来ないなら、原因はページの外にあります。その場合は、下の入口からご相談ください。

自社のマーケティング課題を根本から解決しませんか?

ウェブサイトから要素を引き算し、訪れた人が迷わず次の一歩に進む形へ組み直す。初回60分のオンラインで御社のサイトを一緒に読み、どこから直すべきかをお伝えします。手順をまとめた無料の診断と解説動画もご用意しています。

まず動画で詳しく見る(約30分)
無料診断を受ける

初回は無料・60分・オンライン完結・その場で契約のお願いはいたしません

LLMO論文
SEO対策 生成AI
よかったらシェアしてね!
  • URLをコピーしました!
  • 【LLMO論文解説】質問の裏の需要をAIで推し量り、生成AIの回答で目立つ文章に書き換える手法|Mind Reader(ACL 2026)
  • 【LLMO論文解説】AIに買い物を任せる時代のサイト設計の枠組み|試作の通販サイトで完全成功率49.3%→89.3%(ICEME 2026採択と記載)

この記事を書いた人

中野輝規のアバター 中野輝規

合同会社謙虚 代表社員。20代から、売る言葉だけを仕事にしてきました。電話営業で受話器を握っていた時代から、数千社のWEB集客に関わったいままで。詳しいプロフィールはこちら

この著者の記事一覧へ

関連記事

  • 引用されない原因を診断して直す仕組み
    【LLMO論文解説】引用されない原因を診断して直す仕組み|AgentGEOは書き換え5%で引用率が向上(プレプリント、2026年3月)
  • 通常のGoogle・AI Overviews・Geminiは、引用する出典がほとんど重ならない
    【LLMO論文解説】通常のGoogle・AI Overviews・Geminiは、引用する出典がほとんど重ならない|1万1,500問で比べた実測(SIGIR 2026)
  • 質問の裏の需要をAIで推し量り、生成AIの回答で目立つ文章に書き換える手法
    【LLMO論文解説】質問の裏の需要をAIで推し量り、生成AIの回答で目立つ文章に書き換える手法|Mind Reader(ACL 2026)
  • 文書に仕込んだ指示でAIの順位づけは乗っ取られるか
    【LLMO論文解説】文書に仕込んだ指示でAIの順位づけは乗っ取られるか|8モデル・3方式で試した「順位づけの盲点」(EMNLP 2025)
  • 悪意あるGEO攻撃を無害化する二段防御「GEO Defender」
    【LLMO論文解説】悪意あるGEO攻撃を無害化する二段防御「GEO Defender」|攻撃成功率を50%から6%に低減(プレプリント)
  • 回答が似ていても出典は重ならない
    【LLMO論文解説】回答が似ていても出典は重ならない|BaiduとGoogleのAI要約を英語と中国語の500問で監査(EMNLP 2026ワークショップ)
  • 健康の質問でAI要約は誰を出典にするか
    【LLMO論文解説】健康の質問でAI要約は誰を出典にするか|GoogleとBaidu、12か国・4言語1,920件を比較(プレプリント2026)
  • AIが2つのページから先に引用する方を選ぶ条件を25万2千回の実験で調べた論文を原文から読む
    【LLMO論文解説】AIが2つのページから先に引用する方を選ぶ条件を25万2千回の実験で調べた論文を原文から読む|関連性・位置・価格・日付(SIGIR 2026)
最近の投稿
  • 温泉の集客は宿泊客と日帰り客の線引きで決まる 掲示ルールに沿うページの作り方
  • デザイナーの集客は作品集だけでは届かない 発注担当が社内で通せるサイトの作り方
  • 屋根の集客は見えない屋根を見せる会社が選ばれる 点検商法と疑われないサイトの作り方
  • 遺品整理の集客は遺族の迷いに先回りして決まる 広告頼みから指名へ移るサイトの作り方
  • 看板の集客は検索した先で決まる 見た人を来店につなぐ受け皿の作り方
最近のコメント
  • ホテルの集客は公式サイトで迷わせないことから 予約サイト頼みを抜ける直し方 に 温泉の集客は宿泊客と日帰り客の線引きで決まる 掲示ルールに沿うページの作り方 - 合同会社謙虚 より
  • 外壁塗装の集客は急がせない会社が選ばれる 下請けを抜けて直接の依頼を増やすホームページの作り方 に 屋根の集客は見えない屋根を見せる会社が選ばれる 点検商法と疑われないサイトの作り方 - 合同会社謙虚 より
  • 不用品回収の集客は料金の見せ方で決まる 当日の追加請求を疑われない業者のサイトの作り方 に 遺品整理の集客は遺族の迷いに先回りして決まる 広告頼みから指名へ移るサイトの作り方 - 合同会社謙虚 より
  • 外壁塗装の集客は急がせない会社が選ばれる 下請けを抜けて直接の依頼を増やすホームページの作り方 に 看板の集客は検索した先で決まる 見た人を来店につなぐ受け皿の作り方 - 合同会社謙虚 より
  • 【LLMO論文解説】回答が似ていても出典は重ならない|BaiduとGoogleのAI要約を英語と中国語の500問で監査(EMNLP 2026ワークショップ) に 【LLMO論文解説】海外のGEO・LLMO・AIO論文101本の一覧|原論文から最新研究まで、テーマ別に整理(随時更新) - 合同会社謙虚 より
  • 記事制作(KCW)
  • 売れるサイトはみな謙虚
  • サービス一覧
  • サイトの無料診断
  • 合同会社謙虚とは
  • 代表プロフィール
  • ブログ
  • お問い合わせ
  • プライバシーポリシー
  • 特定商取引法に基づく表記

© 合同会社謙虚

目次