MENU
  • 料金
  • 会社案内
  • コンサル
  • お問い合わせ
  • 無料で1ページ頼む
AIO・LLMO・GEO対策の記事制作
合同会社謙虚
  • 料金
  • 会社案内
  • コンサル
  • お問い合わせ
  • 無料で1ページ頼む
  • 料金
  • 会社案内
  • コンサル
  • お問い合わせ
  • 無料で1ページ頼む
合同会社謙虚
  • 料金
  • 会社案内
  • コンサル
  • お問い合わせ
  • 無料で1ページ頼む
  1. ホーム
  2. LLMO
  3. LLMO論文
  4. 【LLMO論文解説】AIが引用するのは自社サイトより第三者サイトが8割5分|128ブランド・12市場・13言語の分析(プレプリント)

【LLMO論文解説】AIが引用するのは自社サイトより第三者サイトが8割5分|128ブランド・12市場・13言語の分析(プレプリント)

2026 9/30
2026年9月23日2026年9月30日
中野輝規
AIが引用するのは自社サイトより第三者サイトが8割5分

ChatGPTやPerplexityのようなAIに自社ブランドについて尋ねると、AIは検索で拾ったウェブページを読んでから回答を組み立てます。

読まれるページが自社サイトなのか、それとも第三者のサイトなのかで、AIが語る内容の土台は変わります。今回取り上げる論文は、回答の中身ではなく、その手前にある「引用元」だけに焦点を当てた研究です。

128のブランド、12の市場、13の言語にまたがる16万7,551件のURL付き引用を集め、AIがどのドメインを読んで回答を組み立てているかを分類しました。

この記事は、原文(arXiv番号2606.25787)を通読し、本文の表と付録の限界事項までを読んだうえで整理したものです。数値はすべて原文の表と本文から拾い、自分で計算し直した箇所には「概算」と明記します。

合同会社謙虚は、3つのドメインを並行して運用し、何を変えると数字が動くかを測り続けています。この論文を読む理由は、自社サイトを書き込むだけでは届かない引用元が、市場ごとにどれだけあるかを先に知っておくためです。

目次

結論:3行で言うと

  • AIがブランドについて答えるとき、根拠にしているのは自社サイトではなく、第三者のサイトが85.7%を占めていました
  • 引用元は少数のドメインに集中しており、Wikipediaが12言語中11言語で最も多く引用されるドメインでした
  • 唯一の例外はリトアニア語で地元の経済紙がWikipediaを上回り、ポーランドでは求人サイト4つの合計がポーランド語版Wikipediaの引用件数を上回っていました

著者は、AIでのブランドの見え方を分析するツールを開発するエストニアの企業(以下、著者の所属企業)に所属しており、分析対象の3つのデータセットは同社が商用に集めたデータです。この点は後の章で整理します。

この論文の基本情報

項目 内容
題名(原題) How Large Language Models Source Brand Reputation Across Languages and Markets
著者 Dmitrij Zatuchin(単著。所属はエストニア起業大学応用科学部門〈EUAS〉、および同国の民間企業である著者の所属企業)
公開日 2026年6月24日(arXiv初版)
arXiv番号 2606.25787
掲載・採択状況 arXivプレプリント。コメント欄には「12 pages, no figures, tables only」とあるのみで、学会・査読誌への掲載を示す記載は見当たりませんでした
種類 著者の所属企業の商用データセットを、著者本人が分析した研究(企業の自社データを用いた論文)
実験データ・コードの公開先 Zenodo(DOI:10.5281/zenodo.20829524、CC BY 4.0)。閲覧用の一覧は著者の所属企業のサイトで公開されています

論文はこちらで読めます。arXiv(2606.25787)、データセット(Zenodo)。

この論文が答えた問い

AIがブランドについて答えるとき、その根拠にしている引用元は自社サイトと第三者サイトのどちらが多く、どのドメインに偏っていて、言語や市場によってどう変わるのか。

背景として、論文は次の点を指摘しています。生成AIの回答は、根拠にした引用を正しく反映していないことがあります。

ある調査では、生成された文の51.5%しか引用元に完全に裏づけられておらず、引用の74.5%しか実際にその文を支えていなかったと報告されています。

それでも引用元は回答を組み立てる材料そのものであり、AIが何を読んでいるかを知ることは、回答の中身を知ることに直結します。

4つの問い

  1. 自社サイトと第三者サイト、どちらが多く引用されているか
  2. 引用元の種類と、ドメインの偏り方はどうなっているか
  3. 言語や市場によって、最も多く引用されるドメインは変わるか
  4. AIの種類(モデル)によって、引用の量や中身は変わるか

どうやって調べたのか

3つのデータセットを1つに統合

分析は、著者の所属企業が集めた3つのデータセットを統合したものです。

データセット 対象 行数
北欧・バルト(NB) 11市場・12言語 15万93行(URL引用13万1,514件)
ポーランド(PL) ポーランド国内の46ブランド 4,151記録(URL引用3万5,880件)
中東欧(CEE) ハンガリーほか 4,001行(URLが分かるのは157件のみ)

3つのうち、引用URLがそのままドメインに変換できるのは北欧・バルトとポーランドの2つだけです。中東欧は96.1%が「一次報道機関」のようなキーワードで出典を記録しており、ドメインを特定できる行は157件、全体の3.9%にとどまります。

論文自身も、この統合を「1つの均質な表ではなく、背骨(バックボーン)に中東欧を付け足した形」と説明しています。ドメインの集中度やべき乗分布の分析は、URLが分かる北欧・バルトとポーランドのデータ(合計16万7,551件)だけで計算されています。

Geminiの引用が、最初は同じ1つのドメインに見えていた

集計に入る前に、論文はもう1つ手を加えています。北欧・バルトのデータのうち2万3,027行(URL付き行の17.5%、すべてGemini由来)は、実際の引用先ではなく、Googleの中継用ドメインが記録されていました。

論文は、引用のタイトル欄に書かれた本来のドメイン名(たとえばapple.comやfashionnetwork.com)から、この2万3,027行すべてを復元しています。

論文は「この修正をしないと、中継用ドメインがすべての言語で1位になり、Wikipediaの首位はどこにも残らない」と述べており、以降の集計はすべて復元後の数字にもとづきます。

「自社サイト」はブランド名がドメインに含まれるかで判定

各引用は、登録ドメイン単位(Wikipediaの言語別サブドメインはすべてwikipedia.orgにまとめる)に変換されます。

「自社サイト」は、ブランド名の一部がドメインに含まれているかどうかで機械的に判定されました(たとえばWiseならwise.com)。

この判定は、ブランド名を含まない自社ドメインを見落とし、逆に第三者のドメインにブランド名がたまたま含まれる場合は誤って数える可能性があると、論文自身が限界として挙げています。

結果

自社サイトは少数派、第三者サイトが主役

URLが分かる13万1,514件のうち、85.7%が第三者サイト、14.3%が自社サイトでした(表)。URLのないキーワードだけの行を含めた全15万93行で見ても、自社14.4%・第三者76.1%・キーワードのみ9.5%とほぼ同じ比率です。

区分 自社サイト 第三者サイト
全体(URL引用) 14.3% 85.7%
BtoB企業のブランド 13.1% 86.9%
BtoC企業のブランド 15.7% 84.3%

自社サイトからの引用がまったくのゼロだったブランドもあります。スロバキアテレコム、PKNオルレン、スウェドバンクのエストニア法人とラトビア法人、Kiwi.com、Latvijas Gazeの6ブランドは、1件も自社サイトから引用されていませんでした。

最も自社サイトの比率が高かったのはスロバキアの銀行Tatra Bankaの34.4%(2,041件中)で、それでも3分の2近くは他社のサイトから引用されています。

引用元はごく一部のドメインに集中

引用元の種類を分けると、公式サイト・Wikipedia・ニュース・レビューサイトといった分類にきれいに収まらない「その他のウェブ」(業界メディア・地域ニュース・ブログ・通販サイトなど)が77.0%を占め、自社サイトの16.4%、Wikipediaの3.9%を大きく上回ります。

ドメインの偏りも大きく、2万815の登録ドメインのうち、引用の80%はわずか3,778ドメイン(全体の18.2%)から来ています。

引用の半分は547ホスト(2.3%)に集中し、残る2割が1万7,000以上のロングテールに広がっています。この分布は、上位1,000ドメインの順位を対数回帰にかけると、べき乗分布(ジップの法則)によく当てはまりました(指数0.86、決定係数0.983)。

論文は言語ごとの引用元の種類の違いも検定していますが、統計的には有意(カイ二乗検定、p<0.001)でも、効果の大きさを示すクラメールの連関係数Vは0.036と小さく、論文は「これだけのサンプル数があれば有意差は出やすく、小さいV値のほうが実態に近い」と述べています。

Wikipediaが11言語で首位、例外はリトアニア語

12言語すべてを合わせた引用元の上位は、Wikipedia(5,800件)、YouTube(2,826件)、統計ポータルのStatista(1,310件)の順で、続いて各ブランドの自社サイトとReddit、europa.euが並びます。言語別に見ても、Wikipediaは12言語中11言語で最も多く引用されるドメインでした(表)。

言語 最多引用ドメイン 引用に占める割合
フィンランド語 wikipedia.org 5.70%
英語 wikipedia.org 4.75%
ポーランド語 wikipedia.org 3.71%
リトアニア語 vz.lt(地元の経済紙) 4.38%

唯一の例外であるリトアニア語では、地元の経済紙vz.ltがWikipediaを上回りました。論文はこの例外を、英語圏やWikipedia中心の見方では見落とす、地元メディアの存在を示す例だと位置づけています。

ポーランドでは、求人サイトがWikipediaより多く引用される

市場ごとの違いが最も分かりやすいのはポーランドです。46のポーランド国内ブランドに対する引用(3万5,880件)を集計すると、最も多く引用されたドメインはYouTube(2,289件、6.4%)で、価格比較サイトのceneo.plや通販サイトのallegro.plが続きます。

その少し下に、求人・転職サイト4つ(indeed.comのポーランド版、livecareer.pl、interviewme.pl、randstad.pl)を合わせた637件があり、これはポーランド語版Wikipediaの297件の約2.1倍です。

論文が示す「求人サイト10.6%対Wikipedia4.6%」という比率は、動画サイトや通販サイトを除いた別の母数で計算されたもので、この記事では母数を揃えやすい件数ベースの比較(637対297)と、そこから出る2.1倍という倍率を採用しました。

AIの種類によって、引用の量も中身も違う

3つのAI(Perplexity Sonar Pro、Gemini 3.1 Pro、GPT-5.4)を比べると、引用の量と自社サイト比率がはっきり分かれました(表)。

AI 引用数 引用したドメイン数 自社サイト比率
Perplexity Sonar Pro 9万276件 1万5,995 16.8%
Gemini 3.1 Pro 2万3,032件 6,568 5.8%
GPT-5.4 1万8,206件 3,284 12.9%

Perplexityは、URL引用13万1,514件のうち9万276件(68.6%)を占め、最も幅広いドメインを引用し、自社サイトへの引用も最も多いモデルでした。

Geminiは復元前の分類ラベルでは自社サイト比率0.0%と表示されますが、これは中継用ドメインがすべて「その他」に分類されていたためで、復元後の実際の比率は5.8%です。

論文は「この中継用ドメインを解決しないまま比較すると、モデルの仕様上のクセを、ブランドについての発見だと誤って報告することになる」と注意しています。

論文自身が書いている限界

論文が自ら挙げている限界は、次の6点です。

  • 3つのデータセットは似ているものの同一の手順で集めたものではなく、統合は均質な1つの表ではありません
  • 自社サイトの判定は中継用ドメインの復元が前提で、Geminiの生データは復元前の状態のままです
  • 引用は回答単位で記録されており、1つの回答が複数のブランドに言及していると、その引用は言及された全ブランドに紐づきます
  • ポーランドの求人サイト対Wikipediaの件数は確かですが、割合の計算に使う母数はレポートによって異なります(本文3.4節・要旨・結論は637対297としていますが、この限界の節自体は460対202という別の件数を挙げており、論文内で件数が一致していません)
  • データは特定の時点・特定のモデルバージョンの結果で、AIの取得方法は頻繁に変わります
  • この論文が測っているのはAIが何を引用したかで、それが実際の評判や人々の受け止め方と同じだとは主張していません

加えて、原文を読んで気づいた点があります。

  • 日本語・日本市場は、この論文の対象外です。対象は北欧・バルト諸国とポーランド、中東欧の12市場・13言語(英語を含む北欧バルトの12言語とハンガリー語)で、アジアの言語や市場はどれも対象に入っていません。ここで見られたWikipedia優位や第三者サイト優位の傾向が、日本語のAI検索でも同じ形で現れるかどうかは、この論文の範囲の外にあります
  • 著者はAIブランド分析ツールを開発する企業(著者の所属企業)に所属しており、分析対象の3つのデータセットはすべて同社の商用データです。論文の利益相反の項目でこの点は開示されており、著者は「分析方法と結論は自分自身のもので、会社から別の影響は受けていない」と述べていますが、自社の商用データを自社の研究者が分析した論文であることは変わらない事実です
  • 評価は自動集計によるもので、人が個別に確認した工程はありませんでした。ドメインの分類や自社サイトの判定は機械的なルール(ブランド名がドメイン名に含まれるか)によるもので、Zenodoで集計スクリプトが公開されている点は透明性の高さといえますが、判定ルールそのものの精度は論文の中では検証の対象外です
  • 査読の状況は確認できませんでした。arXivのコメント欄には掲載先の記載がなく、学会や査読誌への採択を示す情報は見当たりませんでした

この論文から、言えること・言えないこと

言えること(この調査で確認された) 言えないこと(この調査では確認されていない)
対象の128ブランドでは、AIの引用の85.7%が第三者サイトだった 日本語や日本市場でも同じ比率になること
引用元のドメインはごく少数(18.2%)に集中していた 自社サイトを充実させれば引用が増えること
Wikipediaが12言語中11言語で最多引用ドメインだった この引用の多さが、実際の評判や購買行動と一致すること
ポーランドでは求人サイトの合計がWikipediaより多く引用されていた いま使われているAIサービスで同じ順位になること(データは特定時点のもの)
AIの種類によって引用の量・自社サイト比率が異なっていた この分析ルールが自社サイトを漏れなく正しく判定できていること

中小企業の視点で、どう受け取るか

ここからは論文の主張とは別の、私の読み取りです。

  • 自社サイトを整えるだけでは、AIの回答の材料の1割強にしか届かないというのが実態です。第三者のサイトにどう取り上げられるかを、自社サイトの整備と同じくらいの重みで考える必要があると読みました。第三者サイトでどう目立つかという発想自体は、GEO原論文の解説で扱った「引用文中でどう目立つか」という話とつながっています
  • Wikipediaはこの論文の対象市場では別格の存在でしたが、日本語版の記事の有無や充実度が同じ意味を持つかどうかは、この論文の範囲の外にあります。まずは自社ブランドの日本語版Wikipediaの有無を確かめる、という小さな一歩は取れそうです
  • ポーランドの求人サイトの例は、業種によっては知名度の高い専門サイトがWikipediaより多く読まれることを示しています。自社の業種でAIが何を読んでいるかは市場ごとに実際に確かめるしかなく、他社の傾向をそのまま当てはめるのは危ういと感じました
  • この論文のデータは著者の会社の商用データです。裏づけとして公開されたZenodoのデータとスクリプトはありますが、同業の独立した研究による再現は、私が調べた範囲では見当たりませんでした

よくある質問

この論文の引用元分析は、日本語や日本市場のAI検索にも当てはまりますか

この論文の対象は北欧・バルト諸国、ポーランド、中東欧の12市場・13言語で、日本語や日本市場はこの論文の対象外です。Wikipediaが多く引用される傾向や、市場ごとに引用元が変わる傾向は日本語のAI検索でも起こり得る可能性ですが、この論文が確かめたのは対象の12市場・13言語だけです。

自社サイトを充実させれば、AIからの引用は増えますか

この論文が確認したのは、対象の128ブランドで自社サイトへの引用が全体の14.3%にとどまり、大半が第三者サイトから引用されていたという実態です。自社サイトの充実がその後の引用数を増やすかどうかは、この論文とは別の検証が必要なテーマです。

Geminiの自社サイト引用率が0%というのは本当ですか

論文の分類ラベルではそう表示されますが、実態は違います。Geminiの引用がすべてGoogleの中継用ドメイン経由で記録され、分類システムがその中継用ドメインを見てしまった結果です。

論文が引用のタイトル欄から本来のドメインを復元すると、Geminiの自社サイト比率は5.8%になります。モデルを比較するときは、この復元後の数字を使う必要があると論文は注意しています。

まとめ:今日できる1つのこと

自社ブランド名でChatGPTかPerplexityに質問を投げ、回答の下に表示される引用元を1つずつ開いてみてください。自社サイトが何件、Wikipediaが何件、それ以外の第三者サイトが何件あるかを数えるだけで、この論文が測ったのと同じ種類の実態を、自社のブランドについて確かめられます。

この論文は、LLMO論文の一覧の一本です。ほかの論文の解説も、順次公開しています。

この記事に書いたことを、そのまま御社のページに

生成AIに引用されるページを、お話しいただくだけでお作りします。お時間をいただくのは初回15分のヒアリングだけです。まず1ページ、無料でお作りします。

OKが出るまで、何度でも直します。事実が違う、言い回しが硬い、この話は入れないでほしい。どれも遠慮なくおっしゃってください。何度お直ししても、追加の料金はいただきません。

これまでに127社にご利用いただきました。毎月ご依頼いただいている方の6割以上が、月10ページを選ばれています。料金はページに掲載しています。

まず1ページ、無料で作らせてください

ページを増やしても問い合わせが来ないなら、原因はページの外にあります。その場合は、下の入口からご相談ください。

自社のマーケティング課題を根本から解決しませんか?

ウェブサイトから要素を引き算し、訪れた人が迷わず次の一歩に進む形へ組み直す。初回60分のオンラインで御社のサイトを一緒に読み、どこから直すべきかをお伝えします。手順をまとめた無料の診断と解説動画もご用意しています。

まず動画で詳しく見る(約30分)
無料診断を受ける

初回は無料・60分・オンライン完結・その場で契約のお願いはいたしません

LLMO論文
SEO対策 生成AI
よかったらシェアしてね!
  • URLをコピーしました!
  • 【LLMO論文解説】大手画像共有サービスがVLMで画像に「使い道の検索語」を生成する仕組み|自社報告20%増の中身を検証(プレプリント)
  • 【LLMO論文解説】中国系AIと欧米系AIでブランド言及率に差|事例企業と著者が同一所属(プレプリント・2025年12月)

この記事を書いた人

中野輝規のアバター 中野輝規

合同会社謙虚 代表社員。20代から、売る言葉だけを仕事にしてきました。電話営業で受話器を握っていた時代から、数千社のWEB集客に関わったいままで。詳しいプロフィールはこちら

この著者の記事一覧へ

関連記事

  • AI検索は引用した出典を均等には使わない
    【LLMO論文解説】AI検索は引用した出典を均等には使わない|1万1,000問で見た「回答の泡」(EMNLP 2026と記載のプレプリント)
  • 文章の中身はそのままに「構造」だけ変えると引用率は上がるか
    【LLMO論文解説】文章の中身はそのままに「構造」だけ変えると引用率は上がるか|GEO-SFEの実測(プレプリント)
  • AIでの見え方は時間で薄れるのか:確信度の減衰の数式と専門AIへの引き継ぎ案
    【LLMO論文解説】AIでの見え方は時間で薄れるのか:確信度の減衰の数式と専門AIへの引き継ぎ案|実験なしの理論提案(プレプリント2026)
  • 自然に見える短い文字列でAIの順位づけは動くか
    【LLMO論文解説】自然に見える短い文字列でAIの順位づけは動くか|4つの公開モデルで試した攻撃(ACL 2026)
  • 同じ質問でも4つのAI検索の引用URLはほぼ重ならない
    【LLMO論文解説】同じ質問でも4つのAI検索の引用URLはほぼ重ならない|ページ採点と実際の露出を分けて測る提案(プレプリント)
  • 生成AIの好みをAIに説明させてルール化する仕組み
    【LLMO論文解説】生成AIの好みをAIに説明させてルール化する仕組み|AutoGEOは書き換えで目立ち方を最大50.99%上げた(ICLR 2026)
  • 広告文を書き換えてAIの回答に含める強化学習の手法
    【LLMO論文解説】広告文を書き換えてAIの回答に含める強化学習の手法|Rewrite-to-Rank(ICML 2025ワークショップ)
  • GEO論文を読み解く
    【LLMO論文解説】GEO原論文|出典・引用・統計を足すとAIの回答に載りやすくなった実験(KDD 2024)
最近の投稿
  • 温泉の集客は宿泊客と日帰り客の線引きで決まる 掲示ルールに沿うページの作り方
  • デザイナーの集客は作品集だけでは届かない 発注担当が社内で通せるサイトの作り方
  • 屋根の集客は見えない屋根を見せる会社が選ばれる 点検商法と疑われないサイトの作り方
  • 遺品整理の集客は遺族の迷いに先回りして決まる 広告頼みから指名へ移るサイトの作り方
  • 看板の集客は検索した先で決まる 見た人を来店につなぐ受け皿の作り方
最近のコメント
  • ホテルの集客は公式サイトで迷わせないことから 予約サイト頼みを抜ける直し方 に 温泉の集客は宿泊客と日帰り客の線引きで決まる 掲示ルールに沿うページの作り方 - 合同会社謙虚 より
  • 外壁塗装の集客は急がせない会社が選ばれる 下請けを抜けて直接の依頼を増やすホームページの作り方 に 屋根の集客は見えない屋根を見せる会社が選ばれる 点検商法と疑われないサイトの作り方 - 合同会社謙虚 より
  • 不用品回収の集客は料金の見せ方で決まる 当日の追加請求を疑われない業者のサイトの作り方 に 遺品整理の集客は遺族の迷いに先回りして決まる 広告頼みから指名へ移るサイトの作り方 - 合同会社謙虚 より
  • 外壁塗装の集客は急がせない会社が選ばれる 下請けを抜けて直接の依頼を増やすホームページの作り方 に 看板の集客は検索した先で決まる 見た人を来店につなぐ受け皿の作り方 - 合同会社謙虚 より
  • 【LLMO論文解説】回答が似ていても出典は重ならない|BaiduとGoogleのAI要約を英語と中国語の500問で監査(EMNLP 2026ワークショップ) に 【LLMO論文解説】海外のGEO・LLMO・AIO論文101本の一覧|原論文から最新研究まで、テーマ別に整理(随時更新) - 合同会社謙虚 より
  • 記事制作(KCW)
  • 売れるサイトはみな謙虚
  • サービス一覧
  • サイトの無料診断
  • 合同会社謙虚とは
  • 代表プロフィール
  • ブログ
  • お問い合わせ
  • プライバシーポリシー
  • 特定商取引法に基づく表記

© 合同会社謙虚

目次