AIの検索が引用するページには、どんな共通点があるのか。この問いに、実際のAI検索が引用したページを集めて採点する方法で答えようとした論文があります。
2025年9月にarXivで公開された「AI Answer Engine Citation Behavior: An Empirical Analysis of the GEO-16 Framework」です。
ページの品質を16の観点(論文は「柱」と呼びます)で採点する「GEO-16」という枠組みを作り、3つのAI検索が引用した1,702件の引用元を調べました。
この記事は、その論文を原文から読み、何を測って、何が分かり、何が分かっていないのかを整理します。先に2点だけお伝えしておきます。
1つは、著者の2人が、AI検索での見え方を支援する企業の共同創業者だという点です。もう1つは、この研究が集めたデータの相関を見る観察研究で、ページを書き換えて結果を比べた実験とは性質が違う点です。
合同会社謙虚は、3つのドメインを並行して運用し、何を変えると数字が動くかを測り続けています。「日付や構造化データを整えるとAIに引用される」という説明が、どこまで数字で支えられているのかを確かめておくために、この論文を読みました。
結論:3行で言うと
- 3つのAI検索が引用した1,100ページを16の観点で採点すると、引用との関係が強かったのは日付などのメタデータ、見出しの階層などのHTML構造、構造化データの3つでした(相関係数0.63〜0.68)
- 論文は「総合点0.70以上」「16の柱のうち12以上で合格」を目安として示しています。ただし相関を見た観察研究で、点を上げると引用が増えるかは、確かめる前の段階です
- 著者はAI検索向けの支援企業の共同創業者で、採点の重み、「引用率」の定義、測定の日付など、確かめるのに必要な情報の多くが原文から読み取れない状態です
この論文の基本情報
| 項目 | 内容 |
|---|---|
| 題名(原題) | arXivの登録: AI Answer Engine Citation Behavior: An Empirical Analysis of the GEO-16 Framework。PDFの表紙: AI Answer Engine Citation Behavior: Bringing the GEO-16 Framework in B2B SaaS(題名が2通りあります) |
| 著者 | Arlen Kumar、Leanid Palkhouski(2人) |
| 所属 | カリフォルニア大学バークレー校、および著者らが創業した企業の研究部門(2人とも両方を併記) |
| 公開日 | 2025年9月13日(arXivの初版で、現時点で唯一の版)。PDFの表紙の日付は9月16日 |
| arXiv番号 | 2509.10762(分野はcs.AI、人工知能) |
| 掲載・採択状況 | arXivのコメント欄と掲載誌欄は空欄(2026年9月24日に確認)。査読前のプレプリントです |
| 種類 | 実際のAI検索の引用を集め、ページの採点結果との関係を統計で見た観察研究。企業の共同創業者による報告 |
| 実験データ・コード | 未公開。「査読のある場に採択されたら公開する。それまでは責任著者への個別の依頼に応じる」と書かれています |
論文はこちらで読めます。arXiv(2509.10762)、DOI。
著者の立場について補足します。大学の起業支援機関の紹介記事と著者本人のサイトによると、2人は、AI検索が企業の情報をどう扱っているかを監視し、ページを「新しく、正確で、引用されやすい」状態に保つサービスを手がける企業の、最高経営責任者と最高技術責任者です。
著者本人のサイトは、この論文の「鮮度(情報の新しさ)」に関する結果を、その企業の事業の考え方の土台だと紹介しています。論文には利益相反の申告欄が無く、結果が著者の事業の方向と重なる点は、読むときに意識しておく必要があります。
なお、その企業のサイトには、2026年9月1日付で事業を終えたという告知が出ています。
この論文が答えた問い
AI検索が引用するページには、ページ上のどんな品質の特徴が見られるのか。その特徴は、AI検索のサービスごとに違うのか。
著者は、従来のSEOの研究は検索順位の要因を扱ってきたもので、AIが引用元を選ぶときのページ側の要因を、複数のAI検索にまたがって数えた研究が無いと述べています。そこで、ページの特徴を点数にする枠組みを作り、実際に引用されたページに当てはめました。
どうやって調べたのか
| 項目 | 内容 |
|---|---|
| 分野 | 法人向けのクラウド型ソフト(B2B SaaS)の16業種 |
| 質問 | 70問(1業種あたり1〜5問)。製品を探す意図の質問で、提供企業の名前が挙がりやすいように作ったもの。質問文そのものは載っていません |
| AI検索 | Brave Summary(ブラウザのBraveの検索に付く要約)、GoogleのAI Overviews、Perplexity(開発者向けのsonar-proモデル) |
| 集めた引用 | 1,702件。内訳はBrave 612件(36.0%)、Google 598件(35.1%)、Perplexity 492件(28.9%) |
| 採点したページ | 重複を除いた1,100のURL。英語で、robots.txt(巡回の許可を示すファイル)で巡回が許されたページだけ |
| 測定の時期 | 「ある1時点で集めた」とだけあり、年月日は不明 |
| 採点の方法 | ページを読み込んで表示し、16の柱ごとに0〜3点の4段階で採点。16の柱の合計を48で割った値を総合点(0〜1)とし、2点以上の柱を「合格」として数える |
採点は、小さな項目ごとの点に重みを付けて合計し、決まった区切りで4段階に振り分ける、機械的なルールだと読めます。ただし、重みと区切りの具体的な値、小さな項目の中身は、原文では空白のままです。
採点にAI(大規模言語モデル)を使ったかどうかの記載も無く、「主張の正確さ」や「透明性と倫理」のように機械では測りにくい柱を、どう採点したのかは不明です。
人の確認については、全体の5%を人手でも採点して一致度(コーエンのカッパ係数)を測ったとありますが、その値は未記載です。
16の柱の名前が全部そろうのは、図5の横軸です。次の表は、図5の上段に書かれた、全ページの平均点(0〜3点)です。
| 柱(原文の名前を訳したもの) | 平均点 | 柱 | 平均点 |
|---|---|---|---|
| 読みやすさ・使いやすさ | 1.89 | 権威と信頼 | 0.76 |
| メタデータと鮮度(日付など) | 1.74 | 外部リンク | 0.71 |
| 内容の深さ | 1.45 | 主張の正確さ | 0.70 |
| 意味に沿ったHTML(見出しの階層など) | 1.45 | 構造化データ(JSON-LDなど) | 0.34 |
| 表示速度と技術的なSEO | 1.31 | 反応・やりとりの仕掛け | 0.15 |
| 内部リンク | 1.30 | 短い要約文などの小さな部品 | 0.03 |
| アクセシビリティ(誰でも使えるか) | 1.20 | 画像・動画 | 0.03 |
| 根拠と出典 | 1.13 | 透明性と倫理 | 0.02 |
下の4つは、ほぼ0点です。平均から見ると、引用されたページのほとんどが、この4つの柱で点を取れていないことになります。
結果
1. AI検索ごとに、引用したページの点が違った
論文の表2です。「引用率」の列は論文の表のままですが、何を分母にした割合なのかは、原文から読み取れません(後で説明します)。
| AI検索 | 総合点の平均 | 95%信頼区間 | 引用率(表2のまま) | 合格した柱の数(16中) |
|---|---|---|---|---|
| Brave Summary | 0.727 | 0.701〜0.753 | 78% | 11.6 |
| Google AI Overviews | 0.687 | 0.658〜0.716 | 72% | 11.0 |
| Perplexity | 0.300 | 0.267〜0.333 | 45% | 4.8 |
BraveとGoogleが引用したページは総合点が0.7前後、Perplexityが引用したページは0.3でした。図4の平均の異なるドメイン数も、BraveとGoogleが9.6、Perplexityが1.4と、大きく違っています。
2. 引用と関係が強かった柱
論文の表3です。載っているのは16の柱のうち6つだけで、残りの10の柱の相関は不明です。
| 柱 | 相関係数 r | 95%信頼区間 | 「引用への影響」(表3のまま) |
|---|---|---|---|
| メタデータと鮮度 | 0.68 | 0.64〜0.72 | +47% |
| 意味に沿ったHTML | 0.65 | 0.61〜0.69 | +42% |
| 構造化データ | 0.63 | 0.59〜0.67 | +39% |
| 根拠と出典 | 0.61 | 0.57〜0.65 | +37% |
| 権威と信頼 | 0.59 | 0.55〜0.63 | +35% |
| 内部リンク | 0.57 | 0.53〜0.61 | +33% |
「引用への影響」の +47% などは、何と何を比べた数字なのか、原文に説明が無いままです。相対か絶対かも不明なので、この記事では意味を解釈せずに、表の値だけを写しています。
3. 目安の点数と、回帰分析
- 総合点0.70以上で区切ると、感度(引用されたものを当てる割合)0.78、特異度(引用されなかったものを外す割合)0.84、両者を合わせたユーデン指数0.62でした
- 合格した柱が12以上で区切ると、感度0.85、特異度0.79、ユーデン指数0.64でした
- ロジスティック回帰(引用される確率を複数の要素で説明する分析)のオッズ比は、総合点が4.2(95%信頼区間3.1〜5.7)、合格した柱の数が1.8(1.4〜2.3)、BraveとPerplexityの差が2.1(1.6〜2.8)、クラウド業種とマーケティング業種の差が1.9(1.3〜2.7)でした。説明力を示す値(ナーゲルケルケの決定係数)は0.743です
数値の変数は標準化したと書かれているので、総合点のオッズ比4.2は「総合点が1標準偏差高いと、引用のオッズが約4.2倍」と読むのが自然です。ただ、単位の明記は無く、これは私の読み取りです。
PDF冒頭の要旨には(arXivに登録された要旨には無い)、本文に対応する箇所が見当たらない数字が2つあります。「総合点0.70以上かつ12の柱以上のページは、複数のAI検索にまたがる引用率が78%」と、「複数のAI検索に引用された134のURLは、1つだけに引用されたURLより品質点が71%高い」です。
どちらも、計算の過程は本文の表と節で追えない状態です。
論文自身が書いている限界
- 対象は英語の、法人向けクラウド型ソフトのページだけです。ほかの言語や業種では結果が違う可能性があります
- 掲載先(どのサイトに載せるか)を実験で変えていないので、外部の権威による因果の効果は未検証です
- 観察研究なので、測っていない要因の影響(交絡)を受けている可能性があります。ブランドの評判や被リンクが、点数と引用の両方に効いているかもしれません
- 16の柱は、ページ品質の一部だけを捉えたものです
- データは1時点のもので、AI検索が更新されれば結果は変わり得ます
論文は考察で、AI検索は第三者の権威あるサイトを好むという別の研究を引き、自社のブログだけに載せたページは、品質が高くても引用されない可能性があると述べています。そのため、ページの品質と、第三者のサイトへの掲載の両方を勧めています。
原文を読んで気づいた点
- 比べる相手の群が見えない構成です。採点した1,100のURLは、すべて3つのAI検索のどれかに引用されたページです。引用されなかったページを集めた記述は無く、「引用されやすさとの相関」が、どのページとどのページを比べた値なのかが分かりません。定義上、比べられるのは「あるAIには引用され、別のAIには引用されなかったページ」だけで、どのAIにも引用されなかったページは入っていません
- 用語の定義に食い違いがあります。方法の節では、真陽性率を「合格と判定されたページのうち、実際に引用された割合」と定義していますが、これは通常「適合率」と呼ぶ量です。結果の節の感度・特異度とは、定義が合っていません
- 採点の中身を外から確かめる手段が無い状態です。重みと区切りの値、人手との一致度、週をまたいだ採点の安定性(ピアソンの相関で測ったとある)の値は、どれも未記載です。著者本人のサイトは「重みの詳細は論文にある」と案内していますが、原文には見当たりませんでした
- Perplexityの点の低さは、取得の経路の違いによる可能性があります。Perplexityだけ開発者向けのモデル名が書かれていて、ほかの2つと集め方が違う可能性があります。図5下段の目盛りを読むと、Perplexityは「内容の深さ」「主張の正確さ」がほかの2つより高く、「根拠と出典」はほぼ同じ水準で、残りの柱は0.4前後以下です(読み取りは概算)。ページの質の差か、取得や採点の差かは、切り分けられていないと私は読みました
- 件数が合わない箇所があります。引用の件数を70問で割ると、1問あたりBraveが約8.7件、Googleが約8.5件、Perplexityが約7.0件です(概算、612÷70など)。図1の「1回答あたりの引用数」は、目盛りの読み取りで約10件、約10件、約5件で、合いません。また、図5の柱の平均点を合計して48で割ると約0.30で、表2の総合点(0.69〜0.73)と合いません
- 参考文献に、確認できないものがあります。AI検索が第三者サイトを好むとした文献(arXiv 2509.08919)の著者を、この論文はGEO原論文の筆頭著者らとしていますが、arXivの登録ではトロント大学の別の研究者らです。別の2本は、題名と掲載先で検索しても、同じものを確認できませんでした
- 日本語のページでの検証は対象外です。測定の年月日、質問文も不明で、再現は難しい状態です
この論文から、言えること・言えないこと
| 言えること(論文のデータで観察された) | 言えないこと(論文では確かめられていない) |
|---|---|
| 英語の法人向けソフトの質問で、BraveとGoogleが引用したページは、Perplexityが引用したページより総合点が高かった | 総合点を上げると、AI検索に引用されるようになること(因果) |
| 日付などのメタデータ、HTMLの構造、構造化データの点が、引用と相関していた | 「引用率78%」「影響+47%」が何を分母にした数字か |
| 引用されたページの多くは、構造化データや透明性の柱でほとんど点を取れていなかった | 日本語のページや、BtoCや地域の業種で同じ傾向になること |
| 論文自身が、第三者サイトへの掲載も必要だと述べている | いまのAI検索で同じ結果になること(測定時期が不明) |
中小企業の視点で、どう受け取るか
ここからは論文の主張とは別の、私の読み取りです。
- 日付・見出し・構造化データは、点検の項目として使えます。日付と見出しの点は、引用されたページで比較的高めでした。構造化データは平均0.34/3と低く、多くのページで整っていません。論文が示したのは点と引用の相関で、原因かどうかは未確定です。条件を1つずつ変えた別の実験では、日付の新しさは引用を左右し、見出しなどの書式だけの違いは有意な差に届かなかったと報告されています(関連性・位置・価格・日付を変えた実験の解説)。一方で、構造だけを変えて引用割合が上がったという報告もあります(ページの構造だけを変えた実測の解説)。書式の効き目は、研究の間でまだ揃っていません
- 「AIに引用される点数」を示されたら、重みと検証方法を尋ねてください。この論文の16の柱も、重みは非公開です。点数が高いページを引用しやすいのか、もともと強いサイトが点数も高いのかは、観察だけでは分けられません
- 自社サイトの外も見ておく必要があります。支援企業の著者自身が、自社のブログだけでは足りない可能性を書いています。業界団体の名簿や、取材記事、比較サイトなど、第三者のページに正しい情報が載っているかも確かめる対象です
- 英語の法人向けソフトの結果です。日本の中小企業、とくに地域の店舗や個人向けのサービスに、数字をそのまま当てはめるのは早いと考えます
よくある質問
GEO-16の総合点が0.70を超えれば、AI検索に引用されますか
論文が示したのは、引用されたページを0.70で区切ると、感度0.78・特異度0.84で分けられたという観察の結果です。点数を0.70に上げたページが引用されるようになったかは、実験の対象外です。
論文自身も、因果を確かめる介入の実験を今後の課題に挙げています。
GEO-16で引用との相関が最も強かった「メタデータと鮮度」とは、何を整えることですか
論文の原則の節は、人が読める日付を画面に出すこと、機械が読める日付(JSON-LDの datePublished と dateModified)を入れること、大きな改訂を記録すること、サイトマップを最新に保つことを挙げています。ここからは私の意見ですが、中身を直していないのに更新日だけを新しくするのは、読み手に誤解を与えるので避けてください。
PerplexityはGEO-16の点が低いページを引用したのに、なぜ引用されたのですか
論文はその理由を分析していません。Perplexityは引用するドメインの種類が少なく(図4の平均の異なるドメイン数で1.4)、集め方がほかの2つと違った可能性もあります。
この差を「Perplexityは品質を見ない」と読むのは、根拠が足りないと考えます。
まとめ:今日できる1つのこと
自社でいちばん大事なページを1つ開き、画面に出ている公開日・更新日と、構造化データの datePublished・dateModified が一致しているかを確かめてください。
食い違っていれば、実際に内容を直した日に揃えます。点数を追う前に、日付という事実を正しく伝える作業から始めるのが、この論文から持ち帰れる、いちばん手堅い一歩です。
この論文は、LLMO論文の一覧の一本です。ほかの論文の解説も、順次公開しています。
この記事に書いたことを、そのまま御社のページに
生成AIに引用されるページを、お話しいただくだけでお作りします。お時間をいただくのは初回15分のヒアリングだけです。まず1ページ、無料でお作りします。
OKが出るまで、何度でも直します。事実が違う、言い回しが硬い、この話は入れないでほしい。どれも遠慮なくおっしゃってください。何度お直ししても、追加の料金はいただきません。
これまでに127社にご利用いただきました。毎月ご依頼いただいている方の6割以上が、月10ページを選ばれています。料金はページに掲載しています。
ページを増やしても問い合わせが来ないなら、原因はページの外にあります。その場合は、下の入口からご相談ください。
自社のマーケティング課題を根本から解決しませんか?
ウェブサイトから要素を引き算し、訪れた人が迷わず次の一歩に進む形へ組み直す。初回60分のオンラインで御社のサイトを一緒に読み、どこから直すべきかをお伝えします。手順をまとめた無料の診断と解説動画もご用意しています。
初回は無料・60分・オンライン完結・その場で契約のお願いはいたしません


