AI検索が答えを作るとき、自社の記事は「出典として名前が出た」のか、それとも「答えの中身を実際に変えた」のか。この2つは、同じようでいて別のことです。
2025年9月にarXivで公開され、12月の第2版で題名も中身も大きく改訂された「CC-GSEO-Bench」は、この違いを分けて測るための評価用データと物差しを作った論文です。
この記事では、その論文を原文から読み、データの作り方、採点の仕組み、結果、実際のAI検索との差を整理します。差を計算した箇所には「概算」と書き添えました。
合同会社謙虚は、3つのドメインを並行して運用し、何を変えると数字が動くかを測り続けています。この論文を読んだのは、「AI検索で効いた」をどう数えるかという測り方の設計が、私たちの計測にもそのまま関わるからです。
結論:3行で言うと
- 1本の記事に言い回しの違う質問を2〜10個ずつ組み合わせ、記事がAIの回答に与えた影響を、目立ち方・正しい使われ方・その記事を抜いたときの回答の劣化の3つに分けて測る仕組みを作りました
- 試した9つの書き換えのうち、引用を足す方法が3つの指標の平均値すべてで最も高い値でした。ただし伸びは10点満点で0.14〜0.58点です(書き換えなしとの差、概算)
- 回答の中で目立つことと、回答の中身を変えることの相関は、ほぼゼロ(0.019)でした。また、AIに渡される順番が後ろになるほど点数は大きく下がり、その幅は書き換えの効果より大きいものでした
なお、実験は論文の著者が用意した模擬環境で、回答を作ったのも採点したのもAIです。ChatGPTやPerplexityなどの実際のサービスでは試されていません。
この論文の基本情報
| 項目 | 内容 |
|---|---|
| 題名(原題) | CC-GSEO-Bench: A Content-Centric Benchmark for Measuring Source Influence in Generative Search Engines |
| 著者 | Qiyuan Chen、Jiahe Chen、Hongsen Huangほか計10人。所属は浙江大学、東呉証券(中国の証券会社)、香港科技大学(広州)、上海交通大学。責任著者の1人は東呉証券の所属で、大学と企業の共同研究です |
| 公開日 | 2025年9月6日(第1版)。2025年12月26日に第2版。第1版は題名も内容も大きく異なります(後述)。この記事は第2版を読んで書いています |
| arXiv番号 | arXiv:2509.05607(分野はcs.CL・計算言語学) |
| 掲載/採択状況 | 学会名の記載はありません。arXivのコメント欄は「Technical Report」(技術報告)です。査読を経たかどうかは確認できませんでした |
| 種類 | ベンチマーク論文(評価用データと採点方法の提案)と、書き換え手法の比較実験 |
| 実験データ/コードの公開先 | 論文中に公開先の記載は見当たりませんでした |
論文はこちらで読めます。arXiv(2509.05607)。
この論文が答えた問い
AI検索が複数のページをまとめて答えるとき、ある1本の記事がその答えにどれだけ影響したかを、聞き方の違う多くの質問にまたがって、安定して測るにはどうすればよいか。
従来の検索なら、何位に出たかで見え方を測れました。AI検索では、拾われたページの一部だけが答えに使われます。
論文は、記事を書く側が気にするのは「1つの質問で出るか」よりも、同じ話題への色々な聞き方や追加の質問に対して、記事の中身が繰り返し答えに効くかどうかだ、と述べています。そこで、記事1本ごとに質問の束をまとめて測る形にしました。
どうやって調べたのか
データの作り方と実験の舞台
記事は実在のウェブページで、質問はAIが作っています。
| 工程・項目 | やったこと |
|---|---|
| 出発点の質問 | 公開されている7つの質問応答データ(ELI5、Natural Questionsなど。英語)から質問を集める |
| 記事の選び方 | その質問をTavilyという検索用の外部サービスで検索し、関連度の高い上位10件から1件をランダムに選ぶ。本文だけを抜き出して使う |
| 質問の作り方 | 記事ごとに、AI(gpt-5)が「この記事で答えられる質問」を作る。定義、比較、手順、長所短所など、聞き方をばらけさせる。人が質問を書いたという記載はありません |
| 絞り込み | 作った質問でもう一度検索し、元の記事が検索結果に出てきた質問だけを残す |
| 規模 | 記事1,030本、記事と質問の組5,353組。1記事あたりの質問は2〜10個(質問が3個の記事が272本で最多) |
| 回答を作るAI | 主にgpt-oss-120b(公開されているモデル)。付録でgpt-5-nanoでも同じ実験 |
| 回答の作り方 | 保存しておいた検索結果の中に対象の記事を含め、番号付きの参考資料として渡し、出典番号を付けて答えさせる。実際のAI検索サービスは使わない |
| 採点するAI | 「採点役のモデル」が0〜10の整数で採点する。どのモデルを採点役に使ったかは、第2版の本文に明記されていません |
5つの物差し
影響を測る物差しが3つ、記事そのものの質を測る物差しが2つです。
| 物差し | 何を見るか | 採点の材料 |
|---|---|---|
| 露出 | 回答の中で、その記事が目立つ場所に出典として出ているか | 質問、回答、記事の題名・URL・短い抜粋 |
| 忠実な帰属 | 回答が記事に頼った部分が、記事に裏づけられていて、意味が曲がっていないか | 質問、回答、記事の本文 |
| 因果的な影響 | 記事を抜いて作り直した回答と比べて、回答がどれだけ悪くなるか | 記事ありの回答と、記事なしの回答 |
| 読みやすさ・構造 | 記事の文章の明快さ、見出し・段落・箇条書きの整い方 | 記事の本文だけ |
| 信頼性・安全性 | 作り話めいた主張、人を操る書き方、有害な内容がないか | 記事の本文だけ |
この論文の特徴は、3つ目の「因果的な影響」です。同じ質問、同じ検索結果のまま、対象の記事だけを抜いて回答を作り直し、2つの回答を比べます。
記事がなくても同じ質の回答ができるなら、その記事の貢献は小さいと判断します。
記事ごとの点数は、次の3つにまとめます。記事ごとの平均を記事どうしで平均した「平均的な影響の強さ」、一定の点数を超えた質問の割合である「広がり」、点数のばらつきの小ささである「安定性」です。
「広がり」の基準点と「安定性」の上限値が具体的にいくつなのかは、論文に書かれていません。
試した書き換え
対象の記事を、9通りの方針で書き換えて比べています。方針は、GEO原論文で使われた9つとほぼ同じ顔ぶれです。
流暢にする、やさしい言葉にする、珍しい語を足す、引用を足す、統計を足す、出典を示す、専門用語を足す、権威的な文体にする、キーワードを足す、の9つです。
付録の説明によると、引用を足す方法は「たとえ人工的なものでも」引用を加え、統計を足す方法は「仮のものでも」数字を加え、出典を示す方法は「作り出したものかもしれない」出典を加える、と書かれています。つまり、足した引用や数字が実在するかどうかは問わない書き換えです。
結果
9つの書き換えの点数
論文の表1から、gpt-oss-120bで回答を作った場合の値を拾います。影響の3指標は記事単位の平均、質の2指標は平均点で、どれも10点満点です。
括弧内は書き換えなしとの差で、私が引き算した概算です。
| 方法 | 露出 | 忠実な帰属 | 因果的な影響 | 読みやすさ | 信頼性 |
|---|---|---|---|---|---|
| 書き換えなし | 5.630 | 5.747 | 5.501 | 4.767 | 8.352 |
| 引用を足す | 5.769(+0.139) | 6.328(+0.581) | 5.642(+0.141) | 5.077(+0.310) | 8.440(+0.088) |
| 統計を足す | 5.558(-0.072) | 6.158(+0.411) | 5.631(+0.130) | 4.705(-0.062) | 7.613(-0.739) |
| 専門用語を足す | 5.618(-0.012) | 6.142(+0.395) | 5.566(+0.065) | 4.411(-0.356) | 8.582(+0.230) |
| キーワードを足す | 5.640(+0.010) | 6.138(+0.391) | 5.576(+0.075) | 4.817(+0.050) | 8.419(+0.067) |
| 流暢にする | 5.658(+0.028) | 5.909(+0.162) | 5.512(+0.011) | 5.980(+1.213) | 8.636(+0.284) |
| 出典を示す | 5.689(+0.059) | 5.908(+0.161) | 5.572(+0.071) | 4.624(-0.143) | 8.153(-0.199) |
| 珍しい語を足す | 5.577(-0.053) | 5.905(+0.158) | 5.524(+0.023) | 4.223(-0.544) | 8.415(+0.063) |
| 権威的な文体にする | 5.655(+0.025) | 5.742(-0.005) | 5.512(+0.011) | 4.726(-0.041) | 7.332(-1.020) |
| やさしい言葉にする | 5.623(-0.007) | 5.610(-0.137) | 5.496(-0.005) | 5.196(+0.429) | 8.412(+0.060) |
- 引用を足す方法が、影響の3指標すべてで最高値でした。論文は、直接の引用があるとAIが記事に注意を向け、正しく出典を付けやすくなると解釈しています
- 統計を足す方法は、因果的な影響では引用に次ぐ値で、「広がり」では最も高い値でした(0.091。書き換えなしは0.045)。一方で信頼性は8.352から7.613に下がりました。論文は、数字を詰め込むと作り話めいて見えるためではないかと述べています
- 権威的な文体は信頼性を最も大きく下げました(-1.020、概算)
- 流暢にする方法は読みやすさを大きく上げ、因果的な影響はほぼ動きませんでした
- 伸びた幅は、最も大きい忠実な帰属でも0.6点弱です。論文は、点数の差が偶然の範囲を超えるかどうかの検定や、信頼区間を示していません
目立つことと、回答を変えることは別
5つの物差しどうしの相関(ピアソンの相関係数。1に近いほど一緒に動く)を見ると、露出と因果的な影響は0.019で、ほぼ無関係でした。
忠実な帰属と因果的な影響は0.254、露出と忠実な帰属は0.335の中程度の相関です。因果的な影響と信頼性は-0.081で、わずかに逆向きでした。
論文はここから、検索で拾われて見えているだけでは足りず、AIに記事を出典として明示的に使わせることが回答を変える条件になる、と述べています。
AIに渡される順番の影響が大きい
対象の記事が、AIに渡される参考資料の何番目にあったかで分けた結果です(表3・表22。論文の0番目を1番目と書きます)。
| 渡された順番 | 組の数 | 書き換えなし(露出/忠実な帰属/因果的な影響) | 引用を足す(同) |
|---|---|---|---|
| 1番目 | 1,882 | 6.18/7.36/5.76 | 6.41/7.70/5.93 |
| 2番目 | 839 | 5.73/6.34/5.51 | 5.83/6.91/5.62 |
| 3番目 | 608 | 5.56/5.56/5.41 | 5.60/6.17/5.54 |
| 4番目 | 521 | 5.57/4.71/5.38 | 5.59/5.41/5.46 |
| 5番目 | 1,503 | 5.14/3.77/5.11 | 5.25/4.59/5.28 |
書き換えなしの忠実な帰属は、1番目の7.36から5番目の3.77まで下がります。引用を足すと5番目でも4.59で、論文は「書き換えで順番の不利を一部取り戻せる」と述べています。
ただ、1番目と5番目の差(3.59点、概算)は、引用を足したときの伸び(5番目で0.82点、概算)よりずっと大きい値です。
回答を作るAIが変わると、勝つ方法も変わる
付録では、gpt-5-nanoでも同じ実験をしています。2つのモデルで書き換えの順位がどれだけ似ているか(スピアマンの順位相関)は、露出0.917、忠実な帰属0.883、因果的な影響0.917、読みやすさ0.533、信頼性0.500でした。
ところが、質問を種類別に分けて「因果的な影響を最も上げた方法」を見ると(表19・表20)、23の区分のうちgpt-oss-120bでは16区分で引用を足す方法、gpt-5-nanoでは19区分で統計を足す方法が1位でした(区分の数は私が表から数えたものです)。本文の表2はgpt-oss-120bの結果だけなので、「引用を足す方法が幅広く効く」という記述は、そのモデルに限った話として読むのが安全です。
論文自身が書いている限界
- 保存した検索結果を使う、管理された模擬環境での実験です。実際に動いているAI検索では、仕組みや指示文、出典の付け方が違うため、絶対値は変わり得ます
- 採点はAIに任せており、人による評価で補っていないため、読みやすさや信頼性の主観的・分野ごとの基準を拾いきれない可能性があります
- 扱ったのは記事の書き換えだけです。個人に合わせた表示、評判の影響、時間による変化は扱っていません
- 倫理の節では、偽情報やスパムの増幅、引用のでっち上げへの悪用を懸念として挙げています
原文を読んで気づいた点
- 査読の有無:arXivのコメント欄は「Technical Report」で、学会名も採択の記載もありません。書式は学会投稿でよく見る形(限界と倫理の節がある)です
- 版の違い:第1版は題名が異なり、6つの物差しと、複数のAIが分担して記事を直す仕組みの提案が中心でした(使ったAIはgpt-4.1-mini)。第1版を元にした紹介とは、中身が合わない可能性があります
- 日本語での検証:出発点の質問は英語のデータで、日本語での実験は報告されていません
- 質問はAI製、採点もAI:質問は記事を見たAIが作ったもので、実際の利用者の検索とは違う可能性があります。要旨は「限られた合成による補強」と書いていますが、付録では記事ごとの質問はすべてAIが作っています。また表5の内訳を足すと5,000組で、全体の5,353組と合わず、説明も見当たりませんでした
- 採点役のモデル名が書かれていない:結果の信頼性を判断する材料なので、明記がほしいところです
- 忠実な帰属は「真実かどうか」とは別:この物差しは、回答が「書き換えた後の記事」と一致しているかを見ます。引用を足す方法は人工的な引用も許すので、引用が実在しなくても点数は上がり得ます
- 文字数も一緒に増えている:引用を足す書き換えは平均487.6字長くなっています(表4)。伸びが引用の形によるのか、情報量が増えたことによるのかは、この実験では切り分けられていません。なお、ほぼ同じ字数が増えた「出典を示す」書き換え(+462.6字)は伸びが小さく、長さだけでは説明しきれません
- 細かな食い違い:表1と表13で同じ値が0.001ずれています(6.328と6.327)。付録の「統計を足す方法が因果的な影響を最も大きく上げた」は、gpt-5-nanoでは表どおりですが、gpt-oss-120bでは引用を足す方法のほうが上です
この論文から、言えること・言えないこと
| 言えること(論文の設定で確認された) | 言えないこと(論文では確認されていない) |
|---|---|
| 目立つことと、記事を抜いたときの回答の劣化は、ほぼ相関しなかった | ChatGPTやPerplexityなど、実際のサービスで同じ傾向になること |
| 模擬環境とgpt-oss-120bでは、引用を足す書き換えが3つの影響指標で最も高かった | どのAIでも引用を足す方法が1位になること(gpt-5-nanoでは統計が多くの区分で1位) |
| 統計を足す、権威的に書くと、採点AIの信頼性の点数が下がった | 人が読んだときも同じように信頼を下げること |
| AIに渡される順番が後ろほど、点数は下がった | 検索で上位に拾われるかどうかが、書き換えで変わること |
| 書き換えの伸びは10点満点で0.6点弱までだった | その差が偶然の範囲を超えるかどうか(検定の記載なし) |
中小企業の視点で、どう受け取るか
ここからは論文の主張とは別の、私の読み取りです。
「出典に名前が出た」と「答えに使われた」を分けて見る
出典欄に名前が出ていても、答えの中身は他のページで足りていた、ということが起こり得ます。同じ問題意識で、引用されたことと回答に吸収されたことを分けて測る研究は、選択と吸収を分けて測る枠組みの記事で解説しています。
引用を足すなら、実在する発言だけにする
実験で最も点数が伸びた「引用を足す」は、人工的な引用も許す書き換えでした。自社の記事に取り入れるなら、元の資料を確認できる発言だけを、出典と一緒に載せるのが前提です。
架空の数字や引用は、たとえ実験で点数が上がっても、読者と取引先の信頼を失う危険のほうが大きいと私は考えます。
書き換えより、まず「拾われる位置」
AIに渡される順番の差は、書き換えの効果より大きく出ました。記事の文章を磨く前に、そもそもその質問で検索に拾われ、上のほうに並ぶかを確かめる順番が合理的です。
記事1本を、複数の聞き方で確かめる
1つの質問だけで「AIに出た・出なかった」を判断するより、1本の記事に3〜5通りの聞き方を用意し、どれくらいの割合で使われるかを見るほうが、ぶれの少ない判断になります。
よくある質問
CC-GSEO-Benchの「因果的な影響」は、AIに引用された回数と何が違いますか
引用された回数は、回答に出典として名前が出たかを数えます。因果的な影響は、その記事を抜いて回答を作り直し、回答がどれだけ悪くなるかをAIが採点します。
論文では、目立ち方(露出)と因果的な影響の相関は0.019で、ほぼ別物でした。
CC-GSEO-Benchで最も効いた「引用を足す」書き換えは、架空の引用でもよいのですか
論文の書き換えは人工的な引用も許す方針で、引用が実在するかは測っていません。点数が上がったことは、架空の引用を使ってよい根拠にならないと私は考えます。
論文自身も倫理の節で、引用のでっち上げへの悪用を懸念しています。
CC-GSEO-Benchの結果は、ChatGPTやPerplexityでもそのまま当てはまりますか
当てはまるかどうかは、この論文からは判断できません。実験は保存した検索結果を使う模擬環境で、回答を作ったのはgpt-oss-120bとgpt-5-nanoです。
論文自身も、実際に動いているAI検索では結果の絶対値が変わり得ると書いています。
まとめ:今日できる1つのこと
自社でいちばん読まれている記事を1本選び、その記事で答えられる質問を、聞き方を変えて3つ書き出してください。それぞれをAI検索に入れ、「出典に名前が出たか」と「記事に書いた内容が答えに入っていたか」を分けて記録します。
2つの欄が食い違う質問が、書き直しの候補です。
この論文は、LLMO論文の一覧の一本です。ほかの論文の解説も、順次公開しています。
この記事に書いたことを、そのまま御社のページに
生成AIに引用されるページを、お話しいただくだけでお作りします。お時間をいただくのは初回15分のヒアリングだけです。まず1ページ、無料でお作りします。
OKが出るまで、何度でも直します。事実が違う、言い回しが硬い、この話は入れないでほしい。どれも遠慮なくおっしゃってください。何度お直ししても、追加の料金はいただきません。
これまでに127社にご利用いただきました。毎月ご依頼いただいている方の6割以上が、月10ページを選ばれています。料金はページに掲載しています。
ページを増やしても問い合わせが来ないなら、原因はページの外にあります。その場合は、下の入口からご相談ください。
自社のマーケティング課題を根本から解決しませんか?
ウェブサイトから要素を引き算し、訪れた人が迷わず次の一歩に進む形へ組み直す。初回60分のオンラインで御社のサイトを一緒に読み、どこから直すべきかをお伝えします。手順をまとめた無料の診断と解説動画もご用意しています。
初回は無料・60分・オンライン完結・その場で契約のお願いはいたしません


