「文章に統計や出典を足すと、AIの回答に取り上げられやすくなる」。この説明を聞いたことがある方は多いと思います。ところが2025年6月に公開された論文「C-SEO Bench: Does Conversational SEO Work?」は、同じ種類の書き換えを6つの分野で試して、ほとんど効かなかったと報告しています。
この記事は、その論文を原文から読み、何を測って、何が分かり、何が分かっていないのかを整理します。数値は論文の表と本文から拾いました。私が計算した値には「概算」と付けています。先に出たGEO原論文(解説記事はこちら)と結論が違う理由も、条件を並べて説明します。
合同会社謙虚は、3つのドメインを並行して運用し、何を変えると数字が動くかを測り続けています。「効いた」という報告と「効かなかった」という報告が並んだとき、その違いがどこから来るのかを自分たちで見分けられるように、この論文を読みました。
結論:3行で言うと
- 文章の書き換え(統計・引用・出典の追加、文体の調整など)は、6分野のうち大半で、AIの回答に引用される順番をほとんど変えませんでした。有意に前へ出たのは、gpt-4o-miniで回答を作らせた場合の、商品推薦の小売(2手法)とゲーム(1手法)の3か所だけです
- 書き換えより効いたのは、AIに渡される文書の並びで先頭に置かれることでした。論文はこれを「従来のSEOの役割」と読んでいます
- みんなが同じ手法を使うと、1社あたりの利得が薄れていきます。論文は「混み合ったゼロサムの競争」と表現しています
ただし、これは英語の文書と、決まった条件の実験での結果です。日本語のページや、いま動いているChatGPTに当てはまるかどうかは、論文の範囲の外にある問いです。
この論文の基本情報
| 項目 | 内容 |
|---|---|
| 題名(原題) | C-SEO Bench: Does Conversational SEO Work? |
| 著者 | Haritz Puerto、Martin Gubri、Tommaso Green、Seong Joon Oh、Sangdoo Yun(5人。所属はParameter Lab、ダルムシュタット工科大学、マンハイム大学、テュービンゲン大学、NAVER AI Lab) |
| 公開日 | 2025年6月6日(初版)。確認した版は2025年10月20日のv3 |
| arXiv番号 | 2506.11097 |
| 掲載・採択状況 | NeurIPS 2025のデータセット・ベンチマーク部門に採択(ポスター発表)。根拠は、arXivのコメント欄の採択表示、論文の書式(第39回NeurIPS 2025)、OpenReviewの登録情報です |
| 種類 | ベンチマーク論文(評価用のデータと評価方法を作り、既存の手法を試した研究)。謝辞に、NAVERの支援を受けたとあります |
| データとコード | GitHub(parameterlab/c-seo-bench)とHugging Face(parameterlab/c-seo-bench)で公開と、論文に書かれています |
論文はこちらで読めます。arXiv(2506.11097)、arXiv発行のDOI、OpenReviewの登録ページ。
この論文が答えた問い
会話型検索に引用されやすくする書き換え(C-SEO)は、商品でも情報記事でも、競合も同じことをする状況でも、本当に効くのか。
C-SEOは、会話型検索向けのSEOのことです。会話型検索は、質問に文章で答え、根拠にしたページの番号を添える検索を指します。GEO原論文が提案した手法は、質問応答という1つの課題で、1社だけが書き換える設定を中心に試されていました。この論文は、その手法を分野と競合の数を増やして試し直しています。
「引用順位」という物差し
論文は、回答の中でそのページが何番目に引用されたかを「引用順位」と呼びます。書き換える前の順位から、書き換えた後の順位を引いた値を「利得」とします。プラスなら前へ出た、マイナスなら後ろへ下がったことになります。単位は「順位の数」で、パーセントとは別の数え方です。
どうやって調べたのか
2つの課題と6つの分野
| 課題 | 分野 | 元のデータ | 質問数 | 文書数 |
|---|---|---|---|---|
| 商品の推薦 | 小売 | Amazonの商品検索データ | 500 | 5,000 |
| 商品の推薦 | ゲーム | Steamのゲーム紹介文 | 436 | 4,360 |
| 商品の推薦 | 本 | Google Books APIの紹介文 | 249 | 2,245 |
| 質問応答 | ウェブ | Googleでの実際の質問と、Brave Searchで集めたページ | 300 | 1,500 |
| 質問応答 | ニュース | 同じ出来事を報じた複数の記事 | 294 | 2,375 |
| 質問応答 | 討論 | 賛否が分かれる質問と、両論の抜粋 | 142 | 880 |
質問数の合計は1,921、文書数の合計は16,360です(表2の合計。私が足し算しました)。商品の推薦では、1つの質問に10件の商品説明を並べ順を混ぜてAIに渡し、AIが上位5件を理由つきで推薦します。質問応答では、複数の文書から答えを作らせます。
試した手法は10種類
- GEO原論文の8手法:権威的な文体、統計を足す、出典を足す、流暢さの改善、珍しい語を足す、専門用語を足す、やさしい言葉にする、引用を足す(GEO原論文と同じ指示文を使ったと、論文に書かれています)
- 新しい手法1「内容の総合改善」:上の8つをまとめて1回で書き直し、構造も整える
- 新しい手法2「LLMガイダンス」:文書の内容を要約したマークダウンの文章を作り、文書の冒頭に足す。llms.txtという規格から着想を得たと、論文は説明しています
書き換えは、すべてOpenAIのgpt-4o-miniが行いました。回答を作る側には4つのモデル(gpt-4o-mini、AnthropicのHaiku 3.5、OpenAIの推論モデルo3とo4-mini)を使っています。
統計の確かめ方と、競合が増える設定
書き換えは、各質問に付いた文書のうち、ランダムに選んだ1件に当てます。順位が最初から高い文書が有利になるのを避けるためです。「書き換えで前へ出たか」を、符号順位検定という方法で確かめ、複数の比較を同時に行う分の補正をかけています。表の太字は、この補正後にp値が0.05を下回ったものです。
競合の増え方は「採用率」で表します。10件のうち何件が同じ手法を使うかで、最大10件(採用率100%)まで動かしました。
結果
書き換えは、ほとんど順位を動かさなかった
表3は、gpt-4o-miniで回答を作らせたときの利得(順位の数)の平均です。10手法のうち、目立つ5行を抜き出しました。
| 手法 | 小売 | ゲーム | 本 | ウェブ | ニュース | 討論 |
|---|---|---|---|---|---|---|
| LLMガイダンス | +0.36 | +0.24 | +0.14 | +0.10 | 0.00 | +0.15 |
| 内容の総合改善 | +0.18 | +0.13 | +0.11 | +0.02 | -0.04 | +0.11 |
| 流暢さの改善 | +0.06 | +0.07 | +0.07 | +0.03 | -0.01 | +0.32 |
| 統計を足す | -0.07 | 0.00 | -0.11 | -0.53 | -0.05 | -0.80 |
| 先頭に置く(従来のSEO) | +2.77 | +1.89 | +1.60 | +0.87 | +0.70 | +1.54 |
太字は論文が有意と示した3か所です(p値は論文の表7で、LLMガイダンスが小売とゲームで0.0000、内容の総合改善が小売で0.0008)。最下段の「先頭に置く」は、論文の「Best SEO」の行で、文書をAIに渡す並びの1番目にしたときの利得です。
- 論文本文は「54件のうち有意にプラスは3件」と書いています。3件は上の太字の3か所で、質問応答は0件です。gpt-4o-miniでの結果と読めます。ただし、この表は10手法×6分野で60マスあり、本文の「54」とは合いません(理由は原文から分かりませんでした)
- LLMガイダンスは、小売で61.0%の文書の順位が変わりませんでした。前へ出たのが26.2%、後ろへ下がったのが12.8%で、打ち消し合って平均が小さくなっています
- 小売で最も大きい+0.36も、「先頭に置く」の+2.77と比べると約8分の1です(2.77÷0.36、概算)
- Haiku、o3、o4-miniでは、論文の説明は「有意にプラスの手法はなし」です(表4・9・11)。ただしo3の表10には、ゲームでp値が0.05を下回る行があり(LLMガイダンス0.0010など)、この説明と食い違っています。補正の有無など、理由は原文から読み取れませんでした
順位を下げる手法もあった
論文は、逆向きの検定(有意に後ろへ下がるか)も行いました。「統計を足す」は、4モデル×6分野の24通りのうち19通りで有意に順位を下げています。Haikuの商品推薦は30通り中26通り、o4-miniの質問応答は30通り中19通りが有意なマイナスでした。gpt-4o-miniの「統計を足す」は、ウェブで-0.53、討論で-0.80です。
効いたのは「並びの先頭」
論文は、対象の文書をAIに渡す並びのi番目に置いたときの利得も調べました(表5)。ここでも数字はgpt-4o-miniのものです。
| 置いた位置 | 小売 | ゲーム | 本 | ウェブ | ニュース | 討論 |
|---|---|---|---|---|---|---|
| 1番目 | +2.77 | +1.89 | +1.60 | +0.87 | +0.70 | +1.54 |
| 2番目 | +1.78 | +1.28 | +1.28 | +0.19 | +0.45 | +0.41 |
| 3番目 | +0.67 | +0.57 | +0.48 | -0.22 | -0.01 | -0.37 |
| 10番目 | -0.78 | -0.64 | -1.02 | -1.79 | -1.29 | -2.18 |
書き換える文書は元の位置がランダムなので、後ろの位置ではマイナスになります。論文は、1番目に置くと、どの書き換え手法よりも引用順位が大きく前に出ると述べています。ほかのモデルでも、「先頭に置く」は全分野で有意でした(論文の表8のp値と、表9・11の説明)。
採用率が上がるほど、利得は薄れた
論文は、最も効いた2手法(LLMガイダンスと内容の総合改善)を、小売とゲームで、採用率を10%から100%まで動かして試しました(図5、gpt-4o-mini)。最初に使った1社は利得を得ますが、同じ手法を使う競合が増えるにつれて1社あたりの利得は下がり、全員が使うとゼロに近づくと論文は述べています。前へ出る文書が増えれば、ほかの文書は後ろへ下がるためです。
GEO原論文と結論が違って見える理由(論文の説明)
GEO原論文は、引用や統計を足すと「語数と位置」の指標が上がったと報告しました。この論文で同じ手法に有意な効果が出たのは、商品推薦の一部だけでした。論文はこの違いを「用いた物差しの違い」と説明しています。両方の設計を並べます。
| 項目 | GEO原論文(KDD 2024) | この論文(NeurIPS 2025) |
|---|---|---|
| 主な物差し | 回答の中で、そのページの文が占める語数(位置で重みづけしたもの) | 回答の中で、そのページが何番目に引用されたか |
| 課題と分野 | 質問応答が中心。質問1万問、25分野 | 商品の推薦と質問応答の2課題。6分野、質問1,921問 |
| 回答を作るモデル | gpt-3.5-turbo(実サービスはPerplexityで確認) | gpt-4o-mini、Haiku 3.5、o3、o4-mini |
| 競合の扱い | 主に1件だけ書き換え。5件すべてを書き換えた実験も追加 | 採用率10〜100%を系統的に変えた |
- 語数と引用順位は、別のものを測っています。語数の多さは、AIがそのページについて多く書いたことを示します。引用が早いことは、AIがそのページを先に根拠として選んだことを示します。この論文は、語数が増えても、引用順位が前へ出るとは限らないと述べています
- 論文は、GEO原論文が併記した「位置を加味した語数」の結果も「全体に低下していた」と読み、両者は矛盾しないと結論しています。ただし、原論文の表1では、位置を加味した総合値は9手法中8手法で書き換えなしを上回っており、この読み方とは合いません。この点は鵜呑みにしないでください。私の見立てでは、両論文の食い違いは、物差しの違いだけでは説明しきれません
- モデルも、分野も、課題も、統計の確かめ方も違うため、差の原因を1つに絞る実験は、この論文の外にある課題です。物差しの違いは論文の説明で、その他の違いは並べただけです
論文自身が書いている限界
- 結論が当てはまるのは、正当な内容改善(論文の言う「ホワイトハット」)に限られます。競合を貶める指示文を紛れ込ませるような「ブラックハット」は対象外です
- 従来のSEOとC-SEOを組み合わせたときの相互作用は調べていません
- 実験に使ったのは、商用の非公開モデルです
- 文書がAIの入力枠に収まらず、要約されてから渡される場面は調べていません
- データは英語だけです。ほかの言語や文化への一般化に影響する可能性があると、論文は述べています
原文を読んで気づいた点
- 日本語での検証は、論文の範囲の外です。論文自身も、データは英語のみと書いています
- 評価は自動です。書き換えも、順位づけも、すべてAIが行い、評価は機械だけで完結しています。書き換えた文の内容が正しいかどうかは、評価の対象外です
- 書き換えと回答が同じモデルです(gpt-4o-mini)。ほかのモデルの表では、書き換えだけがgpt-4o-miniで、回答役が別のモデルです。回答役ごとの違いが小さくないことは、表3と表4を並べると読み取れます
- 「先頭に置く」は、書き手が直接動かせる操作とは別のものです。実験では、AIに渡す並びを実験者が直接入れ替えています。実際には、検索エンジン側の順位で決まるため、事業者が自由に先頭へ置けるという意味ではありません
- 引用されなかった文書の扱いが、本文から分かりませんでした。順位の差を測るため、引用された文書だけが集計されているのか、どう補っているのか、私は読み取れませんでした
- AUCの値の単位が、私には読み取れませんでした。本文の定義は、採用率0〜100%の平均利得を積分した値です。しかし図5の凡例にある1.88などは、縦軸(0.05〜0.35)から想像する大きさより大きくなっています。順序の結論(LLMガイダンスが最も高い)は、そのまま読めます
- NeurIPSの採択は査読を経ていますが、査読コメントの中身は、私の確認の範囲外です。実験の再現も、私は行っていません
- 実験は、論文が組んだ模擬の会話型検索の中で行われました。実際のサービスでの確認は含まれていません
この論文から、言えること・言えないこと
| 言えること(論文の設定で確認された) | 言えないこと(論文では確認されていない) |
|---|---|
| GEO原論文の8手法は、引用順位を前へ出す効果が、この設定ではほとんど確認されなかった | GEO原論文の結果が誤りだったこと(測った物差しが違う) |
| 統計の追加は、多くの設定で引用順位を下げた | 統計の追加が、人の読者にとっても悪いこと |
| 商品の推薦(小売・ゲーム)では、要約の追加などが小さく有意に効いた(gpt-4o-mini) | Haikuなど、ほかのモデルでも同じように効くこと |
| AIに渡す並びの先頭に置くことの効果は、書き換えより大きかった | 自社のページが、実際の検索で先頭へ置かれる方法 |
| 同じ手法を使う競合が増えるほど、1社あたりの利得は薄れた | 日本語や、実際のChatGPT・Perplexityでも同じ結果になること |
| 結論は、正当な内容改善に限った話 | アクセスや問い合わせ、売上への効果 |
中小企業の視点で、どう受け取るか
ここからは論文の主張とは別の、私の読み取りです。
1. 書き換えの前に、まず「AIに渡される側」に入っているかを見る
この論文で最も大きかったのは、文章の工夫ではなく、AIに渡される文書の並びでした。論文はこれを従来のSEOの役割と読んでいます。自社が答えてほしい質問で、通常の検索にどの順位で出ているかを先に確かめる価値があると、私は受け取りました。渡される段階の話は、論文の実験では最初から固定されています。
2. 一斉に書き換えず、1ページずつ前後を記録する
「統計を足す」は多くの設定でマイナスでした。GEO原論文で効いたとされる書き換えを、全ページに一括で当てるのは、記録を取らないまま賭けることになります。1ページだけ変えて、変える前と後の見え方を自分の目で確かめる進め方のほうが、この2本の論文の食い違いに合っていると考えます。
3. 商品の紹介文は、記事とは別に考える
効いたのは、商品を推薦する課題の小売とゲームで、質問応答には有意なプラスがありませんでした。商品の紹介文には、要約を冒頭に添えるなどの工夫は、試す価値があると考えます。一方、情報記事は、この論文からは書き換えの効果を期待しにくいと読めます。
4. 同じ手を全員が使う世界を、前提にしておく
手法が広まるほど利得が薄れるという結果は、「AI向けの型」を真似る施策の寿命が短いことを示しています。この論文は検証していませんが、私は、他社が真似しにくい一次情報や自社の実績のほうが、長く効く土台だと考えています。これも実験の結果ではなく、私の見立てです。
よくある質問
GEO原論文は間違っていたのですか
間違いだったかどうかは、この論文の実験からは判断が付けられない、というのが私の読みです。GEO原論文は「語数と位置」、この論文は「引用順位」を測っています。論文は、両者が測る対象の違いを理由にしています。モデルや分野の違いもあるため、どの違いが結論を分けたのかは、まだ切り分けの途中です。
llms.txtは効くのですか
この論文の「LLMガイダンス」は、llms.txtという規格から着想を得て、要約の文章を文書の冒頭に足す手法です。サイトにllms.txtというファイルを置く方法を試した実験とは別物です。ファイルを置く効果について、この論文が触れていない話題です。LLMガイダンスは、商品推薦の小売とゲームで小さく有意でしたが、質問応答では有意ではありませんでした。
SEOだけやっていればよいのですか
論文の結論は「C-SEOはSEOを置き換えず、補うもの」です。ただし、従来のSEOとの組み合わせ方は、調べていない領域です。この論文だけでSEO一本に絞るのは、行き過ぎた読み方です。
まとめ:今日できる1つのこと
自社に引用してほしい質問を3つ選び、通常の検索で自社ページが何位に出るかを記録してください。書き換えを試すのは、その記録を取ってからにします。この論文が示したのは、文章の工夫よりも、まず渡される側に入ることの大きさでした。
この論文は、LLMO論文の一覧の一本です。ほかの論文の解説も、順次公開しています。
この記事に書いたことを、そのまま御社のページに
生成AIに引用されるページを、お話しいただくだけでお作りします。お時間をいただくのは初回15分のヒアリングだけです。まず1ページ、無料でお作りします。
OKが出るまで、何度でも直します。事実が違う、言い回しが硬い、この話は入れないでほしい。どれも遠慮なくおっしゃってください。何度お直ししても、追加の料金はいただきません。
これまでに127社にご利用いただきました。毎月ご依頼いただいている方の6割以上が、月10ページを選ばれています。料金はページに掲載しています。
ページを増やしても問い合わせが来ないなら、原因はページの外にあります。その場合は、下の入口からご相談ください。
自社のマーケティング課題を根本から解決しませんか?
ウェブサイトから要素を引き算し、訪れた人が迷わず次の一歩に進む形へ組み直す。初回60分のオンラインで御社のサイトを一緒に読み、どこから直すべきかをお伝えします。手順をまとめた無料の診断と解説動画もご用意しています。
初回は無料・60分・オンライン完結・その場で契約のお願いはいたしません

