「AIに引用されている記事の型をまねれば、うちも引用される」。そう考えて、上位の記事と見出しの数や文字数をそろえる。
1社なら小さな工夫です。では、同じ分野の書き手がみな同じことを何度も繰り返したら、何が起きるのでしょうか。
2026年8月にarXivで公開され、言語モデルの国際会議COLM 2026に採択された論文「CHASE」は、この問いをシミュレーション(模擬実験)で調べました。
AIの順位づけで上位に来た文書の特徴を割り出し、ほかの文書をそこへ寄せて書き換える。これを20回繰り返しています。
この記事では、実験の組み立てと結果の大きさ、そして実際のウェブにどこまで当てはめてよいかを原文から整理します。
合同会社謙虚は、3つのドメインを並行して運用し、何を変えると数字が動くかを測り続けています。この論文を読むのは、「うまくいった型を、ほかの記事にもそのまま使ってよいのか」という、記事づくりで毎月出てくる判断に、実験の側から材料を持っておきたいからです。
結論:3行で言うと
- 順位の上位に共通する特徴へ文書を寄せる書き換えを20回繰り返すと、「上位の型に近いこと」と「独立した採点者が付けた品質」の結びつきが、6分野すべてで弱まりました(順位相関の変化は-0.107〜-0.018、平均-0.068)
- 標的をでたらめな特徴に替えた対照実験では、この弱まり方は小さくなりました。論文は、書き換えそのものより「順位から割り出した型を追うこと」に結びついた現象だと読んでいます
- 一方で、文書どうしの似通い具合(均質化)の変化は、論文自身が「比較的小さい」と書く程度でした。起きた変化の形は分野ごとに違い、結果は英語の文書を使った20回分の模擬実験の範囲に限られます
この論文の基本情報
| 項目 | 内容 |
|---|---|
| 題名 | CHASE: How Content Ecosystems Are Reshaped When Ranking Is the Only Target |
| 著者 | Qianwen Gao、Zichang Su、Yiwen Hou、Arlen Kumar、Leanid Palkhouski の5人(所属はカリフォルニア大学バークレー校、浙江大学) |
| 公開日 | 2026年8月31日(arXiv第1版) |
| arXiv | 2608.30466(分野はcs.AI、情報検索のcs.IRにも登録) |
| 掲載・採択 | COLM 2026(言語モデルの国際会議)に採択。arXivのコメント欄の記載に加え、査読システムOpenReviewの最終版の登録と、会議サイトの採択論文一覧(ポスター発表)で確認しました |
| 種類 | 模擬実験の枠組みの提案と、その実験結果(大学の研究) |
| 実験データとコード | 元の文書は既存の評価用データ集(C-SEO Bench)から取得。コードは著者がコード共有サイトで公開(論文の脚注にリンクあり) |
論文はこちらで読めます。arXiv(2608.30466)、arXivが発行したDOI。
コードの公開先は、arXivのページの脚注から辿れます。
この論文が答えた問い
書き手たちが、AIの順位づけで上位に来る文書の特徴に、繰り返し自分の文書を寄せていくと、文書の集まり全体と「順位と品質の関係」はどう変わるのか。
これまでのGEO(生成AIの回答で目立つための最適化)の研究は、多くが「1つの文書を1回書き換えたら、目立ち方がどう変わるか」を調べてきました。
GEO原論文がその代表です。
論文は、実際の最適化は1回で終わらず、うまくいった手法はほかの書き手にもまねされる、と指摘します。全員が寄せていけば、「何が上位の特徴か」そのものが動くかもしれません。
論文の土台は、経済学でいう「グッドハートの法則」です。ある数字を目標にして追い込むと、その数字が本来測りたかったものを表さなくなる、という考え方です。
競合を想定した戦略選びの研究との違い
競合も書き換えてくる前提でGEOの戦略を選ぶ研究は、相手の出方を読んで1社が得をする手を選ぶ話でした。
CHASEの書き手は相手を読まず、その回の上位の型に寄せるだけです(論文は「近視眼的で、戦略的でない」と明記)。見ているのは、集まり全体の変化です。
どうやって調べたのか
CHASEは、次の4段階を1回として、20回繰り返します。
- 順位づけ:AIに、1つの質問に対する候補の文書をすべて読ませ、1位から最下位まで並べさせる。並び順の影響を減らすため、文書の順番を5通りにシャッフルして平均を取る
- 上位の特徴の割り出し:上位10%の文書を「勝者」とし、文書ごとに測った25種類の特徴から、勝者を見分けるのに効いた上位5つを統計の手法で選ぶ。勝者のその特徴の平均値を「目標値」にする
- 書き換え:勝者以外の文書の一部を、AIが目標値に寄せて書き換える。事実は変えない、新しい事実を作らない、長さを大きく変えない、と指示する
- 評価:集まり全体の変化を測る
実験の設定は次のとおりです。
| 項目 | 設定 |
|---|---|
| 元の文書 | 既存の評価用データ集C-SEO Benchの英語の文書。6分野(商品推薦の小売・ゲーム・書籍、質問応答のウェブ・ニュース・討論)から各20問を選び、1問あたり候補は5〜10件 |
| 書き手の数 | 書き手の人数は定めず、文書ごとに書き換えるかを抽選する。毎回、勝者以外の文書の平均約29%(確率2/7)がランダムに書き換えに参加する |
| 順位づけ役 | Gemini 3.1 Flash-Lite |
| 書き換え役 | GPT-5.4-mini(長さが元の文書から50%超変わった書き換えは不採用) |
| 品質の採点役 | Claude Haiku 4.5(正確さ・網羅性・有用性を各1〜5点で採点し平均)。順位づけや書き換えと別系統のAIを使い、身内びいきを避ける設計 |
| 繰り返し | 20回。0・5・10・15・20回目に詳しく評価。乱数の条件を変えて5回実行 |
| 25種類の特徴 | 構造(文字数、段落数、箇条書きの頻度など8種)、根拠(出典の書き方、数字の密度など8種)、意味(質問との近さ、語彙の多さなど9種)。言語モデルを使わず、規則・埋め込みの類似度・品詞解析で測る |
文書が勝者の特徴に寄っていくのは、仕組みがそう作られているからで、論文も結果として扱っていません。見ているのは、繰り返したときに順位と品質の関係がどう動くかです。
中心の物差しは「型への近さ」と「品質」の順位相関
中心の指標は、各文書の「その回の勝者の型への近さ」と「採点AIが付けた品質」の順位相関(スピアマンの順位相関。1に近いほど、型に近い文書ほど品質も高い)です。
この値が下がることを、論文は「品質と順位の乖離(かいり)」と呼んでいます。
ほかに、次の指標も追っています。
- 見分けやすさ(AUC):25種類の特徴だけで、勝者とそれ以外をどれだけ見分けられるか
- 均質さ:同じ質問の文書どうしが、意味の上でどれだけ似ているか。高いほど多様さが低い
- 順位の安定性:文書の並べ方を変えても、AIが同じ順位をつけるか
「順位」を「AIの回答での引用」の代わりに使えるかも確かめた
この実験は、AIの回答での引用を順位で代用しています。そこで論文は、同じAIに文書を根拠にした回答文を書かせ、引用された文書が順位でも上位かを調べました。
90件の集計で、引用された文書のほうが上位にいる確率を表す値は0.853(ばらつき±0.093。0.5なら無関係)、分野別では0.730〜0.928でした。
結果
6分野すべてで、「型への近さ」と品質の結びつきが弱まった
論文の表1から、中心の指標を拾います。変化の列は、20回目の値から0回目の値を引いたものです。
| 分野 | 0回目 | 20回目 | 変化 |
|---|---|---|---|
| 小売 | +0.110 | +0.063 | -0.047 |
| ゲーム | +0.129 | +0.062 | -0.067(私が表1から計算) |
| 書籍 | +0.022 | +0.004 | -0.018(最小) |
| ウェブ | +0.202 | +0.095 | -0.107(最大) |
| ニュース | +0.164 | +0.060 | -0.104 |
| 討論 | +0.104 | +0.039 | -0.065 |
- 6分野すべてで、20回目は0回目より低くなりました。平均の変化は-0.068です(論文の要旨の値)
- ウェブの分野では、0.202が0.095になり、概算で半分以下になりました(0.095÷0.202で約0.47)
- ただし、20回目の値はどの分野もプラスのままです。関係が逆転したわけではなく、弱まったという結果です
- (私の読みでは)0回目でも最大0.202で、「型に近いほど品質が高い」関係は最初から弱いものでした
- 途中の動きは一直線ではありません。付録の表6では、ニュースは15回目に0.191まで上がり、20回目に0.060へ下がっています
品質そのものが落ちたわけではない
論文は、この乖離を品質の低下と読まないよう繰り返し書いています。表1のほかの指標です。
| 分野 | 見分けやすさ(AUC) | 均質さ | 順位の安定性 | 品質(5点満点) |
|---|---|---|---|---|
| 小売 | 0.805→0.877 | 0.731→0.720 | 0.628→0.624 | 3.514→3.621 |
| ゲーム | 0.826→0.898 | 0.334→0.348 | 0.722→0.697 | 2.270→2.226 |
| 書籍 | 0.824→0.914 | 0.406→0.419 | 0.729→0.713 | 3.018→2.838 |
| ウェブ | 0.864→0.924 | 0.513→0.517 | 0.703→0.587 | 2.913→2.833 |
| ニュース | 0.934→0.941 | 0.517→0.524 | 0.697→0.716 | 2.195→2.190 |
| 討論 | 0.861→0.910 | 0.626→0.628 | 0.488→0.502 | 3.032→3.029 |
- 見分けやすさは、6分野すべてで上がりました。上位の文書が、測った25種類の特徴で見分けやすくなった、ということです
- 均質さの変化は小さく、論文も「比較的小さい」と書いています。5分野でわずかに上がり、小売では0.731から0.720へわずかに下がりました
- 品質は小売で上がり、いくつかの分野ではほぼ横ばいでした。書籍(3.018→2.838)とウェブ(2.913→2.833)は下がりましたが、この低下への言及は本文に見当たりませんでした
つまり、この論文の中心は「全部が同じ文章になった」という結果ではありません。上位に来る理由が表面の特徴で説明しやすくなる一方で、その特徴に近いことが品質の目印として当てにならなくなっていった、という結果です。
対照実験:でたらめな標的では、弱まり方が小さかった
書き換えの繰り返しだけで同じことが起きるかを確かめるため、論文は2つの対照実験を置きました。
| 分野 | CHASE(順位から割り出した標的) | でたらめな標的 |
|---|---|---|
| 小売 | -0.047 | +0.001 |
| 討論 | -0.065 | +0.014 |
| ニュース | -0.104 | -0.036 |
数字は順位相関の0回目から20回目への変化で、でたらめな標的の実験は3分野・3回の実行です。もう1つの「書き換えない」対照では、小売(0.732→0.732)と討論(0.633→0.633)で均質さが動きませんでした。
何が上位の特徴になるかは、分野で違い、途中で入れ替わった
論文は、変化の形を3つに分けて説明しています。
- 構造への収束(小売):段落の数や文字数など、構造の特徴が上位を説明するようになった
- 信号の不安定さ(討論):順位も上位の特徴もぶれやすかった
- 特徴の独占(ニュース):質問との近さなど少数の特徴に、順位の説明が集中した
付録の表7では、0回目・10回目・20回目で上位を説明する特徴の顔ぶれが入れ替わっています。順位をつけるAIは同じままで、文書の側が変わったことで「勝ちの特徴」が動いたわけです。
出典などの根拠系の特徴が一部の分野でマイナスの係数になった点について、論文は因果の証拠として読まないよう明記しています。
書き換えの品質チェック
別のAI(Claude Sonnet 4.6)で3,472件の書き換えを点検すると、93.0%がすべての点検を通過しました。
事実の付け足し(捏造)は3.4%、出典の削除は2.3%、引用の削除は2.1%です。通過率は最初の評価回の90.3%から15回目の96.4%へ上がっており、書き換えの劣化が積み重なった結果とは考えにくい、と論文は述べています。
論文自身が書いている限界
- 生成AI検索の全体(検索、回答の生成、利用者ごとの調整など)から、順位づけへの適応だけを切り出した模擬実験です
- 書き手は、その回の型をきれいに受け取り、先を読まずに独立して動きます。実際の書き手は、不完全だったり遅れたりした情報を見ていることがあり、競合の出方を読むこともあります
- 順位づけ・書き換え・採点に、それぞれ1つのAIと1つの指示文しか使っていません。結果はこの組み合わせに左右される可能性があります
- 特徴は25種類に固定されています。測っていない性質が順位と品質の両方に効いていれば、乖離の一部は特徴の足りなさで説明できる可能性があります
- 順位をつけるAIは固定です。実際の検索のように、順位づけの仕組みが更新される場合は扱っていません
- 20回で終わっています。長期的にどこへ落ち着くかの証拠にはなりません
- 品質は主にAIの採点で、人による検証は一部の文書に限られます
原文を読んで気づいた点
- 日本語での検証はありません。元の文書は英語で、特徴の測り方も英語向けです(読みやすさは英語の学年水準の式、語彙の難しさは英語の頻出5,000語が基準)
- 枠組みの名前は「均質化」ですが、均質さの変化は小さな値でした。「コンテンツが似通っていく」という紹介は、この論文の主な結果とは少しずれます
- 「順位は引用の代わりになる」という確認は、順位をつけたのと同じAIに回答を書かせて行っています。実際のAI検索での引用と照らし合わせたものとは別物です
- 人による検証は60件の文書を3人で採点した規模です。AI採点との一致は順位相関0.58(95%信頼区間0.49〜0.66)。品質変化の向きを人も支持したとありますが、その数値と、検証可能性(主張をたどれるか)の採点結果は見当たりませんでした
- 対照実験は6分野のうち3分野、書き換えない対照は2分野だけです。分野ごとの変化に、統計的な検定の結果は付いていません
- 根拠系の特徴がマイナスになった分野の詳細は「付録B」にあると本文にありますが、付録Bは特徴の定義の一覧で、係数の符号は載っていませんでした。どの分野のどの特徴かは、原文からは確認しきれません
- 参加の仕方を変えた感度分析(討論)では、順位相関が+0.050から-0.049へマイナスに転じていますが、論文は「質的に似た動き」とまとめています
この論文から、言えること・言えないこと
| 言えること(論文の設定で確認された) | 言えないこと(論文では確認されていない) |
|---|---|
| 上位の型に寄せる書き換えを20回繰り返すと、型への近さと品質の結びつきが6分野すべてで弱まった | 実際のウェブやAI検索で、同じことが起きていること |
| でたらめな標的では、弱まり方が小さかった(3分野) | 順位を追うことが品質低下を引き起こすという因果 |
| 上位の文書は、測った25種類の特徴で見分けやすくなった | 文書の品質そのものが下がること(小売では上がった) |
| 何が上位の特徴かは、分野で違い、回を重ねると入れ替わった | 文書がみな同じような内容になること(均質さの変化は小さかった) |
| AIの書き換えで、3.4%に事実の付け足しが見つかった | 日本語の記事や、20回を超える長期で同じ結果になること |
中小企業の視点で、どう受け取るか
ここからは論文の主張とは別の、私の読み取りです。日本語での検証はないので、方向を考える材料として扱ってください。
1. 勝った記事の「型」は、中身の良さの証明とは別物として扱う
この論文の小売の分野では、上位の型は段落の数や文字数などの構造の特徴でした(ニュースやウェブでは質問との近さ、討論では出典の密度などが上位でした)。
全員がそこへ寄せると、型に近いことが品質の目印として弱まりました。うまくいった記事の構成をほかの記事の型紙にするときは、「型で読まれた」のか「中身で読まれた」のかを分けて考えるほうが安全です。
2. 1つの勝ちパターンを、業種をまたいで使い回さない
論文では、分野によって上位を説明する特徴が違い、同じ分野でも回を重ねると入れ替わりました。小売で効いた型が討論で効くとは限らず、今日効いた型が半年後も効くとも限りません。
業種ごと、テーマごとに、読み手の質問から構成を組み直すほうが、この結果と整合します。確度は中程度です。
模擬実験の分野は英語の6つだけだからです。
3. 引用や順位の数字とは別に、品質を見る目を置く
この論文の設計の要は、順位をつけるAIとは別系統の採点者を置いたことでした。自社でも、引用や順位の数字に加えて「質問に正確に、漏れなく答えているか」を人が読んで確かめる工程を残すと、中身が置き去りになる事態に気づきやすくなります。
4. AIで書き換えたら、事実の確認を毎回する
「引用や具体的な主張を足せ」という特徴ごとの指示と「事実を作るな」という指示を同時に与えた書き換えで、3.4%に事実の付け足しが見つかりました。書き換えた回数分だけ、確認が要ります。
なお、CHASEが元の文書を借りたC-SEO Benchの論文は、みんなが同じ手法を使うと1社あたりの利得が薄れることを示していました。CHASEは、その先で順位の意味そのものが変わっていく様子を描いた研究と読めます。
よくある質問
CHASEの論文は、AI検索向けの書き換えをやめるべきだと言っていますか
そこまでは言っていません。示したのは、上位の型へ寄せる書き換えを全員が繰り返すと、型への近さが品質の目印として弱まる、という模擬実験の結果です。
論文は結果を、順位づけの仕組みを作る側への示唆(繰り返し最適化されたときに生む動機も評価すべき)としてまとめています。
CHASEの実験で、文書はみな同じような内容になったのですか
均質さの変化は小さく、論文自身も「比較的小さい」と書いています。はっきり起きたのは、上位が表面の特徴で説明しやすくなったことと、その特徴への近さと品質の結びつきが弱まったことです。
品質と順位の乖離は、実際のChatGPTやGeminiでも起きていますか
この論文からは分かりません。順位づけに使ったのはGemini 3.1 Flash-Liteの1モデルです。
論文も倫理面の注記で、既存の検索や推薦のサービスで同じことが起きている証拠として読まないよう求めています。
まとめ:今日できる1つのこと
自社で最も読まれている記事を1本開き、読まれている理由を「型」(見出しの数、文字数など)と「中身」(読者の質問に答えている具体的な情報)に分けて書き出してください。次の記事に引き継ぐのは中身の考え方だけにして、型はテーマに合わせて組み直します。
この論文は、LLMO論文の一覧の一本です。ほかの論文の解説も、順次公開しています。
この記事に書いたことを、そのまま御社のページに
生成AIに引用されるページを、お話しいただくだけでお作りします。お時間をいただくのは初回15分のヒアリングだけです。まず1ページ、無料でお作りします。
OKが出るまで、何度でも直します。事実が違う、言い回しが硬い、この話は入れないでほしい。どれも遠慮なくおっしゃってください。何度お直ししても、追加の料金はいただきません。
これまでに127社にご利用いただきました。毎月ご依頼いただいている方の6割以上が、月10ページを選ばれています。料金はページに掲載しています。
ページを増やしても問い合わせが来ないなら、原因はページの外にあります。その場合は、下の入口からご相談ください。
自社のマーケティング課題を根本から解決しませんか?
ウェブサイトから要素を引き算し、訪れた人が迷わず次の一歩に進む形へ組み直す。初回60分のオンラインで御社のサイトを一緒に読み、どこから直すべきかをお伝えします。手順をまとめた無料の診断と解説動画もご用意しています。
初回は無料・60分・オンライン完結・その場で契約のお願いはいたしません


