「このページはAIに引用されやすいか」を点数で示すツールが増えています。その点数の多くは、AIに実際に質問して回答を集める代わりに、ページの文章だけを機械的に数えて出したものです。
2026年9月にarXivで公開された論文は、そうした採点の1つがどこまで信用できるかを確かめた記録です。
書いたのは、その採点の仕組みをサービスとして運営している企業の研究者2人です。この記事は原文42ページを付録まで読み、水増しへの強さと、「点数が高いページは実際にAIに引用されやすいのか」をどう確かめたのかを整理します。
数値は原文の表と本文から拾いました。
合同会社謙虚は、3つのドメインを並行して運用し、何を変えると数字が動くかを測り続けています。外部の採点ツールの点数を施策の判断材料にしてよいのか、その線引きを原文で確かめておくために、この論文を読みました。
結論:3行で言うと
- 著者らの採点は、同じ要素を足し続けても伸びが頭打ちになるよう作られていて、500件のページを使った実験で水増しによって稼げた点数は最大6点ほどでした
- 点数と実際の引用のされ方の関係は、同じ質問の候補5件の中での順位の相関が0.11ほどという弱いものでした。これは相関の調査で、点数を上げると引用が増えるという因果は確かめていない数字です
- 2023年のGEO論文で効いた「引用・統計・出典を足す」は、今回試した10系統のAIで引用を増やさず、論文はこの種の点数を「品質の足切り」に使うべきものと位置づけ直しています
なお、検証された採点は著者の所属企業が提供する採点ツール(無料枠のある有料サービス)の中身の一部にあたり、利益相反がある前提で読む必要があります。
この論文の基本情報
| 項目 | 内容 |
|---|---|
| 題名(原題) | Scoring Without the Engine: Validating a Deterministic, Manipulation-Resistant Content Score for Generative Engines, End to End |
| 著者 | エリシャ・バジェモン、アンドレ=ルイ・ロシェの2人。所属はどちらも、フランス・パリの同じ企業 |
| 公開日 | 2026年9月7日(arXiv初版)。論文の表紙の日付は2026年7月 |
| arXiv番号 | 2609.07559(分類は人工知能) |
| 掲載・採択状況 | arXivのプレプリント。コメント欄に学会・論文誌の名前はなく、査読前の段階と判断しました |
| 種類 | 企業の研究者が、自社で運用する採点を自社で検証した論文 |
| 実験データとコード | 公開済み(公開先はarXivのコメント欄。同じ欄に著者の会社のサービスサイトの案内も併記) |
| 利益相反の申告 | 論文中に申告の記載なし(この記事で確認した範囲) |
論文はこちらで読めます。arXiv(2609.07559)、DOI(10.48550/arXiv.2609.07559)。
著者の所属企業と、採点ツールの関係
著者2人の所属企業は、ページのURLを入れると「AIに引用されやすいか」を採点し、直す箇所を示す有料のウェブサービスを運営しています。同社の公式サイトで、運営会社名と月額の料金表を確認しました。
論文は検証した採点を「本番で使っている採点」「出荷した重み」と呼び、以前の本番用の重みとも比べています。検証の対象は、著者の所属企業の採点ツールの中身と読むのが自然です。
一方、公式サイトは「5つの基準」で採点すると説明していて、論文の11項目の採点と画面に出る点数がまったく同じ仕組みかどうかまでは、この記事では確かめきれていません。
論文自身も、本番の仕組みには文章の自然さ(AI生成らしさの判定)とドメインの信頼度もあり、それらは今回の点数から意図的に外したと書いています。
サービス画面の点数は、論文の採点と同一ではない可能性が高いと考えられます。
一方で、論文は予測力の弱さや自分たちの評価の誤りなど、不利な結果も載せています。
この論文が答えた問い
AIに質問せず、ページの文章だけから機械的に出す点数は、水増しに強く作れるのか。そして、その点数が高いページは、本当にAIに引用されやすいのか。
AIの回答での見え方を測る正攻法は、AIに質問して回答を集めることです。ただ、お金がかかり、回数に制限があり、AIの中身も入れ替わります。
そこで安くて毎回同じ結果が出る「代わりの点数」が使われますが、点数そのものを狙って文章をいじられると、中身と点数がずれていく弱点を抱えています。
論文は、この代わりの点数をどう確かめるか、その手順を示すことを目的にしています。
どうやって調べたのか
採点の中身:文章だけから11項目を数える
点数は0〜100点で、ページの文章から11項目を数えて合計します。AIも学習済みの言語モデルも使わず、1ページ0.07秒ほどで採点できます。
重みの大きい項目は、語の出現の偏りの少なさ(重み0.246)、情報の密度(0.244)、定義文や誰かの発言を引いた文の割合(0.124)、固有名詞や日付の密度(0.094)、文のつながり(0.084)、段落が単独で読めるか(0.073)、数字の密度(0.051)です。残りの4項目は出典の記載と見出しの構造などで、重みはどれも0.04未満です。
各項目の値は、足す前に平方根で縮めます。1つの項目だけを伸ばしても点数が伸びにくくなる「詰め込み対策」です。
最後に新しさの点数を8%混ぜ、短いページには上限(100語未満は35点など)を設けます。
5つの関門で、採点の作り方を選ぶ
重みの付け方の候補を3種類作り、次の5つの関門をすべて通ったものだけを採用しています。関門は、学習用の250件で判定し、別の250件で結果が変わらないことを確かめました。
| 関門 | 中身 | 合格の条件 |
|---|---|---|
| 詰め込みで上がらない | キーワードを繰り返した文を足す | 1回分でも8回分でも、点数が上がらない(0以下) |
| 足すほど下がらない | 引用や数字を1回、2回、3回と足す | 1段ごとの下がり幅が0.5点以内 |
| やりすぎが報われない | 同じ要素を8回分足す | 8回分の伸びが、1回分の伸びの3倍以内 |
| 丸写しで稼げない | 本文をまるごと複製する | 伸びが2点以内 |
| 長さに引っぱられない | 点数と文章の長さの関係を見る | 相関の強さが0.35以内 |
どの比較も、同じ長さの「意味のない埋め草」を足した場合と比べ、長さの影響を差し引いています。
使ったデータ
ページは、研究用の質問集(GEO-Bench)に付いている英語のページ500件で、1件を400語で切っています。フランス語のページ60件も確認に使いました。
重みの手がかりには、2023年のGEO論文が報告した書き換えごとの効果(引用を足す+42.6%、統計を足す+32.8%、出典を示す+27.7%など、この論文が引用した値)を使っています。
リンク先の解説では、同じ研究の総合値から+41%などと概算しているため、数字が少し違って見えます。
「点数が高いページは引用されやすいか」の確かめ方
論文は、性質の違う3つの調べ方を使っています。
- 相関の調査:質問集の質問229問(重複を除いた数)に、候補のページ5件を添えてAIに答えさせ、文ごとに根拠のページを示させました。各ページが回答のどれだけを占めたか(前のほうの文ほど重く数える語数の割合)を測り、同じ質問の5件の中で「点数の順」と「占めた割合の順」がどれだけ一致するかを、順位の相関で見ています。AIは公開された重みのモデル6種と商用モデル1種の計7系統です。2026年7月には、ある大手AI企業の非公開モデル3種で、各150問の再調査もしています
- 書き換えの実験:同じページについて、引用・統計・出典を足した版と、同じ長さの埋め草を足した版を作り、引用のされ方の差を比べました。比べる相手をそろえた実験ですが、試したのは2023年の3つの書き換えで、点数そのものを直接動かす実験にはなっていません
- 予測の天井の確認:質問を見ずに付ける点数と、質問とページの関連を見るモデルとで、引用の予測力を比べました。学習と評価で同じ質問が混ざらないように分けています
1の調査には、点数を操作した比較群がありません。点数と引用が同じ方向に動くかを見た観察で、因果の証拠にはあたらない種類の数字です。
結果
水増しで稼げる点数は、最大6点ほどに収まった
3種類の作り方のうち、5つの関門をすべて通ったのは平方根で縮める方式だけでした。2023年の効果の大きさとの一致度(相関0.949)は、縮めない方式(0.956)よりわずかに低いものの、縮めない方式は「足すほど下がらない」の関門で落ちています。
論文は、一致度より関門を優先して選んだと書いています。
採用した採点に対して、500件のページで水増しを試した結果が次の表です(論文の表4と本文から。長さの影響をそろえた比較で、単位は点)。
| 水増しの方法 | 点数の変化 |
|---|---|
| 引用を1回分足す | +6.1(最大) |
| 引用を8回分足す | +3.5 |
| 統計を1回分→8回分足す | +4.6→+0.1 |
| 出典を1回分→8回分足す | +3.9→+0.5 |
| 引用・統計・出典を8回分ずつ全部足す | +4.5 |
| キーワードを8回分詰め込む | -13.0 |
| 本文をまるごと複製する | -2.9 |
- 同じ要素を足し続けると、伸びはむしろ小さくなりました。3つを8回分ずつ全部足しても+4.5点で、引用を1回分足した+6.1点を下回っています
- 水増しを見抜く力は限られていました。キーワードの大量詰め込みは、誤検出を5%に抑えたときに49.8%を見抜けました。一方、繰り返しの多さを数えるだけの昔ながらのスパム判定は、同じ詰め込みをほぼ完全に見分けています
- 採点を作る過程で使わなかった3種類の水増し(スパム的なリンクの差し込み、キーワードの散りばめ、定型文の水増し)は、当てずっぽうと同程度の見分けしかできませんでした。定型文の水増しは、比べたスパム判定も含めて、どれも見抜けていません
論文はここから、実際に使うなら既存のスパム判定と組み合わせ、この採点は「水増しで大きく動かない品質の物差し」として重ねるのがよい、と結論しています。
点数と引用の相関は0.11ほどで、質問との関連のほうが強かった
7系統のAIをまとめた点数と引用の順位の相関は0.114でした(777件、統計的に偶然とは考えにくい水準)。7系統のうち4系統で個別に有意で、1系統はほぼ0(0.016)です。
非公開モデル3種での再調査も0.118で、ほぼ同じ値が出ました。
次の表は、同じ質問の候補5件を並べる力を、ほかのやり方と比べたものです(論文の表11。10系統・1,269組。
「1位の的中」は、いちばん上に置いたページが実際にいちばん引用された割合で、当てずっぽうなら0.20です)。
| 並べ方 | 順位の相関 | 1位の的中 |
|---|---|---|
| 当てずっぽう | 0.00 | 0.20 |
| この論文の採点(質問を見ない) | 0.119 | 0.25 |
| AIに渡したときの並び順(先に置いたものを上に) | 0.131 | 0.33 |
| 質問の語とページの語の重なり | 0.147 | 0.28 |
| 11項目のうち機能する8項目を自由に組み合わせる学習モデル(質問を見ない) | 0.104 | 0.24 |
| 質問との関連も数えるモデル(言語モデルなし) | 0.222 | 0.34 |
| 質問とページの関連を判定する公開モデル(学習なし) | 0.388 | 0.45 |
- 質問を見ない範囲では、この採点より良い並べ方は作れませんでした。論文はこれを、質問を見ない点数には超えられない天井がある、という自分たちの証明と合う結果と読んでいます
- 質問との関連を見ると、相関は0.119から0.388へ上がりました。0.388÷0.119で約3.3倍(私の計算による概算)で、論文は「おおよそ3倍」と書いています
- 以前の本番用の重みのほうが、引用との相関は少し高く出ています(0.137)。論文は、重みを付け直した新しい採点が、引用の予測では前の版を上回っていないことを認めています
論文は、最初の評価で同じ質問が学習と評価の両方に混ざる誤りがあり、分け直すと、質問を見ない試験用の学習モデルの相関が0.48から0.065(7系統のデータ)に下がったことも開示しています。
2023年の3つの書き換えは、今回のAIでは引用を増やさなかった
書き換えの実験の結果です(論文の表6。数字は回答の中で占める割合の差で、1が全体。
「補正前」は複数の検定をまとめて補正する前の値です)。
| 書き換え | 2023年の報告 | 今回・当初の系統(605組) | 今回・非公開モデル3種(450組) |
|---|---|---|---|
| 引用を足す | +42.6% | -0.0009(偶然で説明できる範囲) | -0.0106(補正前で有意) |
| 統計を足す | +32.8% | -0.0002(偶然で説明できる範囲) | -0.0066(偶然で説明できる範囲) |
| 出典を示す | +27.7% | -0.0101(補正前で有意、補正後は有意でない) | -0.0054(偶然で説明できる範囲) |
全系統をまとめると、引用を足す-0.33、統計を足す-0.28、出典を示す-0.79(回答の中の割合、百分率の単位)でした。3つとも増える方向には動かず、区間が0をまたがなかったのは出典を示す(マイナス側)だけです。
この新しい値で重みを付け直すと、正則化(重みが極端にならないようにする調整)をかけない版では、書き換えに反応する項目の重みが0になりました。論文は、今のAIに対して採点が保証できるのは5つの関門が守る性質の部分だ、とまとめています。
論文自身が書いている限界
- 手がかりの効果は5つだけで、関門も同じ書き換えで作っているため、試験に合わせて作り込む危険が残ります。評価の仕組みから誤りが3つ見つかっていて、未発見の誤りが残る可能性もあります
- 語の偏りの項目は、元のページの84%で満点に張り付いています
- 語の切り出しはアルファベットだけが対象で、珍しい語の判定には英語の単語表を使っています
- 引用の調査は、5件の候補と固定の指示文による代用の環境で、実際のウェブでの競争とは違います。非公開モデル3種は各1回ずつの実行です
- 質問は229問で、学習モデルの比較は小さな標本にとどまります
原文を読んで気づいた点
- 自社の商品を自社で検証した論文です。著者の所属企業は、この種の採点を無料枠のある有料サービスとして提供しています。論文中に利益相反の申告欄は見当たらず、第三者による再現もまだ報告されていない段階です
- 査読前のプレプリントです
- 日本語での検証は報告されていません。語の切り出しがアルファベットだけを数える作りなので、ここからは私の推測ですが、日本語のページにそのまま当てると、語の数え方に頼る項目の多くが既定値に張り付くと考えられます
- 表11を並べ直すと、この採点の並べ方(0.119)は、AIに渡した並び順(0.131)や、質問とページの語の重なり(0.147)よりも弱い結果でした
- 論文は3つを足した効果を「足し算より小さい」と書いていますが、8回分同士では単独の合計4.1(3.5+0.1+0.5、私の計算)より組み合わせの4.5がわずかに大きくなります。何と比べた表現かは原文に明示がなく、8回分同士の比較では当てはまりません
- ここは私の読み取りですが、引用を1回分足すと採点は6.1点上がる一方、同じ書き換えは今回のAIで引用を増やしていません。この実験の範囲では、点数と引用のされ方が別々に動いています
この論文から、言えること・言えないこと
| 言えること(論文の設定で確認された) | 言えないこと(論文では確認されていない) |
|---|---|
| 平方根で縮める作りにすると、同じ要素の水増しで稼げる点数は最大6点ほどに収まった | この採点が、見たことのない種類の水増しを見抜けること |
| 点数と引用の順位には、弱いながら偶然とは考えにくい相関(0.11ほど)があった | 点数を上げれば、AIに引用されやすくなること(因果) |
| 質問との関連を見るほうが、引用の予測力はおよそ3倍高かった | 日本語のページで同じ結果になること |
| 引用・統計・出典を足す書き換えは、今回の10系統のAIで引用を増やさなかった | 実際のウェブ検索の競争の中で、同じ結果になること |
| 引用の予測では、新しい重みは以前の本番用の重みを上回らなかった | 論文の採点と、著者の会社のサービス画面の点数が同一であること |
0.11という相関は、候補5件の並びを当てずっぽうよりわずかに良く当てる程度の強さです。1位の的中で見ると、当てずっぽうの0.20に対して0.25でした。
中小企業の視点で、どう受け取るか
ここからは論文の主張とは別の、私の読み取りです。
採点ツールの点数は「品質の目安」として読む
著者自身が、質問を見ない点数で引用を約束するのは言い過ぎだと書いています。採点ツールの点数は文章の大きな崩れを見る目安にとどめ、「引用される確率」と読み替えないのが安全です。
点数を上げる作業より、狙う質問に答えているかを先に見る
引用の予測力が高かったのは、質問とページの関連を見るやり方でした。ページの点数を上げる前に、そのページが狙う質問を1つ決め、冒頭でまっすぐ答えているかを確かめるほうが、この論文の結果に沿った順番です。
ツールの検証の中身を聞く
採点ツールを選ぶときは、点数の根拠が相関の調査か実験か、何語で確かめたかを提供元に聞くとよいと思います。16の観点で引用ページを採点した研究も、相関と利益相反の点で同じ注意が要りました。
「引用・統計・出典を足す」は、読み手のために足す
今回のAIで3つの書き換えが引用を増やさなかった以上、形だけ足す作業に時間を使う理由は弱くなりました。出典や数字は、読んだ人が確かめられる根拠のあるものだけを足せば十分だと考えます。
よくある質問
「AIに引用されやすいか」を採点するツールの点数が高いページは、AIに引用されますか
この論文の設定では、点数と引用の順位の相関は0.11ほどの弱い関係でした。相関の調査なので、点数を上げたら引用が増えるとまでは言えない数字です。
論文も、この種の点数は品質の足切りに使うものと位置づけています。
2023年のGEO論文の「引用・統計・出典を足す」は、今のAIでは効かないのですか
この論文が試した10系統のAIと、5件の候補を渡す実験の設定では、3つとも引用を増やしませんでした。ただし、実際のウェブ検索や日本語のページでの結果ではありません。
構造の特徴を扱った研究は、この論文が最も近い先行研究に挙げていて、文章の構造だけを変えた実測の解説で別の角度から読めます。
採点ツールの点数の水増しは、この論文の採点で防げますか
防げるのは同じ要素を足し続ける種類の水増しで、稼げる幅は最大6点ほどでした。想定外の水増しは見抜けておらず、論文は既存のスパム判定との組み合わせを勧めています。
まとめ:今日できる1つのこと
採点ツールの点数を見る前に、そのページで答えたい質問を1つ書き出し、ページの冒頭3行にその答えがあるかを確かめてください。
なければ、冒頭に答えを1文足します。この論文の結果では、点数よりも質問との関連のほうが、引用のされ方と強く結びついていました。
この論文は、LLMO論文の一覧の一本です。ほかの論文の解説も、順次公開しています。
この記事に書いたことを、そのまま御社のページに
生成AIに引用されるページを、お話しいただくだけでお作りします。お時間をいただくのは初回15分のヒアリングだけです。まず1ページ、無料でお作りします。
OKが出るまで、何度でも直します。事実が違う、言い回しが硬い、この話は入れないでほしい。どれも遠慮なくおっしゃってください。何度お直ししても、追加の料金はいただきません。
これまでに127社にご利用いただきました。毎月ご依頼いただいている方の6割以上が、月10ページを選ばれています。料金はページに掲載しています。
ページを増やしても問い合わせが来ないなら、原因はページの外にあります。その場合は、下の入口からご相談ください。
自社のマーケティング課題を根本から解決しませんか?
ウェブサイトから要素を引き算し、訪れた人が迷わず次の一歩に進む形へ組み直す。初回60分のオンラインで御社のサイトを一緒に読み、どこから直すべきかをお伝えします。手順をまとめた無料の診断と解説動画もご用意しています。
初回は無料・60分・オンライン完結・その場で契約のお願いはいたしません


