「AIの回答に自社名が出るようになった。それは売上にどれだけ効いているのか」。LLMO対策に取り組んだ方なら、一度は考える疑問です。2026年9月10日に公開された「Generative Marketing Mix Modeling」は、この疑問に因果推論(原因と結果の関係を統計で切り分ける方法)で答えようとしたプレプリントです。論文は、AIの回答に自社名が出るよう情報源を整える施策を「GEO」、AIの回答内に有料で枠を出す広告を「GEM」と呼び、両方の効果を推定する枠組みを提案しています。
この記事では、数式を使わずに、次の3点を原文から整理します。何を推定したいのか、なぜ普通のマーケティングデータでは足りないのか、推定のためにどんな条件が必要なのか。あわせて、論文の検証が実データではなく主にシミュレーション(人工的に作ったデータでの実験)であること、日本語での検証が何を指すのかも、原文で確かめて書きます。
合同会社謙虚は、3つのドメインを並行して運用し、何を変えると数字が動くかを測り続けています。この論文を読むのは、「AIに出ること」と「売上が動くこと」の間を測る難しさを、統計の側から整理しておくためです。
結論:3行で言うと
- AIの回答での露出は、従来の広告ログに記録が残りません。論文は、回答の実測、質問の件数、各AIの利用割合、ユーザーが気づく確率の4つを組み合わせて、露出を推定する方法を提案しています
- 施策の効果を求めるには、施策のある世界とない世界を、期間全体で比べる必要があります。論文はそのために必要な条件(施策を入れる時期にばらつきがあること、出現確率が対象の市場に当てはまることなど)を整理しています
- 検証の中心はシミュレーションです。売上に当たるデータは人工的に作られています。AIの回答の集計は実際に取得した2,240件で、そのうち半分は日本語の質問です
この論文は、GEOの効果を「実測した」ものではありません。効果を測るための設計図と、その設計図が人工データでどこまで働くかを示した論文です。
この論文の基本情報
| 項目 | 内容 |
|---|---|
| 原題 | Generative Marketing Mix Modeling: A Causal Inference Framework Linking GEO and GEM to Business Impact |
| 著者 | Masahiro Kato(東京大学、みずほ第一フィナンシャルテクノロジー)、Daiki Honma、Taka Kato(この2名の所属は原文にNP-hardと表記) |
| 公開日 | 2026年9月10日(arXiv v1)。原文の表紙の日付は9月11日 |
| arXiv番号 | 2609.11915(分類は統計・機械学習) |
| 掲載・採択状況 | arXivのプレプリントです。arXivの欄に学会名や査読済みの記載は見当たりませんでした |
| 種類 | 統計手法の提案と、シミュレーションによる検証 |
| 実験データ・コード | この論文自身のデータやコードの公開先は、原文で確認できませんでした。付録の参考分析は、別の論文の公開リポジトリを利用しています |
論文はarXiv(2609.11915)で読めます。
この論文が答えた問い
AIの回答での露出(GEO)や、回答内の広告(GEM)が、売上などの成果に与えた効果を、どうすれば因果の意味で推定できるのか。
背景には、マーケティングミックスモデリング(MMM)という古くからの手法があります。テレビ、検索広告、SNS広告などの出稿量と、売上を、地域や期間ごとに並べて、各媒体の貢献を推定する手法です。広告には次の2つの性質があるため、MMMは出稿量をそのまま使わず、加工してから使います。
- 持ち越し:広告を出した週の後にも、効果が残ります
- 飽和:すでに多く出している状態では、追加の効果が小さくなります
従来の媒体は、出稿量や表示回数が記録に残るため、この加工ができました。AIの回答は事情が異なります。論文の言い方では、通常のマーケティングデータは、ユーザーが企業名を回答の中で見て、気づいた回数を記録していません。GEOで自然に出る社名の出現は、従来の表示ログの記録の対象外です。GEMの有料枠はプラットフォームに記録が残りますが、ユーザーが気づいたかどうかを読み取れない点が課題です。
何を推定したいのか
論文が推定したい量は、次の比較の差です。
- GEOの施策(例えばFAQの追加や製品資料の改訂)を、決めた時期に実施した世界の、期間全体の成果
- 同じ期間に、その施策を一切しなかった世界の成果
論文はこの差を、施策の「総合的な効果」と呼んでいます。AIの回答を通った効果だけでなく、通常の検索経由の流入や、着地ページでの成約の変化など、施策が生んだほかの変化もすべて含みます。GEMも同様に、有料枠がある世界とない世界の差で定義します。
なぜ普通のマーケティングデータでは足りないのか
論文が挙げる理由は2つあります。
理由1:露出の量が記録されていない
AIの回答での露出量を、論文は「回答に社名が出て、かつユーザーが気づく回数の期待値」として組み立てます。そのために、次の4つの材料が要ります。
- AIの回答を繰り返し取得した記録:質問ごとに、社名が回答に出る確率を推定します
- 関連する質問の件数(市場・期間ごと):確率を、市場の規模に引き伸ばします
- 各AIサービスの利用割合:AIごとに出方が違うため、割合で重みを付けます
- ユーザーが社名に気づく確率:回答に出ても読まれていない場合を除きます
論文は、AIからの流入数(リファラル)も代わりにならないと述べています。回答を読んでもリンクをたどらないユーザーがいるためです。GEMでは、広告費から「表示された枠の数」を推定し、そこに気づく確率を掛けます。
理由2:施策の効果は、期間全体の入れ替えで測る
持ち越しがあるため、ある週の成果は、それ以前の週の露出にも左右されます。施策をやめると、その週だけでなく、以降の露出の並び全体が変わります。論文は、「回帰係数(1単位あたりの効果の推定値)をそのまま読んでも、この比較にはならない」としています。施策のある期間全体と、ない期間全体を入れ替えて、成果を比べる必要があります。
効果を推定するための条件
論文は、効果を確かめられるための条件を整理しています。専門用語を外して書くと、次のようになります。
- 施策のある状態とない状態の両方を観察すること。回答の実測が施策なしの状態だけなら、分かるのは「その状態での出現確率」だけです。施策による変化を求めるには、両方の状態のデータが要ります
- 施策を入れる時期に、ばらつきがあること。すべての市場が同じ日に始めると、比べる相手がいません。論文は、ランダムな順で展開する設計なら、この条件を設計で満たせると述べています。ランダムでない場合は、施策の前の状況を制御し、両方の状態が起こりうる状況で比べる必要があります
- 出現確率が、対象の市場に当てはまること。取得した回答が想定する質問の分布と、実際の市場の質問の分布がずれると、推定が外れます
- 持ち越しと飽和の形が、決まっているか推定できること。施策の始まりが1回きりの段階的な変化だと、効果の大きさと飽和の形を区別しにくくなります
- 成果を表すモデルが、大きく間違っていないこと。AIからの流入や指名検索のような中間の変数を「固定」すると、総合的な効果が測れなくなる点にも注意が要ります
どうやって調べたのか
検証は2本立てです。1つは実際のAIから回答を集めた調査、もう1つは人工データでのシミュレーションです。
AIの回答の収集(実際のデータ)
| 項目 | 内容 |
|---|---|
| 質問 | 製品の推薦を求める56問。7つの用途(Web上のハイライト、AIによる要約など)に、各英語4問・日本語4問 |
| 対象のサービス | GPT-5.6 Luna と GPT-4o(この2つは原文の表記) |
| 回数 | 各質問・各AIに20回。合計2,240件(56問×2×20回) |
| 条件 | 共通の指示文で、回答前にWeb検索を必須とした。質問にも指示文にも、調べたい社名は含めない |
| 集めた期間 | 2026年9月3日から4日にかけての約1日 |
| 数えたもの | 回答の中に、Glasp(ウェブ上のハイライト保存サービス)の名前があるか。良い評価かどうかは問わない |
シミュレーション(人工データ)
| 項目 | 内容 |
|---|---|
| 市場と期間 | 5つの地域市場、それぞれ6つの商品群、36期間。観測は合計1,080件 |
| 施策の入れ方 | 各市場で、2つの商品群が19期から、2つが23期から、2つは施策なし |
| 正解の効果 | 人工的に決めた係数で、成果を生成する |
| ユーザーが気づく確率 | 各条件で50件の観察があるものとして設定 |
| 既知とした量 | 質問の件数と、AIごとの利用割合 |
| 指標・繰り返し | 効果の推定のずれ(相対RMSE:真の値に対する、ずれの大きさの割合)と、95%区間が真の値を含む割合。各条件で120回 |
比べた推定方法は、加工の形(持ち越しと飽和)を固定する方法、データから推定する方法、測定の不確かさを成果データで更新する方法としない方法です。「正解の露出を知っている場合」も比較の基準として置いています。
結果
AIの回答での出現率:日本語と英語で順位が逆転した
| AI | 英語の質問 | 日本語の質問 | 全体 | 出現時に1位で挙がる割合 |
|---|---|---|---|---|
| GPT-4o | 35.4% | 20.2% | 27.8% | 60.5% |
| GPT-5.6 Luna | 28.6% | 38.9% | 33.8% | 39.4% |
この表は原文の表1から拾いました。数字は、回答にGlaspの名前が出た割合です。最右の列は、名前が出た回答のうち、候補11ブランドの中で最初に挙がった割合です。
- 全体では、GPT-5.6 Lunaのほうが高い出現率でした。論文は、差を5.70ポイント(95%区間は3.12から8.27)と報告しています
- 言語別に見ると、英語ではGPT-4oが6.79ポイント高く、日本語ではGPT-5.6 Lunaが18.75ポイント高くなりました
論文は、ここから「1つの全体平均では足りない」と述べています。
シミュレーション:持ち越しと飽和を推定することが効いた
| 方法(1条件あたり回答5件) | 係数の誤差 | 効果の相対RMSE | 95%区間の的中率 |
|---|---|---|---|
| 加工を事前の平均値に固定 | 1.207 | 17.642% | 0.975 |
| 加工を成果データから推定(プラグイン) | 0.945 | 17.525% | 0.975 |
| 加工を成果データから推定(同時推定) | 0.950 | 17.541% | 0.975 |
| 加工の正解を知っている場合 | 0.882 | 17.135% | 0.950 |
この表は原文の表2から拾いました。「係数の誤差」は、4つの係数のずれをまとめた値です。
- 持ち越しと飽和を推定するかどうかが、係数の当たり方を最も左右しました。固定した場合の1.207が、推定すると0.945に下がっています
- 測定の不確かさを成果データで更新する同時推定は、一様な利点を示しませんでした。効果のずれ(RMSE)では、ほとんどの比較で差の区間がゼロを含みます。ただし、出現確率を実回答から推定した条件では、更新しない方法より、同時推定が0.154ポイント悪化しました
- 効果の総量のずれは、どの方法でも約17%前後でした。正解の露出を知っている場合でも17.135%です。成果のばらつきを小さくした条件(表3)では、約6%まで下がっています
効果の内訳:総量は当たっても、内訳は外れやすい
論文は、総合的な効果を2つに分けています。露出の変化を通らない部分(人工データで0.55に設定)と、露出を通る部分です。原文の表4によると、回答5件・成果のばらつき大(誤差の標準偏差1.2)の条件で、内訳の相対RMSEは、前者が約33%、後者が約48%でした。2つの誤差は逆向きに出やすく(相関は約-0.63)、足し合わせると打ち消し合います。
人工データでは、露出を通らない部分が総効果の約66%を占めました(制御設計での原文の平均値。出現確率を推定する設計では、この値は約75%になります)。実際の施策の配分を示す数字ではありません。
ランダム化実験の結果を加えた場合
論文は、ランダム化実験(施策をランダムに割り当てた試験)で得た効果の推定値を、統計モデルに加える場合も調べました。実験が対象の市場と揃っている場合、効果のずれは17.576%から17.057%に下がっています(原文の表5)。実験の結果が対象と食い違う場合(0.75を加えた設定)は、相対バイアス(推定が真の値からどちらかに偏る割合)が0.380%から3.813%へ増えました。
付録の参考分析:実データでのAI経由の流入
付録Fでは、別の論文(Watanabe氏とNakayashiki氏)の公開データを使い、AI経由の流入を試しに分析しています。処置群と対照群の流入の比は、処置の開始週を12月30日とした場合に1.842(95%区間1.306から2.599)でした。ただし、開始週を12月16日にすると1.183、1月6日にすると2.404と、大きく動きます。論文は、事前の期間にも同程度の変動があるため、この診断だけでは効果を確立できないと述べています。この公開データは、提案した枠組みには載せられなかったとも書かれています。
日本語での検証は、何を確かめたのか
日本語が関わる範囲を、原文の記述で整理します。
- 回答の収集:56問のうち28問が日本語です。ユーザーのメッセージの冒頭に「Respond in Japanese.」と付けて、日本語で回答させました。日本語の回答は、2つのAIで計1,120件(28問×2×20回。私の計算)になります
- 確かめた内容:日本語の質問への回答に、Glaspの名前が出るかどうか。出現率は上の表のとおりです
- シミュレーションでの使い方:回答から得た出現確率を、2つ目の設計の元にしています。各回、英語6問と日本語6問を選んで使いました
日本語で検証していないものもあります。売上や成約に当たるデータは人工データで、日本の市場のデータではありません。ユーザーが日本語の回答で社名に気づく確率も、実測はありません(気づく確率はシミュレーション内で設定した値です)。
論文自身が書いている限界
論文には「限界」という独立の節はありません。考察の節に、次の点が書かれています。
- シミュレーションでは、質問の件数とAIごとの利用割合を「既知」として扱っています。実際には推定が必要で、期間中に変わることもあります
原文を読んで気づいた点
- 成果のデータが人工です。売上に当たる数値は、決めた係数から生成されています。GEOやGEMが実際の事業に与える効果の大きさは、この論文からは分かりません
- 要旨の「simulated answers」は、本文の内容と食い違います。要旨には「シミュレーションされた回答」とありますが、本文では、実際のAIのAPIから2,240件の回答を取得したと書かれています。私は、本文と付録の記述を優先して読みました
- 対象は1つの企業名(Glasp)だけです。質問も製品の推薦を求める7用途に限られ、日本語は28問と少数です
- 日本語の回答で、社名の表記をどう数えたかは、本文で確認できませんでした。「辞書に載った表記」で数えたとあり、辞書の中身(カタカナ表記を含むか)は本文に書かれていません
- プレプリントで、査読の記載がありません。数値は著者の報告で、追試は確認できていません
- 効果のずれは、正解の露出を知っていても約17%あります。効果の大きさを厳密に当てる道具というより、条件を整理する枠組みと読めます(私の読み取りです)
この論文から、言えること・言えないこと
| 言えること(論文の設定で確認された) | 言えないこと(論文では確認されていない) |
|---|---|
| AIの回答での露出は従来のログに残らず、推定には回答の実測、質問数、AIの利用割合、気づく確率が要る | GEOやGEMで売上が何%上がるか |
| 施策の効果は、期間全体で施策のある世界とない世界を比べて定義される | 自社のデータで、そのまま効果が測れること |
| 人工データでは、持ち越しと飽和を推定すると係数の当たりが良くなった | 実際の市場でも、同じ改善が出ること |
| 2つのAIで、社名の出現率は言語によって順位が逆転した | ほかの企業や業種でも同じ傾向になること |
| 日本語の質問28問でも、回答の実測ができた | 日本語での売上や成約への効果 |
中小企業の視点で、どう受け取るか
ここからは論文の主張とは別の、私の読み取りです。
1. 「AIに出た回数」は、売上の代わりにならない
回答に社名が出ることと、読まれること、売上が動くことは、別々の出来事です。論文は、その間をつなぐために、気づく確率まで組み込んでいます。自社で数えるときも、出現の有無だけを成果とみなさないほうが安全です。
2. 施策の入れ方が、あとで効果を測れるかを決める
論文の条件から読み取れるのは、「全ページを同じ日に一斉に直すと、あとで比べる相手がいない」ことです。ページや地域を分けて、時期をずらして実施し、日付を記録しておくと、あとの分析の材料になります。規模の小さい自社サイトでは、比較できる単位が少ないため、これは特に効きます。
3. 言語や質問の型で、出方は変わりうる
この論文の調査では、日本語と英語で、2つのAIの順位が入れ替わりました。日本語の質問での見え方は、英語圏の研究結果と別に確かめる価値があります。ただし、この結果は1社の名前と約1日の収集に基づいています。
4. 統計モデルの導入は、大きな企業向けの話
この枠組みは、複数の市場と長い期間のデータを前提にしています。中小企業に使えるのは、「何を記録すれば、あとで効果を見られるか」という考え方だと私は読みました。
よくある質問
この論文の枠組みは、GEOの効果を測るツールですか
ツールではなく、推定のための考え方(統計モデル)の提案です。論文に、誰でも使えるソフトウェアの公開先は書かれていません。実際に使うには、統計の専門家の設計が要ります。
シミュレーションだと、意味がないのでしょうか
意味がないわけではありません。正解が分かっている人工データだからこそ、「推定方法がどれだけ外れるか」を測れます。ただし、実際の市場の複雑さは再現しきれないため、結果は「この設計では」の但し書き付きで読みます。
まとめ:今日できる1つのこと
自社で行ったLLMO対策(FAQの追加、ページの書き直しなど)を、「いつ・どのページに・何をしたか」で1枚の表にまとめてください。日付と対象ページがあれば、あとで「施策をした時期とそうでない時期」を比べられます。記録がないものは、いま思い出せる範囲で構いません。
この論文が整理したのは、効果を測るための条件です。効果の大きさは、まだ実データで示されていません。
この論文は、LLMO論文の一覧の一本です。ほかの論文の解説も、順次公開しています。
この記事に書いたことを、そのまま御社のページに
生成AIに引用されるページを、お話しいただくだけでお作りします。お時間をいただくのは初回15分のヒアリングだけです。まず1ページ、無料でお作りします。
OKが出るまで、何度でも直します。事実が違う、言い回しが硬い、この話は入れないでほしい。どれも遠慮なくおっしゃってください。何度お直ししても、追加の料金はいただきません。
これまでに127社にご利用いただきました。毎月ご依頼いただいている方の6割以上が、月10ページを選ばれています。料金はページに掲載しています。
ページを増やしても問い合わせが来ないなら、原因はページの外にあります。その場合は、下の入口からご相談ください。
自社のマーケティング課題を根本から解決しませんか?
ウェブサイトから要素を引き算し、訪れた人が迷わず次の一歩に進む形へ組み直す。初回60分のオンラインで御社のサイトを一緒に読み、どこから直すべきかをお伝えします。手順をまとめた無料の診断と解説動画もご用意しています。
初回は無料・60分・オンライン完結・その場で契約のお願いはいたしません

