AIに質問するとき、1回で終わることは少なく、答えを読んで次の質問を重ねていくのが普通です。ところが、GEO(AIの回答に取り上げられやすくする工夫)の研究は、ほとんどが「1回の質問に対する1回の回答」で効果を測ってきました。
2026年9月30日に公開された論文「Conversational Capture」は、この測り方に疑問を投げかけ、会話全体で評価する枠組みを提案しています。この記事は原文を通読し、理論で示されたことと、実測では確かめられていないことを分けて整理します。
合同会社謙虚は、3つのドメインを並行して運用し、何を変えると数字が動くかを測り続けています。この論文を読むのは、私たちが使っている「1回の回答での見え方」という物差しに、どんな見落としがあり得るかを知っておくためです。
結論:3行で言うと
- 会話の早い段階で引用された出典が、その後も引用されやすくなる現象を「会話の捕捉(conversational capture)」と名づけ、数理モデルにした論文です
- 前に引用された出典が有利になる向きに循環が働く、という仮定を置いたモデルの上では、1回の回答で測った効果は、会話全体での効果を小さく見積もることが示されました。計算例では、10回のやり取りで約2.2倍の開きが出ています
- ただし、数値はすべてモデルから計算した例です。実際のAIサービスでも、人を対象にした実験でも測られていないと、論文自身が明記しています
つまり、これは「こういうことが起こり得る」という理論と、それを確かめるための物差しを示した論文です。
この論文の基本情報
| 項目 | 内容 |
|---|---|
| 題名(原題) | Conversational Capture: A Trajectory-Level Framework for Evaluating Generative Engine Optimization in Multi-turn Human-Agent Interaction |
| 著者 | Junwei Yu、Jieyu Zhou、Mufeng Yang、Yepeng Ding、Hiroyuki Sato(5人。所属は東京大学、東京の民間企業、筑波大学、広島大学、国立情報学研究所) |
| 公開日 | 2026年9月30日(arXiv初版v1) |
| arXiv番号 | 2609.40069(分野はcs.HC、人とコンピューターの相互作用) |
| 掲載/採択状況 | arXivのコメント欄に「第14回 Human-Agent Interaction 国際会議(HAI ’26、2026年11月16〜19日、大阪)の会議録に収録」と記載。論文の書式もACMの会議録のものです |
| 種類 | 理論とモデルの論文(9ページ、図2、表2)。人を対象にした実験や実サービスでの測定は含みません |
| 実験データ/コード | 公開先の記載は見当たりませんでした。証明は「補足資料」にあると書かれています |
論文はこちらで読めます。arXiv(2609.40069)。
論文に印字された会議録のDOI(10.1145/3841580.3841626)は、2026年10月3日の時点では未登録でした。会議の開催前なので、採択については「コメント欄にそう記載されている」という範囲でお伝えします。
この論文が答えた問い
GEOの効果を「1回の回答」だけで測ると、会話が続く場面での本当の効果を見誤るのではないか。見誤るなら、どれだけ、どちらの方向にずれるのか。
これまでの評価は、質問を1つ固定し、文章を整えた場合と整えない場合で、回答の中の目立ち方を比べるものでした。出発点になった研究は、GEO原論文の解説でまとめています。
論文は、この測り方が2つの前提に頼っていると指摘します。質問はAIの外から与えられるという前提と、1回ごとのやり取りは互いに独立しているという前提です。
会話では、どちらも成り立ちにくくなります。利用者は答えを読んで考えを更新し、次の質問を変えるからです。
論文はこの関係を「閉じた輪」と呼びます。AIの答えが次の質問を形づくり、その質問がまたAIの検索を決める、という循環です。
出典が引用され続ける2つの経路
論文は、早く引用された出典が残り続ける理由を、2つの経路に分けました。この分け方が論文の方法上の核だと、著者は述べています。
| 経路 | 何が起きるか | 測り方 |
|---|---|---|
| 機械の側(M1) | AIは会話の履歴を踏まえて検索し、回答を作る。前に引用した出典が、利用者の質問と関係なく再び出やすくなる | 同じ質問を、履歴を持つAIと持たないAIに与えて比べる。利用者のモデルは不要 |
| 人の側(M2) | ある出典に寄った答えを読んだ利用者が、その出典の方向へ追い質問をする | 「GEOの影響がなければ何を尋ねたか」という仮の道筋が必要。利用者を模したシミュレーターを使う |
論文が強調するのは、この持続が「いまの質問との関連の強さ」と切り離されて起こり得る点です。利用者の関心が狭まったり移ったりしても、前に出た出典が残る可能性があります。
どうやって調べたのか
調べ方は3段階です。指標を定義し、確率の理論で性質を証明し、最後に数値例で示しています。
人を集めた実験や、実在のAIサービスへの質問は行われていません。論文は「理論とモデル化の貢献であり、人による注釈は集めていない」と書いています。
会話全体で測るための指標
| 指標 | 意味 |
|---|---|
| 累積の見え方 | ある出典が、会話の各回で得た目立ち方の合計。従来の1回ごとの指標をそのまま足し上げる |
| 直接の分 | 質問の流れがGEOなしの場合と同じだと仮定したときの、1回ごとの上乗せの合計。1回の測定を回数倍した値にあたる |
| 循環の分 | GEOが後の質問と履歴を変えたために増えた見え方。機械の側と人の側に分けられる |
| 捕捉係数 | 前の回で引用された場合と、されなかった場合の、次の回で引用される確率の差 |
| 複利の倍率 | 会話全体での効果を、「1回の効果×回数」で割った値。1なら1回の測定で足りる |
| 順位のずれ | 複数の手法を、1回の効果で並べた順位と、会話全体の効果で並べた順位の一致度(ケンドールの順位相関) |
これらは、いま使われている1回ごとの目立ち方の値から計算できると、論文は述べています。目立ち方の測り方は同じで、足し上げ方と比べる相手を変える提案です。
理論の部分
証明には「ポリアの壺」という確率のモデルが使われています。壺から玉を引き、引いた色の玉を足して戻す、という繰り返しです。
引用された出典ほど次も引用されやすくなる、という性質を表すのに向いています。論文は、整えた出典と、その他をまとめた競合の2つで考えました。
証明された内容は、言葉にすると次の3点です。
- 循環の分は、1回の評価や、履歴を持たないAIでは、必ずゼロになる
- 強まり方が両者で同じ場合でも、最終的な引用の割合は最初の状態に左右される。序盤のやり取りが長期の結果を決める
- 整えた出典のほうが強まりやすい場合、会話全体の効果は回数に比例する以上に伸びる。ただし見え方には上限があるので、倍率は有限の天井に近づく
証明の全文は補足資料にあると書かれています。私が読んだ9ページの本文には、命題の文面だけが載っていました。
結果
計算例:10回のやり取りでの内訳
論文は、単純な計算式に値を入れて、10回の会話を計算しました。入力は、1回あたりの上乗せが0.12、強まり方の強さが0.6です。
出典の目立ち方は、GEOなしを0.5としています。
整えた出典は1回目に0.62で始まり、10回目に0.91まで上がりました。循環がない場合は0.62のまま横ばいです。
| 量 | 値 |
|---|---|
| 1回での効果 | 0.120 |
| 1回の効果×10回(単純な見積もり) | 1.200 |
| 直接の分 | 1.200 |
| 循環の分 | 1.481 |
| うち機械の側(M1) | 0.851 |
| うち人の側(M2) | 0.630 |
| 会話全体での効果 | 2.681 |
| 複利の倍率 | 2.234 |
出典は論文の表1です。式と入力値から私も計算し直し、同じ値になることを確かめました。
- 循環の分(1.481)が、直接の分(1.200)を上回りました。会話全体の効果に占める割合は約55%です(概算。1.481÷2.681)
- 複利の倍率は2.23でした。1回の測定を10倍した見積もりと比べて、会話全体の効果が2.23倍あるという意味です
- 会話が長くなると倍率は上がり続け、この式では約4.17(1÷(2×0.12))が天井になります
- 強まり方0.6を機械の側0.35、人の側0.25に分けた配分は、論文が「例示」と断って置いた値です。実際の比率は、今後の測定で求めるものとされています
計算例では、1回で1位の手法が会話全体では3位になる
次に論文は、架空の手法を5つ用意しました。1回での目立ちやすさと、会話の中で強まる力が、それぞれ違う設定です。
| 手法 | 1回での効果 | 強まる力 | 会話全体での効果 | 1回での順位 | 会話全体での順位 |
|---|---|---|---|---|---|
| A | 0.18 | 0.2 | 2.343 | 1 | 3 |
| B | 0.15 | 0.7 | 3.224 | 2 | 1 |
| C | 0.12 | 0.3 | 1.919 | 3 | 4 |
| D | 0.10 | 0.8 | 2.851 | 4 | 2 |
| E | 0.08 | 0.5 | 1.855 | 5 | 5 |
出典は論文の表2です。10組の比較のうち順位が合ったのは7組で、一致度は0.4((7-3)÷10)でした。
論文はこれを「弱い相関にとどまる」と評しています。
論文はさらに、5つの手法の組を5万通り無作為に作って確かめました。2つの値を独立に選んだ場合、90%の組で順位が食い違い、48%の組で1位が入れ替わっています(一致度の平均は0.54)。
目立ちやすい手法ほど強まる力が弱い、という関係を仮定すると、一致度の平均は0.18に下がりました。1回での1位が会話全体の1位と異なった組は91%です。
どちらもモデルの中での計算です。現実の手法が、この2つの値の組み合わせのどこに位置するかは、今後の実測で決まる問題だと論文は書いています。
AIサービスの設計への提案
論文は、会話の捕捉を「操作の入り口になり得る面」と位置づけ、AIを作る側への対策を3つ挙げています。
- 毎回、履歴の重みを下げて検索し直す
- 1回の回答の中で、1つの出典が占める割合に上限を設ける
- ある出典が引用され続ける理由を利用者に示し、前に引用されたからなのか、いまの質問に合うからなのかを区別できるようにする
論文自身が書いている限界
論文は「限界と妥当性への脅威」の節と理論の節で、次の点を断っています。
- 論文中の数値は、すべてモデルから導いたものです。実際に使われているAIでの大きさを推定した値とは別物だと、繰り返し断っています
- 人の信頼や受け止め方は測っていません。利用者が操作されていると主張するものでもなく、検証が要る仮説だとしています
- 循環の向きは、仮定に依存します。利用者が「これは別の情報源でも確認できますか」と問い直す場合、人の側の経路は逆に働き、1回の評価は効果を大きく見積もりすぎることになります
- 人の側の経路を測るには、利用者を模したシミュレーターが必要です。その作り方で結果がどれだけ変わるかを報告すべきだと書いています
- 壺のモデルは、多数の出典を「整えた出典」と「その他」の2つにまとめています。整えた出典どうしが競う場面は、モデルの外です
- 今後の検証で使う予定の公開版の検索・生成の仕組みは、商用のAIサービスとは別のものです
次の一歩として論文が挙げるのは、人の追い質問が記録された公開の会話データで測ることです。機械の側の経路は利用者のモデルが要らないので、すぐに測れるとしています。
原文を読んで気づいた点
- 日本語での検証は、報告されていません。そもそも実測がなく、今後の検証計画の節も、対象とする言語に触れていません
- 著者は全員が日本の機関の所属で、会議の開催地は大阪です。ただし、それは日本語のAI検索で確かめたことを意味しません。この2つは別の話です
- 実験は、式に値を入れた計算です。実サービスでの測定、利用者のシミュレーション、人を対象にした調査は、いずれも行われていません
- 計算に使った値(0.12や0.6、5つの手法の設定)は例示で、実測から決めた根拠は示されていません
- 5つの手法は架空のものです。論文は「キーワードの詰め込み」と「次の質問を誘う書き方」を対比の例に挙げますが、どの手法がどれに当たるかは対応づけていません
- 証明は補足資料にあるとされ、本文9ページには含まれていません。私は証明そのものを確認できていません
- 著者の1人は民間企業の所属です。論文中に、特定の製品やサービスの宣伝は見当たりませんでした
- 採択の根拠は、arXivのコメント欄と論文の書式です。会議側の採択一覧では確かめていません
この論文から、言えること・言えないこと
| 言えること(論文のモデルの中で示された) | 言えないこと(論文では確認されていない) |
|---|---|
| 履歴や追い質問で循環が生じるなら、1回の評価は会話全体の効果を捉えきれない | 実際のChatGPTやGeminiで、会話の捕捉が起きていること |
| 例示の設定では、10回の会話で効果が単純な見積もりの2.23倍になった | 現実のGEOの効果が2.23倍になること |
| 1回で最も効く手法と、会話全体で最も効く手法は、食い違い得る | 現実のどの手法が、会話全体で有利かということ |
| 序盤に引用されることの影響が、モデル上は長く残る | 最初の回答に載れば、その後も引用され続けること |
| 循環の向きが逆なら、1回の評価は効果を過大に見積もる | 日本語の会話で、どちらの向きが強いかということ |
中小企業の視点で、どう受け取るか
ここからは論文の主張とは別の、私の読み取りです。
1. 自社の見え方を、追い質問まで続けて確かめる
AIに1回だけ質問して、自社が載ったかどうかを見る確認には、会話の2回目以降が写りません。同じ話題で2〜3回質問を重ね、出典がどう入れ替わるかを記録しておくと、論文が言う循環の有無を自分の目で見られます。
2. 入口になる質問のページを、先に整える
序盤の引用が後まで響くという結論は、まだモデル上のものです。それでも、利用者が最初に尋ねそうな基本の質問に、正確に答えるページを用意しておくことは、理屈に合う備えだと考えます。
3. 追い質問を「誘う」より、追い質問に「答える」
論文は、会話の捕捉を、操作の入り口になり得る面と位置づけています。次の質問を誘う書き方は、その力を持つ手法の例として挙がっています。
読者が次に知りたくなることを先回りして正直に書く、という範囲にとどめるのが安全です。
4. 「2.23倍」を効果の数字として使わない
この数字は、例示の入力から計算した値です。提案書や社内の説明で、GEOの効果の根拠として引用できる性質のものとは違います。
よくある質問
会話の捕捉(conversational capture)とは何ですか
AIとの会話で、早い段階に引用された出典が、その後の回答でも引用されやすくなる現象を指す、この論文の用語です。
AIが履歴を踏まえて検索する経路と、利用者がその出典の方向へ追い質問をする経路の、2つで起こると論文は説明しています。
会話の捕捉は、実際のChatGPTやGeminiで確認されていますか
この論文の中では、確認されていません。数値はすべて、モデルに値を入れて計算したものです。
実際の検索の仕組みと実際の利用者での検証は、次の課題として論文が挙げています。
複利の倍率2.23は、GEOの効果が2.23倍になるという意味ですか
違います。1回の測定を10倍した見積もりに対して、モデル上の会話全体の効果が2.23倍だった、という比です。
入力の値は例示で、現実のAIサービスでの大きさは測られていません。利用者が問い直す場合は、1回の評価のほうが効果を大きく見積もることになると、論文は述べています。
まとめ:今日できる1つのこと
ふだん確認しているAIへの質問を1つ選び、答えを読んだあとに自然な追い質問を2回続けてみてください。
1回目に出た出典が2回目、3回目にも残るか、自社のページがどの回で現れるかを書き留めます。1回の結果だけで判断していた部分が、どれだけあるかが見えてきます。
この論文は、LLMO論文の一覧の一本です。ほかの論文の解説も、順次公開しています。
この記事に書いたことを、そのまま御社のページに
生成AIに引用されるページを、お話しいただくだけでお作りします。お時間をいただくのは初回15分のヒアリングだけです。まず1ページ、無料でお作りします。
OKが出るまで、何度でも直します。事実が違う、言い回しが硬い、この話は入れないでほしい。どれも遠慮なくおっしゃってください。何度お直ししても、追加の料金はいただきません。
これまでに127社にご利用いただきました。毎月ご依頼いただいている方の6割以上が、月10ページを選ばれています。料金はページに掲載しています。
ページを増やしても問い合わせが来ないなら、原因はページの外にあります。その場合は、下の入口からご相談ください。
自社のマーケティング課題を根本から解決しませんか?
ウェブサイトから要素を引き算し、訪れた人が迷わず次の一歩に進む形へ組み直す。初回60分のオンラインで御社のサイトを一緒に読み、どこから直すべきかをお伝えします。手順をまとめた無料の診断と解説動画もご用意しています。
初回は無料・60分・オンライン完結・その場で契約のお願いはいたしません


