AIとのやり取りは、1回で終わるより何往復か続くことが多いものです。最初に目的を伝え、途中で予算や条件を足し、最後に「どれがいいですか」とだけ聞く、という流れです。
2026年8月にarXivで公開された論文は、この最後のひと言だけをAIに渡した場合と、会話全体を渡した場合とで、答えがどれだけ変わるかを英語の会話180件で測りました。
この記事は原文8ページを付録まで読み、数値を原文の表と本文から拾って整理します。
合同会社謙虚は、3つのドメインを並行して運用し、何を変えると数字が動くかを測り続けています。AIでの見え方を「1つの質問文」で確かめる方法がどこまで当てになるのか、その前提を原文で確かめるために、この論文を読みました。
結論:3行で言うと
- 最後のメッセージを同じにしたまま、それより前のやり取りを外すと、44.7%の会話で、利用者の行動が変わりうるほど違う答えになりました(会話全体を渡した答えとの比較、重みづけ後の推定)
- 依頼にどれだけ応えたかをAIが0〜4点で採点すると、会話全体を渡した答えのほうが平均0.49点高くなりました
- 前のやり取りを160語以内に要約して添えると点数の差はほぼ0に縮みましたが、30.8%は会話全体の答えと実質的に違うままでした
単著のプレプリントで、答えの採点もAIが行っています。人による判定での確認は、論文自身が今後の課題に挙げている段階です。
この論文の基本情報
| 項目 | 内容 |
|---|---|
| 題名(原題) | Beyond the Final Prompt: Measuring the Effect of Within-Conversation Context on AI Answers |
| 著者 | ベンジャミン・タネンバウム(1人)。所属はイスラエル・テルアビブ(別の論文 arXiv:2609.22655 で、AI検索での見え方を測るソフトウェアの企業の創業者と明記) |
| 公開日 | 2026年8月3日(arXiv初版) |
| arXiv番号 | 2608.02556(分類は情報検索) |
| 掲載・採択状況 | arXivのプレプリント。コメント欄は「8ページ、図3、表2」と、2607.22392の姉妹編である旨だけで、学会・論文誌の記載がないため、査読前と判断しました |
| 種類 | 同じ会話を3通りの渡し方でAIに答えさせ、答えを比べた実験研究 |
| 実験データとコード | 設計、設定、分析のコード、会話の文面を含まない件ごとの数値をまとめた資料一式がある、と本文に記載。公開先のURLは書かれておらず、arXivの投稿ファイルは原稿のみでした。会話の原文と生成された答えは非公開 |
| 利益相反の申告 | 本文に記載なし |
論文はこちらで読めます。arXiv(2608.02556)、DOI(10.48550/arXiv.2608.02556)。
同じ著者は、AI検索の測り方についての論文を続けて出しています。当社では、4つのAI検索の引用URLの重なりを測った論文を解説しました。
著者はその論文で、AI検索での見え方を測るソフトウェアの企業の創業者だと明記しています。
コメント欄が姉妹編として名指しするarXiv:2607.22392は、目的や条件が最後のメッセージより前にだけ書かれている会話がどれだけあるかを数えた論文です。今回の論文はその続きとして、「抜けた情報で、実際に答えが変わるのか」を測っています。
この論文が答えた問い
最後のメッセージを固定したとき、同じ会話の前のやり取りは、AIの答えをどれだけ変えるのか。
AIの評価では、利用者の最後のメッセージだけを「質問」として扱うことがよくあります。保存しやすく、何度も流し直せて、件数も数えやすいからです。
論文は、扱いやすさと、測りたいものを正しく測れているかは別だと指摘します。
付録には、説明用に作った会話の例があります。旅行用のノートパソコンを探し始め、途中で予算と対応する基本ソフトの条件を足し、AIが勧めた1機種を断ってから「どっちがいい?」
で終わる会話です(データから引いたものではないと注記されています)。
最後のひと言だけでは、候補も予算も、断った機種も分かりません。
姉妹編の2607.22392は、こうした情報が前のやり取りにあることまでは示しました。今回の論文は、それが答えを変えることは示されていなかったとして、その空白を埋める位置づけです。
対象は「同じ会話の中の前のやり取り」に限られます。別々の会話をまたいで覚える機能と混同しないよう、論文は「記憶」という言葉を意図して避けています。
どうやって調べたのか
1つの会話ごとに、最後のメッセージと答えるAIは固定し、前のやり取りの渡し方だけを3通りに変えました。
| 条件 | AIに渡したもの |
|---|---|
| 会話全体 | 前のやり取り(利用者とAIの発言を、話し手の区別つきで)+最後のメッセージ |
| 最後だけ | 最後のメッセージのみ |
| 要約つき | 前のやり取りを160語以内にまとめた要約+最後のメッセージ |
要約は、最後のメッセージを見せずに作らせています。答えから逆算した都合のよい要約になるのを防ぐためです。
要約には、目的、条件、候補、訂正、受け入れた案と断った案、根拠の求め、未解決の問いを書き、AIの提案と利用者の要望を区別し、事実を足さないよう指示しました。できた要約は42〜158語で、中央値は111語でした。
| 項目 | 内容 |
|---|---|
| 会話の出どころ | 非公開の商用の会話データから90件、公開データセットのPRISM(参加者の好みを集めた研究用の会話集)から90件 |
| 言語 | 英語のみ |
| 条件を満たした会話 | 商用544件(読み込んだ1,477件から)、PRISM 1,384件(7,125件から、参加者1人につき1会話まで) |
| 会話の長さ | 利用者の発言が2〜3回の会話64件、4〜6回が62件、7回以上が54件 |
| 主な条件 | 利用者の発言が2回以上、AIの発言が1回以上、最後のメッセージが2〜96語 |
| 外した会話 | 英語以外、あいさつだけの締め、個人の連絡先、自傷、性的な内容、危険な行為、医療・法律・金融の重い相談 |
| 答えるAI(モデル名) | gpt-5.4-mini(要約づくりも同じ)。検索などの道具は使わせず、推論の手間は「なし」に設定、300語以内 |
| 採点するAI(モデル名) | gpt-5.5。3つの答えをA・B・Cの記号で伏せ、会話全体と照らして採点 |
主な指標は「実質的な違い」です。次のどれかによって、利用者の行動が変わりうる違いだけを数えます。
- 勧める物、選ぶ物、事実の結論が違う
- 明示された条件を守るかどうかが違う
- 求められた成果物が違う
- 聞き返すか、断るかの振る舞いが違う
言い回し、口調、構成、詳しさだけの違いは数えません。このほか、依頼にどれだけ応えたかの点数(0〜4点)と、違いの深刻さ(0〜3点)も付けています。
2つの出どころから同じ数ずつ選んだため、条件を満たした会話全体の構成(商用28.2%、PRISM 71.8%)に戻す重みづけをして全体の割合を出しています。95%の区間は、会話を単位に5,000回引き直す方法で求めました。
設計、指標の定義、分析の方法は、答えを作る前に固定したと論文は書いています。採点の安定性は、48件を記号の順を入れ替えて採点し直して確かめました。
結果
前のやり取りを外すと、44.7%で答えが実質的に変わった
重みづけ後の主な推定値です(論文の表2)。
| 指標 | 推定値 | 95%の区間 |
|---|---|---|
| 実質的な違い(会話全体と最後だけ) | 44.7% | 33.8〜56.1% |
| 実質的な違い(会話全体と要約つき) | 30.8% | 20.2〜42.1% |
| 違いの減り幅(最後だけの値から要約つきの値を引いたもの) | 13.9ポイント | 4.9〜24.1ポイント |
| 点数の差(会話全体から最後だけを引いたもの) | 0.488点 | 0.319〜0.668点 |
| 点数の差(会話全体から要約つきを引いたもの) | 0.015点 | -0.119〜0.133点 |
| 勧めや結論が変わった(会話全体と最後だけ) | 26.7% | 17.0〜36.9% |
| 聞き返し・断りが変わった(同) | 14.4% | 8.0〜22.0% |
| 条件を守るかが変わった(同) | 10.6% | 5.3〜17.0% |
- 44.7%は重みづけ後の値です。180件をそのまま数えると53.3%で、論文はこの差を、出どころを同数ずつ選んだことと、PRISM側の会話が多いことによるものと説明しています
- 点数の平均は、会話全体が3.80点、最後だけが3.31点です。会話全体のほうが高かったのは36.2%、低かったのは6.0%で、残りは同点でした
- 違いの深刻さは平均0.65点(0〜3点)でした
- 答えの長さは、最後だけが平均96語、会話全体が110語です。詳しさだけの違いは数えない決まりなので、長さでは説明できないと論文は述べています
- 勧め・聞き返し・条件の3つの内訳は、1件の中で重なることがあります
要約で点数は戻ったが、答えそのものは3割が違うままだった
要約つきの点数は平均3.78点で、会話全体の3.80点とほぼ同じです。差の区間は0をまたいでいます。
それでも、会話全体の答えと実質的に違う答えは30.8%残りました。減り幅の13.9ポイントは、最後だけの44.7%に対して31.1%の減少にあたると論文は書いています。
点数が同じでも、勧める物や結論、振る舞いまで同じとは限らない、というのが論文の読み方です。
単語の重なりから出した表面上の距離(0は同じ、1は共通の単語なし)は、最後だけが0.707、要約つきが0.650でした。論文は、どちらも大きな値で、この指標では行動が同じになるかは判断できないとしています。
要約で何が抜けるのかについて、論文は候補を挙げています。断った順番、AIの提案が既に決まった事実のように書き換わること、迷いや未解決の点の脱落などです。
ただし、個々の会話でどれが起きたかは確かめていないと明記しています。
出どころと会話の性質で、変わりやすさに差があった
実質的な違いの割合を、会話の区分ごとに並べます(論文の図2・図3と本文)。比べる相手はどれも会話全体の答えです。
| 区分 | 件数 | 最後だけ | 要約つき |
|---|---|---|---|
| 全体(重みづけ後) | 180 | 44.7% | 30.8% |
| 商用の会話 | 90 | 68.5% | 38.1% |
| PRISM | 90 | 35.4% | 28.0% |
| 前への依存度・低 | 59 | 31.0% | 24.6% |
| 前への依存度・中 | 63 | 56.1% | 37.8% |
| 前への依存度・高 | 58 | 48.4% | 27.0% |
- 商用の会話は、PRISMのほぼ2倍の割合で答えが変わりました。点数の差も、商用が0.91点、PRISMが0.32点です
- 出どころは無作為に割り当てたものではないため、論文はこの差を記述にとどめ、原因は特定していません
- 「前への依存度」は、指示語の多さや、前にだけ出てくる条件などから機械的に付けた目安です。中のほうが高より変わりやすく、順番どおりになりませんでした
- 依存度が低い区分でも31.0%が変わっており、論文は「最後のメッセージだけで完結している会話」と見なせる安全な集まりはなかったと述べています
採点の順番を入れ替えても、判定はおおむね一致した
48件を記号の順を入れ替えて採点し直すと、会話全体と最後だけの比較は91.7%が同じ判定で、偶然の一致を除いた一致度(カッパ係数)は0.83でした。
会話全体と要約つきの比較は85.4%、カッパ係数は0.70です。違いが小さい比較ほど、判定がぶれやすい結果でした。
論文自身が書いている限界
- 答えるAIは1種類、実行の仕組みも1つです。会話は研究用の指示の中に並べて渡したもので、普段使うチャット画面での会話を再現したものとは違います
- 条件ごとに答えを1回しか作っていません。毎回の答えのぶれと前のやり取りの効果を分けられず、繰り返すと区間は広がる可能性がある、と論文は書いています
- 採点はAIです。記号の伏せ方と順番の入れ替えで位置の偏りには手を打ちましたが、採点するAIの癖や専門知識の不足は残ります。人による判定での追試が重要だとしています
- 要約は「160語以内、同じ系統のAI」という1つのやり方だけです。最適な要約の方法を示したものとは位置づけていません
- 商用の会話データは公開できず、PRISMは特定の手順で集めたものです。重みづけで、全体の推定はPRISMの比重が大きくなっています
- 別の会話をまたぐ記憶、アカウントごとの個人化、ほかの会話からの取り出しは対象外です
- 医療、法律、金融、自傷、性的な内容などは除外しているので、こうした相談にこの数値を広げるべきでないとしています
原文を読んで気づいた点
- 査読前のプレプリントで、著者は1人です。arXivのコメント欄に学会や論文誌の記載はありません
- 日本語での検証はありません。会話はすべて英語です。日本語の会話で同じ割合になるかは、この論文からは分かりません
- 答えるAIには検索を使わせていません。AI検索がどのページを引用するか、どの会社名を出すかは測っていない設計です。論文は、見え方の計測では「引用されるブランドが変わることがありうる」と書いていますが、これは実測ではなく含意として述べたものです
- 同じ条件で2回答えさせたときに、どれだけ実質的に違うかの基準値がありません。44.7%には、前のやり取りの効果に加えて、毎回のぶれによる違いも含まれている可能性があります(論文の限界の項を受けた、私の読み取りです)
- 答えるAIは小型の版で、推論の手間は「なし」、300語以内という設定でした。実際のサービスの設定とは異なる可能性があり、論文も結果が変わりうるとしています
- 要旨と本文は要約つきの点数差を「0.01点」と書き、表2では0.015点です。表示する桁数の違いによるものとみられます
- 著者は、別の論文でAI検索での見え方を測るソフトウェアの企業の創業者だと書いています。この論文には利益相反の記載がなく、「会話ごと測るべき」という結論は、計測サービスを提供する側の方向と重なります
この論文から、言えること・言えないこと
| 言えること(論文の設定で確認された) | 言えないこと(論文では確認されていない) |
|---|---|
| 英語の会話180件で、前のやり取りを外すと、重みづけ後44.7%の答えが実質的に変わった | 日本語の会話や、ほかのAIでも同じ割合になること |
| 会話全体を渡した答えは、AIの採点で平均0.49点高かった | 人が読んでも、会話全体の答えのほうが良いと判断すること |
| 160語以内の要約を添えると、点数の差はほぼ0になった | 要約を添えれば会話全体と同じ答えになること(30.8%は違うまま) |
| 勧めや結論が変わったのは26.7%だった | AI検索で引用されるページや会社名が変わる割合 |
| 商用の会話はPRISMより変わりやすかった(68.5%と35.4%) | その差がどんな会話の性質から生じたのか |
| 依存度が低いと判定した会話でも31.0%が変わった | 別の会話をまたぐ記憶や個人化による答えの変化 |
論文の結論は、測り方についての教訓です。会話のAIを評価するなら、答えの前提になった前のやり取りや要約の作り方まで明記すべきで、最後の一文だけを流し直すのは別の課題を測ることになる、と述べています。
会話の中で引用が積み重なる影響を理論で示した論文は、早く引用された出典が会話の中で引用され続けるかを扱った論文の解説で取り上げました。今回の論文は、1回の質問で測る方法の限界を、実験の側から補う位置にあります。
中小企業の視点で、どう受け取るか
ここからは論文の主張とは別の、私の読み取りです。
AIでの見え方を確かめるときは、前置きの会話ごと記録する
この実験では、最後の一文が同じでも、前のやり取りを渡すかどうかで、答えの4割強が実質的に変わりました。自社が出た・出なかったを記録するときは、最後の質問だけでなく、その前に伝えた目的や条件も一緒に残しておくと、後から比べられます。
1つの質問文だけで判断せず、相談の流れを再現した確認も足す
お客様は「地域」「予算」「急ぎかどうか」を先に話し、最後に「どこがいいですか」と聞くことがあります。単発の質問での確認に加えて、前置きを数往復入れた会話でも確かめると、実際の相談に近い条件で見え方をつかめます。
途中で足される条件への答えを、ページに書いておく
勧めや結論が変わった26.7%は、前のやり取りを渡すかどうかで結論まで変わった割合です(毎回の答えのぶれも含みえます)。
対応地域、価格の目安、対応できない依頼などをページに明記しておくと、会話のどの段階で条件が出ても照らし合わせやすくなると考えます。
ただし、論文はページ側の工夫の効果を検証していません。
数字の大きさは割り引いて読む
44.7%は、英語の会話、小型のAI、検索なし、AIによる採点という条件の値です。日本語の地域の商売の相談で同じ割合になるとは考えず、「前の話で答えは変わりうる」という方向だけを受け取るのが妥当です。
よくある質問
会話の前のやり取りで答えが変わるという結果は、AI検索で自社が引用されるかどうかにも当てはまりますか
この論文では直接は確かめられていません。
実験ではAIに検索を使わせておらず、測ったのは勧めや結論、聞き返しの振る舞いの変化です。論文は、見え方の計測でも引用される会社名が変わりうると述べていますが、引用そのものの変化は測っていない段階です。
最後の質問だけで答えると44.7%で変わるという数字は、日本語の会話にも当てはまりますか
この論文からは分かりません。
会話はすべて英語で、日本語での検証は報告されていません。商用の会話とPRISMで68.5%と35.4%と大きく違ったことからも、会話の集め方で割合は動くと読むのが自然です。
前のやり取りを要約してAIに渡せば、会話全体を渡したときと同じ答えになりますか
この実験では、同じにはなりませんでした。
160語以内の要約を添えると点数の差はほぼ0になりましたが、30.8%の答えは会話全体の答えと実質的に違うままでした。論文は、この要約のやり方は1例にすぎず、長い要約や人が書いた要約では結果が変わりうるとしています。
まとめ:今日できる1つのこと
お客様がAIに相談しそうな流れを1つ書き出してください。目的や地域、予算を伝える前置きを入れた会話と、最後の質問だけの場合とで、AIの答えを並べて残しておくと、どちらで自社が出るかの違いが見えてきます。
この論文は、LLMO論文の一覧の一本です。ほかの論文の解説も、順次公開しています。
この記事に書いたことを、そのまま御社のページに
生成AIに引用されるページを、お話しいただくだけでお作りします。お時間をいただくのは初回15分のヒアリングだけです。まず1ページ、無料でお作りします。
OKが出るまで、何度でも直します。事実が違う、言い回しが硬い、この話は入れないでほしい。どれも遠慮なくおっしゃってください。何度お直ししても、追加の料金はいただきません。
これまでに127社にご利用いただきました。毎月ご依頼いただいている方の6割以上が、月10ページを選ばれています。料金はページに掲載しています。
ページを増やしても問い合わせが来ないなら、原因はページの外にあります。その場合は、下の入口からご相談ください。
自社のマーケティング課題を根本から解決しませんか?
ウェブサイトから要素を引き算し、訪れた人が迷わず次の一歩に進む形へ組み直す。初回60分のオンラインで御社のサイトを一緒に読み、どこから直すべきかをお伝えします。手順をまとめた無料の診断と解説動画もご用意しています。
初回は無料・60分・オンライン完結・その場で契約のお願いはいたしません


