検索窓に打ち込まれる質問は、たいてい短い言葉です。「伝記作家の道徳的な義務とは」と打った人が本当に知りたいのは、定義なのか、書き手としての判断の仕方なのか。
質問の文字面だけでは、どちらとも読めます。2026年7月の計算言語学の国際会議ACL 2026で発表された論文「Mind Reader」は、この「質問の裏にある需要」を先に書き出してから文章を書き換えると、研究用の模擬環境で、AIの回答の中で目立ちやすくなった、と報告しています。
この記事は、その論文を原文から読み、「潜在的な需要」を何と定義し、どうやって取り出したのか、評価はどのAIで何を測ったのか、効果はどれくらいだったのかを整理します。数値は論文の表と本文から拾い、倍率などを私が計算し直した所には「概算」と書いています。
合同会社謙虚は、3つのドメインを並行して運用し、何を変えると数字が動くかを測り続けています。記事を書く前に「読者はこの言葉の裏で何を知りたいのか」を考える作業は、私たちが毎回やっていることで、その作業を機械でどこまで再現でき、どれだけ効いたのかを確かめるために、この論文を読みました。
結論:3行で言うと
- 論文は、短い質問をAIに分解させて立場や目的の違う言い換えの質問を何通りも作り、生成AIが回答を組み立てるときにたどる考えの手順を網羅するように文章を書き換える小型のAIを訓練しました
- 生成AIが回答の中でその文章をどれだけ使ったかの総合値は、書き換えなしの19.85(汎用の質問集)と26.42(パソコン分野の質問集)から、53.39と57.95に上がりました。比べた12の手法のどれよりも高い値です
- ただし「潜在的な需要」は実際の検索データから取り出したものではなく、AIが推し量って作った言い換えの質問です。評価も研究用の模擬環境で行われ、日本語での検証や人による評価は報告されていません
数字の読み方と、実サービスにどこまで当てはめてよいかは、後の章で整理します。
この論文の基本情報
| 項目 | 内容 |
|---|---|
| 題名(原題) | Mind Reader: Latent User Demand-Guided Content Optimization for Generative Search Engine |
| 著者 | Tong Chen ほか計10人。9人は中国の民間AI企業の研究部門、1人(責任著者の1人)は香港中文大学のマルチメディア研究室の所属です |
| 公開 | ACL 2026(2026年7月、米国サンディエゴ)の会議録。第1巻(長編論文)の40832〜40848ページ |
| arXiv番号 | 確認できませんでした(arXivを題名と主要な語句で検索しましたが、該当する版は見つかりませんでした) |
| 掲載・採択状況 | ACL 2026本会議の長編論文として、ACL Anthology(計算言語学の論文庫)に掲載されています。査読を経た論文です |
| 種類 | 手法の提案と実験。著者の大半が民間企業の所属で、産業界が主体の研究です |
| データとコード | 論文中に公開先の記載は見当たりませんでした。新しく作った質問集(PC-GEO)も、公開するとは書かれていません |
論文はこちらで読めます。ACL Anthology(2026.acl-long.1894)、DOI。
この論文が答えた問い
論文が立てた問いは、次のとおりです。
生成AIの検索(論文の呼び方では「生成検索エンジン」)で自分の文章を目立たせるには、質問の文字面に合わせるだけで足りるのか。質問の裏にある需要まで読んで書き換えれば、もっと目立つのか。
論文は、これまでの手法を2つに分けています。1つは質問を見ずに一般的な方針で書き換える手法で、GEOの原論文の「統計を足す」「引用を足す」などが入ります。
もう1つは質問に合わせて書き換える手法で、生成AIの好みをルール化するAutoGEOが代表です。
論文の見立てでは、後者も「質問に出てくる語」に合わせる段階にとどまり、その奥の需要を取りこぼしています。理由として挙げているのは2点です。
質問は短くて言葉が足りず、書かれていない意図を多く含んでいること。そして、生成AIは回答の前に何段階か考えて需要を推し量っていて、その考えの中身に文章が合っていないこと、です。
なお、論文による「潜在的な需要」の説明は、数式や判定基準の形をとらず、言葉だけです。本文では、短い質問に暗に込められた情報とし、それを意図と言い回しで捉える、としています。
「質問の奥にある、課題としての情報の必要」とも表現しています。
どうやって調べたのか
手法は2段階
論文の手法は、次の2段階でできています。
- 質問を分解して、言い換えの質問を作る。AIに質問から語句を抜き出させ、語句どうしの結びつきの強さを付けた図(論文は「実体グラフ」と呼びます)を作ります。その図の上を、結びつきの強い方へ確率的にたどって、語句の組み合わせを最大3通り取り出します。組み合わせごとに、AIが「どんな目的の質問か」(定義を知りたい、手順を知りたい、比べたい、原因を知りたい、おすすめを知りたいなど)を推し量り、続けて「どんな立場の人の言い方か」(学生、研究者、購入を考える消費者、経営判断をする人など)を推し量ります。最後に、組み合わせ・目的・立場をまとめて、AIが新しい質問文を書きます
- 生成AIの考えの手順を網羅するように、書き換えを学習させる。言い換えの質問それぞれを生成AIに投げ、回答から「考えの手順」をAIに抜き出させます。さらに、言い換えの質問のあいだで共通する手順も、AIにまとめさせます。書き換え役の小型AIは、この個別の手順と共通の手順をどれだけ文章が押さえたか、実際に回答で使われたか、元の文章と意味がずれていないか、の3つを合わせた点数で、強化学習(点数が上がる方向へ少しずつ調整する学習法)によって訓練されます
ここで押さえておきたいのは、「潜在的な需要」も「考えの手順」も、すべてAIに推し量らせたものだという点です。
材料は、質問の文面と各段階のAIの出力だけで、実際の検索ログや利用者への聞き取りは使われていない設計です。手順を押さえたかどうかの採点も、AIが0〜1の点数で行っています。
実験の舞台
| 項目 | 設定 |
|---|---|
| 質問集1(GEO-Bench) | GEOの原論文が作った英語の質問集。学習用8,000問、検証用1,000問、テスト用1,000問 |
| 質問集2(PC-GEO) | この論文が新しく作ったパソコン分野の質問集。学習用3,533問、テスト用424問。質問はAI(Doubao-seed-1.6)が一般消費者・学生・ゲーマーなど6つの人物像を演じて作り、文章はウェブ検索で集めた通販の商品ページやレビューなどです |
| 回答を作る側 | Qwen3-30Bを使った模擬の生成検索。特に断りのない実験は、すべてこの環境です |
| 書き換える側 | Qwen2.5-7B-Instruct(比較手法も同じAIで書き換え) |
| 比べた手法 | GEO原論文の9手法、RAID、AutoGEOの2種類(計12手法)と、書き換えなし |
| 指標 | 客観指標3つ(回答の中で引用された語数、位置、両方を合わせた総合値)と、主観指標7つ(関連性、影響、独自性、多様性、クリックされそうか、位置、量) |
客観指標は、回答の中でその文章がどれだけの割合を占めたかを百分率で表したものと読めます。書き換えなしの値は汎用の質問集で20前後です。
回答に使われる材料の中でほぼ均等の取り分から出発している、というのは私の推測です(1つの質問あたり何件の文章が使われるかは原文に書かれていません)。
主観指標は原論文にならった採点方式ですが、この論文では採点に使ったAIの名前は不明です。
結果
論文の表1から、代表的な手法の総合値と、主観指標7つの平均を拾いました。主観指標の平均は、表の7つの値から私が計算した概算です。
| 手法 | 汎用・総合値 | 汎用・主観平均(概算) | パソコン・総合値 | パソコン・主観平均(概算) |
|---|---|---|---|---|
| 書き換えなし | 19.85 | 19.85 | 26.42 | 27.02 |
| 統計を足す | 22.53 | 20.13 | 29.80 | 27.34 |
| 引用を足す | 22.74 | 20.72 | 29.60 | 27.70 |
| キーワードを詰め込む | 17.13 | 18.80 | 19.16 | 24.63 |
| やさしい言葉にする | 16.20 | 19.00 | 25.62 | 26.78 |
| RAID | 20.46 | 20.50 | 27.35 | 27.29 |
| AutoGEO(プロンプト版) | 37.89 | 23.51 | 38.94 | 32.12 |
| Mind Reader | 53.39 | 24.61 | 57.95 | 33.21 |
論文が要旨で掲げる「客観指標で最大2.44倍、主観指標で平均1.23倍」は、書き換えなしとの比です。私が表1から計算し直すと、総合値の比は汎用で約2.69倍、パソコン分野で約2.19倍、その平均が約2.44倍でした。
主観平均の比は約1.24倍と約1.23倍で、平均すると約1.23倍です。計算式は論文に書かれていないので、この対応は私の再計算によるものです。
読み取れること
- 客観指標の伸びが大きく、主観指標の伸びは小さめでした。AutoGEO(プロンプト版)との差は、総合値で約15〜19ポイントあるのに対し、主観平均では約1ポイントです
- 質問に合わせる手法は、質問を見ない手法より高くなりました。論文の集計では、客観指標の総合値の平均が、質問を見ない手法で23.16、質問に合わせる既存手法で32.70です
- キーワードの詰め込みは、2つの質問集とも書き換えなしを下回りました。やさしい言葉にする手法も、汎用の質問集では下回っています
部品を外すと、どれだけ下がるか
論文は、手法の部品を1つずつ外す実験を汎用の質問集で行いました(表2と図3)。数字は総合値です。
| 条件 | 総合値 |
|---|---|
| 全部入り | 53.39 |
| 言い換えの質問を作る段階を外す | 29.64 |
| 考えの手順を押さえたかの点数を外す(個別・共通の両方) | 36.95 |
| 回答で使われたかの点数を外す | 40.96 |
| 個別の手順の点数だけ外す | 44.81 |
| 共通の手順の点数だけ外す | 47.52 |
| 元の文章と意味がずれていないかの点数を外す | 52.60 |
| 言い換えの代わりに、元の質問をそのまま複製して使う | 33.69 |
| 言い換えの代わりに、AIに自由に言い換えさせる | 40.42 |
下がり幅がいちばん大きいのは、言い換えの質問を作る段階を外した場合でした。AIに「言い換えて」と頼むだけでは40.42にとどまり、語句を分解して目的と立場を推し量る手順を踏んだ場合との差は約13ポイントです。
付録の実験では、「目的→立場」の順を「立場→目的」に入れ替えると42.57に下がっています。
条件を変えた追加の実験
| 確かめたこと | 結果(総合値) |
|---|---|
| 回答を作るAIの考えの手順が見えない場合(別のAIで代用) | 代用したAIによって43.93〜53.27。最も良かったQwen3-14Bは、本来の手順を使った53.39とほぼ同じでした |
| 書き換えに使った質問とは別の言い回しで聞かれた場合 | 52.84(元の質問では53.39、差は0.55ポイント) |
| 汎用の質問集で学習し、パソコン分野で試した場合 | 39.93(パソコン分野の書き換えなしは26.42) |
| パソコン分野で学習し、汎用の質問集で試した場合 | 22.83(汎用の書き換えなしは19.85) |
| 回答を作るAIをGPTとGeminiに替えた場合 | 客観指標3つで、質問に合わせる既存手法(AutoGEOの2種)を上回ったと論文は述べています。数値はレーダー図だけで、表はありません |
分野をまたぐ実験では、汎用から専門分野へはかなり効果が残り、逆向きではほとんど残りませんでした。論文は、汎用の質問集で学んだ書き換え方のほうが応用が利くためだと解釈しています。
論文自身が書いている限界
論文が「限界」の節で挙げているのは、計算の手間が増えることだけです。言い換えの質問作り、考えの手順の抽出、書き換え役の訓練にそれぞれ計算が要ります。
実験設定の節には、書き換え役の訓練に高性能な演算装置8基で15時間(汎用の質問集)、7.5時間(パソコン分野)かかったとあります。
論文は、前の2つは事前に済ませられ、計算資源が安くなれば問題は小さくなると見ています。倫理の節では、使ったAIとデータは学術研究の範囲で使ったと述べています。
原文を読んで気づいた点
- 「潜在的な需要」は、AIが推し量ったものです。実際の利用者の検索ログや、需要の正しさを人が確かめた手順は、論文に書かれていません。言い換えの質問を作ったAIの名前も、明記がない状態です。
- 日本語での検証は報告されていません。汎用の質問集は英語です。パソコン分野の質問集は言語の明記がなく、文章の集め先には中国の大手通販サイトの商品ページが挙げられています。
- 評価はすべて自動で、客観指標は回答中の引用から計算し、主観指標はAIが採点しています。人による評価はなく、実行回数やばらつきの記載もない状態です。
- 訓練と評価に、同じ模擬の生成検索を使っています。考えの手順は評価に使うQwen3-30Bの環境から取っており、回答で使われたかの点数も同じ環境と読めます(点数をどの環境で計算したかは原文に明記がありません)。別のAIでの検証は図のみで、型番や数値は読み取れない形です。
- 書き換えで、元の文章の内容が入れ替わっています。論文の事例(表4)では、元の文章にあった「編集者の義務」の話が消え、元になかった主張が加わっています。内容の正確さを確かめる評価は、論文には含まれていません。
- 測定の場は、研究用の模擬環境に限られます。ChatGPTやAI Overviewsなど、公開中のサービスは対象外です。
- 本文は、別の言い回しでの低下幅を「0.92%、0.39%、0.55%」と書いています。指標自体が百分率なので、これは元の値からの低下率ではなく、0.92ポイントなどの差です(低下率にすると約1.7%、0.7%、1.0%)。
この論文から、言えること・言えないこと
| 言えること(論文の設定で確認された) | 言えないこと(論文では確認されていない) |
|---|---|
| 模擬の生成検索では、言い換えの質問から考えの手順を集めて書き換えると、総合値が書き換えなしの約2.2〜2.7倍になった | ChatGPTなど実サービスの回答で、同じ倍率で目立つこと |
| AIに自由に言い換えさせるより、語句・目的・立場に分けて言い換えるほうが高かった | AIが推し量った需要が、実際の利用者の需要と一致していること |
| 別の言い回しで聞かれても、効果はほぼ保たれた(差は0.55ポイント) | 日本語の質問と文章で、同じ効果が出ること |
| キーワードの詰め込みは、この設定でも書き換えなしを下回った | 書き換えた文章の内容が正確であること |
| 汎用の質問で学んだ書き換え方は、パソコン分野にもある程度通用した | アクセス数や問い合わせが増えること |
「2.44倍」は、回答の中での取り分を表す指標値の比です。AIの回答に載る確率や、サイトへの訪問が2.44倍になるという意味ではありません。
中小企業の視点で、どう受け取るか
ここからは論文の主張とは別の、私の読み取りです。この論文の手法そのものは、書き換え役のAIを訓練する大がかりな仕組みで、中小企業がそのまま導入するには重い道具です。
一方で、手法の「段取り」は記事づくりに置き換えられます。
1つの質問を、目的と立場で何通りにも言い換えてから書く
論文の実験で最も効いた部品は、言い換えの質問作りでした。記事に置き換えると、書く前に「この言葉で調べる人は、比べたいのか、手順を知りたいのか、原因を知りたいのか」「学生か、経営者か、購入を迷っている人か」を組み合わせて、質問を5〜10通り書き出す作業です。
AIに「言い換えて」と頼むだけでは差が縮んだ、という結果もあるので、目的と立場の軸を先に決めてから言い換えるのがよいと考えます。
回答者がたどる「考えの手順」を、見出しで押さえる
論文の事例では、書き換え後の文章が「事実の確かさ」「公益と害の比較」「時代背景」など、回答者が考える順番の要素を押さえていました。
記事でも、言い換えた質問に答えるときの判断の手順を並べ、個々の言い換えへの手順と、多くの言い換えに共通する手順の両方を見出しで押さえると、論文の設計に近づきます。
論点の網羅という点では、質問を下位の問いに分けて数えた論文とも考え方が通じます。
読み直しの手法とは、訓練の有無が違う
検索意図を4つの視点で読み直すRAIDの論文も、「質問の裏の意図」を扱っています。
この論文の実験では、RAIDは書き換えなしをわずかに上回る程度でした。両者は訓練の有無など条件が大きく違うので、優劣をそのまま人の作業に持ち込むのは早いと考えます。
書き換えた後の事実確認は、人が持つ
論文の評価は目立ち方と意味のずれだけで、内容の正確さは評価の外です。事例でも元の話題が入れ替わっています。
需要に合わせて書き足すほど、元の資料にない主張が混ざりやすくなるので、足した一文ごとに根拠を確かめる工程を、人の側に残しておく必要があります。
よくある質問
Mind Readerの「潜在的な需要」は、実際の検索データから取り出したものですか
いいえ。質問から抜き出した語句をもとに、AIが目的と立場を推し量って作った言い換えの質問です。
パソコン分野の質問集も、AIが6つの人物像を演じて作っています。実際の検索ログは使われていません。
Mind Readerの結果は、日本語の記事やChatGPTにも当てはまりますか
論文の範囲では、まだ分からない、というのが答えです。実験は英語の質問集などを使い、回答を作るAIは研究用に組んだ模擬の生成検索です。
GPTとGeminiに替えた実験もありますが、結果は図で示されているだけで、使った型番も書かれていない状態です。
Mind Readerは、ツールとして使えますか
論文にはコードやデータの公開先が書かれていないため、確認できた範囲では、すぐ使える形の公開物は見当たらない状況です。考え方だけなら、言い換えの質問を書き出して、答えるときの手順を記事で押さえる、という形で人の作業に取り入れられます。
まとめ:今日できる1つのこと
次に書く記事のキーワードを1つ選び、「比べたい・手順を知りたい・原因を知りたい・おすすめを知りたい」の4つの目的と、読み手の立場2つを掛け合わせて、質問を8通り書き出してください。そのうち多くの質問に共通する判断の手順を3つ選び、見出しに入っているかを確かめます。
この論文は、LLMO論文の一覧の一本です。ほかの論文の解説も、順次公開しています。
この記事に書いたことを、そのまま御社のページに
生成AIに引用されるページを、お話しいただくだけでお作りします。お時間をいただくのは初回15分のヒアリングだけです。まず1ページ、無料でお作りします。
OKが出るまで、何度でも直します。事実が違う、言い回しが硬い、この話は入れないでほしい。どれも遠慮なくおっしゃってください。何度お直ししても、追加の料金はいただきません。
これまでに127社にご利用いただきました。毎月ご依頼いただいている方の6割以上が、月10ページを選ばれています。料金はページに掲載しています。
ページを増やしても問い合わせが来ないなら、原因はページの外にあります。その場合は、下の入口からご相談ください。
自社のマーケティング課題を根本から解決しませんか?
ウェブサイトから要素を引き算し、訪れた人が迷わず次の一歩に進む形へ組み直す。初回60分のオンラインで御社のサイトを一緒に読み、どこから直すべきかをお伝えします。手順をまとめた無料の診断と解説動画もご用意しています。
初回は無料・60分・オンライン完結・その場で契約のお願いはいたしません


