AI検索が返す長い回答は、質問に答えるのに必要な論点を、どれだけ押さえているのでしょうか。この問いを、数字で測る方法を提案した論文があります。
2024年10月にarXivで公開され、2025年の自然言語処理の国際会議NAACLで発表された「Do RAG Systems Cover What Matters?」です。
論文は、1つの質問を20個ほどの「下位の問い」に分け、それを「中核」「背景」「発展」の3種類に分類します。そのうえで、実際のAI検索3社(You.com、Perplexity AI、Bing Chat)の回答が、中核の問いをどれだけ答えているかを数えました。
この記事では、原文を読んで、測り方、数字、論文自身が認めている限界を整理します。数値は論文の表と本文から拾っています。
合同会社謙虚は、3つのドメインを並行して運用し、何を変えると数字が動くかを測り続けています。AI検索が「どの論点を拾い、どの論点を落とすのか」を知っておくと、自社のページがどの問いに答えるべきかを考える手がかりになるため、この論文を読みました。
結論:3行で言うと
- 質問を「中核・背景・発展」の下位の問いに分けて数えると、調べた3つのAI検索は、どれも中核の問いを優先して答えていましたが、それでも中核の問いの約半分(46〜58%)を回答から落としていました
- 中核の問いに答えるページを引用元に持っていても、回答にその内容が入ったのは51〜71%でした。検索で拾うことと、拾った内容を回答に使うことの両方に、改善の余地があると論文は述べています
- GPT-4で下位の問いの網羅率を判定して2つの回答の優劣を予測すると、人の好みと82%一致しました。また、中核の問いを使って検索し直す仕組みは、使わない仕組みに対して約73%の勝率でした(判定はGPT-4)
ただし、評価の大部分はGPT-4による自動判定で、質問はすべて英語です。測定の時期も論文に書かれていません。
この点は後の章で整理します。
この論文の基本情報
| 項目 | 内容 |
|---|---|
| 題名(原題) | Do RAG Systems Cover What Matters? Evaluating and Optimizing Responses with Sub-Question Coverage |
| 著者 | Xie、Laban、Choubey、Xiong、Wu(5人。所属はジョージア工科大学と、米国の大手業務ソフトウェア企業のAI研究所。筆頭著者はその企業でのインターン中の研究と注記) |
| 公開日 | arXiv初版は2024年10月20日(確認した版はv1) |
| arXiv番号 | 2410.15531 |
| 掲載・採択状況 | NAACL 2025(米州の計算言語学の国際会議)の会議録、第1巻の長編論文部門に掲載(5836〜5849ページ、2025年4月〜5月、米国アルバカーキ)。arXivのコメント欄には記載がなく、ACL Anthology(計算言語学の論文庫)の会議録で確認しました |
| 種類 | 評価方法の提案と、実サービスの測定、改善手法の実験を組み合わせた研究論文。著者5人中4人が企業(米国の大手業務ソフトウェア企業)の研究所所属 |
| データとコード | 論文中に公開先の記載は見当たりませんでした。使った質問の元データ(Researchy Questions、WebGPT Comparisons)は既存の公開データです |
論文はこちらで読めます。arXiv(2410.15531)、ACL Anthology(会議録)、DOI。
会議録版とarXiv版を比べると、表と本文の数値は同じで、会議録版には「人の判定者には、高い学位と自然言語処理の経験を持つ人を集めた」という一文が足されています。
この論文が答えた問い
論文が立てた問いは、次のとおりです。
正解が1つに決まらない複雑な質問に対して、AI検索の回答は、答えるべき論点をどれだけ押さえているのか。押さえ損ねるのは、検索で拾えていないからか、拾ったのに使っていないからか。
RAG(検索拡張生成。AIが検索で集めた文書を読んでから回答を作る仕組み)の評価では、これまで「回答が出典に忠実か」「質問と関連しているか」といった観点が中心でした。
論文は、それだけでは「必要な論点を網羅しているか」が見えないと指摘しています。
論文の例で言うと、「生の野菜と冷凍野菜はどちらが健康的か」という質問には、「冷凍の工程は栄養にどう影響するか」「野菜を冷凍する一般的な方法は何か」「値段や味の違いは何か」といった下位の問いが含まれます。論文は、1つ目が最も重要で、2つ目は前提の説明、3つ目は一歩先の話だと整理し、下位の問いを同じ重さで扱うべきではないと主張しています。
3種類の下位の問い
- 中核の問い:質問の中心にあり、直接または部分的に答えになるもの。これが抜けると、回答として成り立ちにくくなります
- 背景の問い:答えるのに必須ではないものの、前提や文脈を補うもの(用語の定義など)
- 発展の問い:元の質問に答えるのには要らず、回答を読んだ後に湧いてくるような問い。深掘りとして役立つ一方で、焦点がずれることもあります
どうやって調べたのか
論文の実験は3つで、データと判定者(人かAIか)がそれぞれ違います。
| 実験 | 対象とデータ | 判定の方法 |
|---|---|---|
| 1. 実際のAI検索の測定(3章) | You.com、Perplexity AI、Bing Chatの3つ。複雑で多面的な英語の質問200問(Researchy Questionsというデータから手で選定)。下位の問いは合計約4,000個 | GPT-4が、回答と引用元ページのそれぞれについて、下位の問いに答えている部分があるかを判定 |
| 2. 回答の良し悪しの判定(4章) | 「なぜ」「どのように」を問う英語の質問500問。1問につき回答が2つあり、人がどちらを好むかの記録付き(WebGPT Comparisonsという公開データ) | GPT-4で下位の問いの網羅率を判定して優劣を予測し、人の好み(正解ラベル)と一致した割合を計算 |
| 3. 仕組みの改善(5章) | 実験1と同じ200問。検索対象は、3つのAI検索が引用したページを集めたもの。検索で上位10件を取り、約300語の回答を作る | GPT-4が2つの回答を比べて勝ち負けを判定(順番を入れ替えて2回判定) |
下位の問いへの分解と3種類への分類は、GPT-4に2段階で指示して行っています。まず約20個の下位の問いを挙げさせ、次に1つずつ3種類に分類させる方法です。
分類の確かさは、人と比べて確かめています。5人の判定者が200個の下位の問いを分類し、多数決を正解としたとき、人の平均の正解率は74.6%でした(中核76.8%、発展79.2%、背景64.3%)。
GPT-4は、例を与えない場合で77.5%、例を与えた場合で84.8%でした。「答えているかどうか」のGPT-4の判定は、100件の見本で人の判定と83%一致したと報告されています。
実験1の実サービスには、約300語で答えるよう頼み、回答の平均は272語でした。「引用元ページ」は、各サービスが回答に付けた出典のページの本文を取得したものです。
測定をいつ行ったかは、論文に書かれていません。公開日から見て、2024年10月より前であることだけが分かります。
結果
実際のAI検索3つの測定結果
論文の表1と表2から、主な数字を拾います。下位の問いのうち、回答が答えていた割合(回答の網羅率)と、引用元ページのどれかが答えていた割合(出典の網羅率)などです。
| 指標 | You.com | Perplexity AI | Bing Chat |
|---|---|---|---|
| 回答の網羅率:中核の問い | 42% | 54% | 49% |
| 回答の網羅率:背景の問い | 20% | 20% | 14% |
| 回答の網羅率:発展の問い | 14% | 17% | 9% |
| 出典の網羅率:中核の問い | 65% | 63% | 67% |
| 中核の答えが出典にあったとき、回答にも入った割合 | 51% | 71% | 63% |
| 回答が落とした中核の問いのうち、出典にも答えがなかった割合 | 45% | 61% | 51% |
| 中核の答えを多く含む出典が回答に反映される度合い(差) | 11% | 53% | 39% |
| 発展の問いを回答の後ろに置く度合い(位置の差) | 36% | 45% | 60% |
下から2行目は、中核の問いを答えた回答と答えなかった回答で、「その問いに答えている引用元ページの割合」がどれだけ違うかを示す差です。
最下行は、回答の中で発展の問いに触れる位置が、中核・背景の問いより平均でどれだけ後ろにあるかを示します。人は、中核と背景を先に、発展を最後に読みたいと考える、という前提で作られた指標です。
読み取れること
- 3つとも、中核の問いを背景や発展より優先して答えていました。論文はこれを、3種類に分ける考え方が妥当である裏づけと位置づけています
- それでも、中核の問いの46〜58%は回答に入っていませんでした。この幅は、100%から表の42〜54%を引いた私の計算です。論文の要旨は「約50%を取りこぼす」とまとめています
- 取りこぼしの原因は2つに分かれました。回答が落とした中核の問いのうち45〜61%は、引用元のどこにも答えがなかったもの、つまり検索の段階で拾えていなかったものです。残りは、答えが引用元にあったのに回答に使われなかったものです
- 拾った内容を回答に使う力は、サービスで差がありました。Perplexity AIは検索と回答作りのつながりが強く、You.comは差の指標が11%と低く、拾った内容を十分に生かせていないと論文は述べています
- 情報の並べ方はBing Chatが最も人の書き方に近いという結果でした
回答の良し悪しを、下位の問いで判定できるか
実験2では、人が好んだほうの回答を、どれだけ当てられるかを比べました(論文の表3)。
| 判定の方法 | 人の好みと一致した割合 |
|---|---|
| GPT-4に2つの回答を直接比べさせる | 71% |
| 中核の問いの網羅率が高いほうを選ぶ | 78% |
| 3種類の網羅率を重み付けして合計する | 82% |
当て推量なら50%です。最も一致した重みは、中核:背景:発展=1:0.5:-1でした。
論文は、中核の問いに答えることが人の好みと最も強く結びつき、背景はその次で、発展の問いに答えることはむしろ評価を下げる方向に働いたと読んでいます。
重みは、100問の検証用データで探しています。
論文は同時に、人の好みは読み手の立場や用途で変わるため、この比率も変わり得ると断っています。この結果は、WebGPTの研究(2021年)で集められた回答データでの傾向です。
中核の問いを使うと、回答はよくなるか
実験3では、中核の問いを仕組みのどこに組み込むかで4通りを試し、何も組み込まない基準と比べました(論文の表4)。
| 方法 | やること | 基準に対する勝率 |
|---|---|---|
| 定義を足す | 中核の問いの定義を指示に加え、AI自身に中核の問いを考えさせて答えさせる | 58.5% |
| 中核の問いを足す | 分解した中核の問いを指示に加え、それを使って検索し、答えさせる | 66% |
| 検索を強化する | 元の質問と中核の問いのそれぞれで検索し、中核の問いに答えている度合いで並べ替えて上位10件を使う | 73.25% |
| 全工程で使う | 中核の問いごとに検索して小さな答えを作り、最後にまとめる | 65.25% |
4つとも基準を上回り、最も勝率が高かったのは「検索を強化する」方法でした。この方法は、手間のかかる「全工程で使う」方法にも57.5%の勝率で勝っています。
論文は、中核の問いに答える文書を拾うことが、網羅的な回答を作るうえで効果が大きいとまとめています。
要旨は「74%の勝率」としていますが、表4の値は73.25%で、四捨五入すると73%です。この差について論文に説明はありません。
なお、ここで比べたのは論文の著者が作った実験用の仕組みで、実際のAI検索サービスを改修したものではありません。
論文自身が書いている限界
論文が限界の節で挙げている点です。
- 自動の分解は、あいまいな質問や微妙な質問の複雑さを捉えきれないことがあります
- 「答えているか」の判定をGPT-4に頼っているため、特に主観が入る場面で、人の判断とずれることがあります
- 下位の問いの種類ごとの重要さを一律に扱っていますが、分野や状況によって変わり得ます
- 中核の問いを重視すると、背景や発展の問いの価値を見落とすことがあります
- 計算の負担が大きく、大規模な利用やその場での利用には制約があります
原文を読んで気づいた点
- 質問はすべて英語で、日本語での検証は報告されていません。質問の元データも英語圏のものです
- 評価の大部分はAI(GPT-4)による自動判定です。人との一致は、分類で84.8%(例を与えた場合)、網羅の判定で83%(100件の見本)と報告されています。裏返すと、判定の1〜2割程度は人と食い違う前提で数字を読む必要があります
- 実サービスの測定時期が書かれていません。Bing Chatは、現在はCopilotという名前で提供されています。回答の長さも約300語に指定しているので、ふだんの使い方での回答とは条件が違います
- 「引用元」は、回答に付いた出典だけです。サービスが内部で読んだものの出典に載せなかった文書は、測定に入っていません。「出典にも答えがなかった」には、検索で拾えなかった場合と、拾ったが出典として示さなかった場合の両方が含まれ得ると私は読みました
- 限界の節の「種類ごとの重要さを一律に扱っている」という記述は、4章で重みを1:0.5:-1と変えている内容と食い違って見えます
- 重みを探した100問と、82%を計算した500問の関係(100問が500問に含まれるのか)は、本文からは読み切れませんでした。表3の説明文は「500件での正解率」と書いています。82%が重みを探した100件での値なら、同じデータで調整した分だけ高く出ている可能性があります
- 査読を経た会議(NAACL 2025)の論文です。著者の大半は企業(米国の大手業務ソフトウェア企業)の研究所の所属です。評価した3つのサービスの運営会社ではありません
この論文から、言えること・言えないこと
| 言えること(論文の設定で確認された) | 言えないこと(論文では確認されていない) |
|---|---|
| 3つのAI検索は、中核の問いを背景・発展より優先して答えていた | いまのChatGPT、Gemini、Copilotでも同じ割合になること |
| それでも中核の問いの46〜58%を回答に入れていなかった(英語の200問、約300語の回答) | 日本語の質問で同じ傾向になること |
| 中核の答えを持つページを引用していても、回答に入ったのは51〜71%だった | どう書いたページなら回答に使われやすいか(ページ側の書き方は調べていない) |
| 下位の問いの網羅率で、人の好みを82%当てられた(WebGPTの研究の回答データ) | 特定の企業のページがAI検索に引用されやすくなること |
| 中核の問いで検索を強化した仕組みは、基準に約73%の勝率だった(判定はGPT-4) | 実際のAI検索サービスが、この方法を採り入れていること |
この論文は、AI検索の回答を作る側の評価と改善の研究です。ページを書く側が何をすれば引用されるか、という問いには直接答えていません。
その問いを扱った研究としては、GEOの原論文の解説や、研究全体をまとめたサーベイの解説があります。
中小企業の視点で、どう受け取るか
ここからは論文の主張とは別の、私の読み取りです。論文はページの書き方を実験していないので、以下は仮説として読んでください。
1. 自社ページの「網羅」を、中核・背景・発展で点検できる
この論文でいちばん使いやすいのは、測り方そのものだと考えています。主題となる質問を1つ決め、下位の問いを書き出して3種類に分ける。
そのうえで、中核の問いに自社のページが答えているかを1つずつ確かめる、という点検は、AIに頼らず手作業でもできます。論文では、人の判定者でも背景の問いの分類は多数決の答えと64.3%しか合っていないので、分け方に迷うのは自然なことです。
2. 引用されることと、回答に使われることは別の段階
中核の答えを持つページを引用していても、回答に入ったのは51〜71%でした。AI検索で「出典に載った」ことと、「その内容が回答に使われた」ことは、分けて確かめる必要があると私は読みました。
出典欄に加えて、回答本文に自社ページの論点が入っているかも見ておくと、実態に近づきます。
3. 中核の問いに、1つずつ答えている段落があるか
論文の実験3では、中核の問いごとに検索すると回答がよくなりました。もし実際のAI検索にも、質問を分けて調べる仕組みがあるなら、「1つの下位の問いに、はっきり答えている段落」を持つページは拾われやすいかもしれません。
これは論文が確かめた内容の外にある推測です。見出しを下位の問いの形にし、直後に答えを書く構成は、試す価値があると考えています。
4. 発展の話は、後ろに置く
人の好みの分析では、発展の問いに答えるほど評価が下がる方向でした。自社の記事でも、関連する話題は、主題に答えきった後の章にまとめるのが、この結果と整合する書き方です。
よくある質問
下位の問いの網羅率(サブクエスチョン・カバレッジ)は、GEO対策の指標ですか
論文の位置づけは、RAG(検索拡張生成)の回答を評価し、改善するための指標です。ページが引用されるための指標ではありません。
ただし、必要な論点を洗い出す考え方は、自社ページの点検にも使えると私は考えています。
下位の問いの網羅率の研究結果は、日本語のAI検索にも当てはまりますか
論文が調べたのは英語の質問だけです。日本語で同じ割合になるかは、確かめられていません。
「中核の問いを優先する」「それでも取りこぼしがある」という大まかな傾向を参考にとどめ、数値そのものは英語の条件での結果として読むのが安全です。
発展の問いに答えると、AI検索の回答の評価が下がるというのは本当ですか
論文の実験2では、発展の問いの網羅率にマイナスの重みを付けたときに、人の好みと最もよく一致しました。これはWebGPTの研究(2021年)で集められた英語の回答データでの結果で、論文自身も、読み手の立場や用途で比率は変わり得ると書いています。
「発展の話は不要」という意味で受け取るより、「主題に答える前に広げすぎない」という程度に読むのが妥当です。
まとめ:今日できる1つのこと
自社でいちばん大事なページを1つ選び、そのページが答えるべき質問を1文で書いてください。次に、その質問に答えるために必要な下位の問いを10〜20個書き出し、中核・背景・発展に分けます。
最後に、中核の問いのうち、ページが答えていないものを1つだけ選び、その答えを短い段落で足します。
この論文は、LLMO論文の一覧の一本です。ほかの論文の解説も、順次公開しています。
この記事に書いたことを、そのまま御社のページに
生成AIに引用されるページを、お話しいただくだけでお作りします。お時間をいただくのは初回15分のヒアリングだけです。まず1ページ、無料でお作りします。
OKが出るまで、何度でも直します。事実が違う、言い回しが硬い、この話は入れないでほしい。どれも遠慮なくおっしゃってください。何度お直ししても、追加の料金はいただきません。
これまでに127社にご利用いただきました。毎月ご依頼いただいている方の6割以上が、月10ページを選ばれています。料金はページに掲載しています。
ページを増やしても問い合わせが来ないなら、原因はページの外にあります。その場合は、下の入口からご相談ください。
自社のマーケティング課題を根本から解決しませんか?
ウェブサイトから要素を引き算し、訪れた人が迷わず次の一歩に進む形へ組み直す。初回60分のオンラインで御社のサイトを一緒に読み、どこから直すべきかをお伝えします。手順をまとめた無料の診断と解説動画もご用意しています。
初回は無料・60分・オンライン完結・その場で契約のお願いはいたしません


