これまでのLLMO(生成AI検索での見え方を高める工夫。学術分野ではGEOと呼ばれます)対策の研究は、ほぼすべて文章だけを対象にしてきました。
しかし実際のページには、写真や図が付き物です。この写真の中身を、生成検索での見え方にどう使えるのかを調べたのが、2025年11月に公開された論文「Caption Injection for Optimization in Generative Search Engine」です。
中国科学技術大学の研究チームによる、ECML PKDD 2026(欧州の主要なデータマイニング系国際会議)採択の論文です。
この記事は、その論文を原文から読み、何を試し、何が分かって、何が分かっていないのかを整理します。数値はすべて論文の表と本文から拾いました。
自分で計算した割合には「概算」と書き添えています。
合同会社謙虚は、3つのドメインを並行して運用し、何を変えると数字が動くかを測り続けています。画像のキャプションという、これまであまり注目されてこなかった要素が、生成検索での見え方に効くのかどうかは、記事に写真を使う判断にも関わるため、原文を確かめておく理由がありました。
結論:3行で言うと
- ページの本文に、画像の説明文(キャプション)を自然な形で書き足す手法「Caption Injection」を提案した論文です。文章だけを書き換える従来のLLMO手法に対して、画像の説明を混ぜる路線を試した、最初の研究だと論文は位置づけています
- 画像と文章の両方をAIに渡す設定(多峰設定)では、提案手法が既存の文章だけの手法をすべて上回りました。ただし伸び幅は約1.1%(後述)と、論文自身が「控えめ」と認める水準です
- 文章だけをAIに渡す設定(単峰設定)では、提案手法を含む5つの手法すべてが、何もしない場合を下回りました。画像の説明が効くのは、画像そのものもAIに渡っている場合に限られます
「効果あり」と単純に一括りにできる話ではありません。条件によって結果の向きが変わる論文です。
この点は、後の章で詳しく整理します。
この論文の基本情報
| 項目 | 内容 |
|---|---|
| 題名(原題) | Caption Injection for Optimization in Generative Search Engine |
| 著者 | Xiaolu Chen、Jie Bao、Haojie Wu、Zhen Chen、Yong Liao(5人。中国科学技術大学) |
| 公開日 | 初版2025年11月6日。確認した版はv4(2026年6月29日改訂) |
| arXiv番号 | 2511.04080(分野はcs.IR、情報検索) |
| 掲載・採択状況 | ECML PKDD 2026のResearch Track(本会議)に採択。Springer(DOI: 10.1007/978-3-032-37664-0_8、Machine Learning and Knowledge Discovery in Databases掲載)で確認済み |
| 種類 | 手法提案の実験論文(査読付き国際会議に採択されたプレプリント) |
| 研究資金 | 中国の国家科学技術イノベーション2030重大プロジェクト、および安徽省科学技術重点プロジェクトの助成。論文は利益相反がないと述べています |
| 実験データ・コードの公開先 | GitHub(GrayChan04/Caption-Injection)で公開。実在を確認済みです |
論文はこちらで読めます。arXiv(2511.04080)。
GEO原論文の解説記事やサーベイ論文の解説記事もあわせてご覧ください。
この論文が答えた問い
画像の説明文(キャプション)を本文に書き足すと、生成検索の回答の中での目立ち方は変わるのか。変わるなら、文章だけを書き換える既存の手法と比べてどうなのか。
これまでのLLMO研究は、統計や引用を足す、文章を滑らかにするなど、文章だけを対象にしてきました。一方で、生成検索の仕組み自体は、写真や図も含めて内容を読み取る「多峰(マルチモーダル)」な方向に進んでいます。
論文は、この技術の進み方に対して、既存のLLMO手法が追いついていない、という問題意識から出発しています。
「生成検索」と「多峰」とは何か
論文が扱う生成検索(GSE)は、検索で集めた複数のページをAIが読み、1つの回答文にまとめて出典を添える仕組みです。従来の検索は、ページを順位のついた一覧として示します。
生成検索では、複数のページの内容が1つの文章の中に溶け込みます。「多峰」とは、文章だけでなく画像・音声・動画など複数の種類の情報を、AIが同時に扱うことを指します。
論文が扱うのは、このうち文章と画像の組み合わせです。
どうやって調べたのか
提案手法「Caption Injection」の3段階
論文は、画像の説明文を本文に書き足す作業を、3つの段階に分けています。
| 段階 | やること |
|---|---|
| 構造化キャプションの生成 | 画像診断モデルのQwen-2.5-VL-7Bが、画像から「何が・どうしていて・どこで」(対象・動作・場面)を抜き出す |
| 整合の調整 | 本文の文脈に合わせて、構造化キャプションを書き直し、意味の重複や食い違いを減らす |
| 本文への差し込み | AIが文脈に合う挿入位置を自分で決め、本文の他の部分は変えずに、書き直したキャプションだけを差し込む |
この作業はすべてプロンプト(AIへの指示文)で行われており、追加の学習は行っていません。比較対象として、キーワードの詰め込み(従来型SEOの再現)、文章を滑らかにする書き換え、統計を足す書き換え、引用や名言を足す書き換えの4つの手法が使われました。
これらは4つとも、既存のLLMO研究(前記事で扱ったGEO論文など)から採ってきた手法です。
実験の舞台
| 項目 | 設定 |
|---|---|
| データセット | MRAMG(多峰検索の代表的なベンチマーク)。6分野・計4,800件の質問と資料の組 |
| 分野の内訳 | やさしい:Wit・Wiki・Web(ウィキペディア由来、計1,850件)。ふつう:Arxiv(2023〜2024年の論文200件)。むずかしい:Recipe・Manual(生活情報、計2,750件。Manualは本文が平均6,365.4字と長い) |
| 回答を作るモデル | GLM-4-9B(幻覚が少ないとされる公開モデル)。すべての手法で同じモデルを使い、条件をそろえています |
| キャプション生成モデル | Qwen-2.5-VL-7B。説明文がない画像に自動で生成させ、専門家が抜き取りで内容の一致を確認 |
| 比べる設定 | 単峰(文章だけをAIに渡す)と、多峰(文章と画像の説明文の両方をAIに渡す)の2通り |
ここで押さえておきたいのは、評価に使われた「目立ち方」の指標が、人手による採点ではないことです。論文はG-EVAL 2.0という、AI自身に採点させる仕組みを使っています。
関連性・回答への影響・多様性・独自性・クリックされそうか・回答内での位置・文章量の7つの観点を、それぞれ0〜5点でAIが採点し、平均を「主観的な見え方」の値としています。
論文自身も「人手による正解データではない」と明記しています。
結果
全体平均:多峰では最上位、単峰ではどの手法も基準を下回った
論文の表1から、6分野の平均値を拾います。数値は、書き換え前と比べた相対的な伸び(%)です。
マイナスは、書き換え前より見え方の値が下がったことを意味します。
| 手法 | 単峰(文章のみ) | 多峰(文章+画像説明) |
|---|---|---|
| キーワード詰め込み | -2.30 | -0.66 |
| 文章を滑らかにする | -0.37(単峰内で最良) | 0.71 |
| 引用・名言を足す | -1.12 | -0.08 |
| 統計を足す | -4.13 | -2.12 |
| Caption Injection(提案手法) | -1.01 | 1.12(多峰内で最良) |
多峰の設定では、提案手法が1.12%で最も高く、2番目に良かった「文章を滑らかにする」(0.71%)より0.41ポイント上回りました。
論文は、この差を統計的な検定で確認したとしています。一方、単峰の設定では、5つの手法すべてが、何もしない場合(0%)より低い値になっています。
もっとも低下が小さかったのは「文章を滑らかにする」でした。
読み取れること
- 画像の説明文が効くのは、画像そのものもAIに渡っている場合に限られます。文章だけの設定では、画像の説明を足しても本文の見え方は改善しませんでした
- 効果の大きさそのものは、控えめです。最も良かった値でも約1.1%の伸びで、論文自身が「modest(控えめ)」と表現しています
- 統計や引用を足す手法は、この実験ではむしろマイナスでした。これは、前記事で紹介したGEO原論文の「統計・引用を足すと最大約41%伸びる」という結果とは逆の傾向です。論文自身も「先行研究との食い違いが見られる」と述べており、原因はデータセットの違い(本論文はMRAMGという別のベンチマーク)にあると考えられます
- 長い文章のデータセット(Manual)では、全手法が単峰・多峰の両方でマイナスでした。論文は、文章が長いほど要点が薄まり、書き換えの効果が出にくいと推測しています
差が最も出た観点は「独自性」
7つの評価観点のうち、提案手法が既存手法との差を最も広げたのは「独自性(uniqueness)」でした。文章量の多いManualデータセットでは、多峰設定で独自性の伸びが7.59%となり、同時に測った関連性の伸び(-2.95%)との差が10.54ポイントに達しています。
論文は、画像の説明が、文章だけでは足りない情報を補い、他のページとの違いを際立たせたと解釈しています。
キャプションを練り直す手順と、差し込む回数の効果
論文は、キャプションをどれだけ作り込むかの違いも比較しています(アブレーション実験)。
| キャプションの作り方 | 単峰平均 | 多峰平均 |
|---|---|---|
| 構造だけのキャプション(1回差し込み) | -1.15 | 0.71 |
| 整合調整済みキャプション(1回差し込み) | -1.01 | 1.12 |
| 整合調整済みキャプション(複数回差し込み) | -0.63 | 0.01 |
整合を調整する手順を挟むと、単峰・多峰のどちらでも、構造だけのキャプションより値が上がりました。この段階には意味があると論文は評価しています。
一方で、差し込みの回数を増やす効果は、設定によって向きが逆になりました。単峰では複数回差し込むほうが良く、多峰では逆に1回のほうが良い結果でした。
論文は、多峰では画像の説明文に注意が向きすぎて、本文の細部への注目が薄れるためではないか、と推測しています。
論文自身が書いている限界
論文は最後に、限界を自分で挙げています。
- 画像を直接読み取れるAI(画像対応の大規模言語モデル)との体系的な比較は行っていません。今回試した構成以外での再現性は、まだ確かめられていません
- 提案手法の平均的な伸びは、約1.1%と控えめです
- 実際の生成検索の利用者にとって、体感できる違いになるかどうかは分かっていません
- 画像と文章の意味の融合は、まだ浅い段階にとどまっています。より深い組み合わせ方は今後の課題としています
- 生成検索AI自身が、どの入力を好むかという性質が、最適化の効果に影響している可能性があります
加えて、この記事を書くために原文を読んで気づいた点があります。
- 評価に使われているのは、AI自身による自動採点(G-EVAL 2.0)です。論文自身も「人手による正解データではない」と明記しています。人が実際にどう感じるかは、この実験の対象外です
- 本文の説明文には「多峰の設定は単峰より最適化が難しく、伸びが低くなりがち」という記述がありますが、表1の平均値を実際に比べると、5つの手法すべてで、多峰のほうが単峰より高い(伸びが良い)値になっています。論文は同時に、文章が長いManualデータセットで多峰設定の値が大きく持ち直すことにも触れており、この分野ごとの差が、全体の記述と平均値の印象にずれを生んでいる可能性があります
- 日本語での検証は、原文のどこにも記載がありません。使われた画像診断AI・回答生成AIの学習データは、英語と中国語が中心と見られます
- 実験に使われた「本文の書き換え」自体はAIが行っており、書き換え後の文章が事実として正確かどうかは、評価の対象に入っていません
- この論文自身が、生成検索を運用する側(GoogleやOpenAIなど)ではなく、大学の研究グループによるものです。実際のGSEでの検証ではなく、研究用に組んだ簡易版の生成検索での実験です
この論文から、言えること・言えないこと
| 言えること(論文の設定で確認された) | 言えないこと(論文では確認されていない) |
|---|---|
| 画像と文章の両方をAIに渡す設定では、画像の説明文を本文に足す方法が、文章だけの書き換え手法を上回った | 実際のChatGPTやGoogleのAI Overviewsなど、現行の商用サービスでの効果 |
| 文章だけをAIに渡す設定では、画像の説明を足しても効果は出なかった | この手法が、検索で拾われる確率やクリック数、問い合わせ数を上げること |
| 統計や引用を足す手法は、このベンチマークではマイナスの傾向だった | 統計や引用が、あらゆるデータセット・AIモデルで同じ結果になること |
| キャプションの整合を調整する手順には、一定の意味があった | 日本語のページや、日本語の質問でも同じ大きさで効くこと |
| 「独自性」の観点で、他の手法より差が付きやすかった | 人が実際に読んだときの、体感できる違い |
中小企業の視点で、どう受け取るか
ここからは論文の主張とは別の、私の読み取りです。
- 画像に代替テキストや説明を付ける作業は、無駄ではなさそうです。ただし、それだけで見え方が大きく変わるという水準ではなく、控えめな補助効果として捉えるのが妥当です
- 「画像もAIに読まれる」ことが前提の話です。いま使われている検索AIが、実際にページの画像をどこまで読み取っているかは、サービスや条件によって変わります。画像の説明を凝ることより先に、画像自体が正しく取得・表示されているかを確かめるほうが優先度は高いはずです
- 統計や引用を足せば伸びる、という単純な話ではありません。この論文では、むしろマイナスに出ています。手法の効果は、使うベンチマークや条件によって変わることを前提に、自社での実測を続ける必要があります
- この論文の実験は、あくまで研究用に組んだ簡易な生成検索での話です。実際のサービスでの効果を約束するものではなく、著者自身も「実運用への適用を意図したものではない」と倫理声明で述べています
よくある質問
Caption Injectionは、画像に代替テキストを入れれば十分ということですか
そうとは言えません。論文が試したのは、画像から作った説明文を、本文の適切な位置に、AIが自然な形で書き足す作業です。
単に画像タグに一言添えるだけの作業とは異なり、本文の文脈に合わせて内容を調整する手順を含んでいます。
単峰と多峰で結果が逆になるのは、なぜですか
論文は明確な因果までは示していませんが、画像の情報がAIに渡っていない単峰の設定では、画像の説明文を足しても、本文の意味を補う材料にならなかったためだと考えられます。逆に多峰の設定では、画像の説明文がAIの読み取り材料として直接使われるため、効果が出たと論文は解釈しています。
統計や引用を足す手法が、この論文ではマイナスだったのはなぜですか
論文自身が「先行研究との食い違い」として言及していますが、明確な理由までは特定していません。使われたベンチマーク(MRAMG)やAIモデル(GLM-4-9B)が、以前の研究と異なることが影響していると考えられます。
効く手法は、条件によって変わり得るという教訓として読むのが妥当です。
まとめ:今日できる1つのこと
自社のページでよく読まれている記事を1つ開き、載せている画像に、内容を正確に説明する代替テキストが付いているかを確かめてください。
付いていなければ、その画像が「何を・どうしている・どこで」写したものかを、1行で書き足します。この論文が示したのは、この作業が生成検索での見え方を大きく変える魔法ではなく、条件がそろえば効果が出得る、控えめな一手だということです。
この論文は、LLMO論文の一覧の一本です。ほかの論文の解説も、順次公開しています。
この記事に書いたことを、そのまま御社のページに
生成AIに引用されるページを、お話しいただくだけでお作りします。お時間をいただくのは初回15分のヒアリングだけです。まず1ページ、無料でお作りします。
OKが出るまで、何度でも直します。事実が違う、言い回しが硬い、この話は入れないでほしい。どれも遠慮なくおっしゃってください。何度お直ししても、追加の料金はいただきません。
これまでに127社にご利用いただきました。毎月ご依頼いただいている方の6割以上が、月10ページを選ばれています。料金はページに掲載しています。
ページを増やしても問い合わせが来ないなら、原因はページの外にあります。その場合は、下の入口からご相談ください。
自社のマーケティング課題を根本から解決しませんか?
ウェブサイトから要素を引き算し、訪れた人が迷わず次の一歩に進む形へ組み直す。初回60分のオンラインで御社のサイトを一緒に読み、どこから直すべきかをお伝えします。手順をまとめた無料の診断と解説動画もご用意しています。
初回は無料・60分・オンライン完結・その場で契約のお願いはいたしません


