中国語で質問したとき、AI検索はどんなページを出典に選び、そのうち何を回答に書き込むのか。この問いを、中国で広く使われている4つの生成AIサービスで数えた論文があります。
2026年7月にarXivで公開された「What Do Chinese-Language Generative Search Engines Cite and Surface?」です。
4サービスのウェブ版とアプリ版、合わせて8つの画面に614問を3回ずつ投げ、16万860件の引用を集計しています。
この記事は、その論文を原文から読んで整理します。分かるのは、出典に載ったブランドが回答に出る割合、従来のSEOの評価点の効き方、引用ページの新しさ、アプリ版とウェブ版の違いです。
先にお伝えしておくと、著者は北京の民間企業の研究所に所属し、データはAI検索の監視ツールで集めた観察データです。質問も回答も中国語で、日本語での検証はありません。
合同会社謙虚は、3つのドメインを並行して運用し、何を変えると数字が動くかを測り続けています。「出典に載ること」と「回答に社名が出ること」の間にどれだけの差があるのかを、大きなデータで確かめておくために、この論文を読みました。
結論:3行で言うと
- 引用されたページの本文に出てきたブランドのうち、回答の本文にも名前が出たのは8.3%でした。連絡先が載った出典から回答に連絡先が出た割合は12.4%です。出典に載ることと、回答に出ることは別の段階だと、論文は数字で示しています
- 回答に名前が出るかと最も強く結びついていたのは、同じ回答の中で、そのブランドに触れた出典が何件あるかでした(1件なら2.1%、11件以上なら59.9%)。従来のSEOの評価点は、どの分析でも最上位の予測要因にはなりませんでした
- 同じサービスでも、アプリ版とウェブ版で引用元の重なりはドメイン単位で約2割〜5割でした。いずれも観察データでの関連で、因果は確かめていません。査読前のプレプリントで、中国語・中国の検索環境の結果です
この論文の基本情報
| 項目 | 内容 |
|---|---|
| 題名(原題) | What Do Chinese-Language Generative Search Engines Cite and Surface? A Large-Scale Empirical Study |
| 著者 | Tao Zhen、Yue Liu、Gege Zhang、Yixuan Niu(4人。最初の2人と後の2人が、それぞれ同等の貢献と明記) |
| 所属 | 北京の民間企業の研究所(全員同じ所属)。データ収集に使った「AI検索の監視ツール」と、研究所の名前の一部が同じです |
| 公開日 | 2026年7月17日(arXivの初版で、現時点で唯一の版) |
| arXiv番号 | 2607.15771(分野はcs.IR、情報検索) |
| 掲載・採択状況 | arXivのコメント欄は「49ページ、図15点」と著者の貢献の記載だけで、学会や論文誌の掲載情報は空欄です(2026年9月25日に確認)。査読前のプレプリントです |
| 種類 | 実際のサービスの回答を集めて集計した観察研究(監査研究)。民間企業の研究所による報告 |
| 実験データ・コード | コード共有サイトで、公開できる範囲の生データと項目の説明を公開。引用ページの全文と分析スクリプトは、公開しないと書かれています |
論文はこちらで読めます。arXiv(2607.15771)、DOI。
データの公開先は、arXivの論文ページから辿れます。
論文に利益相反の節はありません。この記事では、著者の所属企業とツールの名前は伏せます。
この論文が答えた問い
中国語のAI検索は、どんなページを引用し、その中身をどこまで回答に使い、どのブランドや連絡先を回答に出すのか。そして、同じサービスのアプリ版とウェブ版で、その結果は同じなのか。
土台になっているのは、AI検索の成果を「出典に選ばれること(選択)」と「回答に中身が取り込まれること(吸収)」の2段階に分けた先行研究です。
この枠組みは引用の選択と吸収を分けて測る論文の解説で紹介しています。
今回の論文は、そこに「回答にブランドや連絡先が出るか(露出)」と「画面による違い」の2層を足し、中国語の4サービスを同じ項目で比べました。
どうやって調べたのか
| 項目 | 内容 |
|---|---|
| 対象のサービス | Doubao、DeepSeek、騰訊元宝(Tencent Yuanbao)、Qwen(通義千問)の4つ。それぞれウェブ版とスマートフォンのアプリ版で、計8画面 |
| 質問 | 614問。質問の性質・極端な場面・業種・頼み方・時事性・購買の強さの6層を組み合わせた31通りの設計で、1通りあたり原則約20問。飲食、家電、美容、ホテル、医療、金融、法律など21業種 |
| 繰り返し | 同じ質問と画面の組み合わせごとに3回 |
| 期間 | 主に2026年6〜7月 |
| 規模 | 生データ21万4,119件を整理し、引用1件を1行とする16万860件の表を作成 |
| 引用ページ | 本文を全件取得。動画は音声を文字起こしし、画像はAIで文字を読み取って分析に含めました。ボタン、ポップアップ、ページ下部の連絡先欄、構造化データは除外 |
| 判定 | 回答と引用の意味の近さ(0〜1)、吸収の度合い、引用の役割は、AI(Doubao-Seed-2.1-Pro)が決まった採点基準で付けました。人の手で付けた正解ではないと、論文自身が書いています |
吸収の度合いは、意味の近さが0.30未満なら「名目だけの引用」、0.30〜0.65なら「一般的な引用」、0.65以上なら「深い引用」の3段階です。
比べる相手として使ったのが、「従来のSEOの評価点」です。中国の大手検索エンジンのウェブマスターツールでの登録ページ数を4割、民間のSEOデータサービスが出すサイトの重みを3割、サイトの届出からの年数を2割、届出の種類を1割で合成した0〜1の点数です。
論文はこれを、サイトの信頼性とは別物の「従来のSEOの強さの代わりの指標」と位置づけています。
分析には、決定木を積み重ねる予測モデルを使い、各要因が予測にどれだけ効いたかを比べています。答えと同じ材料から作った変数は、見かけの説明力を上げるため外しています。
結果
1. 引用元の約7割は、ニュース・業界サイト・SNS
16万860件のうち、種類を1つに決められた15万9,423件(99.1%)の内訳です。
| サイトの種類 | 引用数 | 割合 | ドメイン数 | SEO評価点の平均 |
|---|---|---|---|---|
| ニュース媒体 | 45,877 | 28.8% | 676 | 0.488 |
| 業界別の専門サイト | 38,497 | 24.1% | 810 | 0.601 |
| SNS・個人の発信者 | 26,089 | 16.4% | 68 | 0.525 |
| ブランド・企業の公式サイト | 20,510 | 12.9% | 6,589 | 0.262 |
| 通販・取引サイト | 12,112 | 7.6% | 285 | 0.473 |
| 百科事典型のサイト | 9,147 | 5.7% | 54 | 0.788 |
| 政府機関 | 7,191 | 4.5% | 1,225 | 0.366 |
- 上の3種類で約69%です。企業の公式サイトは12.9%で、6,589ものドメインに細かく散らばっていました
- 政府機関の割合は、法律で14.7%、医療で8.2%、金融で5.2%と、消費者向けの多くの業種(1〜4%)より高くなりました
- サービスごとの差も大きく、Doubaoのアプリ版は最も多い1ドメインが引用の28.6%を占めました。DeepSeekはウェブ版もアプリ版も、最多のドメインで約5%と幅広く引用していました
- 1つのドメインが引用の半分以上を占めた質問は0.8%で、行政手続きや公式窓口の電話番号など、答えが1つに決まる質問に多く出ました
2. 本文に番号を付ける2サービスでは、並んだ出典の約4割が本文で使われていなかった
本文中に引用番号を付けるDeepSeekと騰訊元宝では、出典の使われ方を追えます。1回答あたり平均10.5件の出典が並び、本文に番号付きで登場したのは約6.9件、約3.5件は本文に一度も出てきませんでした。
この「本文で使われない出典」は39.3%です。全体では、名目だけの引用が55.1%を占めました。
深く引用されやすかったのは長いページで、100字未満では深い引用が10%、1,000字超では39%です。役割別では定義・説明が41.1%、手順が36.0%と高く、背景説明は6.3%でした。
従来のSEOの評価点は、最低の帯から最高の帯へ上がっても、深い引用の割合が約16%から約14%に動いただけでした。
3. 出典に載ったブランドのうち、回答に出たのは8.3%
4,493件の回答で、引用ページの本文に出たブランドと、回答の本文に出たブランドを突き合わせました。候補63万2,256件のうち、回答にも出たのは8.3%です。
予測モデルの判別力(AUC)は0.87でした。
| 要因(予測への効き方の順) | 低い側の選ばれる割合 | 高い側の選ばれる割合 |
|---|---|---|
| そのブランドに触れた出典の数 | 1件:2.1% | 11件以上:59.9% |
| 回答と引用の意味の近さ | 0:1.1% | 0.6〜1:21.1% |
| 従来のSEOの評価点 | 0〜0.3:2.7% | 0.85〜1:16.5% |
| 吸収の度合い | 名目:1.5% | 深い:20.7% |
| 出典の並び順 | 12番目以降:2.4% | 1番目:18.5% |
- 最も効いていたのは、同じ回答の中で、そのブランドに触れた出典の数です。ブランドそのものの出現回数と切り分けても、この傾向は残りました(オッズ比は2.71から2.87へ)
- 従来のSEOの評価点は、この分析では3番目で、高いほど選ばれやすい向きでした。ほかの分析では下位で、論文は「どの分析でも最上位ではなかった」とまとめています
- 引用の役割別では、比較・ランキングが22.9%、定義が20.7%、統計・データが17.3%で、全体の8.3%を上回りました
4. 回答に出た名前の約13%は、その時の出典と照合できなかった
回答にブランドが出た6万311件のうち、7,855件(13.02%)は、その回答の出典のどこにも見つかりませんでした。データ内での出現回数が少ないブランドほど、出典側のブランドが少ない回答ほど、この割合は高くなります。
質問の種類では、あいまいな質問で27.5%、時事性の高い質問で24.3%でした。
連絡先では、回答に出た連絡先の71.1%が、取得した本文と照合できませんでした。ただし本文の取得でページ下部の連絡先欄などを外しているため、論文はこの数字を「本文抽出の定義の範囲での値」と断っています。
連絡先が回答に出るかは質問の種類で大きく分かれ、ブランドに関する質問では基準の群に対するオッズ比が約89でした。種類別では、公式サイトのURLが出典での割合14.2%に対し回答では45.0%と多く、店舗の住所は19.9%に対し0.9%と少なく出ています。
5. 時事性の高い質問では、引用されるページの半減期が約39日
公開日が読み取れた引用で、ページの古さ(公開日から収集日までの日数)を比べました。時事性の高い・中くらい・低い質問で、中央値は18日・52日・101日です。
引用されたページの古さの分布を1時点で指数関数に当てはめると、頻度が半分になる日数は、時事性の高い質問で約39日、低い質問で約68日、全体で約60日でした。
時事性の高い質問では、引用ページの61%が30日以内の公開で、全体の32%を上回ります。
ページの古さは回答の中での並び順とほぼ無関係で(相関0.041)、論文は、新しさの差が表れるのは出典に選ばれる段階だと読んでいます。古さと従来のSEOの評価点の相関は0.069でした。
6. 同じサービスでも、アプリ版とウェブ版で引用元が違う
同じ質問について、アプリ版とウェブ版の引用元の重なりを、重なり÷全体(1なら完全一致、0なら重なりなし)で測りました。3回分の引用はまとめてから比べています。
| サービス | URL単位 | ドメイン単位 | 上位3件の重なり | 比べた質問数 |
|---|---|---|---|---|
| DeepSeek | 0.408 | 0.507 | 0.484 | 580 |
| Doubao | 0.310 | 0.505 | 0.457 | 580 |
| 騰訊元宝 | 0.097 | 0.299 | 0.262 | 591 |
| Qwen | 0.014 | 0.190 | 0.133 | 352 |
- 4つとも、アプリ版とウェブ版の引用元は一致しませんでした。Qwenでは、64.2%の質問で共通するURLが1つもありません。件数の差の影響を除く検算でも、重なりの低さは同じでした
- 違いは上位3件や回答の長さにも出ました。DeepSeekの回答の平均は、ウェブ版1,792字、アプリ版1,157字です
- サービス間の幅(0.32)は、6業種の間の幅(0.059)より大きくなりました
論文自身が書いている限界
- 観察データであること:1つの要因だけを無作為に変える設計は未実施です。関連は、この質問集合とサービスの範囲での条件付きのものと書いています
- 見ているのは出典に載ったページだけ:ウェブ全体の候補や落とされたページは、分析の範囲外です
- 時期と範囲:収集は主に2026年6〜7月、4サービス・8画面・614問で、アプリ版とウェブ版の業種別の比較は6業種に限られます(業種の比較全体は21業種)
- 測り方の誤差:吸収の度合い・役割・意味の近さはAIの判定です。本文抽出でページ下部の連絡先欄や構造化データを外したため、出典側の連絡先を少なく数えている可能性があります。公開日が読めない画面もありました
- 統計の扱い:標本が大きいため、効果の大きさと向きを重視したと書いています。方法の節では、半減期や一部のオッズ比は区間のない点推定だとしています
原文を読んで気づいた点
- 査読の有無:arXivの初版のみで、コメント欄に学会の記載はありません。査読前のプレプリントとして読むのが妥当です
- 著者の立場:全員が同じ民間企業の研究所に所属し、データ収集に使ったツールは研究所と同じ名前を冠しています。企業による報告として読む必要があります
- 判定したAIの系列:意味の近さや吸収の度合いを付けたのはDoubao系のモデルで、調査対象の1つと同じ系列です。この点が判定に偏りを生むかどうかは、論文で検討されていません
- 数字の食い違い:照合できないブランドを、節の見出しは「約10分の1」、本文と要旨は13.02%(13%)としています。まとめの図の「実質的に使われた30%」は本文の名目だけの引用55.1%から出る44.9%と合わず、「深い引用8%」も、2.2節の深い引用の割合(長さ別の最低でも10%、評価点の帯別で約14〜16%)を下回ります。この記事では本文と表の数字を使いました
- 連絡先の分析の範囲:連絡先の分析は614問のうち574問が対象です。オッズ比約89の「基準の群」がどの質問群かは、原文に明記がありません
- 日本語での検証はありません:質問・回答とも中国語で、評価点も中国の検索エンジンや届出制度にもとづく指標です。日本語のサービスや日本の検索環境で同じ数字が出るかは、この論文からは分かりません
この論文から、言えること・言えないこと
| 言えること | 言えないこと |
|---|---|
| 中国語の4サービスでは、出典に載ったブランドのうち回答に名前が出たのは8.3%だった | 出典に載れば、どの言語のAI検索でも同じくらいの割合で名前が出る |
| そのブランドに触れた出典が多い回答ほど、名前が出やすいという関連があった | 第三者のページを増やせば、名前が出るようになる(因果は未検証) |
| 従来のSEOの評価点は、どの分析でも最上位の予測要因ではなかった | 従来のSEOは、AI検索では意味がない(ブランドの分析では正の向きに効いていた) |
| 時事性の高い質問では、引用ページの頻度が約39日で半分になる当てはめ結果だった | 39日ごとに記事を更新すれば引用が保たれる |
| 同じサービスでも、アプリ版とウェブ版で引用元が大きく違った | 画面による違いが、なぜ生じるのか(論文は今後の課題としています) |
中小企業の視点で、どう受け取るか
ここからは論文の主張とは別の、私の読み取りです。中国語・中国の検索環境の結果を、日本語での検証がないまま日本の環境に当てはめて考えています。
- 「出典に載った」で満足しないこと:出典に載っても、回答に社名が出たのは1割未満でした。見え方を確かめるときは、出典の一覧と回答の本文を分けて見るほうが実態に近づくと考えます
- 自社サイトに限らず、複数の出典に事実どおり載る:名前が出るかと最も結びついていたのは、同じ回答の中で自社に触れた出典の数でした(公式サイトも含めた数です)。業界の専門サイトやニュース、比較記事に事実どおりの情報で載ることを、自社サイトの整備と並べて進めるのは、私の推測を含む読み取りです。ただし相関で、因果は未検証です
- 定義・手順・比較・数字の形で書く:定義や手順として使われた引用ほど、深く使われていました。サービスの説明を定義・手順・比較表・具体的な数字で組み立てるのは、読み手のためにもなる工夫です
- 測るときは画面を分ける:アプリ版とウェブ版で引用元が違ったため、見え方を測るときは、どの画面で聞いたかも記録しておくと比べやすくなります。中国系AIと欧米系AIのブランド言及の違いの解説も、サービスごとに分けて測る理由の1つです(その記事の言及率とこの論文の8.3%は、数え方が違う数字です)
よくある質問
中国語の生成検索を調べたこの監査研究の結果は、日本語のChatGPTやGeminiにも当てはまりますか
そのままは当てはまりません。質問も回答も中国語で、従来のSEOの評価点も中国の検索エンジンの指標でできています。
日本語での検証は論文にありません。「出典に載ることと回答に出ることは別の段階」という枠組みは、日本語でも確かめる価値のある考え方として受け取るのが妥当です。
従来のSEOの評価が高いサイトは、中国語のAI検索で引用されやすいのですか
この論文では、従来のSEOの評価点は、引用の深さ・並び順・ページの新しさのどの分析でも弱い関連にとどまりました。ただしブランドが回答に出るかの分析では、評価点が高いほど選ばれやすい向きで、要因の中では3番目でした。
「効かない」とは書かれていません。なお、ウェブ検索とAIの出典の重なりを英語で比べた研究はウェブ検索と生成AIの出典比較の解説で扱っています。
AI検索のアプリ版とウェブ版で引用元が違うのは、なぜですか
理由は、この論文では分かっていません。論文は、サービス内部の検索記録などを集めて技術的な出どころを確かめることを、今後の課題にしています。
分かっているのは、違いが上位の引用元や回答の長さにも出ていたことと、その大きさがサービスで異なることです。
まとめ:今日できる1つのこと
自社名で出てきてほしい質問を1つ決め、ふだん使うAIサービスのアプリ版とウェブ版の両方で聞いてみてください。並んだ出典のうち自社名が載ったページの件数と、回答の本文に自社名が出たかを、画面ごとに書き留めます。
この2つを分けて記録しておくと、次に何を増やすべきかが見えやすくなります。
この論文は、LLMO論文の一覧の一本です。ほかの論文の解説も、順次公開しています。
この記事に書いたことを、そのまま御社のページに
生成AIに引用されるページを、お話しいただくだけでお作りします。お時間をいただくのは初回15分のヒアリングだけです。まず1ページ、無料でお作りします。
OKが出るまで、何度でも直します。事実が違う、言い回しが硬い、この話は入れないでほしい。どれも遠慮なくおっしゃってください。何度お直ししても、追加の料金はいただきません。
これまでに127社にご利用いただきました。毎月ご依頼いただいている方の6割以上が、月10ページを選ばれています。料金はページに掲載しています。
ページを増やしても問い合わせが来ないなら、原因はページの外にあります。その場合は、下の入口からご相談ください。
自社のマーケティング課題を根本から解決しませんか?
ウェブサイトから要素を引き算し、訪れた人が迷わず次の一歩に進む形へ組み直す。初回60分のオンラインで御社のサイトを一緒に読み、どこから直すべきかをお伝えします。手順をまとめた無料の診断と解説動画もご用意しています。
初回は無料・60分・オンライン完結・その場で契約のお願いはいたしません


