「同じ英語の質問をしても、使うAIが変わるとブランドの出方が変わる」。そう聞くと、多くの人は言語の違いを思い浮かべます。
しかし2025年12月に公開された論文は、原因を、AIの学習データがどの地域を中心に集められたかに求めています。質問の言語が理由だとは述べていません。
この記事は、その論文を原文から読み、何を測って何が分かったのかを整理します。あわせて、この論文には見過ごせない条件が付いていることも書きます。
事例として扱われた企業と、論文の著者3名の所属先が同じ会社だという点です。数値はすべて論文の表や本文から拾い、私が計算し直した値には「概算」と添えています。
合同会社謙虚は、3つのドメインを並行して運用し、何を変えると数字が動くかを測り続けています。この論文を読む理由は、AIによるブランドの見え方の差が、書き方の工夫ではなく学習データの出身という、もっと手前の要因で生まれることがあると知っておくためです。
結論:3行で言うと
- 同じ英語の質問でも、中国系の生成AI(Qwen3・DeepSeek・Doubao)は欧米系の生成AI(GPT-4o・Claude・Gemini)より、ブランドを回答に入れる割合が30.6ポイント高い(88.9%対58.3%)と報告しています
- 論文の中心の事例企業(著者の所属先と同じ会社)は、中国系AIでの言及率65.6%に対し、欧米系AIでは0%でした。ただし著者全員がこの企業に所属しているため、この差を一般的な傾向として広げて読むには注意が要ります
- 「学習データを増やせば見え方が変わる」という枠組みと18か月の行動計画を提案していますが、これは論文の提案であって、実際に試して効果を確かめた結果ではありません
この論文の基本情報
| 項目 | 内容 |
|---|---|
| 題名(原題) | Cultural Encoding in Large Language Models: The Existence Gap in AI-Mediated Brand Discovery |
| 著者 | Huang Junyao、Situ Ruimin、Ye Renqin(3名。全員が深センのAIコンサルティング企業に所属。以下、著者の所属企業) |
| 公開日 | 2025年12月30日(arXiv初版) |
| arXiv番号 | 2601.00869(分野:cs.AI) |
| 掲載・採択状況 | arXivのプレプリント。学会・論文誌への採択を示す記載は見当たりません |
| 種類 | 企業が実施した準実験的な比較研究 |
| 実験データ/コードの公開先 | GitHub(著者の所属企業のアカウント、MITライセンス)。論文は「生データ」の公開を書いていますが、実際に確認すると公開されているのは100件のサンプルのみで、分析に使った1,909件全体のデータは見当たりませんでした |
論文はこちらで読めます。arXiv(2601.00869)。
この論文が答えた問い
生成AIの学習データが、欧米中心か中国中心かという違いだけで、同じ英語の質問への回答に出てくるブランドは変わるのか。変わるなら、その差はどのくらいで、どんな種類の質問で大きくなるのか。
論文はこの問いを「カルチュラル・エンコーディング(Cultural Encoding)」と名づけています。回答に出るブランドを左右するのは、AIが学習した文章の出身地域だという考え方です。
ユーザー自身が使う言語は関係がないとしています。論文は、学習データに存在感が薄いブランドは、質の良し悪しに関わらずAIの回答に出てこないという状態を「エグジステンス・ギャップ(Existence Gap、存在の空白)」と呼んでいます。
どうやって調べたのか
調べ方の骨組みは、同じ英語の質問を、学習データの出身が違う2種類のAIに投げて、回答にブランド名が出るかどうかを比べる、というものです。
| グループ | 使ったAI |
|---|---|
| 欧米系 | GPT-4o Search Preview、Claude Sonnet 4.5、Gemini Pro Latest |
| 中国系 | Qwen3 Max Preview、DeepSeek V3.2 Exp、Doubao 1.5 Thinking Pro |
対象にしたブランドは、コラボレーションツールや業務効率化ソフトの分野から30件。内訳は、欧米発が10件(Slack、Microsoft Teamsなど)、中国発が10件(DingTalk、Feishu、事例企業〈著者の所属企業と同じ会社〉など)、どちらとも言いにくい国際ブランドが10件(Miro、Figma、GitHubなど)です。
ユーザーの意図別に、基本認知・機能・比較・推薦・場面・技術・料金・評判・代替・トレンドの10種類の質問を作りました。
言語の影響を切り分けるための手順が、この論文でいちばん丁寧な部分です。まず2,800件の質問と回答のペアを集め、質問や回答に中国語の文字が1文字でも含まれるものを、文字コードで機械的に検出して891件(31.8%)取り除きました。
中国系ブランドの名前自体が中国語表記になっているケースなどが対象です。残った1,909件が、すべて英語だけで書かれた質問と回答のペアになります。
この絞り込みによって、「AIが中国語混じりの質問に混乱しただけ」という説明を排除しています。
ブランドが回答に出たかどうかの判定と、好意的か批判的かの判定は、2人の評価者が独立して人手で行いました。ブランド言及の一致率は98.2%(カッパ係数0.96)、好意度の一致率は94.7%(カッパ係数0.91)と報告されています。
AIの自動採点は使わず、人手で評価しています。
結果
全体の言及率をまとめたのが下の表です。
| AIのグループ | 質問数 | 言及数 | 言及率 |
|---|---|---|---|
| 欧米系AI | 955 | 557 | 58.3%(95%信頼区間 55.2〜61.4%) |
| 中国系AI | 954 | 848 | 88.9%(95%信頼区間 86.8〜90.8%) |
差は30.6ポイントで、統計的に意味のある差でした(カイ二乗値226.60、p<.001、効果量ファイ係数0.34)。同じ英語の質問という条件をそろえたうえでの差なので、質問の言語が理由ではないと論文は述べています。
割合で見ると、中国系AIの言及率は欧米系AIの約1.5倍です(88.9÷58.3、概算)。
ブランドの出身別に分けると、差の大きさが変わります。
| ブランドの出身 | 欧米系AI | 中国系AI | 差 |
|---|---|---|---|
| 欧米発ブランド | 72.1% | 81.3% | +9.2ポイント |
| 中国発ブランド | 31.2% | 96.8% | +65.6ポイント(p<.001) |
| 国際・その他ブランド | 71.6% | 88.6% | +17.0ポイント(p<.01) |
差が最も大きかったのは中国発ブランドで、中国系AIでの言及率は欧米系AIの約3.1倍です(96.8÷31.2、概算)。質問の種類別でも差の大きさは一定ではありません。
| 質問の種類 | 欧米系AI | 中国系AI | 差 |
|---|---|---|---|
| ポジショナル(「〇〇に最適なツールは」) | 45.2% | 92.1% | +46.9ポイント(p<.001) |
| 推薦(「協業ツールを教えて」) | 51.3% | 90.4% | +39.1ポイント(p<.001) |
| 比較(「AとBを比べて」) | 68.7% | 87.2% | +18.5ポイント(p<.01) |
| 基本情報(「〇〇とは何か」) | 73.1% | 85.6% | +12.5ポイント(p<.01) |
好意度も調べています。ブランドが言及された1,405件(欧米系557件、中国系848件)を対象に、-1(批判的)から+1(好意的)の3段階で採点したところ、欧米系AIの平均は+0.42、中国系AIの平均は+0.71でした(t検定、t値-11.76、p<.001、効果量d=0.53)。
ブランドが登場した場合、中国系AIのほうが好意的な書き方になりやすいという結果です。
事例企業の言及率
論文は、著者の所属企業と同じ会社である事例企業(チャットやビデオ会議、ファイル共有を扱う協業ツールを提供)を、中心の事例として取り上げています。1,909件のうち、この企業を対象にした質問は64件でした。
| AIのグループ | 質問数 | 言及数 | 言及率 |
|---|---|---|---|
| 欧米系AI | 32 | 0 | 0.0%(95%信頼区間 0〜10.9%) |
| 中国系AI | 32 | 21 | 65.6%(95%信頼区間 46.8〜81.4%) |
差は65.6ポイントで、統計的に意味のある差でした(カイ二乗値21.33、p<.001、効果量ファイ係数0.58)。論文が引用している回答例では、中国系AIは、事例企業のツールについて「バイリンガル対応が必要なチームに向いており、リアルタイム翻訳機能を持つ」といった具体的な特徴まで答えています。
一方、欧米系AIは「そのプラットフォームについての情報がない」「知らない、詳しく教えてほしい」という趣旨の回答でした。
読み取れること
- 同じ英語の質問でも、言及率に大きな差がありました。論文はこの差を、学習データの出身地域によるものだとしています(質問の言語による差だとはしていません)
- 差の大きさは、ブランドの出身と質問の種類によって変わります。中国発ブランドで、かつ名前を出さずに探すポジショナルな質問で、差が最も大きくなりました
- 言及された場合の好意度にも差がありました。言及そのものだけでなく、書かれ方にも違いが出ています
- 事例企業の差は、この論文でいちばん極端な数字です。ただし、その企業は論文の著者3名全員の所属先でもあります
論文自身が書いている限界
論文は最後に、自分で4つの限界を挙げています。
- 対象はコラボレーションツールという1つの分野に限られており、他の商品分野では効果の大きさが変わる可能性があります
- 調べたAIは6つで、新しいモデルでは違う傾向になる可能性があります
- ある一時点を比べた設計のため、因果関係までは確かめられていません
- 事例企業の深掘りは1社だけの事例であり、他のブランドでも同じ傾向になるかは確かめられていません
加えて、この記事を書くために原文を読んで気づいた点があります。
- 著者3名全員が、事例企業と同じ会社に所属しています。論文には利益相反の申告があり、「事例の選定は特徴に基づくもので商業的な考慮ではない」と書かれています。ただし、自社の海外展開の課題を、自社が書いた学術論文の中心事例として使っている構図自体は、読み手が割り引いて考える材料になります。データを公開しているGitHubのページ自体も、同社が実際に販売しているブランドAI可視性戦略コンサルティングなどの自社サービスへの案内を兼ねていました
- この論文はarXivのプレプリントで、査読を経たかどうかを示す記載は見当たりませんでした。arXivのComments欄には、ページ数とコード公開先の記載のみで、学会名や採択の言及はありません
- データ公開の記載と実際が食い違っています。論文本文は「生データ(geo_data_english_only.json)を誰でも入手できる形で公開している」と書いていますが、実際にGitHubのリポジトリを確認すると、公開されているのは100件のサンプル(data_sample_100.json)のみでした。分析対象の1,909件全体は、氏名・所属機関・研究目的・発表予定時期を明記したメール申請が必要な、審査つきの限定提供です
- 本文中の年の表記に不自然な点があります。データ収集時期を「2026年11月〜12月」、使用AIの出典を「(OpenAI, 2026)」「(Anthropic, 2026)」などと書いていますが、この論文自体はarXivに2025年12月30日に提出されています。提出日より後の年をデータ収集時期として書いている箇所があり、年の記載に誤りが含まれている可能性があります
- 「18か月の行動計画に沿えば、言及率が40%以上改善する」という記載は、実際に計画を実行して確かめた結果ではなく、論文が示す見込みです
この論文から、言えること・言えないこと
| 言えること(論文の設定で確認された) | 言えないこと(論文では確認されていない) |
|---|---|
| 同じ英語の質問でも、中国系AIと欧米系AIで、ブランドの言及率に差があった | この差が、コラボレーションツール以外の分野でも同じ大きさで出ること |
| 差の大きさは、ブランドの出身や質問の種類によって変わった | 特定の施策を行えば、言及率が特定の割合だけ改善すること |
| 言及された場合の好意的な書かれ方にも、AIグループ間で差があった | 事例企業1社の結果が、他のブランドにも同じ大きさで当てはまること |
| この一時点の比較で、AIグループ間の言及率に差が見られた | 学習データを増やせば、どの程度・どれくらいの期間で言及率が変わるかという因果関係 |
中小企業の視点で、どう受け取るか
ここからは論文の主張とは別の、私の読み取りです。
- 「AIに聞かれても出てこない」状態は、質問の言い方ではなく、AIの選び方だけで起こり得ます。自社のブランドを確かめるときは、1つのAIサービスだけで判断せず、複数のAIで試すのが安全です
- 名前を出さない質問(推薦・ポジショナル型)で差が大きいという結果は、実務の感覚とも合います。「〇〇というブランドはどう?」には答えられても、「おすすめは?」には出てこない、という状態は、実際の営業機会に近い場面で起きやすいと考えられます
- この論文の事例企業の結果は、自社の課題を自社で調べて書いたものです。同じような「うちのAI経由の見え方」を語る記事や調査を読むときは、書き手と調査対象が同じ会社かどうかを確かめる価値があります
- 「18か月でこう変わる」という数字は、まだ実証された結果ではありません。ブランド評判が言語や地域でどう変わるかは、複数市場・複数言語でのAI引用元の分析を扱った別の論文の記事でも取り上げているので、あわせて確認することをおすすめします
よくある質問
カルチュラル・エンコーディングは、学習データの出身地域で決まり、質問の言語では決まらないのですか
論文はそう報告しています。中国語を含む質問をすべて取り除き、英語だけの質問1,909件に絞ったうえでも、中国系AIと欧米系AIの言及率に30.6ポイントの差が残りました。
この絞り込みが、質問の言語による影響を切り分ける根拠になっています。
事例企業のデータは、著者の所属企業と同じ会社のものなので割り引いて読むべきですか
その視点は必要です。論文には利益相反がない旨の申告がありますが、著者3名全員が事例企業と同じ会社に所属しています。
0%対65.6%という際立った差は、この論文でいちばん印象に残る数字ですが、自社の事例を自社で分析した結果である点は、読むときに意識しておく事実です。
中国系AIのほうが、自社のブランドを取り上げてくれる可能性が高いということですか
この論文の結果だけからは、そこまでは言えません。差が大きかったのは中国発ブランドについての質問で、欧米発ブランドの差は9.2ポイントにとどまっています。
ブランドの出身によって、どちらのAIグループで有利かは変わり得ます。
まとめ:今日できる1つのこと
自社のブランド名を出さずに、「〇〇分野でおすすめのツールは」という質問を、複数の生成AIサービスに投げてみてください。答えに自社が出てこないAIサービスがあれば、それがどのAIかを記録します。
原因を探るのは次の一歩で構いません。まずは、AIサービスごとに見え方が違うかもしれないという前提を持つことが、この論文からの実務上の出発点です。
この論文は、LLMO論文の一覧の一本です。ほかの論文の解説も、順次公開しています。
この記事に書いたことを、そのまま御社のページに
生成AIに引用されるページを、お話しいただくだけでお作りします。お時間をいただくのは初回15分のヒアリングだけです。まず1ページ、無料でお作りします。
OKが出るまで、何度でも直します。事実が違う、言い回しが硬い、この話は入れないでほしい。どれも遠慮なくおっしゃってください。何度お直ししても、追加の料金はいただきません。
これまでに127社にご利用いただきました。毎月ご依頼いただいている方の6割以上が、月10ページを選ばれています。料金はページに掲載しています。
ページを増やしても問い合わせが来ないなら、原因はページの外にあります。その場合は、下の入口からご相談ください。
自社のマーケティング課題を根本から解決しませんか?
ウェブサイトから要素を引き算し、訪れた人が迷わず次の一歩に進む形へ組み直す。初回60分のオンラインで御社のサイトを一緒に読み、どこから直すべきかをお伝えします。手順をまとめた無料の診断と解説動画もご用意しています。
初回は無料・60分・オンライン完結・その場で契約のお願いはいたしません


