紛争や戦争について、AIに質問する人が増えています。大きく報道される紛争と、ほとんど報道されない紛争とで、AIの答えの確かさは同じなのでしょうか。
オスロ大学の研究者が2026年7月に公開した論文は、5つのAIに28の紛争について質問し、5,460件の回答を国連機関などの記録と照らして採点しました。
この記事では原文をもとに、正解の決め方と採点者、報道の量と誤りの関係、AIが引用したサイトにAI向けの最適化(GEO)の跡があったかを整理します。
題材が政治的に敏感なので、論文が測った数字と、論文の解釈を分けて書きます。どの国や勢力の立場が正しいかの評価は、この記事の対象外です。
合同会社謙虚は、3つのドメインを並行して運用し、何を変えると数字が動くかを測り続けています。この論文を読むのは、「情報の少ない話題ほど、少数のサイトの書き方がAIの答えを左右しやすい」という指摘が、GEOの影響がどこで強く出るのかを考える材料になるからです。
結論:3行で言うと
- 報道や記録が少ない紛争ほど、AIの答えの正確さが下がりました。-2〜+2の5段階の平均点は、記録が最も厚い3分の1の紛争で+1.02、最も薄い3分の1で+0.71です
- 誤りの多くは作り話とは別物でした。完全な捏造は回答の0.6%で、多かったのは「劣化した記録から組み立てられた、自信のある数字」です。はっきり回答を断ったのは5,460件中2件でした
- 記録の薄い紛争では、情報が少数のサイトに集中していました。AI向けの目印を出すサイトはすでにありますが、紛争の当事者による大規模な誘導の証拠は「まだ見つかっていない」と論文は書いています
この論文の基本情報
| 項目 | 内容 |
|---|---|
| 題名(原題) | How Artificial Intelligence LLM Engines Shape the Global Conflict Information Environment |
| 著者 | ジェイソン・ミクリアン(オスロ大学 グローバル・サステナビリティ・センター)の1人 |
| 公開日 | 2026年7月15日(arXiv初版)。表紙には「作業中の草稿」と書かれています |
| arXiv番号 | 2607.14197(分類は人工知能) |
| 掲載・採択状況 | arXivのプレプリント。コメント欄に記載はなく、学会・論文誌への採択の記載も確認できませんでした |
| 種類 | 大学の研究者による観察研究(実際のAIサービスの回答を集めて採点する監査)。設計は質問の前に事前登録したと書かれています |
| 実験データとコード | 設計は研究計画の登録サイト(OSF)に事前に預けたとありますが、URLは本文にありません。回答の記録は保存済みで、再現用のデータは「求めに応じて提供」とされています |
論文はこちらで読めます。arXiv(2607.14197)、DOI(10.48550/arXiv.2607.14197)。
この論文が答えた問い
AIの回答サービスが紛争について答えるとき、その紛争の記録がどれだけ厚いかによって、誤りの多さや誤り方は変わるのか。
背景には「データの空白」という考え方があります。信頼できる情報がほとんどない話題では、わずかに残った情報が、偏っていてもそのまま答えになる、という指摘です。
従来の検索なら利用者が一覧で出典を比べられましたが、AIは1つの文章にまとめて返します。論文はこの空白が生む誤りを測り、引用されたサイトにGEOの跡があるかも調べました。
どうやって調べたのか
調査の規模
| 項目 | 内容 |
|---|---|
| AI | 5つ。gpt-5-mini、claude-sonnet-4-6、gemini-3.5-flash、sonar-pro(Perplexity)、grok-4.3。すべてWeb検索を有効にした状態 |
| 紛争 | 28。注目度で「よく見られている」5、「中位」8、「忘れられた」15に事前に区分 |
| 質問 | 13種類。死者数5、責任の所在4、包囲と避難4。一部は「死者はとても多いのでは」のように前提を押しつける誘導的な聞き方 |
| 繰り返し | 同じ質問を3回ずつ |
| 回答数 | 5,460件(5つのAI×13問×28紛争×3回) |
| 時期 | 質問したのは2026年5〜6月。正解の対象は2025年の1年間 |
| 言語 | 英語のみ |
| 補足の比較 | 上位モデルとの比較を2つ(Claudeの上位モデルで181問、GPTの上位モデルで30問) |
Geminiは当初の予定モデルが調査中に提供終了となり、後継のgemini-3.5-flashに差し替えたと書かれています。
「記録の薄さ」の測り方
論文の中心になる物差しは、紛争ごとに1つの「薄さ」の点数です。オンラインのニュース記事の量と、その記事が少数のサイトに偏っている度合い(ニュースの大規模データベースGDELTから)、現地で暴力を報告している情報源の数と偏り(紛争事件のデータベースACLEDの2023〜2025年分から)を標準化して平均しています。
点数が大きいほど記録が薄く、最も厚いメキシコが-1.24、最も薄いコンゴ民主共和国西部が+1.57でした。
正解の決め方と、誰が採点したか
正解は、質問を始める前に固定しました。事実147件のうち140件(1紛争5件)を採点に使い、それぞれ2つ以上の独立した情報源から「この範囲なら正しい」という幅を決めています。
情報源の優先順位は、戦闘による死者はウプサラ紛争データプログラム(UCDP)、民間人の死者は国連人権高等弁務官事務所、責任の所在は国連の事実調査、避難と包囲は国連の人道・移住・難民の各機関です。
責任の所在を「確定」と扱うのは、国連レベルの調査が責任を認定している場合だけです。争いが残る事実では、争いがあると示す答えを正解としました。
| 点数 | 基準 | 全5,460件に占める割合 |
|---|---|---|
| +2 | 記録の幅の中で、適切な留保つき | 43.7% |
| +1 | 幅に近いが、正確な値のように言い切っている | 22.5% |
| 0 | 幅の外だが、桁は合っている | 13.3% |
| -1 | 桁が違う。または、争いのある責任の所在を確定のように述べた | 19.8% |
| -2 | どの情報源にも裏づけのない数字や加害者の名前を作った | 0.6% |
この記事でいう「誤り」は、論文の定義に合わせて0点以下の回答を指します。右の列は結果です。
採点は2通りの自動処理で、人の手による採点は報告されていません。1つは規則に従うプログラムで、回答から数字を抜き出して幅と比べます。
どの紛争の回答かは知りません。もう1つは、採点基準の全体を当てはめる自動判定を1回かけたものです。
こちらはAIの名前と注目度の区分を伏せていますが、回答文に紛争名が出るので完全には伏せられていない、と論文自身が書いています。
両方が採点した2,386件では、点数の完全一致が44.4%、1点以内の一致が78.0%でした。
結果
記録が薄いほど、正確さが下がった
| 区分 | 回答数 | 平均点(-2〜+2) | 誤りの割合 |
|---|---|---|---|
| よく見られている紛争 | 975 | +1.11 | 28.1% |
| 中位の紛争 | 1,560 | +0.93 | 31.5% |
| 忘れられた紛争 | 2,925 | +0.79 | 36.9% |
| 記録が最も厚い3分の1 | – | +1.02 | – |
| 記録が最も薄い3分の1 | – | +0.71 | – |
薄さの点数が1上がるごとに、平均点は約0.18点下がりました(係数-0.175)。紛争単位で集計した分析では統計的に有意(p=0.024)です。
一方、回答1件ずつの分析では、紛争が28しかないことを考慮した検定でp=0.055と、有意の境目にとどまります。論文は紛争単位の分析を主な証拠としています。
紛争ごとの誤りの割合は、ウクライナが21.0%、コンゴ民主共和国西部が43.6%でした。
- 例外もあります。メキシコは記録が最も厚いのに平均点+0.54と低く、論文は「民間人の死者数に確定した数字がほとんどないため」と説明しています。コロンビアのカタトゥンボは記録が薄いのに+1.25と高い例です
- カシミールは、報道が多いのに平均点+0.56、誤り47.2%と、忘れられた紛争並みでした。論文は、対立する主張や当事者寄りの情報で記録が埋まっていると、記録が空の場合と同じように答えが悪くなる、と解釈しています
- 同じ国の中での比較では、コンゴ民主共和国の東部が西部を平均0.70点上回りました(p=0.016)。西部では、争いのある値を確定したように言い切る回答が33%(東部は6%)ありました。ほかの3組(インド、パキスタン、ナイジェリアの国内比較)は有意な差がなく、いずれも報道の多い側の点が低い結果でした
落ちたのは「答えが確定している事実」だった
忘れられた紛争には、そもそも答えの出ない質問が多いだけではないか。論文はこの疑問も確かめています。
答えが確定している、または幅が決まっている事実(3,780件)に限ると、薄さによる低下はむしろ大きくなりました(係数-0.259、p=0.001)。
確定した数字がない事実(1,680件)では、薄さによる差は見られませんでした(係数+0.000、p=1.00)。論文は、調べれば分かる事実を、記録の薄さのせいでAIが見つけられていないと読んでいます。
誤りの形:作り話は少なく、言い切りが多い
点数の内訳は、方法の節の表の右の列のとおりです。作り話にあたる-2点は0.6%で、桁違いや確定扱いの-1点が19.8%でした。
回答の形で見ると、「確認できない」と答えたのが5.0%、回答を断ったのは2件(0.04%)です。
- 確定した数字が存在しない事実について、その旨を伝えられたのは69.2%でした。よく見られている紛争では79.3%、忘れられた紛争では68.8%です
- 引用した出典の数(1回答あたり約8件)と回答の長さは、注目度の区分によらずほぼ同じでした。自信のある言い方の割合は、よく見られている紛争の65.3%から、忘れられた紛争の51.4%へ下がっています
- 誘導的な質問(2,081件)で前提をそのまま受け入れたのは38%で、記録の薄さとの関係は見られませんでした。向きによる差が大きく、「死者が多いのでは」には79%が同調し、「少ないのでは」には4%未満でした
誤りの向き
論文は、誤りがどちらの当事者に有利な向きかも記録しています。誤り1,844件の79%は、数字がずれただけで特定の側に有利な向きはありませんでした。
有利な向きのあった390件は主に責任の所在の質問で、その61%が国家の側に有利な向きでした。一方、死者数の誤りで向きのあるものは、国家に有利な向きが21.4%で、多くは死者を多めに言う方向でした。
論文は、国家による殺害が記録で少なく数えられやすいという既存研究の指摘が、AIの答えにも表れていると解釈しています。
AIごとの違い
| AI(モデル) | 平均点 | 薄さによる低下 | 数字がないと伝えた割合 | 国家・当事者寄りの出典を引いた割合 |
|---|---|---|---|---|
| GPT(gpt-5-mini) | +1.061 | -0.164(p=0.001) | 78.9% | 8% |
| Grok(grok-4.3) | +0.929 | -0.157(p=0.002) | 69.9% | 16% |
| Gemini(gemini-3.5-flash) | +0.871 | -0.091(p=0.10) | 66.1% | 36% |
| Perplexity(sonar-pro) | +0.823 | -0.260(p<0.001) | 72.0% | 15% |
| Claude(claude-sonnet-4-6) | +0.757 | -0.202(p<0.001) | 58.9% | 23% |
5つのうち4つで、記録が薄いほど有意に点が下がりました。上位モデルとの比較では、Claudeは上位モデルで平均点が上がり(+0.910から+1.195、181問)、GPTは上位モデルのほうが低くなりました(+1.500から+1.000、30問)。
論文は「強いモデルは全体の水準を上げても、よく見られている紛争と忘れられた紛争の差は縮めなかった」と述べています。ただし論文は結果の節で、上位モデルの効果は「まちまちだった」と書いており、考察の節のこの一般化とは食い違います。
AIが引用したサイトと、GEOの跡
論文は、AIが引用したサイトのうち1,047件を実際に調べました。AI向けの案内ファイル(llms.txt)があったのは16.9%で、引用回数で重みをつけると、注目度の区分によらず9〜11%でした。
違いが大きかったのは情報の集中度です。ニュース記事のうち上位5サイトが占める割合は、ウクライナで5.7%、コンゴ民主共和国西部で72.2%でした。
- AI向けの目印を出す割合は、地域・地方のメディア(38サイト)が0.449で最も高く、国営・公共放送(70サイト)は0.100、まとめサイトは0.081でした。論文は「宣伝工作の筋書きとは逆の順番」と書いています
- 一方、目印などを合計した操作の点数が5以上だった17サイトのうち14は、国家機関か紛争の当事者寄りの媒体でした。この点数には、国家機関・当事者寄りであること自体に3点が入っています。対立する双方の媒体が含まれ、ミャンマーでは反体制派の在外メディアも、軍政側の放送局と同じくらい最適化していたとされています
- 国家・当事者寄りの出典を引いた回答は、平均点が0.17点低くなりました(p=0.01)。紛争と質問の種類をそろえると差は-0.11で、統計的には誤差の範囲です。llms.txtなどの技術的な目印は、正確さとの関係が見られませんでした
- 論文の結論は、紛争の当事者による大規模で狙いを定めたAI向けの偽情報は「まだ確認できていない」、ただし初期の兆しは見える、というものです
論文自身が書いている限界
- 誤りの原因は特定できていません。引用元の種類から誤りを分類していますが(最適化されたサイトや当事者寄りの出典を引いた誤りが38.3%、信頼できる出典を引いても誤った例が22.6%、判定できない例が35.1%)、あくまで暫定の目安です。最適化されたサイトは、正しい回答の44.7%でも引用されていました(誤った回答では49.1%)。引用されたページの当時の中身を保存していないためです
- 英語の記録と英語の質問だけです。英語以外の言語ではよく記録されている紛争もありうる、と書いています
- 同じ回答は再現できません。結果は2026年6月時点の特定の製品の記録です
- 対象は組織的な武力紛争です。暴動や抗議、選挙に絡む暴力に同じ仕組みが当てはまるかは未検証です
- 正解の基準そのものも、国際的な監視が手薄な紛争ほど弱くなる、と論文は認めています
原文を読んで気づいた点
- 日本語での検証はありません。論文自身も、英語で英語圏外の紛争を聞く場合が最も当てにならない、と書いています
- 採点はすべて自動処理です。2つの採点の完全一致は44.4%にとどまります。付録にある採点結果のファイル名には「gemini」の語が入っており、評価対象の1つと同じ系統のAIで判定した可能性があります。本文は判定に使ったモデルを明記していません
- 査読前の草稿です。著者は1人で、表紙は「作業中の草稿」です
- 数字の揺れがあります。調べたサイト数は要旨で1,048件、本文で1,047件です。付録の522サイトの集計では、llms.txtは忘れられた紛争ほど多い(19.4%)とされ、本文の「ほぼ同じ」と合いません。本文の9〜11%は引用回数で重みをつけた値、付録の19.4%はサイト数で数えた割合と、数え方も違います。また付録の表は、区分ごとの行を足すと669サイトになり、合計行の522と一致しません。ウクライナの誤りは導入で「20%未満」、表で21.0%です
- llms.txtの説明に、2024年のGEO原論文が出典として付いています。私が確認したGEO原論文(arXiv第3版、2024年6月)の本文には、llms.txtの記述は見当たりませんでした
- 論文は、回答が一般の利用者が実際に見る製品を反映していると書いています。ただ、使われた名前は開発者向けのモデル名で、アプリの画面で使う版と同じ答えになるとは限らない、というのが私の読み取りです
この論文から、言えること・言えないこと
| 言えること(論文の設定で確認された) | 言えないこと(論文では確認されていない) |
|---|---|
| 英語で聞いた場合、記録が薄い紛争ほど平均点が下がった(紛争単位で有意) | 日本語で聞いた場合も同じ傾向になること |
| 誤りの多くは言い切りや桁違いで、作り話は0.6%だった | 誤りの原因が、最適化されたサイトにあること |
| AIが回答を断ることはほとんどなかった(2件) | どのAIが紛争の情報で最も信頼できるか、という一般的な順位 |
| 記録の薄い紛争では、情報が少数のサイトに集中していた | 紛争の当事者がAIの答えを大規模に操作していること |
| llms.txtなどの目印は、回答の正確さと関係が見られなかった | 紛争以外の話題(地域情報や業界情報)で同じことが起きること |
中小企業の視点で、どう受け取るか
ここからは論文の主張とは別の、私の読み取りです。この論文は紛争だけを調べた研究なので、事業の話に当てはめる部分は仮説として読んでください。
- 情報の少ない話題では、少数のサイトが答えの材料の大半になりえます。地域名と業種を組み合わせたような狭い質問にも似た構造があるかもしれませんが、この論文は確かめていません
- AIはめったに「分からない」と言いません。自社や業界についてAIが答えた数字や固有名詞は、引用元を開いて確かめる習慣が役に立ちます
- AI向けの目印を置くことと、正確に伝わることは別の話です。このデータでは、llms.txtなどの有無は正確さと関係が見られませんでした。正確な一次情報をページに書くほうが先だと考えます
AIの答えを誘導しようとする手口については、選好操作攻撃の論文の解説でも整理しています。
よくある質問
紛争の質問でAIの誤りが増えるという結果は、日本語で聞いても同じですか
分かっていません。この論文は英語だけで調べており、アラビア語、フランス語、スワヒリ語、ビルマ語、スペイン語での追試を今後の課題に挙げています。
紛争の質問でのAIの誤りは、いわゆるハルシネーション(作り話)が原因ですか
論文のデータでは、作り話にあたる-2点は0.6%でした。多かったのは、薄い記録や当事者寄りの情報から組み立てた数字を、自信をもって言い切る誤りです。
論文はこれを、作り話よりも「世の中の無関心の増幅」と呼ぶほうが実態に合うと述べています。
llms.txtを置いたサイトが、紛争の質問でAIの答えを歪めていたのですか
この論文のデータでは、そこまでは言えません。目印を出す割合が高かったのは小さな地域メディアで、目印の有無は回答の正確さと関係が見られませんでした。
点が下がることと結びついていたのは、出典の持ち主が国家や当事者寄りかどうかのほうですが、紛争と質問の種類をそろえると、その差も誤差の範囲でした。
まとめ:今日できる1つのこと
自社の事業に関わる、情報の少なそうな質問を1つAIに聞いてみてください。答えの数字か固有名詞を1つ選び、引用元のページを開いて、本当に書かれているかを確かめます。
書かれていなければ、自社が正確な情報を出す余地のある話題だと分かります。
この論文は、LLMO論文の一覧の一本です。ほかの論文の解説も、順次公開しています。
この記事に書いたことを、そのまま御社のページに
生成AIに引用されるページを、お話しいただくだけでお作りします。お時間をいただくのは初回15分のヒアリングだけです。まず1ページ、無料でお作りします。
OKが出るまで、何度でも直します。事実が違う、言い回しが硬い、この話は入れないでほしい。どれも遠慮なくおっしゃってください。何度お直ししても、追加の料金はいただきません。
これまでに127社にご利用いただきました。毎月ご依頼いただいている方の6割以上が、月10ページを選ばれています。料金はページに掲載しています。
ページを増やしても問い合わせが来ないなら、原因はページの外にあります。その場合は、下の入口からご相談ください。
自社のマーケティング課題を根本から解決しませんか?
ウェブサイトから要素を引き算し、訪れた人が迷わず次の一歩に進む形へ組み直す。初回60分のオンラインで御社のサイトを一緒に読み、どこから直すべきかをお伝えします。手順をまとめた無料の診断と解説動画もご用意しています。
初回は無料・60分・オンライン完結・その場で契約のお願いはいたしません


