MENU
  • 料金
  • 会社案内
  • コンサル
  • お問い合わせ
  • 無料で1ページ頼む
AIO・LLMO・GEO対策の記事制作
合同会社謙虚
  • 料金
  • 会社案内
  • コンサル
  • お問い合わせ
  • 無料で1ページ頼む
  • 料金
  • 会社案内
  • コンサル
  • お問い合わせ
  • 無料で1ページ頼む
合同会社謙虚
  • 料金
  • 会社案内
  • コンサル
  • お問い合わせ
  • 無料で1ページ頼む
  1. ホーム
  2. LLMO
  3. LLMO論文
  4. 【LLMO論文解説】AIが「説得力がある」と判断する証拠とは|関連性重視・文体はほぼ無視(ACL 2024)

【LLMO論文解説】AIが「説得力がある」と判断する証拠とは|関連性重視・文体はほぼ無視(ACL 2024)

2026 9/30
2026年9月23日2026年9月30日
中野輝規
AIが「説得力がある」と判断する証拠とは

「アスパルテームは発がん性があるか」。この質問には、賛成派と反対派の両方の記事がインターネット上に存在します。

検索で見つけた文章をAIに読ませて回答を作る仕組み(RAG、検索拡張生成)にこの質問を投げると、AIは矛盾した文章を読んだうえで、どちらか一方の答えを選ぶことになります。

では、AIはどちらの文章を「説得力がある」と判断しているのでしょうか。この問いに正面から取り組んだのが、2024年2月に公開され、同年のACL(自然言語処理分野の主要な国際会議)に採択された論文「What Evidence Do Language Models Find Convincing?(言語モデルはどんな証拠を説得力があると判断するのか)」です。

この記事は、その論文を原文から読み、何を測って、何が分かったのかを整理します。この論文はGEO(Generative Engine Optimization、生成エンジン最適化)という言葉が広まる前の基礎研究で、AIの「引用のされやすさ」ではなく、AIが出す結論そのもの(賛成か反対か)をどんな証拠が動かすのかを調べたものです。

数値はすべて論文の本文・表から拾いました。

合同会社謙虚は、3つのドメインを並行して運用し、何を変えると数字が動くかを測り続けています。この論文を読むのは、「文章に権威性や科学的根拠を足せばAIに評価される」という説明が、どこまで実験で確かめられたものかを、自分たちで確かめておくためです。

目次

結論:3行で言うと

  • 賛否が分かれる質問について、対立する証拠の文章をAIに読ませたとき、AIは質問との関連性が高い文章を強く重視し、それ以外の要因にはあまり影響されませんでした
  • 人間が信頼性の手がかりにする読みやすさや語彙の多様さは、AIの判断とほとんど相関しませんでした。科学的な出典や自信のある文体を足す書き換えも、効果は中立か、むしろ下がる方向でした
  • 文章の内容をほとんど変えずに関連性だけを高める、ごく小さな書き換えでも、AIの回答を動かせることが分かりました

ただし、この結果は2023年時点のモデルと、実験用に作ったデータセットで得られたものです。日本語での検証や、いまのAIサービスへの当てはめは、論文自身が確認していません。

この点は後の章で整理します。

この論文の基本情報

項目 内容
題名 What Evidence Do Language Models Find Convincing?
著者 Wan、Wallace、Klein(3人。所属はアメリカのカリフォルニア大学バークレー校)
公開日 2024年2月19日(初版)。確認した版は2024年8月9日のv2
arXiv番号 2402.11782(分野は自然言語処理と機械学習)
掲載・採択状況 ACL 2024の本会議に採択(査読あり)。arXivのコメント欄に採択の記載があります
種類 実証研究。新しいデータセットを作り、複数のAIモデルで実験しています
実験データ・コードの公開先 論文にGitHubのリポジトリが記載されています

論文はこちらで読めます。arXiv(2402.11782)。

この論文が答えた問い

検索で見つかった、賛否が対立する証拠の文章をAIに読ませたとき、AIはどの文章を説得力があると判断して自分の回答に取り込むのか。それは、人間が説得力を感じる理由と同じなのか。

人間は、文章の説得力を判断するとき、出典の信頼性を確かめたり、これまでの知識と照らし合わせたり、論理の運び方を検討したりします。

これらは過去の心理学・情報行動の研究で確かめられてきた手がかりです。AIが検索結果を読んで答えを作る場面が増えるいま、AIも同じ手がかりを使っているのか、それとも別の基準で判断しているのかは、まだよく分かっていませんでした。

この論文は、そこを実験で確かめています。

どうやって調べたのか

ConflictingQAというデータセットを作った

論文は、この研究のためにConflictingQAというデータセットを新しく作りました。手順は次のとおりです。

手順 内容
質問を作る GPT-4を使い、分野ごとに賛否の分かれる質問を生成。191の分野(薬理学、オンライン教育、生物多様性など)にわたる
関連する文章を集める 質問を肯定文・否定文の両方に言い換え、それぞれでGoogle検索を行い、上位20件のページを取得
本文だけを抜き出す ページから本文だけを取り出す専用のツールを使う。出典のURLや公開日、見出しといった付随情報は、AIに渡す文章にあえて含めない
立場を判定する 2つの異なるAI(claudeとGPT-4の系列)が一致して同じ立場だと判定した文章だけを残す。判定が割れた文章や、質問と無関係と判定された文章は除く
関連箇所を切り出す 質問との近さを測る専用の検索モデルを使い、文章の中で最も質問に近い512トークン分の範囲を1つ取り出す。近さの基準に届かない文章は除く

あるモデル(LLaMA-2 Chat)を評価する時点でのデータセットの規模は、次のとおりです。

項目 数値
質問数 238問
質問の分野数 144分野(全191分野のうち、この評価に使われた数)
取得した文章数 2,208件
文章1件あたりの平均語数 約365語
5件以上の比較に使われた文章 912件
文章1件あたりの平均比較回数 6.54回

集めた文章の出どころ(トップレベルドメイン)は、企業や個人のサイトを表す「.com」が527件と最も多く、次いで団体を表す「.org」が175件、政府機関の「.gov」が59件、教育機関の「.edu」が57件、ネットワーク関連の「.net」が12件でした。データセット全体では、39種類のトップレベルドメインが含まれています。

「説得力」をどう数値にしたか

論文は、AIに賛成側の文章1つと反対側の文章1つを同時に見せ、「この文章だけを根拠に、質問にYesかNoで答えてください」と指示します。

ある文章について、これを異なる反対側の文章と何度も組み合わせ、AIの答えがその文章の立場と一致した割合を「勝率」と呼びます。

文章を提示する順番による偏りを避けるため、順番を入れ替えた両方で測定し、比較相手が5件に満たない文章は集計から外しています。

論文はもう1つ、別の測り方も試しています。文章を1つだけAIに見せて「この文章は5段階でどれくらい説得力がありますか」と直接尋ねる方法です。

しかし、この直接尋ねた評価と、先ほどの勝率とのあいだにはほとんど相関が見られませんでした。論文は、AIは1つの文章だけを見て、その説得力を言葉で言い当てるのが苦手だと述べ、以降の分析では実際の質問応答に近い、勝率による測り方を主に使っています。

対象にしたAI

区分 モデル
公開されているモデル LLaMA-2 Chat、Vicuna v1.5、WizardLM v1.2
非公開のモデル GPT-4、Claude v1 Instant

すべてのモデルに「上の文章の情報だけを使って答えてください」と指示しています。これは、モデルが元々持っている知識や考えではなく、渡された文章の性質そのものを見るための工夫です。

結果

何がAIの判断と相関するか

論文は、文章のさまざまな特徴を自動で数値化し、勝率との相関を調べました。

特徴 何を測るか 結果
読みやすさ(Flesch-Kincaid法) 1文の平均長と、単語の音節数から算出 すべてのモデルで、勝率との相関はほぼありません
語彙の多様さ 文章内の異なり語(ユニークな単語)の数 すべてのモデルで、勝率との相関はほぼありません
文の調子(感情) FLANというモデルによる、肯定的な調子である確率 弱い影響。強さはモデルによって違います
文章の複雑さ(困惑度) 別のAIモデルによる、文章の予測しにくさ 弱い影響。あるモデルは複雑でない文章をやや好む傾向でした
質問との語の重なり 質問と文章に共通する、最長の連続した語句 弱いながら、正の相関があります
質問との意味的な近さ 質問と文章を、意味の近さとして数値化した指標 GPT-4を除くすべてのモデルで、強い正の相関があります

読み取れることを整理します。

  • 人間が重視しがちな「読みやすさ」は、AIの判断とほぼ無関係でした。文章の分かりやすさそのものは、説得力の判断材料になっていません
  • 最も強く効いたのは、質問との意味的な近さでした。質問の意図に正面から答えている文章ほど、勝率が高くなる傾向です
  • GPT-4だけ、この相関が弱いという結果でした。ただしGPT-4の分析に使われた文章数は38件と少なく、他のモデル(242件〜334件)より母数がかなり小さい点には注意が必要です

実際に書き換えると、判断は動くのか

相関を調べるだけでは、原因と結果の関係までは分かりません。そこで論文は、AIを使って文章を実際に書き換え、勝率がどう変わるかを確かめる実験も行いました。

書き換え方は10種類あり、大きく2つに分かれます。

種類 書き換え方 やること
関連性を上げる 文章の書き換え 質問に関する語句を増やし、質問に答える文を強調する、大きめの書き換え
関連性を上げる 一文の追加 立場をはっきりさせる一文だけを追加する、最小限の変更
関連性を上げる 質問文の前置き 「この文章は次の質問についてです」という一文を先頭に置く
関連性を上げる キーワードの詰め込み 質問に関連する語句を使った文を追加する
見た目・文体を変える 科学的な出典を足す 内容は変えず、科学文献への言及を追加する
見た目・文体を変える 情報を足す 質問と直接関係のない、話題に関する文を6つ追加する
見た目・文体を変える 連絡先を足す 架空の著者名と電話番号を文末に加える
見た目・文体を変える 自信のある書き方にする 断定的で、曖昧さのない文体に書き換える
見た目・文体を変える 専門的な言葉にする 専門用語を使った文体に書き換える
見た目・文体を変える 客観的な書き方にする 客観的な調子の文体に書き換える

比較の基準として、文末に「読んでくれてありがとう」という一文を足しただけの、内容にほとんど影響しない書き換えも用意しています。

結果は、はっきり分かれました。関連性を上げる4つの書き換えは、いずれも基準より勝率が上がりました。

「一文の追加」や「質問文の前置き」のように、変える語数がごくわずかな書き換えでも、勝率は大きく上がっています。

一方、見た目や文体を変える6つの書き換えは、基準と変わらないか、むしろ下がる方向でした。科学的な出典を足す書き換えや、自信のある文体・専門的な言葉にする書き換えも、この中に含まれます。

論文は、書き換えが狙いどおりに関連性を上げていたかどうかも、別の指標(質問と文章に共通する、最長の語句の長さ)で確かめています。

書き換え方 種類 質問との語の重なり
質問文の前置き 関連性 6.89
文章の書き換え 関連性 5.08
一文の追加 関連性 3.64
キーワードの詰め込み 関連性 2.47
情報を足す 見た目・文体 2.46
連絡先を足す 見た目・文体 2.41
科学的な出典を足す 見た目・文体 2.38
客観的な書き方にする 見た目・文体 2.15
自信のある書き方にする 見た目・文体 2.17
専門的な言葉にする 見た目・文体 1.97

関連性を狙った4つの書き換えのほうが、見た目・文体を変える6つの書き換えより、この数字が高くなっています。狙いどおりに関連性を強められていたことが確かめられたうえで、その関連性の高さがそのまま勝率の上昇につながった、という組み立てです。

この論文は、キーワードの詰め込みも「関連性を上げる書き換え」の1つとして扱っており、勝率を上げる方向の結果でした。一方、この論文と同時期に発表され、当サイトで別に解説したGEO原論文(2311.09735)では、語数・位置などの客観指標では効果が出ず、主観的な目立ち方の指標ではわずかに上がる、という結果でした。

2つの論文は、測っている指標(この論文はAIが出す結論そのもの、GEO原論文は回答の中での取り分)も、実験の作り方も異なるため、単純に優劣は比較できません。

ただし、同じ「キーワードの詰め込み」という手法でも、研究によって結果が違うことがある、という例として押さえておく価値はあります。

論文自身が書いている限界

論文は最後に、限界を自分で挙げています。

  • ConflictingQAは多様な質問を集めていますが、実際にAIが使われる場面の複雑さを、すべて捉えられているわけではありません
  • 実験は、対立する文章2つを同時に見せる設定に絞っています。実際のAIサービスでは、もっと多くの文章が一度に渡されることもあります
  • 回答はYesかNoの二択に絞っています。実際のAIの答えは、もっと含みのある言い方になることもあります
  • 文章そのものに焦点を当てており、出典のURLや公開日、見た目といった要素は扱っていません
  • AIがウェブの大部分を読み、かつ生成してもいるという、より広い倫理的な論点までは扱っていません

加えて、この記事を書くために原文を読んで気づいた点があります。

  • 実験に使われた質問と文章はすべて英語です。日本語での検証は報告されていません
  • 対象になったのは2023年当時のモデル(LLaMA-2、Vicuna、WizardLM、GPT-4、Claude v1 Instant)です。現在使われているAIサービスと同じ挙動とは限りません
  • 「勝率」の評価はすべて自動計算で、人手による採点は行われていません。AIの答えがそのまま集計されています
  • 書き換えに使われた文章もAIが作ったものです。追加された情報や出典が事実かどうかは、評価の対象に入っていません
  • GPT-4だけ相関が弱いという結果でしたが、GPT-4の分析対象は38件と、他のモデルより少なくなっています
  • AIに渡す文章から、出典のURLや公開日をあえて除いているのは、一般的なRAG(検索で集めた情報をAIに読ませる仕組み)の設計に合わせ、かつAIモデルが視覚情報を扱わないためと論文は説明しています。この情報を含めた場合に結果が変わるかどうかは、この論文では確かめられていません

この論文から、言えること・言えないこと

言えること(論文の設定で確認された) 言えないこと(論文では確認されていない)
質問との関連性が高い文章ほど、AIの判断に強く影響した 日本語の文章でも、同じ強さで同じ結果になること
読みやすさや語彙の多様さは、判断とほぼ無関係だった いま使われているAIサービスで、同じ結果になること
科学的な出典や自信のある文体を足しても、効果は中立か下がる方向だった 人間の読者にとっても、これらの要素が説得力を持たないこと
ごくわずかな書き換えでも、関連性を上げればAIの答えを動かせた 検索での見つかりやすさや、実際のアクセス・成約への影響
AIは、単独の文章の説得力をうまく言葉で言い当てられなかった 足した数字や出典が、事実として正しいかどうか

中小企業の視点で、どう受け取るか

ここからは論文の主張とは別の、私の読み取りです。

  • まず、質問に正面から答えているかを確認する。この論文で最も強く効いたのは関連性でした。専門用語や自信のある言い回しを足す前に、読者が実際に知りたいことに答えているかを見直す方が、優先順位が高いといえます
  • 権威性を演出する書き換えだけでは、この論文の設定では効果が薄いようです。ただし、これはAIの回答への影響を測った結果であり、人間の読者が出典をどう受け取るかは、この論文の対象外です。両者を混同しない方がよいでしょう
  • AIに書き換えさせた数字や出典は、そのままでは使えません。この論文でも、追加した情報が事実かどうかは評価されていません。自社のページに数字や出典を足す場合は、元の資料で必ず裏を取ってください
  • キーワードの詰め込みの効き方は、研究によって割れています。1つの論文の結果だけで、特定の手法の是非を決めつけない方が安全です

よくある質問

この論文は、LLMOやGEOの論文ですか

いいえ。この論文は「RAG(検索拡張生成)」や「説得力」という言葉を使っており、LLMOやGEOという言葉は使っていません。

ただし発表時期は近く、論文自身も、AIの回答での取り分を最適化しようとする同時期の研究(GEO原論文)に触れています。違いは、GEO原論文がAIの回答の中での取り分(引用のされやすさ)を測ったのに対し、この論文はAIが出す結論そのもの(YesかNoか)がどれだけ動くかを測っている点です。

結局、何が一番効くのですか

論文の結果でもっとも効いたのは、質問との関連性でした。文章の見た目や文体を変える書き換えより、質問の意図に正面から答える文章にすることのほうが、AIの判断に強く影響しています。

科学的な出典を足すのは、無意味ということですか

この論文の実験では、効果は中立か、下がる方向でした。ただし、これはAIに読ませたときの結果です。

人間の読者にとって出典が信頼の手がかりになるかどうかは、別の話として扱う必要があります。

まとめ:今日できる1つのこと

自社のいちばん読まれているページを1つ開き、想定する読者の質問に、最初の数行で正面から答えているかを確かめてください。専門用語や自信のある言い回しを足す前に、まず関連性を見直すことが、この論文からの一番シンプルな教訓です。

この論文は、LLMOという言葉が広まる前に書かれた基礎研究です。次に読む論文では、この結果が生成エンジンの実際の回答や、日本語の環境でどこまで当てはまるのかを追います。

この論文は、LLMO論文の一覧の一本です。ほかの論文の解説も、順次公開しています。

この記事に書いたことを、そのまま御社のページに

生成AIに引用されるページを、お話しいただくだけでお作りします。お時間をいただくのは初回15分のヒアリングだけです。まず1ページ、無料でお作りします。

OKが出るまで、何度でも直します。事実が違う、言い回しが硬い、この話は入れないでほしい。どれも遠慮なくおっしゃってください。何度お直ししても、追加の料金はいただきません。

これまでに127社にご利用いただきました。毎月ご依頼いただいている方の6割以上が、月10ページを選ばれています。料金はページに掲載しています。

まず1ページ、無料で作らせてください

ページを増やしても問い合わせが来ないなら、原因はページの外にあります。その場合は、下の入口からご相談ください。

自社のマーケティング課題を根本から解決しませんか?

ウェブサイトから要素を引き算し、訪れた人が迷わず次の一歩に進む形へ組み直す。初回60分のオンラインで御社のサイトを一緒に読み、どこから直すべきかをお伝えします。手順をまとめた無料の診断と解説動画もご用意しています。

まず動画で詳しく見る(約30分)
無料診断を受ける

初回は無料・60分・オンライン完結・その場で契約のお願いはいたしません

LLMO論文
SEO対策 生成AI
よかったらシェアしてね!
  • URLをコピーしました!
  • 【LLMO論文解説】LLMO(AIO・GEO)論文98本を読んで分かったこと|合同会社謙虚の見解(2026年10月時点)
  • 【LLMO論文解説】引用されない原因を診断して直す仕組み|AgentGEOは書き換え5%で引用率が向上(プレプリント、2026年3月)

この記事を書いた人

中野輝規のアバター 中野輝規

合同会社謙虚 代表社員。20代から、売る言葉だけを仕事にしてきました。電話営業で受話器を握っていた時代から、数千社のWEB集客に関わったいままで。詳しいプロフィールはこちら

この著者の記事一覧へ

関連記事

  • 生成AIの好みをAIに説明させてルール化する仕組み
    【LLMO論文解説】生成AIの好みをAIに説明させてルール化する仕組み|AutoGEOは書き換えで目立ち方を最大50.99%上げた(ICLR 2026)
  • メンタルヘルスの質問で3つのAIは何を出典にしたか
    【LLMO論文解説】メンタルヘルスの質問で3つのAIは何を出典にしたか|7言語・1万5,942件の引用を監査(プレプリント2026)
  • LLMO論文の一覧
    【LLMO論文解説】海外のGEO・LLMO・AIO論文101本の一覧|原論文から最新研究まで、テーマ別に整理(随時更新)
  • 競合も書き換える前提でLLMO対策を選ぶ「Competitor-Aware GEO」論文を読む
    【LLMO論文解説】競合も同時に最適化する前提でGEO戦略を選ぶ|Beyond the Vacuum(プレプリント)
  • 自然に見える短い文字列でAIの順位づけは動くか
    【LLMO論文解説】自然に見える短い文字列でAIの順位づけは動くか|4つの公開モデルで試した攻撃(ACL 2026)
  • AI検索は引用した出典を均等には使わない
    【LLMO論文解説】AI検索は引用した出典を均等には使わない|1万1,000問で見た「回答の泡」(EMNLP 2026と記載のプレプリント)
  • 早く引用された出典は会話の中で引用され続けるのか
    【LLMO論文解説】早く引用された出典は会話の中で引用され続けるのか|GEOを会話全体で評価する理論の枠組み(HAI 2026採択と記載)
  • ページに仕込んだ指示はAIの回答まで届くか
    【LLMO論文解説】ページに仕込んだ指示はAIの回答まで届くか|7つの攻撃を検索・並べ替え・回答の3段で測り直した研究(プレプリント)
最近の投稿
  • 温泉の集客は宿泊客と日帰り客の線引きで決まる 掲示ルールに沿うページの作り方
  • デザイナーの集客は作品集だけでは届かない 発注担当が社内で通せるサイトの作り方
  • 屋根の集客は見えない屋根を見せる会社が選ばれる 点検商法と疑われないサイトの作り方
  • 遺品整理の集客は遺族の迷いに先回りして決まる 広告頼みから指名へ移るサイトの作り方
  • 看板の集客は検索した先で決まる 見た人を来店につなぐ受け皿の作り方
最近のコメント
  • ホテルの集客は公式サイトで迷わせないことから 予約サイト頼みを抜ける直し方 に 温泉の集客は宿泊客と日帰り客の線引きで決まる 掲示ルールに沿うページの作り方 - 合同会社謙虚 より
  • 外壁塗装の集客は急がせない会社が選ばれる 下請けを抜けて直接の依頼を増やすホームページの作り方 に 屋根の集客は見えない屋根を見せる会社が選ばれる 点検商法と疑われないサイトの作り方 - 合同会社謙虚 より
  • 不用品回収の集客は料金の見せ方で決まる 当日の追加請求を疑われない業者のサイトの作り方 に 遺品整理の集客は遺族の迷いに先回りして決まる 広告頼みから指名へ移るサイトの作り方 - 合同会社謙虚 より
  • 外壁塗装の集客は急がせない会社が選ばれる 下請けを抜けて直接の依頼を増やすホームページの作り方 に 看板の集客は検索した先で決まる 見た人を来店につなぐ受け皿の作り方 - 合同会社謙虚 より
  • 【LLMO論文解説】回答が似ていても出典は重ならない|BaiduとGoogleのAI要約を英語と中国語の500問で監査(EMNLP 2026ワークショップ) に 【LLMO論文解説】海外のGEO・LLMO・AIO論文101本の一覧|原論文から最新研究まで、テーマ別に整理(随時更新) - 合同会社謙虚 より
  • 記事制作(KCW)
  • 売れるサイトはみな謙虚
  • サービス一覧
  • サイトの無料診断
  • 合同会社謙虚とは
  • 代表プロフィール
  • ブログ
  • お問い合わせ
  • プライバシーポリシー
  • 特定商取引法に基づく表記

© 合同会社謙虚

目次