「RAG」という言葉を、AI関連の記事で見かけることが増えていないだろうか。ChatGPTやPerplexityがなぜ最新の情報を答えられるのか、その裏側にはこの仕組みが関わっている。専門用語を使わずに言えば、RAGとは「AIが自分の記憶だけに頼らず、その場で資料を調べてから答える仕組み」のことである。
この記事では、生成AIの仕組みを理解したい中小企業の経営者やWeb担当者に向けて、RAGの基本的な考え方と、AI検索(ChatGPTやPerplexity等)との関わりについて、一次情報をもとに整理する。
手を広げる前に、LLMO対策でやらなくていいことをあわせてご覧ください。
RAGとは:検索して答えるAIの仕組み
RAGは「Retrieval-Augmented Generation(検索拡張生成)」の略で、2020年に発表された研究をきっかけに広まった技術である。従来の生成AIは、自分が学習した時点の知識だけをもとに答えを作っていた。これは「自分の記憶だけを頼りに試験を受ける」ようなもので、学習していない最新の出来事や、企業独自の非公開情報については答えられない、あるいは、もっともらしい嘘(ハルシネーション)を作ってしまうことがある。
RAGは、この弱点を補うために考案された。質問が来るたびに、AIがまず外部の資料やデータベースを検索し、関連する情報を見つけてから、それをもとに答えを作る。「資料を調べながら試験を受ける」形に近い。
検索・拡張・生成という3つの手順
RAGの処理は、大きく3つの手順に分けられる。
| 手順 | 内容 |
|---|---|
| ①検索(Retrieval) | 質問の意味を数値データに変換し、意味の近い情報を外部の資料から探し出す |
| ②拡張(Augmentation) | 見つけた情報と元の質問を組み合わせ、AIへの新しい指示を作る |
| ③生成(Generation) | 組み合わせた情報をもとに、AIが最終的な回答を作成する |
2020年に発表された研究(Lewisらによる論文)では、この仕組みを使ったAIモデルが、従来のモデルよりも事実に沿った回答を作りやすくなることが示された。具体的には、AIが生成した回答について人間が評価したところ、RAGを使ったモデルの回答の方が、従来モデルの回答よりもはるかに高い割合で「事実に基づいている」と判断されたという結果である。加えて、回答の根拠となった資料を示せるため、後から内容を確認しやすくなるという利点もある。
RAGとAI検索(ChatGPT・Perplexity)の関係
GoogleのAI Overviews(AIによる概要)や、Perplexity、ChatGPTの検索機能は、このRAGの仕組みをインターネット全体に適用したものと考えるとわかりやすい。ユーザーが質問を入力すると、AIはその場でWeb上の最新ページを検索し、見つけた情報をもとに回答を組み立てる。回答文の中に番号付きの出典リンクが表示されるのは、このRAGの仕組みによるものである。
ここで押さえておきたいのは、AI検索が使うクローラー(自動巡回プログラム)には、大きく2つの種類があるという点である。1つは、AIモデルを訓練するための情報を集める「学習用」のクローラー(GPTBot等)。もう1つは、ユーザーの質問に答えるたびにリアルタイムで情報を探しに行く「検索用」のクローラー(PerplexityBotやOAI-SearchBot等)である。自社サイトがAI検索の回答に引用されるかどうかは、後者の検索用クローラーがアクセスできるかどうかに関わっている。
ゼロクリック検索という新しい現実
AI検索の普及に伴い、検索結果の要約だけで満足し、実際のWebサイトをクリックしない「ゼロクリック検索」が増えている。SparkToroの調査によれば、Google検索全体のうち、クリックを伴わずに終わるセッションの割合は7割近くに達しているとされる。この傾向を踏まえると、これまでの「検索順位を上げてクリックしてもらう」という発想だけでなく、「AIの回答の中で自社の情報が根拠として使われる」という新しい目標を持つ必要が出てきている。
自社サイトがAIに引用されるための工夫
RAGの仕組みを踏まえると、AIに情報を拾ってもらいやすくするための工夫がいくつか見えてくる。
| 工夫 | 内容 |
|---|---|
| クローラーのアクセスを許可する | robots.txtでAI検索用のクローラーをブロックしていないか確認する |
| 結論を先に書く | 見出しの直後に、その質問への直接的な答えを先に置く |
| 具体的な事実を書く | 曖昧な表現より、具体的な数値や一次情報を優先する |
| 1つの段落を1つの意味にまとめる | AIは文章を塊ごとに抽出するため、段落単体で意味が通じるようにする |
これらは、AIに限らず人間の読者にとっても読みやすい文章の条件と重なる部分が多い。AI対策として特殊な書き方に走る必要はない。結論を明確にし、根拠のある情報を書くという基本を徹底することが、結果的にAI検索での引用にもつながる。
社内の資料をAIに活用させる場合の注意点
RAGは、外部のWeb検索だけでなく、社内のマニュアルや過去の議事録をAIに読み込ませて質問応答に活用する、社内向けの用途でも広がっている。ただし、実際に導入してみると、期待したほどうまく機能しないケースが少なくない。
情報が「真ん中」に埋もれると見落とされやすい
スタンフォード大学の研究(Liuらによる2023年の研究)では、AIに複数の資料を読み込ませた際、資料の最初や最後に書かれた情報は正確に扱えるものの、真ん中あたりに書かれた情報は見落とされやすいという傾向が確認されている。関連する情報が資料の中間に埋もれていると、正解率が大きく下がることが実験で示された。長い資料をそのままAIに渡すのではなく、重要な情報を要点としてまとめ直しておくといった工夫が有効とされている。
うまくいかない原因の多くは「資料の質」にある
社内向けRAGの導入がうまくいかない場合、その原因はAIの性能そのものよりも、読み込ませる資料の質にあることが多いと指摘されている。古い情報がそのまま残っている、表の形式がAIに読み取りにくい、主語が省略されていて文脈が伝わらないといった、資料側の不備が主な原因になりやすい。導入前に、AIに読み込ませる資料自体を整理しておくことが、遠回りに見えて確実な近道になる。ある企業の分析事例では、AIの回答が「使えない」と評価された原因のうち、資料の不備によるものが半数近くを占め、AIモデル自体の問題は1割程度に過ぎなかったという報告もある。原因の多くは、AI側ではなく人間が用意する資料の側にあるという見方は、社内でRAGを検討する際の目安になる。
仕組みの進化:シンプルな検索から高度な連携へ
RAGの仕組みは、初期の単純なものから、より高度な形へと進化を続けている。すべてを覚える必要はないが、この分野が発展途上にあることを知っておくと、今後ニュースで見かける新しい用語にも戸惑いにくくなる。
| 段階 | 特徴 |
|---|---|
| 初期の仕組み | 検索して情報を組み合わせ、そのまま回答を作る最もシンプルな形。検索の精度が低いと、そのまま回答の質に影響する |
| 改良版の仕組み | 検索する前に質問を言い換えたり、検索後に見つかった資料の順位を並び替えたりする工程が加わる |
| 自律的な仕組み | AI自身が状況に応じて検索や計算を使い分ける、より複雑な連携の形 |
| 関係性を捉える仕組み | マイクロソフトの研究チームが提唱した手法で、単語同士のつながりを地図のように整理してから検索に活用する |
中小企業がRAGを社内で導入する場合、最初から高度な仕組みを目指す必要はない。まずは初期の単純な仕組みで試し、検索の精度に課題を感じた段階で、改良版の工夫を取り入れていくという段階的な進め方が現実的である。
RAGとファインチューニングの違い
AIに自社の情報を反映させる方法として、RAGとよく比較されるのが「ファインチューニング(AIモデル自体を再学習させる方法)」である。両者は目的が異なる。
| RAG | ファインチューニング | |
|---|---|---|
| 得意なこと | 新しい事実・知識を補うこと | AIの話し方や出力形式を調整すること |
| 情報の更新 | 資料を差し替えればすぐ反映される | 反映には再学習が必要 |
| 導入コスト | 比較的安価 | 専門知識と計算資源が必要で高額になりやすい |
社内規程や商品情報のように日々更新される情報を扱いたい場合は、コストと更新のしやすさの両面から、RAGの方が現実的な選択肢になることが多い。
RAGについてよくある質問
RAGを使えばAIが嘘をつかなくなりますか
完全になくなるわけではないが、大きく減らすことが期待できる。ただし、読み込ませる資料自体が古かったり間違っていたりすると、AIはその誤った情報をもとに回答してしまう。資料の質を保つことが前提になる。
自社サイトがRAGの検索対象になるにはどうすればよいですか
まずはrobots.txtでAI検索用のクローラーをブロックしていないか確認したい。そのうえで、質問に対する答えを明確に書く、具体的な事実を盛り込むといった基本的なコンテンツの工夫が土台になる。
中小企業が社内でRAGを導入する意味はありますか
ある。社内マニュアルやよくある質問への回答をAIに任せることで、問い合わせ対応や新人教育の負担を減らせる可能性がある。ただし、読み込ませる資料を事前に整理しておくことが成功の鍵になる。
まとめ:AIは「調べてから答える」時代へ
RAGは、AIが自分の記憶だけに頼らず、その場で資料を調べてから答えるという、生成AIの弱点を補うための仕組みである。ChatGPTやPerplexityのようなAI検索は、この仕組みをインターネット規模で動かしているに過ぎない。自社サイトがAIに引用されるかどうかを左右するのは、特殊な裏技ではない。クローラーへのアクセス許可や、結論を明確にした読みやすい文章づくりといった、地道な積み重ねである。社内活用を検討する場合も、AIの性能よりもまず「読み込ませる資料の質」を整えることが、遠回りのようで最も確実な一歩になる。
今日できる点検
| 状態 | 今日やること |
|---|---|
| AI検索用のクローラーをブロックしているか確認していない | robots.txtの設定を見直す |
| 記事の結論を後半に書いている | 見出しの直後に結論を先に書く形に直す |
| 社内でAI活用を検討しているが資料が未整理 | まず主要な資料の古い情報を洗い出す |
この記事に書いたことを、そのまま御社のページに
生成AIに引用されるページを、お話しいただくだけでお作りします。お時間をいただくのは初回15分のヒアリングだけです。まず1ページ、無料でお作りします。
OKが出るまで、何度でも直します。事実が違う、言い回しが硬い、この話は入れないでほしい。どれも遠慮なくおっしゃってください。何度お直ししても、追加の料金はいただきません。
これまでに127社にご利用いただきました。毎月ご依頼いただいている方の6割以上が、月10ページを選ばれています。料金はページに掲載しています。
ページを増やしても問い合わせが来ないなら、原因はページの外にあります。その場合は、下の入口からご相談ください。
自社のマーケティング課題を根本から解決しませんか?
ウェブサイトから要素を引き算し、訪れた人が迷わず次の一歩に進む形へ組み直す。初回60分のオンラインで御社のサイトを一緒に読み、どこから直すべきかをお伝えします。手順をまとめた無料の診断と解説動画もご用意しています。
初回は無料・60分・オンライン完結・その場で契約のお願いはいたしません

