社内の問い合わせ対応や製品マニュアルの検索にAIを使う話が出ると、ベンダーの提案書や打ち合わせで「RAG」という言葉を目にします。
RAGは、生成AI(=学習したデータをもとに文章を新しく作り出すAI)が答える前に文書を検索し、見つけた内容を材料にして回答を作る仕組みです。検索を挟めば回答の誤りが無くなるわけではなく、何を検索の対象に入れ、どう探すかで答えの質が変わります。
この記事では、RAGの仕組みと、よく比べられる方法との違いから、メリット、活用例、精度の上げ方と導入時の注意点までをご紹介します。
RAGとは、生成AIが回答を作る前に外部の文書を検索し、取り出した内容を材料にして答えを組み立てる仕組みのことです。英語のRetrieval-Augmented Generationの頭文字を取った呼び名で、日本語では検索拡張生成と訳されます。
図1:RAGでは、その場で検索して取り出した文書が答えの材料になる。
拡大図1:RAGでは、その場で検索して取り出した文書が答えの材料になる。
閉じる 出所:GMO AI検索ラボ たとえば社員が「在宅勤務の手当はいくらですか」と尋ねると、RAGを組み込んだチャットボットは、まず社内規程の文書から在宅勤務の手当について書かれた箇所を探します。見つけた箇所を質問と一緒に生成AIへ渡し、生成AIはその箇所の記述に沿って回答の文章を書きます。
生成AIが学習で身につけた知識だけで答える場合と違い、RAGでは、その場で取り出した文書が答えの材料になります。社内規程のように学習に入っていない文書でも、検索の対象に入れておけば、回答の材料として使えます。
RAGという呼び名は、2020年5月にarXiv(=査読を経る前の論文を公開するサイト)で公開された論文で使われたものです。論文の題は「Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks」です。著者はFacebook AI Research、University College London、New York Universityに所属する12名です。論文は、機械学習の国際会議NeurIPS 2020に採択されました。
論文はRAGを、学習済みのパラメトリックな記憶(=モデルが学習の過程で内部の数値に蓄えた知識)と、ノンパラメトリックな記憶を組み合わせて文章を作るモデルと定義しています。ノンパラメトリックな記憶とは、モデルの外に置き、検索で取り出す文書の集まりのことです。
論文の実験では、2018年12月時点のWikipediaの記事を重ならない100語ずつに区切り、2,100万件の文書にして検索の対象にしました。検索する側にはDPR(=質問と文書をそれぞれ数値の並びに置き換え、並びの近さで文書を探す、学習で作られた検索の方式)を使っています。文章を作る側にはBARTという学習済みの言語モデルを使い、取り出した文書を質問の文にそのままつないで渡しました。
論文のRAGは、課題ごとに、質問を数値の並びに置き換える検索の部品と、文章を作るBARTを一緒に追加で学習させています。文書の側の数値の並びとインデックスは固定したままです。論文の要旨も、RAGを汎用的なファインチューニング(=学習済みのモデルに追加のデータを学習させ、モデルの内部の数値を調整すること)の手順と呼んでいます。
いまの各社の技術文書は、検索で取り出した文書をモデルへの入力に加える形でRAGを説明しており、論文のようにモデルを追加で学習させることは前提にしていません。AWSはRAGを、大規模言語モデル(=大量の文章で学習し、次に来る語を選びながら文章を作るAIのモデル)の出力を最適化するプロセスと書いています。応答を生成する前に、学習データの外にある信頼できる知識ベースを参照させるという説明です。
Microsoftは、Foundry(=Microsoftが提供する、生成AIのアプリケーションを作るための基盤)の技術文書でRAGを説明しています。検索と大規模言語モデルを組み合わせて、回答を利用者のデータに根ざしたものにするパターンという説明です。
生成AIが学習した知識だけで答えるときの弱点は、RAGを提唱した論文とAWSが、それぞれ別の数え方で挙げています。どちらの弱点も、答えの材料がモデルの中の知識に限られることから起きており、RAGは検索で外の文書を足すことで、その一部に手当てをする仕組みです。
MicrosoftのFoundryの技術文書によると、大規模言語モデルは、学習した時点で手に入った公開のインターネットのデータで学習されています。同じ文書は、非公開の文書にもとづく答えや最新の情報が要る場面では、公開のデータだけでは足りない場合があるとしています。
RAGを提唱した論文は冒頭で、学習した知識だけで答えるモデルの弱点を3つ挙げています。1つめは記憶を広げたり直したりしにくいこと、2つめはなぜその答えになったのかを示しにくいことです。3つめは、ハルシネーション(=事実と異なる内容を、もっともらしい文章で出力してしまう現象)を起こす場合があることです。
AWSが挙げる課題は、大規模言語モデルについての4つです。4つの課題それぞれに、社内の問い合わせ対応で起きる場面の例を当ラボが添えて並べました。
AWSが挙げる大規模言語モデルの課題(AWS「検索拡張生成(RAG)とは何ですか?」の記述の要旨・2026年9月18日確認)と、社内で起きる場面の例。場面の例は、AWSの課題を社内の問い合わせ対応に当てはめて当ラボが作った例
AWSが挙げる課題 社内で起きる場面の例 答えが無いのに、誤った情報を答える 社内に無い制度を、あるかのように説明する 最新の答えが要るのに、古い情報や一般的な情報を答える 改定された経費の上限を、改定前の金額で答える 信頼できる出どころではない情報から答えを作る 出どころの確かでないウェブの記述をもとに、社内の手続きを説明する 同じ用語が別の意味で使われていて、答えが不正確になる 社内で独自の意味を持つ略語を、一般的な意味で受け取って答える
横にスクロールできます
AWSの1つめの課題は、論文のいうハルシネーションと同じ事柄を指しているとみられます。2つめの古い情報を答える課題は、論文のいう記憶を直しにくいことから起きると考えられます。AWSはRAGを、これらの課題のいくつかを解決する1つの方法と位置づけており、すべてを解決するとは書いていません。
RAGは、質問を受け取ってから回答を返すまでに、取得・拡張・生成の3つの段階を踏みます。この3段階はMicrosoftのFoundryの技術文書による区分で、英語ではRetrieve、Augment、Generateと呼ばれています。
図2:インデックスから文書を取り出し、質問と一緒に渡して、文書に沿って答えを書く。
拡大図2:インデックスから文書を取り出し、質問と一緒に渡して、文書に沿って答えを書く。
閉じる 出所:GMO AI検索ラボ 段階の数え方は文書によって違い、AWSは外部データの作成、関連情報の取得、プロンプトの拡張、外部データの更新の4つで説明しています。AWSの区分には生成が入らず、代わりに文書の準備と更新が段階に入っています。
3つの段階の前には、検索の対象にする文書を用意する準備があります。社内規程や製品マニュアルのような文書を集めて、検索しやすい大きさのまとまりに区切り、インデックス(=検索を速くするために、文書を整理して登録しておく索引)に登録します。
ベクトル検索(=質問と文書を数値の並びに置き換え、近さで文書を探す検索)を使う場合は、区切った文書ごとに埋め込み(=文章の意味を数値の並びで表したもの)も計算しておきます。AWSは、埋め込み言語モデルで文書を数値の並びに変え、ベクトルデータベース(=数値の並びを保存し、近いものを速く探せるデータベース)に格納する流れで説明しています。
取得の段階では、質問が来るとアプリケーションがインデックスに問い合わせ、質問に関係のありそうな文書のまとまりを取り出します。AWSは、質問も数値の並びに置き換え、保存しておいた文書の数値の並びと照らし合わせる流れで説明しています。
拡張の段階では、利用者の質問と取り出した文書を1つのプロンプト(=生成AIへ渡す指示や質問の文)にまとめます。在宅勤務の手当の例なら、「渡した規程の抜粋にもとづいて答えてください」という指示に、規程の該当箇所と社員の質問を並べた文になります。
生成の段階では、大規模言語モデルがそのプロンプトを受け取り、渡された文書に沿って回答を書きます。MicrosoftのFoundryの技術文書は、取り出した内容に根ざした回答にすることで不正確さを減らし、正確な引用を付けられるようになると書いています。
AWSが4つめに数える外部データの更新では、文書を更新したら、その文書の埋め込みも計算し直します。規程やマニュアルを改定したのにこの作業が抜けていると、チャットボットは古い版の記述のまま答える場合があります。
RAGとよく比べられるのが、ファインチューニングです。違いは、答えに使う知識をモデルの外に置いて検索で渡すか、モデルの中に学習させて覚えさせるかにあります。
MicrosoftのFoundryの技術文書は、非公開のデータや頻繁に変わるデータにもとづく回答が要るときはRAGを使うと書いています。新しい知識を足すのではなく、モデルの振る舞いや文体、特定の作業の出来を変えたいときはファインチューニングを使う、という書き分けです。
RAGを提唱した論文も、T5やBARTといった言語モデルのように、モデルの中だけに知識を持つ方式の弱点を挙げています。世の中の変化に合わせて振る舞いを変えるには、さらに学習させる必要があるという点です。RAGでは、知識を新しくする手段として、検索の対象の文書を差し替える方法が取れます。
RAGとファインチューニングについて、何を変えるか、知識の更新、向いている目的、回答の根拠の示し方の4つの観点で並べました。
RAGとファインチューニングの違い。RAGの列は、AWSとMicrosoftが説明する、学習済みのモデルに文書を渡す形を指す。原論文のRAGは、検索の部品と文章を作るモデルも課題ごとに追加で学習させる。向いている目的と引用はMicrosoftのFoundryの技術文書による。知識の更新と根拠の示しにくさはLewis ほか(arXiv:2005.11401)による(いずれも2026年9月18日確認)
観点 RAG ファインチューニング 何を変えるか モデルに渡す文書。モデルそのものは変えない モデルの内部の数値 知識の更新 検索の対象の文書を差し替える 追加のデータで学習させ直す 向いている目的 非公開の文書や、頻繁に変わる情報にもとづいて答える モデルの振る舞い、文体、特定の作業の出来を変える 回答の根拠の示し方 取り出した文書を引用として添えられる モデルの中の知識から答えるため、根拠を示しにくい
横にスクロールできます
MicrosoftのFoundryの技術文書は、用途の複雑さと、どこまで制御したいかに合わせて、RAG、ファインチューニング、エージェント向けの道具の3つから選ぶよう書いています。社内の文書にもとづいて答えさせたいという相談は、この書き分けでいえば非公開のデータにもとづく回答にあたるので、先にRAGで足りるかを確かめる順番になると考えられます。
AWSは、RAGを使うメリットとして4つを挙げています。4つの見出しと、AWSがそれぞれに書いている内容の要旨は次のとおりです。
図3:インデックスと尋ねた年がそろうと正答率が高く、食い違うと大きく下がった。
拡大図3:インデックスと尋ねた年がそろうと正答率が高く、食い違うと大きく下がった。
閉じる 出所:GMO AI検索ラボ コスト効率の高い実装:組織の情報を足すために基盤モデルを再トレーニングするより、費用を抑えて新しいデータを渡せる 現在の情報:最新の研究、統計、ニュースを生成モデルに渡せる ユーザー信頼の強化:出力に出典への引用や参照を含められ、利用者が元の文書を自分で確かめられる 開発者によるコントロールの強化:情報源を変えたり、機密情報の取得を権限に応じて制限したりできる このうち現在の情報を保てる点は、RAGを提唱した論文のインデックスの差し替えの実験が裏づけています。ユーザー信頼の強化にあたる根拠の示しやすさについても、論文が記述を載せています。
論文は、2016年と2018年の間に入れ替わった各国の首脳82人について、「ペルーの大統領は誰か」の形で尋ねました。そのとき、検索の対象を2016年12月時点と2018年12月時点のWikipediaで入れ替えています。2016年のインデックスで2016年の首脳を答えた正答率は70%、2018年のインデックスで2018年の首脳は68%でした。
インデックスと年が食い違うと、正答率は12%(2018年のインデックスで2016年の首脳)と4%(2016年のインデックスで2018年の首脳)まで下がりました。
モデルを学習し直さなくても、検索の対象の文書を入れ替えれば答えが変わるという点が、RAGの大きな特徴です。論文もこの結果から、ノンパラメトリックな記憶を差し替えるだけでモデルの知識を新しくできると書いています。規程の改定や新製品の追加のように、内容が変わる情報を扱う用途で役に立つと考えられます。
論文はほかに、事実に合った文章を書けるかを人の評価で比べています。使ったのは、答えになる語を渡してJeopardy(=ある事柄の説明文から、その事柄の名前を当てる形式のクイズ)の問題文を作らせる課題です。事実に合っているかは、信頼できる外部の情報で裏づけられるかどうかで判断しました。
論文の表4は、RAGと、検索を持たないBARTの出力452組を比べた結果です。事実に合っているのはRAGのほうだと判断されたのが42.7%、BARTのほうだと判断されたのが7.1%でした。残りの50.2%は、両方とも良い、両方とも悪い、評価者の多数がそろわない、のどれかに分かれています。
両方とも良いとされた割合は、論文の本文と表4で値が食い違っているため、ここでは分けて示しません。また、この評価はWikipediaを検索の対象にした研究の結果で、社内の文書で同じ差が出るとは限りません。
根拠の示しやすさについて、論文は、検索の対象が人の読める文章なので、モデルが何を参照したかを人が確かめられ、文書を書き換えればモデルの記憶も直せると書いています。MicrosoftのFoundryの技術文書も、RAGの回答には元の文書への引用を含められると書いています。
MicrosoftのFoundryの技術文書の書き分けにならえば、RAGが向くのは、非公開の文書や、内容が頻繁に変わる文書を答えの材料にしたい場面です。社内の規程、製品のマニュアル、問い合わせへの過去の回答のように、社内にしかない文書が当たります。
社内で導入の話が出やすい3つの使われ方について、検索の対象にする文書、質問の例、気をつけることを並べました。
代表的な使われ方と、検索の対象にする文書、質問の例、気をつけること。使われ方と質問の例は当ラボが整理した例で、特定の製品の機能ではない
使われ方 検索の対象にする文書 質問の例 気をつけること 社内の問い合わせ対応 就業規則、経費精算の規程、社内手続きの手順書 「在宅勤務の手当はいくらですか」 改定前の版を検索の対象から外す 顧客向けのサポート 製品マニュアル、よくある質問、問い合わせへの過去の回答 「この機種の初期設定をやり直す手順は?」 個人情報を含む記録を混ぜない 営業やマーケティングの資料作り 過去の提案書、製品の仕様書、公開済みの導入事例 「製造業向けの導入事例を3件まとめて」 社外に出してよい資料かどうかを分けておく
横にスクロールできます
改定前の版や、社外に出せない資料が検索の対象に混ざっていると、その記述がそのまま回答に出る場合があります。
AI検索では、自社は検索の仕組みを運用する側ではなく、自社サイトが検索される側に立ちます。Googleの検索結果の上に出るAIの要約「AI による概要」や、Google AIモードも、答えを書く前にウェブを検索しています。
Google 検索セントラルは、AI による概要とAIモードが「クエリ ファンアウト」手法を使う場合があると書いています。クエリ ファンアウトとは、関連する複数のサブトピックやデータソースに対して検索を実行し、それをもとに回答を組み立てる手法です。同じページは、回答を生成する際に、Googleのモデルが裏付けとなる関連ウェブページを特定するとも書いています。
GoogleはこのしくみをRAGとは呼んでいませんが、検索してから答えを組み立て、根拠のページを添えるという流れは、RAGと同じ形をしていると考えられます。この流れを自社サイトの側から見ると、AIの回答の根拠に選ばれる前に、まず検索で見つけてもらう必要があります。
Google 検索セントラルは、ページがAI による概要やAIモードのサポートリンクとして表示される条件を3つ挙げています。インデックスに登録されていること、Google 検索でスニペット(=検索結果に出る本文の抜粋)が表示されること、検索の技術的要件を満たしていることです。同じページは、AI による概要やAIモードのための特別な最適化を行う必要は無いとも書いています。
RAGの回答の質は、文書の準備、検索の設定、プロンプトの設計の3つで変わります。MicrosoftのFoundryの技術文書は既知の制限として、RAGの品質がこの3つによって変わると書いています。データの準備やインデックスの作り方がまずければ、回答の質に直接響くという注意です。
図4:MicrosoftのFoundryの技術文書は、RAGの品質がコンテンツの準備、取得の設定、プロンプトの設計によって変わると書いている。
拡大図4:MicrosoftのFoundryの技術文書は、RAGの品質がコンテンツの準備、取得の設定、プロンプトの設計によって変わると書いている。
閉じる 出所:GMO AI検索ラボ 文書の準備では、長い文書をどの大きさに区切るかを最初に考えます。チャンク分割を勧めているのは、MicrosoftのAzure AI Search(=Microsoftが提供する検索のサービス)の技術文書です。大きな文書をチャンク(=検索のために文書を区切った小さなまとまり)に分け、部分ごとに照合できるようにする方法です。RAGを提唱した論文も、Wikipediaの記事を重ならない100語ずつに区切っていました。
検索の設定では、質問と文書で言葉が食い違う場合への備えが要ります。Azure AI Searchの技術文書が挙げる英語の例では、利用者は「2023年より後に採用された在宅勤務の社員の有給休暇の規程は?」と尋ねています。ところが文書のほうは、同じことを「time off」「telecommute」「recent hires」という別の言葉で書いています。
こうした言葉の食い違いは、語の一致で探すキーワード検索では拾いにくいと考えられます。意味の近さで探すベクトル検索なら、言い回しの違う文書も候補に入る場合があります。
RAGを提唱した論文は表6で、検索の部品をBM25(=語の重なりで文書に点数を付ける、キーワード検索の代表的な方式)に置き換えた結果を載せています。主張の真偽を判定する課題のFEVERでは、BM25のほうが良い結果になりました。論文はその理由を、FEVERの主張が固有名詞を中心にしているためかもしれないと推測しており、ほかの課題では学習させたDPRのほうが良い結果でした。
Azure AI Searchの技術文書は、ハイブリッド検索を、再現率(=関連する文書を取りこぼさずに拾えた割合)を高める方法として勧めています。ハイブリッド検索とは、キーワード検索とベクトル検索を組み合わせる検索です。取り出した候補を意味の近さで並べ直すセマンティックランク付けは、Foundryの技術文書が、ハイブリッド検索に添えることのある設定として挙げています。
キーワード検索、ベクトル検索、ハイブリッド検索の3つの検索のしかたについて、何を手がかりに探すかと、どういう質問に合うかを並べました。
検索のしかたと、何を手がかりに探すか、合う質問。MicrosoftのAzure AI SearchとFoundryの技術文書、Lewis ほか(arXiv:2005.11401)の記述をもとに当ラボが整理した。キーワード検索が固有名詞に合うという点は、論文が推測として書いたもの(2026年9月18日確認)
検索のしかた 何を手がかりに探すか 合う質問 キーワード検索 質問と文書に同じ語が出てくるか 固有名詞のように、語そのものが手がかりになる質問(論文の推測による) ベクトル検索 質問と文書の意味の近さ 文書と違う言い回しで尋ねた質問 ハイブリッド検索 語の一致と意味の近さの両方 語の一致と言い回しの両方が関わる質問
横にスクロールできます
モデルに渡す文書の数も、回答の質に関わります。論文の図3は、オープンドメインの質問応答(=特定の文書を渡さずに、一般の知識を問う質問に答える課題)で、テスト時に取り出す文書を増やしたときの成績を示しています。
RAG-Sequence(=1つの回答の全体で、同じ文書の組を参照する型)は文書を増やすほど成績が上がり続けました。一方、RAG-Token(=回答の語ごとに、別の文書を参照できる型)は10件で頭打ちになっています。
プロンプトの設計では、取り出した文書だけにもとづいて答えるよう、生成AIへの指示に書いておきます。Foundryの技術文書は、検索を挟んでも不正確な回答が出ることへの手当てを2つ挙げています。
1つは引用を表示する設定を有効にすることです。もう1つは、システムメッセージ(=生成AIの振る舞いを決めるために、質問とは別に渡す指示)で、取り出した内容に沿って答えるよう指示することです。
RAGを入れる前に確かめておきたい注意点は、回答の誤り、権限、取り出した文書に紛れ込む指示、費用と待ち時間の4つです。どれも、社内の文書を検索して生成AIに渡すという仕組みそのものから生じます。
回答の誤りについて、MicrosoftのFoundryの技術文書は、取り出した内容があってもモデルが不正確な回答を作ることがあると書いています。検索が無関係な文書や不完全な文書を返せば、回答も不完全や不正確になりうるという注意も添えています。RAGを提唱した論文も、Wikipediaを含め、外から持ってくる知識源が完全に事実どおりで偏りの無いものにはならないだろうと書いています。
権限では、検索の対象に入れた文書を、質問した人が本来見てよいかが問われます。Foundryの技術文書は、検索の時点でアクセスを制御するよう勧め、制御しなければ回答を通じてインデックスの中の機密の情報が漏れうると書いています。Azure AI Searchの技術文書は、財務のデータは、役員がチャットボットに尋ねた場合でも財務のチームだけが見られるようにすべきだという例を挙げています。
取り出した文書に紛れ込む指示は、プロンプトインジェクション(=文書や入力に紛れ込ませた指示で、生成AIに本来と違う動きをさせる攻撃)と呼ばれます。Foundryの技術文書は、取り出した文書を信頼できない入力として扱い、システムメッセージとアプリケーションの処理で、文書に含まれる指示の危険を減らすよう書いています。
OWASP(=ソフトウェアの安全性についての指針を公開している団体)も、大規模言語モデルを使うアプリケーションのリスクを一覧にまとめています。その2025年版には、「Vector and Embedding Weaknesses」が入っています。例として挙げているのは、権限の無いアクセスによる情報の漏えいや、検索の対象のデータを汚す攻撃です。
費用と待ち時間について、Foundryの技術文書は3つの上乗せを挙げています。インデックスへの問い合わせ、埋め込みの計算、取り出した文書で増える入力のトークン(=生成AIが文章を数える単位)で、どれもモデルだけに尋ねる場合より増えると書いています。
4つの注意点それぞれについて、起きることと、導入前に決めることを並べました。起きることはFoundryの技術文書の記述により、導入前に決めることは当ラボが整理したものです。
RAG導入時の注意点と、起きること、導入前に決めること。起きることはMicrosoftのFoundryの技術文書の記述による(2026年9月18日確認)。導入前に決めることは当ラボが整理した
注意点 起きること 導入前に決めること 回答の誤り 検索を挟んでも、文書に無い内容や不正確な回答が出る 回答を人が確かめる手順と、引用を表示する設定 権限 見てよい範囲の外の文書が、回答を通じて見えてしまう 文書ごとに誰が見てよいかと、検索の時点でそれを確かめる設定 文書に紛れ込む指示 取り出した文書の中の指示に、生成AIが従ってしまう 検索の対象に入れる文書の出どころと、システムメッセージでの指示 費用と待ち時間 検索と埋め込みの計算、増えた入力の分だけ上乗せになる 渡す文書の件数の上限と、使う料金プラン
横にスクロールできます
文書を選ぶ担当と更新する担当、閲覧の権限、回答を人が確かめる手順を先に決めておくと、ベンダーの提案を比べるときの基準にもなると考えられます。
RAGは、生成AIが答える前に文書を検索し、取り出した内容を材料にして回答を書く仕組みです。検索の対象の文書を差し替えて答えを新しくでき、根拠の文書を回答に添えられる一方で、答えの質は、検索の対象に入れた文書と、その探し方に左右されます。
社内で導入を検討するときは、どの文書を検索の対象にするか、誰がその文書を更新するか、誰がどの文書を見てよいかの3つを、製品を選ぶ前に決めておくと進めやすくなります。
AI検索の回答が作られる流れを、 AI検索とは では、問いを受け取る、ウェブを探す、答えを作る、引用元を添えるの4つの工程に分けています。このうちウェブを探す工程と答えを作る工程が、RAGにあたります。
公式ドキュメントによると、MCP(Model Context Protocol)は、AIアプリケーションを外部のシステムにつなぐためのオープンソースの標準です。RAGが答えの作り方の名前であるのに対し、MCPはつなぎ方の標準の名前で、2つの違いは MCPとは の表で並べています。
自社の文書やサイトをAIにどう読ませるかで迷う場合は、お問い合わせからご相談ください。
RAGとは何ですか? RAG(検索拡張生成)とは、生成AIが回答を作る前に外部の文書を検索し、取り出した内容を材料にして答えを組み立てる仕組みです。2020年にFacebook AI Researchなどの研究者12名が発表した論文で使われた呼び名です。AWSやMicrosoftは、取り出した文書をモデルへの入力に加える形で説明しています。検索の対象の文書を差し替えれば、社内の文書や新しい情報を回答の材料にできます。
RAGとファインチューニングはどう使い分けますか? MicrosoftのFoundryの技術文書は、非公開のデータや頻繁に変わるデータにもとづく回答が要るときはRAGを使うと書いています。モデルの振る舞いや文体、特定の作業の出来を変えたいときは、ファインチューニングを使うという書き分けです。社内の規程やマニュアルにもとづいて答えさせたい場合は、新しい知識を足す用途にあたるので、先にRAGで足りるかを確かめる順番になると考えられます。
RAGを使えばハルシネーションは無くなりますか? 無くなりません。MicrosoftのFoundryの技術文書は、取り出した内容があってもモデルが不正確な回答を作ることがあると書いています。RAGを提唱した論文では、人による評価で事実に合っているとされた割合がRAGのほうが高かったものの、検索の対象はWikipediaでした。回答に添えられた引用を開き、同じ記述が元の文書にあるかを確かめる手順を残しておくと、誤りに気づけます。
RAGを導入するときに最初に用意するものは何ですか? 検索の対象にする文書と、その文書を管理する担当です。AWSは外部データの作成を最初の段階に置き、MicrosoftのFoundryの技術文書も、文書を整理して検索しやすいまとまりに区切ることを最初の作業に挙げています。あわせて、文書を更新する担当と、誰がどの文書を見てよいかも決めておきます。
RAGの精度を上げるには何から見直せばよいですか? 文書の準備、検索の設定、プロンプトの設計の3つを順に見直します。MicrosoftのFoundryの技術文書は、RAGの品質がこの3つで変わると書いています。関連する文書が返ってこない場合は、文書の区切り方、埋め込みのモデルの質、検索のしかたの設定を見直すよう勧めています。
GoogleのAI による概要もRAGなのですか? Googleは自社の機能をRAGとは呼んでいません。ただしGoogle 検索セントラルは、AI による概要とAIモードが関連する複数のサブトピックに対して検索を実行し、それをもとに回答を組み立てる場合があると書いています。回答を生成する際に裏付けとなる関連ウェブページを特定するとも書いており、検索してから答えを組み立てる点で、RAGと同じ形をしているとみられます。
掲載した記述と数字は、次のページの原文から引いています。論文は本文のPDF(第4版)まで読み、公式ドキュメントは各ページを開いて確かめた日を、URLの横の確認日の列に添えました。RAGまわりの技術文書は各社が更新を続けているため、確認日より後にお読みの場合は、元のページで最新の内容を確かめてください。
ページ URL 確認日 Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks(arXiv:2005.11401、Lewis ほか) https://arxiv.org/abs/2005.11401 2026年9月18日 検索拡張生成(RAG)とは何ですか?(AWS) https://aws.amazon.com/jp/what-is/retrieval-augmented-generation/ 2026年9月18日 Retrieval augmented generation (RAG) and indexes in Microsoft Foundry(Microsoft Learn) https://learn.microsoft.com/en-us/azure/foundry/concepts/retrieval-augmented-generation 2026年9月18日 RAG and Generative AI – Azure AI Search(Microsoft Learn) https://learn.microsoft.com/en-us/azure/search/retrieval-augmented-generation-overview 2026年9月18日 AI 機能とウェブサイト(Google 検索セントラル) https://developers.google.com/search/docs/appearance/ai-features?hl=ja 2026年9月18日 LLM08:2025 Vector and Embedding Weaknesses(OWASP) https://genai.owasp.org/llmrisk/llm082025-vector-and-embedding-weaknesses/ 2026年9月18日 What is the Model Context Protocol (MCP)?(Model Context Protocol) https://modelcontextprotocol.io/docs/2026-07-28/getting-started/intro 2026年9月18日
横にスクロールできます