本文へスキップ

LLM(大規模言語モデル)とは?仕組みと誤りの理由を解説

LLM(大規模言語モデル)とは、トークンの並びを予測して文章を組み立てるモデルです。事前学習から人に合わせた調整までの段階、パラメータ数の読み方、事実と異なる内容を答える理由、AI検索の中での役割までを、公式ドキュメントと論文の記述からご紹介します。

ChatGPTやGeminiに資料の下書きを頼むと、読める文章が数秒で返ってきます。ところが、その中に事実と違う一文が混ざっていることがあり、どの作業まで任せてよいのかを社内で決めきれません。

この文章を組み立てているのがLLMで、Large Language Model の略、日本語では大規模言語モデルと呼びます。LLMはトークン(=文章を数えるときの最小の単位)の並びを予測して文を作るため、誤りが混ざることがあります。

この記事では、LLMが経る学習の段階から、パラメータ数の読み方、事実と異なる内容を答える理由、AI検索の中での役割までをご紹介します。

学習は事前学習だけで終わらない。人に合わせて仕上げる段階がある

LLMは、そもそも何をしているモデルなのでしょうか。Google for Developers によると、LLMはトークン、またはトークンの並びを予測するモデルです。この予測の力は、大量の文章を読み込ませる工程だけで身につくわけではありません。同じページは、最初の段階を教師なし学習(=正解を付けないデータから規則性を学ばせる方法)だと説明しています。

図1:3つは同じものを測っていない。どれか1つを増やしても、残る2つは付いてこない。

規模を測る軸は3つあり、それぞれ別の上限になる
規模を測る軸は3つあり、それぞれ別の上限になる

図1:3つは同じものを測っていない。どれか1つを増やしても、残る2つは付いてこない。

出所:GMO AI検索ラボ

そこで行われるのがマスクされた予測で、学習データの中のトークンを意図的に隠し、欠けたトークンをモデルに当てさせます。この繰り返しを通じて、語と語のつながりの規則や、文章を組み立てるときの土台が身についていきます。

ただし、この段階を終えただけでは、人の指示に沿って答える振る舞いは身につきません。同じページは、指示チューニング(=指示に従う力を高めるための任意の追加学習)という段階を挙げ、それがLLMの指示に従う能力を高められると書いています。

その追加の段階を実際に組んだ報告が、OpenAIの研究チームによる論文「Training language models to follow instructions with human feedback」です。arXivへ投稿されたのは2022年3月4日で、この論文は調整を2つの段階に分けています。

はじめに行うのが教師あり微調整で、ラベラーが書いた模範回答のデータを集め、それを使ってGPT-3を教師あり学習で微調整します。

次に行うのが、複数の出力に人が順位を付けたデータを集め、そこから人間のフィードバックによる強化学習をさらに行う段階です。この段階がRLHF(=人の評価を基準に強化学習でモデルを仕上げる手法)にあたります。

こうして仕上がったモデルがInstructGPTで、同じ論文は、13億パラメータのInstructGPTの出力が、1,750億パラメータのGPT-3の出力より人の評価で好まれたと報告しています。パラメータ数は100分の1で、規模の差がそのまま評価の差にはなっていません。

あわせて、真実性の改善と有害な出力の減少も示されたと書かれており、規模を増やすことと、人の評価に沿って調整することでは、効き方が違うと読めます。

段階ごとに、何をするかと主な効果を並べました。Google for Developers の教材と、OpenAIの論文「Training language models to follow instructions with human feedback」の記述から採っています(2026年9月23日確認)

段階何をするか主な効果
事前学習トークンを隠し、欠けたトークンを予測させる語と語のつながりの規則が身につく
教師あり微調整ラベラーが書いた模範回答でモデルを微調整する指示に沿った答え方が身につく
RLHF複数の出力への人の順位づけをもとに強化学習を行う人の評価で好まれる答えに近づく

横にスクロールできます

パラメータの数は多いほど良いとは限らない。データ量との釣り合いが要る

パラメータとは、学習によって定まるモデル内部の重み(=計算に使う数値)の数のことです。Google for Developers は、LLMが再帰モデルよりはるかに多くのパラメータを含むと書いており、Transformerには数千億から数兆のパラメータが含まれるとも書いています。

図2:どちらもクエリ ファンアウトを使う場合があるが、使うモデルや手法が異なる場合があり、出る回答とリンクも違う。

同じ手法を使う2つの機能は、向く問いが違う
同じ手法を使う2つの機能は、向く問いが違う

図2:どちらもクエリ ファンアウトを使う場合があるが、使うモデルや手法が異なる場合があり、出る回答とリンクも違う。

出所:GMO AI検索ラボ

同じページには、パラメータが多いTransformerのほうが、少ないTransformerより一貫して高い性能を示すという研究がある、とも書かれており、ここだけを読むと、数字が大きいモデルほど良いように見えます。

ところが、規模の数字だけで話は片付かず、DeepMindのチームは、2022年3月29日にarXivへ投稿した論文で、いまの大規模言語モデルが著しく学習不足だと報告しました。学習データの量を一定にしたまま規模を大きくしてきた結果だ、というのがその説明です。

同じ論文は、7,000万から160億超のパラメータのモデルを400本以上、50億から5,000億のトークンで学習させて調べたと書いています。結論は、計算量あたりで最適な学習ではモデルの大きさと学習トークン数を同じだけ増やす、というもので、大きさが2倍になるなら学習トークン数も2倍にします。

この釣り合いの関係が、スケーリング則(=モデルの規模と性能の関係を表す経験則)と呼ばれるものです。パラメータ数を100分の1にしたまま人の評価で上回ったInstructGPTも、その関係の表れ方の1つで、数字の大小だけではモデルの出来を判断できません。

規模とは別の上限もあり、一度に読み書きできる量はコンテキストウィンドウ(=一度に扱えるトークン量の上限)と呼ばれ、その値はモデルごとに違います。用語そのものの説明は、このサイトの用語集にあります。

規模についての記述と、その出どころと、確認日を並べました。英語の原文は、語順を変えずに日本語へ置き換えています

規模についての記述出どころ確認日
LLMは再帰モデルよりはるかに多くのパラメータを含むLLM: 大規模言語モデルとは何でしょうか。(Google for Developers)2026年9月23日
Transformerには数千億から数兆のパラメータが含まれる同上2026年9月23日
パラメータが多いTransformerは、少ないTransformerより一貫して高い性能を示す同上2026年9月23日
いまの大規模言語モデルは著しく学習不足であるTraining Compute-Optimal Large Language Models(arXiv・2022年3月29日投稿)2026年9月23日
モデルの大きさが2倍になるなら、学習トークン数も2倍にする同上2026年9月23日

横にスクロールできます

なぜ事実と異なる内容を自信ありげに言うのか。学習と評価の設計に理由がある

事実と違う内容が、もっともらしい文章として出てくることがあり、この現象はハルシネーション(=日本語では幻覚と訳され、事実でない内容をもっともらしく生成する現象を指します)と呼ばれます。OpenAIは2025年9月5日付の記事で、これを、言語モデルが生成するもっともらしいが誤った記述だと定義しています。Google for Developers も、LLMの予測にはしばしば誤りが含まれると書いています。

図3:途中の推論を書き出させる形は、複数の手順を踏む問題で報告された成果が大きい。

答えを出す前に考える段階を挟むかどうかで分かれる
答えを出す前に考える段階を挟むかどうかで分かれる

図3:途中の推論を書き出させる形は、複数の手順を踏む問題で報告された成果が大きい。

出所:GMO AI検索ラボ

同じ記事は、その理由を採点のしかたに置いており、標準的な学習と評価の手順が、不確かさを認めることよりも推測を報酬づけしているためだ、というのがその説明です。

正答率だけで採点されると、当てずっぽうでも当たれば得点になり、いっぽう「分からない」と答えた場合の得点は0点です。何千問も重ねれば、推測を続けるモデルのほうが、不確かさを認めるモデルより採点表で高い点に見えます。

OpenAIは、正答率だけの採点表がリーダーボードとモデルカードを占めており、それが開発者に推測するモデルを作らせる動機になっていると書いています。

つまりハルシネーションは、個々のモデルの出来不出来から出てくるというより、学習と評価の設計から生まれる結果だと読めます。設計が変わらないうちは、出力を外部の情報で裏づける仕組みを、モデルの外側に足すことになります。

AI検索の中でLLMはどんな役割を担っているのか。問いを分解し答えを組み立てる

検索の画面に先に出てくる答えの文章も、組み立てているのはLLMで、そこは対話サービスと変わりません。Google 検索セントラルの公式ドキュメントは、Google AI Overviews(=検索結果の画面に出るAIの要約で、日本語の画面では「AI による概要」と表示されます)を説明しています。同じページは、Google AIモードにも同じ手法を挙げています。

図4:モデル単体に出どころを示す機能は含まれない。裏づけは外側の仕組みが持つ。

出どころが付くかどうかは、検索を挟むかで分かれる
出どころが付くかどうかは、検索を挟むかで分かれる

図4:モデル単体に出どころを示す機能は含まれない。裏づけは外側の仕組みが持つ。

出所:GMO AI検索ラボ

それがクエリファンアウト(=1つの問いを複数のサブトピックの検索に分解する手法)です。同じページは、関連する複数のサブトピックやデータソースに対して検索を実行し、それをもとに回答を組み立てる手法だと書いています。

分解した検索で集めたページをLLMが読み込み、要点を選び出して、1つの答えにまとめます。回答を生成する際に、Googleの高度なモデルが裏付けとなる関連ウェブページを特定する、というのが公式の書き方です。

一度に読み込める量には、コンテキストウィンドウの上限がかかります。集めたページを余さず使えるとは限らず、どこまで渡せるかはモデルごとの上限に左右されます。

同じページは、Google AIモードと Google AI Overviews では使用するモデルや手法が異なる場合があるため、表示される回答やリンクの内容にも違いがあると書いています。Google AI Overviews については、従来の検索結果に対して付加価値があるとシステムが判断した場合にのみ表示されるとしています。

工程ごとに、LLMがすることと公式の記述を並べました。出どころは Google 検索セントラル「AI 機能とウェブサイト」です(ページの最終更新は2025年12月31日。2026年9月23日確認)

工程LLMがすること公式の記述
問いを受け取る問いを複数のサブトピックへ分ける関連する複数のサブトピックやデータソースに対して検索を実行する
ページを集める分けた検索の結果を読み込む裏付けとなる関連ウェブページを特定する
答えを組み立てる読み込んだ内容から1つの回答を作るそれをもとに回答を組み立てる
リンクを添える参照したページを回答のそばに出す従来の検索よりも幅広く有益なリンクを表示できる

横にスクロールできます

LLMの仕組みは今も変わり続けている。回答前に考える段階を挟むモデルが登場した

LLMの標準的な予測のしかたは、問いを受け取ったらすぐ次のトークンを選んでいく形です。この形とは別に、答えを出す前の段階で途中の考え方を書き出させる手法が、2022年1月28日にarXivへ投稿された論文で報告されました。

図5:推測を報酬づけする採点が残るかぎり、モデルは推測を続ける側へ寄る。

採点のしかたが変わると、モデルの答え方も変わる
採点のしかたが変わると、モデルの答え方も変わる

図5:推測を報酬づけする採点が残るかぎり、モデルは推測を続ける側へ寄る。

出所:GMO AI検索ラボ

論文の題は「Chain-of-Thought Prompting Elicits Reasoning in Large Language Models」で、Google Research などのチームによるものです。この手法は思考の連鎖(Chain-of-Thought=答えに至る途中の推論の手順を言葉で書き出させる手法)と呼ばれます。

要旨は、途中の推論の手順を並べて生成させると、算術・常識・記号の推論の課題で性能が上がると述べています。5,400億パラメータの言語モデルに8つの例を与えるだけで、数学の文章題のベンチマークGSM8Kで当時の最先端の精度に達したとも書かれています。

この考え方は、回答前に長く考えるよう設計された近年のモデルの土台になりました。OpenAIは2024年9月12日付の記事で、人が難しい問いに長く考えてから答えるのと同じように、o1が問題を解くときに思考の連鎖を使うと説明しています。

同じ記事は、大規模な強化学習の手法によって、思考の連鎖を使って生産的に考える方法をモデルへ教えていると書いています。いま挙げた説明は、公開されている記述にもとづくもので、この分野では研究が続いています。

まとめ。大規模言語モデル単体は、出どころを示さない

LLMは、トークンの並びを予測して文章を組み立てるモデルで、学習は事前学習だけで終わらず、教師あり微調整とRLHFを重ねて仕上がります。パラメータ数は多いほど良いとは限らず、学習に使う文章の量との釣り合いが要ります。

事実と違う内容が混ざるのは、学習と評価の設計から生まれる結果だとOpenAIは説明しており、答えを作れることと、その答えの出どころを示せることは別です。

出どころが付いてくるのは検索を挟んだときで、Google 検索セントラルは、AI機能が裏付けとなる関連ウェブページを特定し、従来の検索よりも幅広く有益なリンクを表示できると書いています。裏を返せば、検索を挟まない使い方では、出どころは回答の側から出てきません。

根拠が要る場面では、検索や社内の資料を結びつける仕組みを、モデルの外側に足すことになります。その仕組みを挟むかどうかを先に決めておくと、答えを確かめるためにかかる手間が変わってきます。

次に読む記事は、知りたいことによって分かれます。検索の画面で起きていることはAI検索とはが扱っています。文章以外を作るAIまで含めた全体像は生成AIとは、AIへ入力する文の書き方はプロンプト設計の基本にあります。

自社のサイトをAIの回答に出すところから考えたい場合は、お問い合わせが相談の窓口になります。

LLMに関するよくある質問

LLMの学習は事前学習だけで終わりますか。

終わりません。OpenAIの研究チームの論文は、事前学習のあとに2段階の調整を置いています。ラベラーが書いた模範回答でGPT-3を微調整する教師あり微調整と、複数の出力への人の順位づけをもとに強化学習を行うRLHFです。この調整を経たInstructGPTは、真実性の改善と有害な出力の減少を示したと報告されています。

パラメータの数が多いほど賢いLLMですか。

そうとは限りません。Google for Developers は、パラメータが多いTransformerが一貫して高い性能を示すという研究があると書いています。いっぽうDeepMindのチームは、いまの大規模言語モデルが著しく学習不足であり、モデルの大きさが2倍になるなら学習トークン数も2倍にすると報告しました。数字の大小だけでは判断できません。

なぜLLMは事実と異なる内容を答えることがありますか。

標準的な学習と評価の手順が、不確かさを認めることよりも推測を報酬づけしているためだと、OpenAIは説明しています。正答率だけで採点されると、「分からない」と答えた場合の得点は0点になり、推測を続けるモデルのほうが採点表で高い点に見えます。モデルの出来不出来ではなく、設計から生まれる結果だと読めます。

AI検索の答えの中で、LLMは具体的に何をしていますか。

1つの問いを複数のサブトピックの検索へ分け、集めたページを読み込んで、要点を1つの答えにまとめます。Google 検索セントラルはこの手法をクエリ ファンアウトと呼び、回答を生成する際に裏付けとなる関連ウェブページを特定すると書いています。検索の画面そのものの話はAI検索とはで扱っています。

LLMと生成AIは同じものですか。

同じではありません。生成AIは文章・画像・動画・音楽などを作るAI全般を指す言い方で、LLMはそのうち文章を扱う代表的な技術です。Google for Developers は、LLMがトークン、またはトークンの並びを予測するものだと説明しています。生成AI全般の仕組みと種類は生成AIとはで扱っています。

関連する出典

この記事の根拠にした一次情報(=発表元がみずから出している資料)です。

  1. Ouyang et al. — Training language models to follow instructions with human feedback(InstructGPT・2022年・教師あり微調整とRLHFの2段階調整、1.3Bパラメータが175Bを上回った結果)(新しいタブで開く)https://arxiv.org/abs/2203.02155
  2. Hoffmann et al. — Training Compute-Optimal Large Language Models(Chinchilla・2022年・パラメータ数と学習データ量のスケーリング則)(新しいタブで開く)https://arxiv.org/abs/2203.15556
  3. OpenAI — Why language models hallucinate(学習・評価の設計が推測を報酬づけしハルシネーションを生む仕組み)(新しいタブで開く)https://openai.com/index/why-language-models-hallucinate/
  4. Google for Developers — AI features and your website(AI OverviewsとAIモードのクエリファンアウトの説明)(新しいタブで開く)https://developers.google.com/search/docs/appearance/ai-features
  5. Wei et al. — Chain-of-Thought Prompting Elicits Reasoning in Large Language Models(2022年・思考の連鎖による推論性能の向上)(新しいタブで開く)https://arxiv.org/abs/2201.11903

この記事に出てくる用語

ハルシネーション
AIが事実でないことを、もっともらしく答えてしまう現象。
RAG
外部の文書を取り込んでから答えを作るAIのしくみ。
生成AI検索
AIが対話形式で答えそのものを返す、新しい検索のかたち。
コンテキストウィンドウ
LLMが一度に扱える入力量の上限(トークン数)。RAGが必要になる根本理由。

執筆者紹介

上席研究員

中村 仁紀

「GMO AI最適化ブースト」のAIO/GEOコンサルタント 兼 GMO AI検索ラボ 上席研究員。生成AIに引用・推奨されるためのウェブサイトの最適化を支援します。

プロフィールを見る
READ MORE

このテーマの記事を読む

RELATED

CONTACT US

お問い合わせ

調査・取材・共同研究のご相談を承ります。

FOLLOW US

最新情報をチェック

新着のレポートと研究員コラムをお知らせします。

調査レポート日本のAI検索 実態レポート 第1回:通信キャリア編