LLMは、そもそも何をしているモデルなのでしょうか。Google for Developers によると、LLMはトークン、またはトークンの並びを予測するモデルです。この予測の力は、大量の文章を読み込ませる工程だけで身につくわけではありません。同じページは、最初の段階を教師なし学習(=正解を付けないデータから規則性を学ばせる方法)だと説明しています。
その追加の段階を実際に組んだ報告が、OpenAIの研究チームによる論文「Training language models to follow instructions with human feedback」です。arXivへ投稿されたのは2022年3月4日で、この論文は調整を2つの段階に分けています。
段階ごとに、何をするかと主な効果を並べました。Google for Developers の教材と、OpenAIの論文「Training language models to follow instructions with human feedback」の記述から採っています(2026年9月23日確認)
段階
何をするか
主な効果
事前学習
トークンを隠し、欠けたトークンを予測させる
語と語のつながりの規則が身につく
教師あり微調整
ラベラーが書いた模範回答でモデルを微調整する
指示に沿った答え方が身につく
RLHF
複数の出力への人の順位づけをもとに強化学習を行う
人の評価で好まれる答えに近づく
横にスクロールできます
パラメータの数は多いほど良いとは限らない。データ量との釣り合いが要る
パラメータとは、学習によって定まるモデル内部の重み(=計算に使う数値)の数のことです。Google for Developers は、LLMが再帰モデルよりはるかに多くのパラメータを含むと書いており、Transformerには数千億から数兆のパラメータが含まれるとも書いています。
Training Compute-Optimal Large Language Models(arXiv・2022年3月29日投稿)
2026年9月23日
モデルの大きさが2倍になるなら、学習トークン数も2倍にする
同上
2026年9月23日
横にスクロールできます
なぜ事実と異なる内容を自信ありげに言うのか。学習と評価の設計に理由がある
事実と違う内容が、もっともらしい文章として出てくることがあり、この現象はハルシネーション(=日本語では幻覚と訳され、事実でない内容をもっともらしく生成する現象を指します)と呼ばれます。OpenAIは2025年9月5日付の記事で、これを、言語モデルが生成するもっともらしいが誤った記述だと定義しています。Google for Developers も、LLMの予測にはしばしば誤りが含まれると書いています。
同じページは、Google AIモードと Google AI Overviews では使用するモデルや手法が異なる場合があるため、表示される回答やリンクの内容にも違いがあると書いています。Google AI Overviews については、従来の検索結果に対して付加価値があるとシステムが判断した場合にのみ表示されるとしています。
工程ごとに、LLMがすることと公式の記述を並べました。出どころは Google 検索セントラル「AI 機能とウェブサイト」です(ページの最終更新は2025年12月31日。2026年9月23日確認)
論文の題は「Chain-of-Thought Prompting Elicits Reasoning in Large Language Models」で、Google Research などのチームによるものです。この手法は思考の連鎖(Chain-of-Thought=答えに至る途中の推論の手順を言葉で書き出させる手法)と呼ばれます。
そうとは限りません。Google for Developers は、パラメータが多いTransformerが一貫して高い性能を示すという研究があると書いています。いっぽうDeepMindのチームは、いまの大規模言語モデルが著しく学習不足であり、モデルの大きさが2倍になるなら学習トークン数も2倍にすると報告しました。数字の大小だけでは判断できません。
同じではありません。生成AIは文章・画像・動画・音楽などを作るAI全般を指す言い方で、LLMはそのうち文章を扱う代表的な技術です。Google for Developers は、LLMがトークン、またはトークンの並びを予測するものだと説明しています。生成AI全般の仕組みと種類は生成AIとはで扱っています。