📚

プレトレーニング(事前学習)

大規模データで汎用知識を学習する段階

Pre-trainingはLLM学習の最初の段階で、数兆個のトークン(書籍、ウェブページ、コード等)で自己教師あり学習(self-supervised learning)を行います。GPT系列は「次トークン予測」(Causal Language Modeling)、BERTは「マスクされたトークン予測」(Masked Language Modeling)方式を使用します。この過程で文法、常識、推論、コーディング、数学などの汎用能力が自然に形成されます。数千のGPUで数週間〜数ヶ月かかり、費用は数千万ドルに達することもあります。Pre-trainingだけでは指示に従ったり会話する能力がなく、その後Fine-tuningとRLHFが必要です。

キーコンセプト

1

大規模テキストコーパスの収集(ウェブクローリング、書籍、コード、論文等)

2

データ前処理 — 重複除去、有害コンテンツフィルタリング、トークン化

3

モデルアーキテクチャの初期化(Transformerベース、ランダム重み)

4

次トークン予測学習を繰り返し — "The cat sat on the [?]" → "mat"を予測

5

数千GPU×数週間〜数ヶ月の訓練(分散学習)

6

Base Model完成 — テキスト補完は可能だが会話/指示追従はまだ不可

メリット

  • 教師なし(ラベルなし)データのみで学習可能
  • 汎用知識と推論能力の形成
  • 多様なdownstreamタスクに活用可能
  • スケーリングに応じてemergent abilityが出現

デメリット

  • 膨大なコスト(GPU、電力、データ)
  • 学習データの偏りと有害コンテンツの吸収
  • ハルシネーション(幻覚)が本質的に内在
  • 会話/指示追従不可(追加学習が必要)

ユースケース

GPT-4 Base Modelの学習 LLaMA / Mistral オープンソースモデル Claude Base Model BERT / RoBERTa事前学習