← 一覧へ
AI・データ
#PLM#LLM#사전학습#SFT#RLHF#133회
最終更新 · 2026-09-29

PLM(事前学習言語モデル)からLLMへの発展

1. 概要

A. 定義

PLM(Pre-trained Language Model) とは、大規模コーパスで言語の一般的パターンを事前学習(Pre-training) した後、個別の下流タスクへファインチューニング(Fine-tuning) して活用する転移学習ベースの言語モデル(BERT・初期GPT系)である。LLM(Large Language Model) は、このPLMをパラメータ・データ・演算の規模で数十〜数百倍に拡大し、その上に指示学習と人間選好アライメントを載せて汎用的に指示を遂行する超巨大言語モデルを指す。

PLMの核心的発想は「言語の一般知識を一度大きく学習しておき、タスクごとに少しだけ調整する」という転移学習である。タスクごとに一からモデルを作っていた以前の方式と異なり、膨大なテキストから得た文脈・文法・常識を再利用するため、少ないラベルデータでも高い性能を出す。これはコンピュータビジョンでImageNetにより事前学習したCNNを複数タスクに再活用していた戦略が自然言語処理へ移ってきたものであり、2018年のBERT・GPTの登場以降、NLPの事実上の標準パラダイムとなった。

このパラダイムが必要となった背景には二つの現実的制約があった。第一に、タスクごとにラベル付けされたデータを大量に確保する作業はコストが莫大であり、ドメインごとに繰り返さねばならない無駄であった。第二に、Word2Vec・GloVeのような静的埋め込みは単語一つにベクトル一つを固定的に割り当て、「金(かね=貨幣)」と「金(きん=金属)」を区別できない多義語の限界があった。事前学習はラベルなしテキストのみで言語知識を蓄積して第一の問題を、文脈ベースの動的埋め込みで第二の問題を同時に解決した。

B. PLMの特性

PLMを可能にした二つの軸は自己教師あり学習(Self-supervised Learning) とトランスフォーマー(Transformer) である。自己教師あり学習は、人がラベルを付けなくてもテキスト自体から学習信号を作る。BERTは文の一部を隠して当てるMLM(Masked LM) で左右双方向の文脈を同時に見させ、文の理解(分類・固有表現抽出など)に強く、GPTは次のトークンを予測する自己回帰(Autoregressive) 方式で前文脈のみを見つつ生成能力を得る。この目的関数の差がすなわちBERT系(理解中心)とGPT系(生成中心)の性格の差を生み、LLMが対話・生成へ進むにつれ自己回帰方式が主流となった。

トランスフォーマーのSelf-Attentionは文内の全トークン対の関係を並列に計算し、単語を固定の辞書的意味ではなく文脈に応じて変わる動的埋め込みとして表現させる。RNN・LSTMがトークンを逐次的にのみ処理し、長い文で前半の情報を忘れ並列化も難しかったのと異なり、Self-Attentionは距離に無関係に関係を直接結び、GPU上で大規模並列学習を可能にした。この並列性こそ、後述する規模の法則を現実に成立させるハードウェア的前提である。

特性 内容
転移学習 事前学習→ファインチューニングの2段階構造で知識を再利用
自己教師あり学習 MLM(BERT)・次トークン予測(GPT)でラベルなし学習
文脈埋め込み 単語を文脈に応じて動的に表現(多義語処理)
トランスフォーマー Self-Attentionベースの並列学習で大規模化が可能

2. PLM → LLM発展の全体構造

PLMからLLMへの進化は単一の飛躍ではなく、規模拡張とアライメント段階の追加という二つの流れが重なって起きた。以下の概念図は静的埋め込みから出発してPLMを経てアライメントされたLLMに至る全体系譜を、続く詳細図はトランスフォーマー内部でトークンが処理される流れを示す。

flowchart LR
  W["静的埋め込み(Word2Vec/GloVe)"] --> B["PLM: 事前学習+ファインチューニング"]
  B --> G["GPT系(自己回帰生成)"]
  B --> E["BERT系(双方向理解)"]
  G --> SC["規模拡張(パラメータ/データ/演算)"]
  SC --> AL["アライメント(SFT+RLHF/DPO)"]
  AL --> L["LLM(汎用指示遂行)"]
flowchart TB
  T["入力トークン"] --> EM["トークン+位置埋め込み"]
  EM --> SA["Multi-Head Self-Attention"]
  SA --> AN["残差接続+正規化"]
  AN --> FF["Feed-Forward Network"]
  FF --> AN2["残差接続+正規化"]
  AN2 --> NX["次の層を反復(N個)"]
  NX --> OUT["次トークンの確率分布"]

第一の系譜図が語る核心は、LLMがPLMの「拡大版」でありながら同時に質的に新しい段階(アライメント) を含む点である。事前学習のみを終えた巨大モデルは次のトークンを滑らかに繋ぐだけで、「人が望む方式で指示に従う」ことはしない。例えば「議事録を要約してくれ」という入力に、要約を出す代わりに似た要求文を生成し続けてしまう類である。この隔たりを埋めるのが二番目以降の段階である。

第二のアーキテクチャ図が示すとおり、トランスフォーマーブロックはSelf-Attentionで文脈情報を集めFeed-Forward Networkでこれを変換する過程をN個の層にわたり反復し、各層は残差接続と正規化で深い学習を安定化する。LLMはこのブロックを数十〜数百層積み、各層の幅(hidden dimension)を広げてパラメータを数千億規模に拡大したものである。

PLMとLLMの違い

PLMとLLMは連続線上にあるが、活用方式で明確な質的差を示す。PLMはタスクごとに別途のファインチューニングとラベルデータを要する「タスク別専門家」に近く、LLMは一つのモデルがプロンプトを変えるだけで翻訳・要約・コーディング・相談をすべて処理する「汎用助手」に近い。この差は規模とアライメントが結合してIn-context Learningが創発しつつ生じた。

区分 PLM LLM
規模 数億〜数十億パラメータ 数百億〜数千億パラメータ
タスク適応 タスク別ファインチューニングが必要 プロンプト(In-context)で即時対応
学習段階 事前学習+ファインチューニング 事前学習+SFT+アライメント(RLHF/DPO)
代表能力 文の理解・分類 生成・推論・指示遂行・対話
活用形態 タスク別専門モデル 汎用ファウンデーションモデル

実務的含意は開発・運用方式の転換である。PLM時代には感情分析・文書分類ごとにモデルを別々に作り配備・管理していたが、LLM時代には一つのAPIにプロンプトを異なるように送ることで多数のタスクを処理でき、モデル管理の負担が減りプロンプトエンジニアリング・RAGのような新たな能力が重要になった。

3. PLM → LLMの訓練過程

flowchart LR
  D["大規模コーパス"] --> P["事前学習<br/>Pre-training"]
  P --> S["教師ありファインチューニング<br/>SFT"]
  S --> R["RLHF / DPO<br/>人間選好アライメント"]
  R --> L["LLM"]

LLMは単にPLMを拡大したものではなく、事前学習の上にアライメント(Alignment) という新たな段階を載せて完成する。各段階は目的が明確に異なり、後の段階へ進むほどデータ規模は小さくなるがデータ品質と人間介入の比重は大きくなる「逆ピラミッド」構造を成す。

段階 訓練特性 目的
事前学習(Pre-training) 自己教師(次トークン予測)で言語・世界知識を獲得、膨大なパラメータ・データ・演算 知識・言語能力の土台形成
教師ありファインチューニング(SFT) 人が作った指示-応答(Instruction)データで学習 指示を理解し遂行する能力の付与
アライメント(RLHF/DPO) 人間選好報酬モデル(RLHF)または選好ペア直接最適化(DPO) 有用・正直・無害(HHH)に行動をアライメント

A. 事前学習

数百億〜数兆トークンのテキストで次のトークンを予測し、この過程で文法・事実・推論パターンがパラメータに圧縮される。学習データはウェブクロール(CommonCrawl)、ウィキペディア、図書、コードリポジトリなどを精製・重複除去・フィルタリングして構成し、データの品質と多様性が最終性能を大きく左右する。コストの大半(数千個のGPUを数週〜数か月)がこの段階で発生するため、少数の組織のみが事前学習を行い、残りはその結果をダウンロードして活用するファウンデーションモデル(Foundation Model) の生態系が形成された。

事前学習の目的関数は単純だが、その副産物は驚くべきものである。「次の単語を当てる」という一つの課題を兆単位で反復するだけで、モデルは翻訳・要約・常識推論に必要な表象を自ら獲得する。これは言語を正確に予測するには世界に関する圧縮された知識が必要だという点で「予測こそ理解」という洞察で説明される。ただしこの段階の産出物は、知識は豊富だが制御されていない「原石」に近い。

また事前学習段階でデータ品質管理が最終性能を左右する点は実務的に極めて重要である。低品質・重複・有害テキストを取り除く精製パイプライン、個人情報・著作権の問題があるデータの排除、言語・ドメインの均衡調整がすべてこの段階で行われる。「ゴミを入れればゴミが出る(garbage in, garbage out)」の原則が兆単位のトークンではより大きく増幅されるため、近年の研究はやみくもにデータを増やすより高品質データを選別する方向へ移動している。

B. 教師ありファインチューニング(SFT)

「質問には答えを、要約要請には要約を」といった高品質の指示-応答例で学習し、事前学習モデルを指示に従う助手へ変える。数千〜数万件の丹念に書かれた(指示、理想的応答)ペアを教師あり学習で再学習させる過程で、データの絶対量は事前学習のごく一部だがモデルの行動様式を決定的に変える。InstructGPT論文が示したとおり、よくアライメントされた13億パラメータのモデルが、アライメントされていない1,750億パラメータのモデルより人の評価で選好され得るという事実は、アライメント段階の価値を雄弁に物語る。

SFTデータの多様性と品質がモデルの指示遂行範囲を決める点も重要である。要約・翻訳・コーディング・ロールプレイなど幅広い類型の指示を均等に含めてこそ特定タスクに偏らない汎用助手となり、近年は人が一つ一つ書く代わりに強力なモデルで指示-応答ペアを大量生成した後、人が検収する方式でデータ構築コストを下げる流れも現れている。

C. アライメント(RLHF/DPO)

同じ質問に対する複数の答えを人が選好順に評価したデータで報酬モデル(Reward Model) を作り、この報酬を最大化するよう方策を強化学習(PPOなど)で最適化するのがRLHF(Reinforcement Learning from Human Feedback) である。一方DPO(Direct Preference Optimization) は、別途の報酬モデル・強化学習ループなしに選好ペア(選好応答、非選好応答)で方策を直接最適化し、実装が単純で学習が安定という理由で近年広く採択される。この段階が有害・虚偽の応答を抑制し、口調・形式・拒否基準のような実使用品質を決める。要するに事前学習が「何を知っているか」、SFTが「どう指示に従うか」、アライメントが「どの価値で答えるか」をそれぞれ担う。

アライメント段階ではアライメント税(Alignment Tax) と呼ばれるトレードオフも考慮せねばならない。安全性と有用性を強くアライメントすると過度に慎重になり(無害な要請まで拒否)、性能が一部犠牲になり得るため、報酬モデル設計と選好データ構成で「有用・正直・無害(HHH)」の間の均衡を細心に調律することが実務の要である。DPOがRLHFより選好される理由の一つも、強化学習ループの不安定さと報酬ハッキング(reward hacking)のリスクを減らし、この均衡をより安定的に達成するためである。

4. 規模の法則(Scaling Law)と創発

LLMへの質的飛躍を説明する鍵が規模の法則と創発(Emergence) である。パラメータ・データ・演算を拡大すると検証損失が冪関数(power-law)の形で予測可能に減少するが(Scaling Law)、興味深いことに特定の臨界規模を超えると小さなモデルにはなかった能力が不連続に発現(創発) する。多段階推論(Chain-of-Thought)、そしてパラメータを変えずプロンプト内の例のみで新タスクを解くIn-context Learningが代表的である。

概念 内容
Scaling Law パラメータ・データ・演算の増加 → 損失減少が冪関数で予測的
創発的能力(Emergent) 臨界規模以上で推論・In-context Learningなどが発現
In-context Learning 重み更新なしにプロンプト例(Few-shot)でタスクを遂行

規模の法則が実務に与えた教訓は演算予算の最適配分である。初期にはパラメータのみを拡大すればよいと見られたが、DeepMindのChinchilla研究(2022)は、与えられた演算量でモデルの大きさと学習トークン数を均衡よく拡大せねばならず、当時の大型モデルがデータに比して過度に大きかったことを示した。例えば700億パラメータを1.4兆トークンで学習したChinchillaが1,750億パラメータのモデルを複数のベンチマークで上回ったのは、「やみくもに大きく」ではなく「データと均衡よく大きく」が正解であることを示した具体的事例である。

創発も実測事例が明確である。GPT-2規模では微々たるものだった三桁の算術・多段階推論能力が、GPT-3(1,750億パラメータ)規模でFew-shotで突然有意になり、「段階的に考えてみて(Let's think step by step)」という一行のプロンプトのみで推論精度が大きく上がる現象もまた一定規模以上でのみ観測される。ただし近年の研究は、こうした「不連続創発」の相当部分が評価指標(正答/誤答の二分法)の選択のために誇張されて見え得ると指摘するため、創発を絶対的な魔法ではなく規模に伴う能力向上の一様相として慎重に解釈する態度が必要である。

In-context Learningが実務に与える意味は特に大きい。重みをまったく変えずプロンプトに例をいくつか(Few-shot)や指示だけを入れて新しいタスクを処理できるということは、モデル再学習なしに即座に応用を変えられることを意味する。この能力がプロンプトエンジニアリングという新たな実務分野を生み、高価なファインチューニングを省いても多様なタスクに一つのモデルを再活用するLLM運用方式の土台となった。

5. 深化:ドメイン適用と最新動向

巨大なLLMを実際の業務へ適用する際は、全体再学習(コスト・時間が莫大)を避け部分適応技法を組み合わせるのが標準となった。能力・形式はPEFT(Parameter-Efficient Fine-Tuning) で、最新・専用の知識はRAG(Retrieval-Augmented Generation) で注入する二元化戦略が核心である。

PEFTの代表であるLoRA(Low-Rank Adaptation) は、元の重みを凍結したまま各層に低次元(low-rank)の行列ペアのみを追加で学習し、全体の1%未満のパラメータのみを更新しつつフルファインチューニングに近い性能を出す。ここに4ビット量子化を結合したQLoRAは、数百億パラメータのモデルも単一の高性能GPUでファインチューニングできるようにし、個々の企業・研究室がドメイン特化モデルを作る敷居を大きく下げた。これは事前学習を少数の組織が独占していた構図から、応用段階の民主化へと繋がった。

RAGはパラメータに知識を刻み込む代わりに、クエリ時点で外部知識ベース(社内文書・最新ニュースなど)をベクトル検索で見つけプロンプトに付け加える方式である。ハルシネーションを減らし最新性を確保し出典を提示できるため、社内知識チャットボット・顧客相談など事実の正確性が重要な現場で事実上必須のアーキテクチャとして定着した。コスト・遅延・データ漏洩が問題な場合には、量子化・知識蒸留で軽量化したsLLM(小型LLM) をオンプレミスに置く戦略も増えている。近年はここに、ツール呼び出し・検索・コード実行を自ら計画・遂行するエージェント(Agent) への拡張が活発である。

産業適用事例を見ると、この組み合わせの実効性が明確である。ソフトウェア開発現場のコード自動補完ツールは、膨大な公開コードで事前学習したLLMに社内コードベースをRAGで接続してチーム固有の慣例に合う提案を出し、金融・法律分野では規制文書・判例を検索して根拠と共に答えるよう設計してハルシネーションによる誤答リスクを下げる。顧客相談では相談履歴・マニュアルを検索するRAGと、会社のトーンに合わせたSFTを結合して一貫した応対品質を確保する類である。このように「汎用LLM + ドメイン知識(RAG) + 形式調整(PEFT/SFT)」の三段構成が産業全般の標準レシピとして固まりつつある。

6. 考慮事項および示唆点

  • 役割分担設計:「能力はファインチューニング(PEFT)、知識はRAG、安全はアライメント・ガバナンス」で責任を分け、信頼性・コスト・セキュリティを均衡よく設計することが技術士の観点の核心である。何をパラメータに刻み何を外部から検索するかの境界設定がアーキテクチャ品質を左右する。
  • リスク管理(ハルシネーション・バイアス・アライメント失敗):規模が大きくなるにつれ能力と共にリスクも大きくなる。事実と異なる答えをもっともらしく作るハルシネーションはRAG・出典引用・不確実性表現で、学習データに由来するバイアスはデータ精製とレッドチーム評価で、意図とずれるアライメント失敗はRLHF/DPOとガードレールで多層防御せねばならない。
  • コスト・遅延・主権のトレードオフ:超巨大APIモデルの性能とsLLMオンプレミスのセキュリティ・コスト・データ主権の間で、タスクの難度と規制要件に応じてモデルを階層化(ルーティング)する設計が現実的である。
  • ガバナンス・規制対応:EU AI Actなどの規制と企業内部の方針に合わせてデータ出典・著作権・個人情報・モデル監査追跡を確保せねばならず、プロンプトインジェクション・データ漏洩のような新種のセキュリティ脅威に対する防御体系も併せて備えねばならない。
  • 評価・検証体系:創発事例が示すとおりベンチマーク指標一つで能力を断定しがたいため、タスク別の定量指標と人の評価・レッドチーム・実使用ログ分析を並行する多面的検証体系を備えてこそ、導入後の品質低下や安全上の問題を早期に捉えられる。
  • 展望:マルチモーダル(テキスト・画像・音声の統合)、長文コンテキスト、自律エージェント、オンデバイスsLLMへの拡張が続いており、単一の巨大モデルより複数のモデル・ツール・検索を組み合わせる複合AIシステムの設計能力がますます重要になる。

参考資料


一言まとめ: PLMは事前学習+ファインチューニングの転移学習モデルであり、そこにSFTとRLHF/DPOアライメントを加え規模を拡大すると、規模の法則に従いIn-context Learningなどの創発的能力を備えたLLMへ発展し、実務ではPEFT・RAG・アライメントで能力・知識・安全を分担して適用する。