モデル量子化(Model Quantization)
1. 概要
モデル量子化(Model Quantization)とは、ニューラルネットワークの重み(weight)と活性値(activation)をFP32・FP16のような高精度浮動小数点から、INT8・INT4のような低ビット整数(あるいはFP8・FP4の低精度浮動小数点)へ変換し、精度の損失を最小限に抑えつつモデルのメモリ使用量・演算量・推論レイテンシ・電力消費を削減するモデル軽量化(Model Compression)手法である。
ディープラーニングモデル、とりわけ大規模言語モデル(LLM)のパラメータ規模は数億から数千億へと爆発的に増大し、性能は規模に比例して向上してきた。この規模の成長はより豊かな表現力とより高いタスク性能をもたらした一方で、モデルを「学習するコスト」と「実際にサービスへ載せて推論するコスト」の双方を押し上げた。特に推論はサービスの寿命を通じて反復的に発生するため、累積コストの面では学習より大きな負担となる場合が多い。
しかしこの成長は、ただちに配備コストの爆発につながる。パラメータ一つを32ビット浮動小数点で保存すると1個あたり4バイトを要するため、700億(70B)パラメータのモデルはFP16(2バイト)だけでも約140GBのメモリを占める。これは高価なデータセンターGPUを複数枚束ねてようやく搭載できる規模であり、スマートフォン・自動車ECU・産業用エッジデバイスのようにメモリ・電力が制限された環境には原本のまま搭載することが不可能である。量子化はまさにこの「性能は大きなモデルから生まれるが、配備は小さくなければならない」という根本的ジレンマを解消するために登場した。
量子化という発想そのものは新しいものではない。信号処理においてアナログ信号をデジタルへ標本化する際の量子化概念がその根であり、組み込み領域では古くから固定小数点(fixed-point)演算で軽量推論を実現してきた。ただしモデル規模が爆発的に増大し、推論コストがサービス運用費を左右するようになると、量子化は「選択的最適化」から「配備の前提条件」へと位置づけが格上げされた。今日の商用LLMサービングスタックはほぼ例外なく低精度フォーマットを既定値として前提とし、量子化品質がそのままサービス単価の競争力に直結する。
量子化が効果を発揮する核心的原理は、学習が終わったニューラルネットワークの重み分布がおおむね0付近に偏った狭い区間に分布し、極端に高い数値精度を要求しないという経験的事実にある。すなわち32ビットが表現する約42億段階の解像度のうち実際に必要なのははるかに少ない段階であるため、適切に設計された整数格子(grid)で近似してもモデルの判断傾向はほとんど保存される。実際、重みをFP32からINT8へ変えると保存領域は4分の1に減り、整数演算を支援するハードウェアではスループット(throughput)が2~4倍向上し、メモリ帯域幅ボトルネックが支配的なLLM推論では体感の加速効果がさらに大きい。このため量子化は今日、オンデバイスAI、sLLM(軽量言語モデル)サービング、リアルタイム推論サービスの事実上の標準的軽量化手段として定着している。
2. 量子化の基本原理と数式構造
flowchart LR
R["実数の重み(FP32分布)"] --> SC["スケール(scale)・ゼロ点(zero-point)算定"]
SC --> Q["量子化: q = round(r/scale) + zero_point"]
Q --> QI["整数表現(INT8/INT4で保存)"]
QI --> DQ["逆量子化: r' = scale * (q - zero_point)"]
DQ --> O["復元実数(近似値、誤差を含む)"]
O --> ERR["量子化誤差(quantization error)"]
量子化の数学的本質は、連続的な実数区間を有限個の整数格子点へ写像(mapping)することである。このとき実数分布のどの範囲までを格子に収めるかを定めることを範囲設定(clipping/calibration)というが、範囲を広く取りすぎると頻出する値の解像度が落ち(クリッピング誤差は小さいがラウンディング誤差が大きい)、狭く取りすぎると極端値が切り捨てられる(ラウンディング誤差は小さいがクリッピング誤差が大きい)。したがって範囲設定は二つの誤差の和を最小化する点を見つける最適化問題であり、最大・最小値をそのまま使う単純な方式ではなく、分布の百分位数やKLダイバージェンス最小化を基準に閾値を定める手法が広く用いられる。実数値rを整数qへ変えるときはスケール(scale)とゼロ点(zero-point)の二つのパラメータを使う。スケールは実数1単位が整数何段階に対応するかを定める解像度であり、ゼロ点は実数0がどの整数に対応するかを定める基準点である。量子化はq = round(r / scale) + zero_pointで、逆量子化(dequantization)はr' = scale × (q - zero_point)で計算する。このとき丸めの過程で原本rと復元値r'の差である量子化誤差が不可避に生じ、この誤差をいかに小さく抑えるかがあらゆる量子化手法の核心的課題となる。
この範囲設定は特に活性値で敏感である。重みは学習が終わった後に値が固定され範囲を一度定めればよいが、活性値は入力に応じて推論ごとに分布が変わるため、代表性のある補正データで「典型的な範囲」を推定しておかなければならない。補正データが実際の運用入力とかけ離れていると推論時に範囲を外れる値が頻発して品質が落ちるため、補正セットの構成はPTQ品質を左右する実務的な急所となる。
ゼロ点の処理方式に応じて対称量子化(Symmetric)と非対称量子化(Asymmetric, Affine)に分かれる。対称量子化はゼロ点を0に固定し値の範囲を0を中心に対称と仮定するため演算が単純で高速だが、分布が片方に偏っている場合は表現範囲を浪費する。非対称量子化はゼロ点を自由に置いて偏った分布(例:ReLU出力のように負値のない活性値)をより精密に収めるが、ゼロ点補正演算が追加される。一般に0を中心に分布する重みには対称量子化を、非対称な分布をもつ活性値には非対称量子化を適用する混合戦略が多く用いられる。
格子の間隔を一定に置くか否かに応じて均一(uniform)量子化と非均一(non-uniform)量子化にも区分される。均一量子化は整数段階の間の実数間隔をすべて同一に置くためハードウェア整数演算との相性がよく、最も広く用いられる。一方、非均一量子化は値が集中する0付近に格子を密に、希薄な外側に疎に配置し、同じビットでより小さな誤差を得る。QLoRAが採用したNF4(NormalFloat4)は、重みが正規分布に従うという仮定のもとで各区間の確率質量が等しくなるよう格子を設計した非均一量子化の代表例であり、4ビットという極限条件でも情報損失を最小化する。
さらにスケールをどの単位で共有するかに応じて精度が大きく変わる。テンソル単位(per-tensor)量子化は一つのレイヤ全体に一つのスケールを使うため軽量だが、特定チャネルの値範囲がとりわけ広いと全体の解像度がそのチャネルに引きずられ誤差が大きくなる。一方チャネル単位(per-channel)量子化は出力チャネルごとに別々のスケールを置いてチャネルごとの分布差を吸収するため、重み量子化で精度を大きく高める。たとえば畳み込み・線形層の重みはチャネル単位で、活性値はテンソル単位で量子化する組み合わせが、精度と効率の均衡点として広く採用される。
| 区分軸 | 種類 | 特徴 | 主な適用対象 |
|---|---|---|---|
| ゼロ点処理 | 対称 / 非対称 | 対称は単純・高速、非対称は偏った分布に精密 | 重み / 活性値 |
| スケール共有 | per-tensor / per-channel | チャネル単位が精密、テンソル単位が軽量 | 活性値 / 重み |
| 精度 | INT8・INT4・FP16・BF16・FP8・FP4 | ビットが低いほど軽量・高速、誤差は増加 | サービング要求に応じて選択 |
3. 量子化方式の種類 — PTQとQAT
flowchart TB
M["事前学習済みモデル(FP32/FP16)"] --> B{"再学習の可否・精度目標"}
B -->|"再学習なしで高速に"| PTQ["PTQ: 事後学習量子化"]
B -->|"精度最優先・低ビット"| QAT["QAT: 量子化認識学習"]
PTQ --> CAL["少量の補正データ(calibration)で範囲推定"]
CAL --> PQ["重み・活性範囲を固定後に整数変換"]
QAT --> FQ["学習中に擬似量子化(fake quant)を挿入"]
FQ --> RT["逆伝播で量子化誤差まで学習・補正"]
PQ --> DEP["軽量モデルを配備"]
RT --> DEP
量子化を適用する時点に応じて二つの大きな流れが存在する。PTQ(Post-Training Quantization、事後学習量子化)はすでに学習が終わったモデルへ事後的に量子化を適用する方式である。全体の再学習が不要で、数百~数千件の補正データ(calibration data)だけで各レイヤの値範囲を推定しスケール・ゼロ点を算定する。コストが非常に低く高速なため現在のLLM配備の主流をなす。ただし再学習で誤差を矯正できないため、4ビット以下の攻撃的な低ビットでは精度低下が顕著になりうる。PTQはさらに、推論時点で活性値範囲をリアルタイムに算定する動的(Dynamic)方式と、補正段階で範囲をあらかじめ固定する静的(Static)方式に細分される。動的方式は実装が容易で正確だが推論時にオーバーヘッドがあり、静的方式は追加演算がなくより高速だが補正データの代表性に敏感である。
QAT(Quantization-Aware Training、量子化認識学習)は学習過程そのものに量子化を模する擬似量子化(fake quantization)ノードを挿入し、モデルが低ビットで表現されることを「あらかじめ知って」パラメータを適応させるようにする方式である。順伝播では量子化・逆量子化を経た値を使うが、丸め演算は微分不可能であるため逆伝播ではSTE(Straight-Through Estimator)で勾配を近似して通過させる。こうするとモデルが量子化誤差を損失関数に反映して自ら補正するため、特にINT4のように極端に低いビットや精度が敏感なタスクでPTQ比の損失を大きく減らす。代わりに全体(あるいは相当部分)の再学習コストと学習データ・パイプラインが必要であるという短所があり、コストと精度の間の典型的なトレードオフが成立する。
実務的には「まずPTQで適用してみて、目標精度に届かなければQATへ切り替える」という段階的戦略が一般的である。また重みだけを低ビットに下げ活性値は相対的に高いビットで維持する重み専用(weight-only)量子化がLLMサービングで広く用いられるが、これはLLM推論が演算量よりも重みをメモリから読み出す帯域幅によって支配されるためである。すなわち重みだけINT4に下げてもメモリ搭載量と帯域幅の負担が大きく緩和され、体感性能が向上する。
実際の量子化プロジェクトはおおむね次のような手順で進む。
- 目標定義:配備ハードウェア、許容精度の下限(SLA)、メモリ・レイテンシ予算をまず確定する。
- 手法選択:再学習の可否と目標ビットに応じてPTQ(動的/静的)とQATの中から一次候補を定める。
- 補正・学習:PTQは代表性のある補正データで範囲を算定し、QATは擬似量子化を挿入して再学習する。
- 評価・チューニング:評価セットで精度・レイテンシを測定し、敏感なレイヤは混合精度でビットを引き上げる。
- フォーマット・エンジン変換:目標推論エンジンが要求するフォーマット(GGUFなど)へ書き出しカーネル互換性を検証する。
- 配備・モニタリング:運用中の入力分布変化に伴う品質低下を継続観測し再補正の周期を設ける。
二つの方式の中間地帯として、レイヤごとに感度が異なる点を利用する混合精度(mixed-precision)量子化が重要に扱われる。すべてのレイヤを等しく4ビットに下げるのではなく、出力誤差への影響が大きい敏感なレイヤ(例:アテンションの一部の投影層や最初・最後のレイヤ)は8ビットで維持し、残りを4ビットに下げると、全体の平均ビットを下げながらも精度の崩壊を避けられる。このとき各レイヤの感度は量子化時の損失増加分や2階微分(Hessian)ベースの指標で事前に測定してビットを差配し、こうした感度分析(sensitivity analysis)は攻撃的な低ビット量子化を安全に推し進める核心的な道具となる。
4. LLM特化の量子化手法と外れ値問題
LLM量子化が一般のニューラルネットワークより厄介な根本原因は活性値の外れ値(outlier)である。トランスフォーマの特定チャネル(feature dimension)では他のチャネルより数十~数百倍大きい活性値が体系的に現れるが、テンソル単位量子化でこの巨大な値に範囲を合わせると残りの大多数の値の解像度がつぶれて誤差が爆発する。興味深い点は、この外れ値が無作為ではなく特定の少数次元に反復的・構造的に集中するという事実であり、これは逆説的に「外れ値だけを別に扱えば残りは安全に低ビットへ下げられる」という解法の手がかりとなる。この現象を解決するため、以下のように複数の専用手法が開発された。
flowchart TB
LLM["大規模言語モデル(重み・活性)"] --> OUT["活性の外れ値(outlier)問題"]
OUT --> M1["LLM.int8(): 外れ値のみFP16、残りはINT8の混合精度"]
OUT --> M2["SmoothQuant: 活性の難しさを重みへ移転"]
OUT --> M3["GPTQ: 2階(Hessian)情報で誤差補償量子化"]
OUT --> M4["AWQ: 活性基準で重要チャネルを保存(per-channelスケール)"]
M3 --> FMT["保存フォーマット(GGUFなど)・推論エンジンへ搭載"]
M4 --> FMT
M1 --> FMT
M2 --> FMT
LLM.int8()は活性値のうち閾値を超える少数の外れ値次元のみFP16で別に計算し、残り大部分はINT8で処理する混合精度(mixed-precision)分解であり、精度損失をほぼ無くしながらメモリを半分程度に減らす。SmoothQuantは量子化しにくい活性値の「難しさ」を数学的に等価な変換を通じて相対的に量子化しやすい重み側へ移転(migrate)させ、活性と重みをともにINT8へ安定的に下げる。
重み専用の低ビット分野ではGPTQとAWQが事実上の標準である。GPTQはレイヤごとに重みを量子化するが、2階微分情報(Hessian近似)を用いて一つのブロックを量子化する際に生じる誤差をまだ量子化されていない残りの重みに補償するよう更新し、3~4ビットでも性能低下を抑える。AWQ(Activation-aware Weight Quantization)は「すべての重みが等しく重要なわけではない」という観察から出発し、活性値の大きさを基準に重要度の高い少数チャネルを選択的に保護するチャネル別スケーリングを適用する。こうして量子化された重みはしばしばGGUF(llama.cpp系)のような保存フォーマットへパッケージングされ、さまざまな推論エンジンへ搭載される。一方QLoRAは重みを4ビットNF4(NormalFloat4)で凍結した状態で少数の低ランクアダプタ(LoRA)だけを学習する手法であり、単一GPUで数百億パラメータモデルの微調整を可能にし、量子化と効率的ファインチューニングを結合した代表事例として評価される。
これらのLLM量子化手法が共通して採用するもう一つの核心的な仕掛けがグループ単位(group-wise)量子化である。チャネル全体を一つのスケールで束ねると依然として誤差が大きく、値ごとにスケールを置くと保存効率が落ちるため、通常は重みを32個・64個・128個単位の小さなグループに分け、グループごとに別々のスケール(およびゼロ点)を与える。グループサイズが小さいほど精度は高まるがスケール保存のための付加ビット(overhead)が増えるため、GGUFの多様な「k-quant」変種のようにグループサイズとビットの組み合わせを変えた複数のプロファイルを提供し、利用者がメモリ予算と品質を天秤にかけられるようにする。結局、LLM量子化の実際の品質は「何ビットか」だけでなく「どの単位で、どの外れ値対応とともに量子化したか」によって決まる。
5. 比較と実際の適用事例
精度別の特性を比較すると選択のトレードオフが明確になる。INT8はFP32比でメモリを4分の1に減らしながらも精度損失がおおむね1%未満であるため「安全な既定値」として通る。INT4はGPTQ・AWQと結合すると標準ベンチマークで損失がおよそ1~3%p水準にとどまり、メモリボトルネックが深刻なLLMサービングの実用的な最適点(sweet spot)として評価される。その理由は、ビットを半分に減らすと表現可能な段階が指数関数的に減って誤差は大きくなる(INT8は256段階、INT4は16段階)が、LLM重みの冗長性(redundancy)が大きいため一定水準までは性能が耐えるからである。
| 精度 | ビット | FP32比メモリ | 特徴・用途 | 精度損失(傾向) |
|---|---|---|---|---|
| FP32 | 32 | 1倍(基準) | 学習の基本、高精度 | なし(基準) |
| FP16/BF16 | 16 | 1/2 | 学習・推論の混合精度、BF16は広い指数 | 軽微 |
| FP8 | 8 | 1/4 | 最新GPUがネイティブ支援、BF16に近接 | 小さい |
| INT8 | 8 | 1/4 | 汎用推論の標準、ハードウェア支援が広範 | おおむね1%未満 |
| INT4 | 4 | 1/8 | LLM重み専用(GPTQ/AWQ) | 約1~3%p |
| FP4(NVFP4など) | 4 | 1/8 | Blackwell級GPUの低精度推論 | 事例により小幅 |
具体的な事例として、70億(7B)パラメータ級のLLMはFP16で約1314GBを占め、消費者向けGPUにはぎりぎりだが、INT4へ量子化すると約3.54GBに減り、一般のノートPC・エッジ機器でも駆動が可能になる。700億(70B)級のモデルもBF16では約140GBが必要で複数GPUが必須だが、INT4へ下げると約35~40GB水準となり、単一の高仕様GPUへサービング範囲が広がる。モバイル領域ではQualcomm Hexagon NPU、Apple Neural EngineなどがINT8演算をハードウェアで加速し、オンデバイスの音声認識・翻訳・カメラAIがリアルタイムに動作する。データセンターではNVIDIA Hopper(H100)世代からFP8をテンソルコアがネイティブに支援し始め、これはBF16に近接した品質を維持しながらスループットと電力効率を引き上げ、大規模推論サービスの単価を下げる核心的手段となった。
ここで留意すべき微妙な点は、重み専用のINT4量子化が「演算自体を整数で速くすること」というより「メモリから読み出すデータ量を減らすこと」に近いという事実である。多くのLLM推論カーネルはINT4で保存された重みを読み込んだのち、演算直前にFP16へ逆量子化して乗算を行う。すなわち保存・転送は4ビットで行うが実際の計算は高精度で行われるため、演算量が支配的な大型バッチ(batch)状況よりも、メモリ帯域幅がボトルネックとなる小バッチ・低レイテンシのサービングで利得が際立つ。逆に活性値までINT8へ下げて整数行列積自体を加速する経路は、演算集約的なワークロードでより大きな効果を出す。したがって「どの量子化がより速いか」はワークロード特性に応じて変わるという点を設計時に必ず考慮しなければならない。
ビジョン・推薦の分野でも量子化は古くから実戦に投入されてきた。モバイル物体認識に使われるMobileNet系はINT8量子化時に精度低下を1%p前後に抑えつつ推論レイテンシとモデルサイズを大幅に減らし、バッテリーで駆動する端末でのリアルタイム処理を可能にする。大規模推薦システムでも埋め込みテーブルがメモリの大部分を占める特性上、埋め込みをINT8・INT4へ量子化してサービングコストを節減する事例が普遍化している。このように量子化の利得が最も劇的に現れる地点は、共通して「メモリ・帯域幅がボトルネックであり、多数の推論要求が反復される」サービング環境であることを確認できる。
6. 深化 — 低精度フォーマットの最新動向とハードウェアの共進化
量子化の最新動向は「整数(INT)から低精度浮動小数点(FP8・FP4)へ」、そして「ソフトウェア手法とハードウェア命令の共進化」に要約される。過去の量子化は主にINT8整数演算に依存したが、近年NVIDIA Hopper世代のFP8やBlackwell世代のFP4(NVFP4・MXFP4)のように低精度浮動小数点をテンソルコアが直接支援することで、同一ビット幅でも指数部を活用して広い動的範囲を確保する方向へ進化している。業界の報告によれば、Blackwell系でのFP4推論は前世代FP8比で数倍のスループット向上とトークンあたり電力消費の大幅な削減を示しつつ、一部の大型推論モデルでMMLUのようなベンチマークスコアの低下が0.1%p水準にとどまったという結果が提示される(ただしこうした数値はベンダー・特定モデル・サービングスタックによって変わるため、一般的な性能向上と断定するのは難しい)。
この流れとともに低精度フォーマットの標準化・エコシステム化も進展している。過去にはベンダーごとにFP8のビット配分(指数/仮数)がまちまちで相互運用が難しかったが、近年は業界コンソーシアムを通じてMX(Microscaling)系のFP8・FP4フォーマットが整理され、Hugging Face・vLLM・TensorRT-LLMなど主要な推論スタックがGPTQ・AWQ・FP8チェックポイントを共通に消費できる方向へ収束している。これは量子化が特定ライブラリに従属するトリックではなく、モデル交換・配備の標準レイヤとして定着しつつあることを示す。
研究の最前線では極端な低ビットである二値・三値(binary/ternary)量子化も活発である。重みを{-1, 0, +1}の三値で表現するBitNet系は乗算を加算で代替してエネルギー効率を最大化しようとする試みであり、特定の規模でFP16に近接した性能を報告した事例があるが、まだ一般化段階とみるのは早い。情報管理技術士の観点から重要な示唆は、量子化がもはやソフトウェアの後処理手法にとどまらず、チップ設計・命令セット・コンパイラ・推論エンジンが共に設計されるシステムレベルの課題へ拡張されたという点である。したがってモデル軽量化戦略は、特定の量子化アルゴリズムの選択を超え、目標ハードウェアがどの低精度フォーマットをネイティブに加速するかを併せて考慮する統合的な意思決定とならなければならない。
7. 考慮事項および示唆(技術士の観点)
精度-効率トレードオフの定量的管理:量子化はただの昼食ではなく、精度を一部差し出して効率を得る取引である。したがって導入前に必ず代表タスク・実データに基づく評価セットでビット別の性能を測定し、サービスが許容する精度の下限(SLA)をまず定義したうえで、その範囲内で最も低いビットを選ぶデータ駆動の意思決定が必要である。「とりあえずINT4」ではなく「検証されたINT8 → 届かなければQAT・混合精度」の段階的アプローチが安全である。
ハードウェア・推論エンジン適合性の検証:どれほど良い量子化フォーマットでも、目標ハードウェアがその演算を加速できなければ理論的利得は実質性能につながらない。配備対象(データセンターGPU、モバイルNPU、エッジMCU)が支援する精度・命令と推論エンジン(TensorRT、ONNX Runtime、llama.cppなど)のカーネル支援範囲を事前に確認し、フォーマットと手法を逆算しなければならない。
補正データと再現性・ガバナンス:PTQの品質は補正データの代表性に大きく左右されるため、実際の運用分布を反映した補正セットの構成とその出所・ライセンス管理が重要である。また量子化されたモデルもバージョン・ハッシュ・評価指標を併せて記録するMLOpsガバナンスに含め、軽量化による性能変化が追跡・監査可能であるようにしなければならない。
軽量化手法の相互補完的結合:量子化は知識蒸留(Knowledge Distillation)・枝刈り(Pruning)・低ランク分解と排他的な関係ではなく、直交的・補完的に結合する。たとえば蒸留で小さくした生徒モデルを再びINT4へ量子化しQLoRAで微調整するといった多段パイプラインが実務で最適な効率を出す。技術士は単一手法ではなく、要求性能・コスト・配備環境を総合した軽量化戦略ポートフォリオを設計できなければならない。
リスク・セキュリティ面の考慮:攻撃的な低ビット量子化は平均精度は維持しても少数の敏感な入力で予測が不安定になったり、公平性・安全性の指標が悪化したりしうる。特に医療・金融・自動運転など高リスク領域では、量子化前後のエッジケース・敵対的堅牢性(robustness)まで評価範囲に含めなければならない。
総所有コスト(TCO)と持続可能性の観点の展望:量子化の究極的価値は単なるモデルの縮小ではなく、推論単価とエネルギー消費の削減にある。生成AIサービスが大規模・常時化するにつれ推論コストが運用費の支配的項目となりつつあり、低精度演算はトークンあたり電力消費を数分の一に下げ、炭素排出と冷却コストまで減らす。したがって技術士は量子化を性能最適化手法を超えグリーンIT・持続可能性戦略の一部として位置づけ、モデルのライフサイクル全般のTCOの観点から軽量化投資の効果を説明できなければならない。
参考資料
- GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers — https://arxiv.org/abs/2210.17323
- AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration — https://arxiv.org/abs/2306.00978
- QLoRA: Efficient Finetuning of Quantized LLMs — https://arxiv.org/abs/2305.14314
- SmoothQuant: Accurate and Efficient Post-Training Quantization for Large Language Models — https://arxiv.org/abs/2211.10438
- LLM.int8(): 8-bit Matrix Multiplication for Transformers at Scale — https://arxiv.org/abs/2208.07339
- A Survey of Quantization Methods for Efficient Neural Network Inference — https://arxiv.org/abs/2103.13630
- PyTorch Quantization公式ドキュメント — https://pytorch.org/docs/stable/quantization.html
一言まとめ: モデル量子化は重み・活性値を低ビット整数・低精度浮動小数点へ変換してメモリ・演算・電力を減らす核心的な軽量化手法であり、PTQ・QATとGPTQ・AWQ・QLoRAなどのLLM特化手法、そしてFP8・FP4へ向かうハードウェアの共進化を、精度-効率トレードオフの観点から設計・検証しなければならない。