NVIDIAは、DeepSeek AIが開発したMixture-of-Experts(MoE)言語モデル「DeepSeek-V4-Pro-0813」をベースに、NVFP4形式で量子化したモデルを公開しました。

このモデルは、NVIDIAのModel Optimizerを使用して量子化されています。特筆すべき点として、推論の加速に用いられるDSpark speculative decoding(投機的デコーディング)モジュールのドラフトヘッドについても、MXFP4からNVFP4へロスレスに変換されており、ターゲットモデルとドラフトモデルが単一のチェックポイント内で一貫した量子化設定を持つよう構成されています。

本モデルは、SGLangやvLLMでの推論に対応しています。NVIDIAは、このモデルがNVIDIAによって開発されたものではなく、特定の用途に合わせてNVIDIAが量子化およびパッケージングを行ったものであると説明しています。


出典: