Asta Lab · 全栈情报站AI FULL-STACK INTELLIGENCE每日 · 全栈 · 精选

AstaNews

AI 全栈每日情报

NVIDIA releases NVFP4-quantized MiniMax-M3 (428B MoE, 1M context) on Hugging Face

先说这条为什么值得停下来:长上下文、多模态的大模型最难的从来不是能力,而是「跑得起」。428B 参数、100 万 token 上下文,光是把权重和 KV cache 塞进显存就是一道门槛。NVIDIA 这次做的,是把 MiniMax-M3 用 NVFP4 量化到 4-bit,让同一个模型占用的磁盘和显存相比 FP8 版本再砍掉约一半——对显卡数量受限、又想跑长上下文的人,这是实打实降门槛的一步。 背景上需要桥接两个名词。MiniMax-M3 本身是一个 Mixture-of-Experts(MoE,混合专家)多模态模型:总参数 428B,但每处理一个 token 只激活其中约 23B(官方写作 A23B),所以推理时的实际算力开销远小于「428B」这个数字看上去的样子;它还能吃文本、图像和视频(最长约 30 分钟),上下文窗口 100 万 token。这次发布的不是新模型,而是 NVIDIA 对它做的量化版。 技术内核是 NVFP4。常见的部署精度是 FP8(8-bit),NVFP4 把权重和激活进一步压到 4-bit,量化用的是 NVIDIA 自己的 nvidia-modelopt 工具(v0.44.0)。精度减半最直接的收益就是体积减半:相比 FP8,磁盘和显存占用再省约 2 倍。这套低精度格式是为 Blackwell 架构 GPU 的执行路径设计的,目前给出的推理运行时是 vLLM(需要带 MiniMax-M3 NVFP4 支持的 nightly 构建)。 量化最怕的是「省了显存、掉了能力」,而这条的关键数字恰恰说明代价很小。NVFP4 对比 FP8 在多项基准上的落差都极小:GPQA Diamond 92.53→91.92,AA-LCR 76.62→75.60,τ²-Telecom 92.22→91.89,MMMU-Pro 71.97→71.01,SciCode 49.90→49.70。五项里没有一项掉超过一个多点,多数在零点几的量级——也就是说,体积砍半换来的精度损失基本可以忽略。 对谁有用?最直接是做本地/私有部署、或者想用更少 Blackwell 卡跑长上下文与多模态推理的团队:同一个模型,显存预算可以低很多。它也是「超大模型靠激进量化下沉到更可及硬件」这条趋势上的一个具体样本,4-bit 几乎无损这件事本身就有参考价值。 诚实的保留有几点。一是许可:这是 MiniMax Community License,仅限非商业用途,商用团队用不了。二是这些基准对比是模型卡里随发布给出的,是 FP8 与 NVFP4 的相对比较,不是与 BF16 原始精度或第三方独立评测的对照,绝对水平和「真实无损」程度仍要看更广的验证。三是它只是量化版,不代表 MiniMax-M3 本体在各自报基准上的客观排名。原文未给出具体的显存占用绝对数值、吞吐数据,以及除 vLLM 外的框架支持情况。