各Qwen3-27B NVFP4变体的精度几乎相同,但实际运行时的显存占用、推理速度和MTP表现差异显著。
AI translation, not an official translation. Refer to the original for technical details.
Adapted from @Oluwaphilemon1Qwen3.8-27B NVFP4 各变体有趣之处在于,它们的精度差异其实并不大。 各版本出奇地接近。 更大的差异在实际运行时才会显现出来。 显存占用、推理速度、MTP支持。 如果你在为每一比特显存而苦苦挣扎,minima-ai/mnma_qwen3.8_27b_nvfp4 看起来是个不错的选择。 但它的缺点是不包含MTP,因此你会失去加速生成的一种主要手段。 NVIDIA的NVFP4构建版本确实包含MTP,如果速度是优先考量,这听起来是显而易见的选择。 但我的长上下文代码测试让这一结论变得不那么令人信服了。 MTP-4的速度仅比不使用MTP时快约2倍。 而它在RTX Pro 6000上仍然比Unsloth实现慢大约2.5到3倍。 这是一个相当显著的差距。 一个可能的解释是lm_head的量化方式不同。 NVIDIA版本对lm_head使用NVFP4量化。 Unsloth则将lm_head保留为FP8。 这一点很重要,因为MTP依赖目标模型的预测来接受推测性token。 如果对lm_head进行更激进的量化导致这些预测的可靠性下降,接受率就会降低。 一旦接受率下降,MTP理论上的加速效果就无法转化为同等的实际吞吐量。 因此,尽管这些Qwen3.8-27B NVFP4变体在精度上非常接近,实际推理体验却可能大相径庭。 就我的使用场景而言,我目前倾向于选择Unsloth的NVFP4构建版本。 并不是因为它的基础模型有什么神奇的优势,而是因为其量化选择与MTP行为的组合,对于实际的长上下文工作负载来说看起来更具吸引力。 这也正是我觉得本地推理有趣的地方。 两个构建版本可以使用相同的模型和相同的名义精度,但一旦开始拓展上下文和推测性解码,行为就会截然不同。 基准测试分数只能告诉你一部分信息。 真正的考验是:当你给模型一个庞大的代码库并让它连续工作一个小时时,会发生什么。 这正是我接下来要测试的内容: 长周期智能体编码。