这个 Qwen 3.8-27B-QUASAR-NVFP4 的模型我部署了2个小时搞定了,我最后还加了 DFlash2
这个 Qwen 3.8-27B-QUASAR-NVFP4 的模型我部署了2个小时搞定了,我最后还加了 DFlash2 K=7 的投机解码算法,效果一般, 只有 16 ~ 27 Tokens
这个论文优化的好处是,Qwen3.8 的上下文可以干到1M,缺点是 DFlash2 的草稿接受率只有21%,太低了
我一会按照大佬 @ElrondGcn 提供的思路,用SGLang +
Wei @wei_wang Qwen3.8-27B 又出现了一个很值得测试的新量化。
这次是 QUASAR-QAT/Qwen3.8-27B-QUASAR-NVFP4。
- 它和普通 NVFP4 有什么区别
常见 PTQ 会在模型训练完成后,直接把高精度权重压成低精度。
QUASAR 使用 Quantization-Aware Distillation,让量化模型在 NVFP4 状态下继续向原始 BF16 模型学习。
