本地大模型的显存壁垒,今天被正式宣告物理终结了, 单张 24G 的 RTX 4090,竟然真把 125B 的

本地大模型的显存壁垒,今天被正式宣告物理终结了, 单张 24G 的 RTX 4090,竟然真把 125B 的 Qwen 3.8 Flash Next 给跑起来了, 而且上下文直接拉到了 25 万,解码速度稳在每秒 21 个词

以前跑这种百亿千亿级的巨无霸,动辄要租几张 A100 数据中心集群,

但这次海外极客在 Ubuntu 上用一张普通 4090

原链接