本地跑大模型的同学,可以试一下新出的推理引擎 Strata(github.com/Niko1221/Strata)。
Strata 是专为 Qwen3.8-Flash-Next 开发的,针对模型做了深度优化。微博群里的同学实际试了一下:用 RTX 3090 跑 Qwen3.8-Flash-Next IQ3_S,短问答输出速度能到 67 tok/s,而同样硬件下 llama.cpp 只有 20 tok/s。
我看了一下 Paper,Strata 针对 Qwen3.8-Flash-Next 的特点,把模型权重拆开:显存放常驻计算部分和热点 experts,内存放路由 experts,SSD 上放 n-gram embedding 表,通过系统页缓存提前读取所需行。缓存命中的 experts 直接由 GPU 计算,未命中的则由 CPU 和 GPU 分担,并且尽可能让计算和数据搬运同时进行。为了让 CPU 算的更快,Strata 甚至还专门针对 Q2_0 量化写了 AVX-512 VNNI 内核。
因为只需要把权重的很少一部分放在显存里,其余放在内存和 SSD,所以 Strata 甚至不需要 RTX 3090 这样 24G 的卡,作者自己用 12G 的 RTX 5070 跑 IQ3_XXS 的 Qwen3.8-Flash-Next 也能有 65.6 tok/s。