OpenAI 这周会停掉的模型 GPT-5.3-Codex-Spark 是跑在 Cerebras 而不是 Nvidia 芯片上的。
Cerebras 的独门技术叫“晶圆级芯片”,也就是把一整个晶圆做成一个大芯片。一般做芯片不会用那么大的硅片。比如 Nvidia H100,一个晶圆可以切 86 片出来。对于由大量芯片构成的集群系统来说,芯片之间的通信是最大的性能瓶颈。然而住的远需要要打电话,但如果全在一个屋里,吼一声就行了。所以基于 Cerebras 的系统能达到很惊人的速度。
拿这玩意跑 Qwen3.8-27B 每秒能喷出超过 1500 个 Token。