我们在一个超过10万块国产AI加速器组成的集群上,从零搭建了一套完整的生产级推理服务。GLM-5.3-Flash的所有生产推理任务都在该系统上运行。

这并非易事。此前没有人将国产加速器集群部署到如此规模。我们面临着芯片内存容量和带宽相对有限的挑战,同时还需支持全新的模型架构、百万token上下文窗口以及多模态请求。生态系统尚不成熟,内核支持不完整,许多本应有文档说明的内容只能靠猜测。最终,工作得以完成。

GLM-5.3-Flash通过匿名模型名Ox-Alpha在OpenCode和OpenRouter平台上接受了真实用户测试。上线一周内,它就成为两个平台上使用量最大的模型,六天内处理了超过62万亿个token。

[..]

综合来看,这些优化将端到端服务性能提升了约3倍。硬件利用效率和每token成本均达到与主流NVIDIA GPU相当的水平。

他们正在接近目标。