科技与AI

智谱揭晓Ox Alpha即GLM-5.3-Flash,十万颗国产芯片承担全部推理

智谱8月27日确认GLM-5.3-Flash全程在国产芯片集群上推理

智谱(Z.ai)8月27日确认,此前在OpenRouter等平台匿名上线、被开发者称作Ox Alpha的模型就是GLM-5.3-Flash。智谱同时说明,该模型的推理服务全程运行在一个由十万颗国产芯片组成的集群上。按智谱披露的用量,模型在正式发布前的匿名测试阶段已处理62万亿token;上线OpenRouter后头三天处理量超过11万亿token,首周用于编码场景的部分为10.3万亿token。定价方面,GLM-5.3-Flash每百万输入token收0.15美元、输出0.5美元,另有限时五折至0.075美元与0.25美元。基准成绩上,该模型Terminal-Bench 2.1得84.3分、DeepSWE得63.4分,分别高于DeepSeek-V4-Flash的82.7分和54.4分,并原生支持图片与视频输入。消息公布当日,智谱在港交所收涨超12%,报1160港元。国产算力此前多在训练环节和适配层面被提及,这次是把一笔全球规模的推理流量连同token量一起摆到台面上。

国产芯片过去在大模型上的公开叙事,多停留在完成适配、可以跑通的阶段,真正对外承接高并发商用推理的证据一直稀薄。智谱这次把承载主体、集群规模和token处理量一并说清楚,等于给国产替代补上了推理侧的实证:模型不是在实验环境里演示,而是在OpenRouter这类全球开发者平台上被真实调用了几十万亿token。对本栏此前写过的DeepSeek融资和Kimi K3底座而言,这是另一个维度的进展——前两者关乎资本与模型能力,这一件关乎算力底座能否脱离英伟达、独立支撑规模化服务。定价压到每百万输出token 0.5美元,基准分又领先DeepSeek-V4-Flash,说明成本优势并非以牺牲能力换来。

对国产芯片厂商而言,一个可对外引用的大规模推理案例比任何适配公告都更有说服力,采购方评估国产方案时有了参照。对模型市场而言,GLM-5.3-Flash把高分与低价放在同一款产品上,同价位段开源模型的报价空间被压缩,DeepSeek-V4-Flash首当其冲。对智谱自身,匿名测试期积累的62万亿token调用先于发布验证了需求,股价当日收涨超12%也反映出市场对这条路径的认可。对海外开发者,低价加上模型可直接在全球平台调用,切换成本主要落在效果验证一侧。

后续关注

一是智谱是否披露该集群的芯片供应商构成与单token成本口径,这决定了与英伟达方案的对比是否可核;二是OpenRouter等平台上GLM-5.3-Flash的调用量在限时五折结束后能否维持;三是同价位竞品,尤其是DeepSeek-V4-Flash,是否跟进降价或推出新版本;四是国产芯片在长上下文与多模态负载下的稳定性能否有第三方评测佐证。

信息来源

  1. South China Morning Post媒体报道 · en · 2026年8月27日发布
  2. 鉅亨網媒体报道 · zh · 2026年8月25日发布

GFT Finance 整理归纳公开信息并总结要点,不构成投资建议。数据以来源原文为准。