科技与AI

智谱上线GLM-5.3-FlashX:最高推理速度200 tokens/s

智谱9月18日上线GLM-5.3-FlashX API,标称最高200 tokens/s

据界面新闻9月18日消息,智谱推出GLM-5.3-FlashX并开放API,Model Key为GLM-5.3-FlashX,官方给出的最高推理速度为200 tokens/s。FlashX是GLM-5.3-Flash的高速版本。界面新闻8月26日报道,基础版GLM-5.3-Flash总参数为3200亿,是GLM-5系列首个原生多模态模型;其AA综合智能指数为57分,与Claude Opus 4.8持平,常规定价为GLM-5.3的十分之一、Opus 4.8的四十分之一,并已开源。South China Morning Post 8月27日报道,基础版就是此前匿名测试的Ox Alpha;该模型测试期间运行在由10万张国产芯片组成的集群上,在OpenRouter上线前三天处理量超过11万亿tokens。报道还称,消息公布当日智谱港股收涨逾12%,报1160港元。这些国产芯片集群和调用量数据均属于此前的GLM-5.3-Flash,现有来源没有说明FlashX采用相同部署,也未披露FlashX的正式定价和实际负载下的持续吞吐。

FlashX把GLM-5.3-Flash系列的产品卖点从开源和低价扩展到推理速度。最高200 tokens/s若能在实际业务负载下保持,将直接影响代码生成、智能体和实时对话的响应体验。不过,现有报道只给出官方最高值,没有提供测试条件、持续吞吐或硬件配置,因此还不能把这一速度归因于此前基础版使用的国产芯片集群。

开发者获得了一个面向低延迟调用的新API选项,但在正式定价、并发限制和真实业务基准公布前,尚不能准确比较其单位成本和稳定性能。对国产芯片厂商而言,10万张芯片集群仍是GLM-5.3-Flash基础版的案例;只有智谱确认FlashX的部署方案后,才能判断高速版是否构成新的国产算力商用案例。

后续关注

关注智谱是否公布FlashX的正式定价、测试口径、并发限制和持续吞吐,是否说明其部署芯片与基础版的关系,以及OpenRouter等平台是否上线FlashX并披露实际调用数据。

信息来源

  1. 界面新闻媒体报道 · zh · 2026年9月17日发布
  2. 界面新闻媒体报道 · zh · 2026年8月25日发布
  3. South China Morning Post媒体报道 · en · 2026年8月26日发布

GFT Finance 整理归纳公开信息并总结要点,不构成投资建议。数据以来源原文为准。