智谱发布 GLM-5.3-FlashX:速度提到 200 tokens/s

前段时间写过不少关于大模型的文章,先是 Cline 官宣 DeepSeek V4-Flash 免费用了,接着 匿名模型 Ox Alpha 被智谱认领为 GLM-5.3-Flash。9 月 18 日午间,智谱在官方公众号发了条简短公告,GLM-5.3-FlashX 上线,API 同步全面开放。核心信息就两行,最高生成速度 200 tokens/s,较 Flash 提升 5 倍,定价是原版的 2.5 倍。

FlashX 不是新模型,是 Flash 的提速档

先把定位说清楚,免得误会成又一波大版本更新。FlashX 与 Flash 用的是同一个基座,规格一个字没变。

  • 320B 总参数 MoE,每 token 激活 18B

  • 1M token 上下文,最大输出约 13.1 万

  • 原生多模态,图片、视频、文件、文本进,文本出

  • thinking 默认开启

第三方数据也能对上。Artificial Analysis 给 FlashX 的智能指数是 41.9,与 Flash 完全一致,Arena Elo 同为 1475。智谱官方的说法更直接,FlashX 是 Flash 家族的生产级高速度档位,速度差异来自 Infra 侧投入和推理优化,不动基座。

所以这次发布的本质是同一款模型拆成了两个 SKU,一个拼性价比,一个拼响应速度。

官方定价

国内站标准价,单位人民币 / 百万 tokens。

模型

上下文

输入

输出

缓存命中

缓存存储

输入模态

GLM-5.3

1M

8

28

2

限时免费

文本

GLM-5.3-Flash

1M

0.8

2.8

0.23

限时免费

图、视频、文件、文本

GLM-5.3-FlashX

1M

2

7

0.57

限时免费

图、视频、文件、文本

从 Flash 到 FlashX,输入 0.8 涨到 2,输出 2.8 涨到 7,缓存命中 0.23 涨到 0.57,整整齐齐 2.5 倍。国际版口径一致,OpenRouter、Z.AI、Vercel AI Gateway 等五个渠道都是 $0.37 输入 / $1.25 输出,缓存读取 $0.075。

放到大盘里看,FlashX 输入仍只有旗舰 GLM-5.3 的四分之一,输出不到旗舰的三成,比 DeepSeek V4.1 Flash(未命中 ¥1.0 / 输出 ¥4.0,高峰全项翻倍)贵一截。真要对价格敏感,Flash 的 0.8 / 2.8 还是全场最便宜的那一档,Qwen3.8-Flash 的 0.8 / 2.7 基本同价。

模型

输入(缓存未命中)

输出

缓存命中

峰谷价

GLM-5.3-Flash

¥0.8

¥2.8

¥0.23

GLM-5.3-FlashX

¥2.0

¥7.0

¥0.57

DeepSeek V4.1 Flash

¥1.0

¥4.0

¥0.02

高峰全项 ×2

Qwen3.8-Flash

¥0.8

¥2.7

200 tokens/s 是怎么跑出来的

比涨价更有信息量的是提速的实现方式。

GLM-5.3-Flash 8 月 26 日开源后,由超过 10 万张国产芯片组成的推理集群上线即被打满。9 月 17 日,智谱创始人唐杰发文披露,团队用两周完成了国产加速卡的全量部署,端到端吞吐提升 3.2 倍,而其中大部分优化工作是由 GLM-5.3 驱动的 Infra Agent 完成的。

工作方式大概是这样,工程师负责设定目标和审核关键变更,Infra Agent 提出诊断、内核补丁和推理栈修改,所有改动在正确性测试、链路追踪和端到端指标的密集反馈下验证。团队还给 Agent 建了分层验证接口,这套基于真实基础设施任务的可验证反馈环境,后续可以直接用于下一代模型的训练。唐杰的原话是「模型优化系统、系统服务模型」的循环已经开始运转。

落到结果上,智谱口径是单 token 推理成本已接近主流英伟达 GPU 的水平。这套东西叠加在一起,才有了 FlashX 的 200 tokens/s。

涨价的底气在哪

FlashX 是智谱第一次明确用「更快」收钱,背后是需求压不住了。

  • 10 万张国产芯片的集群上线即满载,智谱管理层在 9 月 16 日的分析师电话会上承认,需求持续超预期,算力一度成为收入增长的主要约束,目前短期已不是

  • 资金面,智谱在 7 月和 9 月分别完成 40 亿、50 亿美元再融资,年末 ARR 指引从 24 亿美元上调到 30 亿美元,当前全业务口径 ARR 已达 18 亿

  • 与海内外头部云服务商签署的收入分成协议将从 10 月起确认收入

  • 公告当天,港股智谱涨逾 5%

市场端的观察是,国产大模型的竞争逻辑正在切换,从单纯追求能力上限,转向同等智能水平下比推理效率和体验。8 月 26 日阿里的 Qwen3.8-Flash 走的是低价路线,智谱这次用 FlashX 把「快」做成了独立收费档,两条路开始分化。

Flash 还是 FlashX,怎么选

两款模型智能完全一致,选型只看一个问题,你的场景对时延有多敏感。

适合切到 FlashX 的场景:

  • Agent 循环和 Coding 工具里的流式输出,生成速度直接决定体感,200 tokens/s 的差距肉眼可见

  • 面向终端用户的在线对话产品,响应快就是留存

  • 高并发在线服务,单实例吞吐上去了,同等硬件能扛的 QPS 更高

继续留在 Flash 的场景:

  • 离线批处理、定时任务、数据清洗这类对延迟不敏感的活

  • 预算敏感的大调用量,Flash 的批量(Batch)通道价格约为主价一半

  • 缓存命中率高的 Agent 负载,缓存命中 ¥0.23 对 ¥0.57,差价也会累积

一句话总结,为速度付 2.5 倍差价值不值,取决于你的用户等不等得起。

接入方法

模型 ID 是 GLM-5.3-FlashX,国内走 bigmodel.cn,国际版走 z.ai,OpenRouter 上是 z-ai/glm-5.3-flashx。接口保持 OpenAI 兼容,原来跑 Flash 的代码把 model 换掉就能用,对话补全、工具调用、多模态字段全部兼容。建议把 stream 打开,不然感知不到这次升级的意义。

curl https://open.bigmodel.cn/api/paas/v4/chat/completions \
  -H "Authorization: Bearer $ZHIPU_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "GLM-5.3-FlashX",
    "messages": [
      {"role": "user", "content": "用一段话介绍你自己"}
    ],
    "stream": true
  }'

完整参数见官方文档 docs.bigmodel.cn。

写在最后

FlashX 本身没什么惊喜,智能没变、参数没变,变的只有速度和价格。真正值得留意的是它背后的生产方式,模型驱动 Agent 优化 Infra,Infra 反过来喂下一代模型,智谱把这个循环从 PPT 落到了生产集群上。当头部模型的能力差距越来越小,速度、价格和单位成本就成了新的战场,这次同一基座拆两个 SKU,受益的其实是开发者,按需选档就行。


未经允许不得转载:w3h5前端开发资源网 » 智谱发布 GLM-5.3-FlashX:速度提到 200 tokens/s

9 月 18 日智谱正式推出 GLM-5.3-FlashX。不是新基座,是 GLM-5.3-Flash 的生产级提速档,速度最高 200 tokens/s(快 5 倍),定价 2.5 倍(输入 ¥2 / 输出 ¥7)。背景是 10 万张国产芯片集群上线即被打满,智谱用 GLM-5.3 驱动的 Infra Agent 在两周内把吞吐做到 3.2 倍。文末附 Flash 与 FlashX 的选型建议和接入代码。 (0)