前段时间写过不少关于大模型的文章,先是 Cline 官宣 DeepSeek V4-Flash 免费用了,接着 匿名模型 Ox Alpha 被智谱认领为 GLM-5.3-Flash。9 月 18 日午间,智谱在官方公众号发了条简短公告,GLM-5.3-FlashX 上线,API 同步全面开放。核心信息就两行,最高生成速度 200 tokens/s,较 Flash 提升 5 倍,定价是原版的 2.5 倍。
FlashX 不是新模型,是 Flash 的提速档
先把定位说清楚,免得误会成又一波大版本更新。FlashX 与 Flash 用的是同一个基座,规格一个字没变。
320B 总参数 MoE,每 token 激活 18B
1M token 上下文,最大输出约 13.1 万
原生多模态,图片、视频、文件、文本进,文本出
thinking 默认开启
第三方数据也能对上。Artificial Analysis 给 FlashX 的智能指数是 41.9,与 Flash 完全一致,Arena Elo 同为 1475。智谱官方的说法更直接,FlashX 是 Flash 家族的生产级高速度档位,速度差异来自 Infra 侧投入和推理优化,不动基座。
所以这次发布的本质是同一款模型拆成了两个 SKU,一个拼性价比,一个拼响应速度。
官方定价
国内站标准价,单位人民币 / 百万 tokens。
模型 | 上下文 | 输入 | 输出 | 缓存命中 | 缓存存储 | 输入模态 |
GLM-5.3 | 1M | 8 | 28 | 2 | 限时免费 | 文本 |
GLM-5.3-Flash | 1M | 0.8 | 2.8 | 0.23 | 限时免费 | 图、视频、文件、文本 |
GLM-5.3-FlashX | 1M | 2 | 7 | 0.57 | 限时免费 | 图、视频、文件、文本 |
从 Flash 到 FlashX,输入 0.8 涨到 2,输出 2.8 涨到 7,缓存命中 0.23 涨到 0.57,整整齐齐 2.5 倍。国际版口径一致,OpenRouter、Z.AI、Vercel AI Gateway 等五个渠道都是 $0.37 输入 / $1.25 输出,缓存读取 $0.075。
放到大盘里看,FlashX 输入仍只有旗舰 GLM-5.3 的四分之一,输出不到旗舰的三成,比 DeepSeek V4.1 Flash(未命中 ¥1.0 / 输出 ¥4.0,高峰全项翻倍)贵一截。真要对价格敏感,Flash 的 0.8 / 2.8 还是全场最便宜的那一档,Qwen3.8-Flash 的 0.8 / 2.7 基本同价。
模型 | 输入(缓存未命中) | 输出 | 缓存命中 | 峰谷价 |
GLM-5.3-Flash | ¥0.8 | ¥2.8 | ¥0.23 | 无 |
GLM-5.3-FlashX | ¥2.0 | ¥7.0 | ¥0.57 | 无 |
DeepSeek V4.1 Flash | ¥1.0 | ¥4.0 | ¥0.02 | 高峰全项 ×2 |
Qwen3.8-Flash | ¥0.8 | ¥2.7 | — | — |
200 tokens/s 是怎么跑出来的
比涨价更有信息量的是提速的实现方式。
GLM-5.3-Flash 8 月 26 日开源后,由超过 10 万张国产芯片组成的推理集群上线即被打满。9 月 17 日,智谱创始人唐杰发文披露,团队用两周完成了国产加速卡的全量部署,端到端吞吐提升 3.2 倍,而其中大部分优化工作是由 GLM-5.3 驱动的 Infra Agent 完成的。
工作方式大概是这样,工程师负责设定目标和审核关键变更,Infra Agent 提出诊断、内核补丁和推理栈修改,所有改动在正确性测试、链路追踪和端到端指标的密集反馈下验证。团队还给 Agent 建了分层验证接口,这套基于真实基础设施任务的可验证反馈环境,后续可以直接用于下一代模型的训练。唐杰的原话是「模型优化系统、系统服务模型」的循环已经开始运转。
落到结果上,智谱口径是单 token 推理成本已接近主流英伟达 GPU 的水平。这套东西叠加在一起,才有了 FlashX 的 200 tokens/s。
涨价的底气在哪
FlashX 是智谱第一次明确用「更快」收钱,背后是需求压不住了。
10 万张国产芯片的集群上线即满载,智谱管理层在 9 月 16 日的分析师电话会上承认,需求持续超预期,算力一度成为收入增长的主要约束,目前短期已不是
资金面,智谱在 7 月和 9 月分别完成 40 亿、50 亿美元再融资,年末 ARR 指引从 24 亿美元上调到 30 亿美元,当前全业务口径 ARR 已达 18 亿
与海内外头部云服务商签署的收入分成协议将从 10 月起确认收入
公告当天,港股智谱涨逾 5%
市场端的观察是,国产大模型的竞争逻辑正在切换,从单纯追求能力上限,转向同等智能水平下比推理效率和体验。8 月 26 日阿里的 Qwen3.8-Flash 走的是低价路线,智谱这次用 FlashX 把「快」做成了独立收费档,两条路开始分化。
Flash 还是 FlashX,怎么选
两款模型智能完全一致,选型只看一个问题,你的场景对时延有多敏感。
适合切到 FlashX 的场景:
Agent 循环和 Coding 工具里的流式输出,生成速度直接决定体感,200 tokens/s 的差距肉眼可见
面向终端用户的在线对话产品,响应快就是留存
高并发在线服务,单实例吞吐上去了,同等硬件能扛的 QPS 更高
继续留在 Flash 的场景:
离线批处理、定时任务、数据清洗这类对延迟不敏感的活
预算敏感的大调用量,Flash 的批量(Batch)通道价格约为主价一半
缓存命中率高的 Agent 负载,缓存命中 ¥0.23 对 ¥0.57,差价也会累积
一句话总结,为速度付 2.5 倍差价值不值,取决于你的用户等不等得起。
接入方法
模型 ID 是 GLM-5.3-FlashX,国内走 bigmodel.cn,国际版走 z.ai,OpenRouter 上是 z-ai/glm-5.3-flashx。接口保持 OpenAI 兼容,原来跑 Flash 的代码把 model 换掉就能用,对话补全、工具调用、多模态字段全部兼容。建议把 stream 打开,不然感知不到这次升级的意义。
curl https://open.bigmodel.cn/api/paas/v4/chat/completions \
-H "Authorization: Bearer $ZHIPU_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "GLM-5.3-FlashX",
"messages": [
{"role": "user", "content": "用一段话介绍你自己"}
],
"stream": true
}'完整参数见官方文档 docs.bigmodel.cn。
写在最后
FlashX 本身没什么惊喜,智能没变、参数没变,变的只有速度和价格。真正值得留意的是它背后的生产方式,模型驱动 Agent 优化 Infra,Infra 反过来喂下一代模型,智谱把这个循环从 PPT 落到了生产集群上。当头部模型的能力差距越来越小,速度、价格和单位成本就成了新的战场,这次同一基座拆两个 SKU,受益的其实是开发者,按需选档就行。
未经允许不得转载:w3h5前端开发资源网 » 智谱发布 GLM-5.3-FlashX:速度提到 200 tokens/s
w3h5前端开发资源网