之前写了 Cline官宣DeepSeek V4-Flash免费用了,之后 Cline 又上线了一个匿名免费模型 Ox Alpha,社区指纹分析都指向智谱。8 月 26 日晚上智谱正式认领了,Ox Alpha 就是 GLM-5.3-Flash,权重也一并开源。
来龙去脉
8 月 14 日,智谱发布 GLM-5.3 旗舰,只有文本版
8 月 20 日,一个叫 Ox Alpha 的模型匿名出现在 OpenRouter、OpenCode、Cline 和 Nous Research,全部免费,104 万 token 上下文,接受文本、图片、视频输入
8 月 21 日,开发者 Ben Davis 发推,DeepSWE 基准 10 个任务小样本通过率 80%,一天传遍全网。Stripe CEO Patrick Collison(前一天刚宣布收购 OpenRouter)试用后说 very impressive
两天后,Davis 自己补跑完整 113 个任务,掉到约 63%,"碾压"的说法他自己撤回
随后几天,社区靠 tokenizer 探测锁定 GLM 家族。同样的数字串,Ox Alpha 只花 29 个 token,DeepSeek 要花 98 个,视频编码方式和 API 报错码也都对上,甚至提前猜中了名字就叫 Flash
8 月 26 日晚,智谱官宣认领,同时在 Hugging Face 以 MIT 协议开源权重
![]()
OpenRouter 上它六天处理了约 42 万亿 token,调用量一度是第二名 DeepSeek 系的两倍多;在 OpenCode 连续六天霸榜,累计 50.3 万独立用户。
匿名盲测是智谱的老玩法了,2 月的 Pony Alpha 就是 GLM-5 的早期版本。先把品牌藏起来,让开发者凭手感评价,再公布身份。这次连名字都被社区提前猜中,算是把盲测玩成了一次大型公开验证。
GLM-5.3-Flash 是什么
规格上几个关键数:
320B 总参数,18B 激活(MoE 架构),45 层,上一代是 92 层,接近腰斩
GLM-5 系列首个原生多模态,文本、图片、视频进,文本出
上下文 104.86 万 token,最大输出 13.1 万
稀疏注意力加线性注意力的混合架构,长上下文算力约为 GLM-5.3 的三分之一,KV 缓存降到四分之一以下,这是 1M 上下文用得起的底气
thinking 默认开启且不能关闭
跑分用官方口径。DeepSWE v1.1 通过率 63.4%,正好对上社区完整复跑的 63%,比 GLM-5.2 的 46.2% 提升明显。Unsloth 的评价是以十分之一的价格全面超过 GLM-5.2,编程和 agent 任务逼近 Claude Opus 4.8。
智谱官方还披露,测试期的全部流量由超过 10 万张国产芯片承载,半导体研究机构 SemiAnalysis 的评价是英伟达的 CUDA 护城河再度受到考验。
使用方法
OpenRouter 上的 stealth/ox-alpha 已经换成正价条目,匿名白给的一周结束了。Cline 这边没有跟着收费。
一、Cline 依旧免费
身份揭晓后,Cline 免费模型列表里的位置延续给了 GLM-5.3-Flash,不收费。
装 Cline,VS Code 用户在扩展商店搜 Cline 安装,命令行用户执行 npm i -g cline
打开设置,Provider 选 Cline 官方免费模型,不需要自己注册 API key
模型列表里选 glm-5.3-flash 就能用了
免费通道可能随时调整,具体以应用内模型列表为准,趁免费赶紧用。
二、GLM Coding Plan
智谱给全体 Coding Plan 用户重置了额度,GLM-5.3-Flash 的可用额度是 GLM-5.3 的 3 倍,非高峰时段和全天周末点数减半。新用户每天有限量 7 天免费体验卡发放,想白嫖尽早去领。订阅后在 Claude Code 或者 Cline 里把模型切到 glm-5.3-flash 就能用,不用换工具。
三、API 直连
国内走智谱开放平台 bigmodel.cn,国际版走 z.ai,模型 ID 都是 glm-5.3-flash,标准 OpenAI 兼容格式,支持图片 URL 和 Base64 输入。官方定价每百万 token 输入 0.15、输出 0.50,缓存命中的输入只要 $0.03。算笔账,处理一份 200 页年报约 15 万 token 输入,成本不到 3 美分。OpenRouter 上也有,模型 ID z-ai/glm-5.3-flash。
官方推荐参数 temperature 设 1,top_p 设 0.95,reasoning effort 用 max。
四、自部署
MIT 协议意味着可以随便商用,权重在 Hugging Face 的 zai-org/GLM-5.3-Flash。不过 320B 的 MoE 即便激活参数少,显存需求也不是个人工作站能消化的,这条路适合有 GPU 集群的团队。
注意事项
匿名期的全免费已经收官,OpenRouter 转了正价,Cline 的免费口子还在但随时可能调,走 API 的话 $0.15 输入价也是主流模型里的最低一档
thinking 关不掉,回复自带推理过程,实际 token 消耗比表面价格高一些,跑长任务记得留余量
80% 那张跑分图是小样本,官方 63.4% 才是可参考的数,选型建议装上拿自己的项目实测
数据隐私方面,Ox Alpha 是目前唯一明确承诺预览期数据不用于训练的隐身模型,转正后按官方 API 条款执行,敏感代码该注意还是要注意
GLM-5.3-Flash 把多模态、1M 上下文、真开源和一个很低的 token 单价打包到了一起,日常编程和 agent 场景值得换上试试,自部署等生态起来再说。Coding Plan 的体验卡每天限量,想薅趁早。
未经允许不得转载:w3h5前端开发资源网 » 智谱官宣发布 GLM-5.3-Flash,Cline 继续免费用
w3h5前端开发资源网