智谱官宣发布 GLM-5.3-Flash,Cline 继续免费用

之前写了 Cline官宣DeepSeek V4-Flash免费用了,之后 Cline 又上线了一个匿名免费模型 Ox Alpha,社区指纹分析都指向智谱。8 月 26 日晚上智谱正式认领了,Ox Alpha 就是 GLM-5.3-Flash,权重也一并开源。

来龙去脉

8 月 14 日,智谱发布 GLM-5.3 旗舰,只有文本版

8 月 20 日,一个叫 Ox Alpha 的模型匿名出现在 OpenRouter、OpenCode、Cline 和 Nous Research,全部免费,104 万 token 上下文,接受文本、图片、视频输入

8 月 21 日,开发者 Ben Davis 发推,DeepSWE 基准 10 个任务小样本通过率 80%,一天传遍全网。Stripe CEO Patrick Collison(前一天刚宣布收购 OpenRouter)试用后说 very impressive

两天后,Davis 自己补跑完整 113 个任务,掉到约 63%,"碾压"的说法他自己撤回

随后几天,社区靠 tokenizer 探测锁定 GLM 家族。同样的数字串,Ox Alpha 只花 29 个 token,DeepSeek 要花 98 个,视频编码方式和 API 报错码也都对上,甚至提前猜中了名字就叫 Flash

8 月 26 日晚,智谱官宣认领,同时在 Hugging Face 以 MIT 协议开源权重

glm5.3-flash.png 智谱官宣发布 GLM-5.3-Flash,Cline 继续免费用 AI大模型

OpenRouter 上它六天处理了约 42 万亿 token,调用量一度是第二名 DeepSeek 系的两倍多;在 OpenCode 连续六天霸榜,累计 50.3 万独立用户。

匿名盲测是智谱的老玩法了,2 月的 Pony Alpha 就是 GLM-5 的早期版本。先把品牌藏起来,让开发者凭手感评价,再公布身份。这次连名字都被社区提前猜中,算是把盲测玩成了一次大型公开验证。

GLM-5.3-Flash 是什么

规格上几个关键数:

320B 总参数,18B 激活(MoE 架构),45 层,上一代是 92 层,接近腰斩

GLM-5 系列首个原生多模态,文本、图片、视频进,文本出

上下文 104.86 万 token,最大输出 13.1 万

稀疏注意力加线性注意力的混合架构,长上下文算力约为 GLM-5.3 的三分之一,KV 缓存降到四分之一以下,这是 1M 上下文用得起的底气

thinking 默认开启且不能关闭

跑分用官方口径。DeepSWE v1.1 通过率 63.4%,正好对上社区完整复跑的 63%,比 GLM-5.2 的 46.2% 提升明显。Unsloth 的评价是以十分之一的价格全面超过 GLM-5.2,编程和 agent 任务逼近 Claude Opus 4.8。

智谱官方还披露,测试期的全部流量由超过 10 万张国产芯片承载,半导体研究机构 SemiAnalysis 的评价是英伟达的 CUDA 护城河再度受到考验。

使用方法

OpenRouter 上的 stealth/ox-alpha 已经换成正价条目,匿名白给的一周结束了。Cline 这边没有跟着收费。

一、Cline 依旧免费

身份揭晓后,Cline 免费模型列表里的位置延续给了 GLM-5.3-Flash,不收费。

装 Cline,VS Code 用户在扩展商店搜 Cline 安装,命令行用户执行 npm i -g cline

打开设置,Provider 选 Cline 官方免费模型,不需要自己注册 API key

模型列表里选 glm-5.3-flash 就能用了

免费通道可能随时调整,具体以应用内模型列表为准,趁免费赶紧用。

二、GLM Coding Plan

智谱给全体 Coding Plan 用户重置了额度,GLM-5.3-Flash 的可用额度是 GLM-5.3 的 3 倍,非高峰时段和全天周末点数减半。新用户每天有限量 7 天免费体验卡发放,想白嫖尽早去领。订阅后在 Claude Code 或者 Cline 里把模型切到 glm-5.3-flash 就能用,不用换工具。

三、API 直连

国内走智谱开放平台 bigmodel.cn,国际版走 z.ai,模型 ID 都是 glm-5.3-flash,标准 OpenAI 兼容格式,支持图片 URL 和 Base64 输入。官方定价每百万 token 输入 0.15、输出 0.50,缓存命中的输入只要 $0.03。算笔账,处理一份 200 页年报约 15 万 token 输入,成本不到 3 美分。OpenRouter 上也有,模型 ID z-ai/glm-5.3-flash。

官方推荐参数 temperature 设 1,top_p 设 0.95,reasoning effort 用 max。

四、自部署

MIT 协议意味着可以随便商用,权重在 Hugging Face 的 zai-org/GLM-5.3-Flash。不过 320B 的 MoE 即便激活参数少,显存需求也不是个人工作站能消化的,这条路适合有 GPU 集群的团队。

注意事项

匿名期的全免费已经收官,OpenRouter 转了正价,Cline 的免费口子还在但随时可能调,走 API 的话 $0.15 输入价也是主流模型里的最低一档

thinking 关不掉,回复自带推理过程,实际 token 消耗比表面价格高一些,跑长任务记得留余量

80% 那张跑分图是小样本,官方 63.4% 才是可参考的数,选型建议装上拿自己的项目实测

数据隐私方面,Ox Alpha 是目前唯一明确承诺预览期数据不用于训练的隐身模型,转正后按官方 API 条款执行,敏感代码该注意还是要注意

GLM-5.3-Flash 把多模态、1M 上下文、真开源和一个很低的 token 单价打包到了一起,日常编程和 agent 场景值得换上试试,自部署等生态起来再说。Coding Plan 的体验卡每天限量,想薅趁早。


未经允许不得转载:w3h5前端开发资源网 » 智谱官宣发布 GLM-5.3-Flash,Cline 继续免费用

匿名模型 Ox Alpha 登顶 OpenRouter 一周后,8 月 26 日被智谱认领为 GLM-5.3-Flash 并同步开源。320B 总参 18B 激活、原生多模态、1M 上下文,DeepSWE 官方跑分 63.4%。Cline 依旧免费,加上 Coding Plan 额度重置、$0.15/M 低价 API、MIT 自部署,都是低成本用上的路子。 (0)