前不久智谱刚认领 Ox Alpha,宣布正式发布GLM-5.3-Flash,价格比 DeepSeek V4 Flash 还要低。9月10日 DeepSeek 就发布 V4.1 Flash,依旧是低调发布,只是邮件通知。
大致意思是 V4.1 Flash 性能、费用、速度、总用时等各项指标上全面超越 V4 Pro。V4.1 Flash 正式上线之后 V4.1 Pro 上线之前,V4 Pro 的请求会全部路由到 V4.1 Flash,按 V4.1 Flash 单价计费。
![]()
DeepSeek V4.1 Flash 参数及架构
552B 骨干参数 MoE,1M token 上下文,原生多模态,HF 上的 pipeline 标记是 image-text-to-text。官方口径里的 552B 不含另一个 196B 参数的 Engram 记忆模块,那个是稀疏访问的。
架构细节:
Causal Encoder-Decoder(CED)非对称架构:40 层 = 20 层因果编码器 + 20 层解码器
prefill 每 token 激活 8B,decode 每 token 激活 16B,输入输出不对称
MoE 每层 1 个共享专家 + 384 个路由专家,每 token 激活 6 个
全局 KV Cache 890 bytes/token,约为 V4-Flash 的 1/4,相对 V1 缩小 437 倍;HBM 需求降到 1/4,SSD 需求降到 1/8
预训练用 45T tokens 多模态语料,稀疏注意力在 64K 序列长度训练,训练到 34T tokens 时扩到 1M 上下文
支持 reasoning_effort 整数 1–100,连续调节成本与准确率
项目 | V4-Flash | V4-Pro | V4.1-Flash |
骨干参数 | 284B | 1.6T | 552B |
每 token 激活 | 13B | 49B | 8B(prefill) / 16B(decode) |
上下文 | 1M | 1M | 1M |
License | MIT | MIT | MIT |
V4.1 Flash 总参数比 V4-Flash 大了近一倍,单次激活量反而更小,价格能降下来就是因为这个。
跑分
基准 | Opus-5.0 | GPT-5.6 Sol | K3 | GLM-5.3 | V4-Pro | V4.1-Flash |
GPQA Diamond | 93.4 | 94.1 | 92.9 | 88.1 | 92.4 | 90.9 |
HLE | 56.3 | 44.5 | 43.5 | 42.0† | 42.7† | 36.8(39.1†) |
Codeforces | — | — | — | — | 3348 | 3471 |
Terminal-Bench 2.1 | 89.1 | 88.8 | 88.3 | 88.2 | 87.9 | 90.6 |
Terminal-Bench 3.0 | 43.3 | 34.4 | 17.7 | 28.3 | 11.8 | 30.0 |
DeepSWE v1.1 | 74.0 | 73.0 | 67.5 | 66.9 | 62.7 | 74.2 |
CyberGym | — | 84.5 | 80.0 | 84.5 | 83.3 | 88.1 |
AutomationBench | 50.3 | 45.8 | 46.7 | 48.8 | 43.2 | 54.8 |
Agent's Last Exam | 28.6 | 26.7 | 27.6 | 28.5 | 25.7 | 31.8 |
HLE w/ tools | 63.6 | — | 59.8 | 62.5 | 60.0 | 63.9 |
† 表示 HLE 的纯文本子集。推理档统一用 reasoning_effort=100。
DeepSeek 官方口径是「性能、费用、速度、总用时全面超越 V4 Pro」。分项看,Agentic 和代码类确实领先:DeepSWE 74.2 对 62.7,Terminal-Bench 2.1 90.6 对 87.9,CyberGym 88.1 对 83.3,AutomationBench 54.8 对 43.2。
但纯推理和知识类反过来落后。HLE 36.8 对 42.7,SimpleQA-Verified 42.3 对 55.2,都是 V4.1 Flash 更低。国盛证券复述官方数据,19 项测评里 14 项超过 Pro,约 74%,不是全部。
这些分数全部来自官方自测,没有中立第三方复核。 技术报告自己的表 4 显示,只是换 scaffold,DeepSWE v1.1 的分数就在 65.5 到 74.2 之间波动;官方多 Agent 的结果也标注为 preliminary。Artificial Analysis、LMArena 目前都还没有 V4.1 Flash 的独立评分。
速度
社区实测的生成速度分布很散,160 / 284 / 287 / 300+ / 355–427 / 507 t/s 都有人报,差异来自任务类型、上下文长度、并发、是否含工具调用。官方没有公布统一的吞吐数字。
同一提示词写长文,V4.1 Flash 160 t/s、V4 Pro 50 t/s,约 3 倍;首 token 0.3s 对 1.1s
另一组 355–427 t/s,TTFT 178ms,对比 V4 Pro 63 t/s、766ms
定价
9 月 10 日 12:00 生效,单位人民币 / 百万 tokens。闲时缓存命中 ¥0.02、未命中 ¥1.0、输出 ¥4.0;高峰价翻倍,也就是 ¥0.04 / ¥2.0 / ¥8.0。高峰时段是周一至周五 9:00–12:00、14:00–18:00,其余含周末全天算空闲。
和旧价比,降幅差别很大。缓存命中从 0.05 砍到 0.02,降 60%;未命中 1.5→1.0,降 33%;输出只从 4.5 动到 4.0,降 11%。缓存命中降幅最大,因为 Agent 场景里系统提示词、历史对话、RAG 前缀常占输入 90% 以上,缓存命中率能到 99%+,账单大头就在这一项。
GLM-5.3-Flash 价格对比
GLM-5.3-Flash 国内站标准价是 ¥0.8 输入 / ¥2.8 输出 / ¥0.23 缓存命中,没有峰谷。
口径 | DeepSeek 闲时 | GLM-5.3-Flash | 谁便宜 |
缓存命中输入 | ¥0.02 | ¥0.23 | DeepSeek 便宜约 10 倍 |
未命中输入 | ¥1.0 | ¥0.8 | GLM 略便宜 |
输出 | ¥4.0 | ¥2.8 | GLM 便宜,DeepSeek 贵 43% |
峰值全项 ×2 | ×2 | 无峰谷 | DeepSeek 明显更贵 |
缓存命中这一项 DeepSeek 便宜约 10 倍,但未命中输入和输出两项都比 GLM 贵,峰值时段还要再翻倍。整体谁更便宜,取决于缓存命中率和调用时段。
白天工时正好压在高峰上,批量任务、后台任务挪到晚间和周末能直接省一半。美洲团队要反过来算,01:00–04:00 UTC 等于美东 21:00–24:00,正是批处理时段,反而落在高峰里。
总用时
总用时由多轮推理、工具调用、文件读写一起决定,单价低的模型未必更快。实测里 V4.1 Flash 做 3D 城市生成器,LLM 推理只花 18 分钟,工具调用花了 83 分钟,总时几乎全被工具调用吃掉。
DeepSeek 把「总用时」和性能、费用、速度并列,盯的是工具调用正确率和步数。对 Agent 用户,总用时比 token 单价更影响体感。
V4 Pro 下线
DeepSeek 计划 9 月 14 日 12:00 下线 V4 Pro。届时 deepseek-v4-pro 的请求会自动路由到 V4.1 Flash,并按 Flash 单价计费。
争议的起点是一条推文:DeepSeek Harness 团队崔添翼 9 月 9 日在 X 上发消息,浏览量 70 万+,很多开发者是刷到这条推文才知道自己调用的 V4 Pro 要被换掉。
具体问题有三个:通知不到 48 小时、没有并行迁移期、消息通过社区群发布而不是 API changelog。
有人直接回复「请不要这样做」
要求新旧模型用不同 model ID,并给至少两周缓冲期
有科研团队在用 DeepSeek-V4-Pro-0813 做研究,论文没完成,模型撤掉后实验无法延续和复现,希望保留独立端点
有人认为只比了 Agent 性能,忽略了非 Agent 场景
Hacker News 上有人说「我需要又快又便宜又一致的东西」,也有人说「在 V4 Pro 上验证过工作流的用户,不想突然在生产上试 V4.1 Flash」
官方解释是「继续以更高价、更慢速度提供更弱的 V4 Pro 已不合适」。这个说法社区认,但接受不了执行方式。对比来看,OpenAI 关停 Sora API 提前 6 个月发了正式 deprecation notice,DeepSeek 只给了不到 48 小时。
也有人觉得这是免费升级还降价了,分歧在于手上有没有已经验证过的生产工作流。
内测期还有两个已知 bug:英文提问偶尔返回中文;开联网搜索时语言不一致,搜到什么语言就用什么语言回答。
使用方法
WorkBuddy 国内版已全量接入,两周限时折扣。据用户实拍,模型列表里 Deepseek-V4.1-Flash 的倍率是 0.03x,带独家优惠标签,GLM-5.3-Flash 是 0.06x。0.03x 是平台积分倍率不是 API 单价,换算不出「便宜一半」,以客户端实际显示为准。同一列表里的 Hy3、Hy4 preview 是腾讯混元,跟 DeepSeek 无关。
腾讯云 TokenHub、ima、CodeBuddy、OpenCode 同步接入,OpenCode Go 套餐提供 4 倍额度。
API 的 base_url 不变,还是 https://api.deepseek.com,保持 OpenAI 兼容。正式模型名简化为 deepseek-flash,旧名 deepseek-v4-flash、deepseek-v4-flash-vision-exp 会自动路由过来。
权重已按 MIT 协议开源,HF 和 ModelScope 都发了,48 个分片,技术报告一并放出。官方原话是自部署需要约 2000 张 GPU 加存储集群,对多数团队来说,552B MoE 是「能下载」而不是「能跑」。
注意事项
9 月 14 日之前,拿真实流量跑一遍回归测试,重点看结构化输出的格式漂移,JSON 和函数调用最容易出问题。还没在 V4 Pro 上验证过的非 Agent 场景,直接切生产有风险。跑分也都是官方自测,第三方评分还没出。
参考文献:
Hugging Face 模型卡:https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash (2026-09-10,含完整评测表与架构说明)
技术报告:https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash/blob/main/DeepSeek_V41_Tech_Report.pdf
官方公告《DeepSeek V4.1 Flash:更强、更快、更普惠》:https://www.deepseek.com/news/deepseek-v4-1-flash/ (2026-09-10)
DeepSeek API 定价页:https://api-docs.deepseek.com/quick_start/pricing
智东西/凤凰网科技(架构与生态最全):https://tech.ifeng.com/c/8wJ8zIXEntx (2026-09-10)
36氪·InfoQ(V4 Pro 静默路由争议):https://www.36kr.com/p/3977115918840065 (2026-09-10)
潮新闻/钱江晚报(WorkBuddy 全量接入与两周优惠):https://www.toutiao.com/article/7683819834974503443/ (2026-09-10)
未经允许不得转载:w3h5前端开发资源网 » DeepSeek V4.1 Flash发布:缓存命中价降至¥0.02/M,V4 Pro将于14日下线
w3h5前端开发资源网