9 月 15 日,TypeSafe AI 发布了一个叫 Jev 的模型。它最容易被记住的特征,是它不会写字。不聊天,不写邮件,不解释,不生成代码。你给它一段状态,再给一组预先定义的问题,它返回一串程序可以直接消费的判断。
这个用户是否愤怒?0.91 该由哪个部门处理?technical,0.87 这条消息是否紧急?0.994
发布当天它在 Hacker News 冲上首页,拿到 1893 分和 496 条评论,5 天里 Forbes、TechCrunch、36 氪跟进了报道,LangChain、Vercel 出了官方集成,社区还长出了好几个开源复刻。一个不发标准跑分的模型,靠「不说话」刷了屏。
Jev 是什么
TypeSafe 给它起的名字叫 System One Model,取自卡尼曼《思考,快与慢》。系统 1 是快而直觉的判断,系统 2 是慢而费力的推理。带思维链的推理模型是系统 2,Jev 只做系统 1。官方对它的定义是「状态输入、类型化概率决策输出」,创始人 Diogo Almeida 的说法更形象,就是一次「前沿智能的函数调用」。
「Jev」这个名字来自经济学家杰文斯。1865 年他提出杰文斯悖论,蒸汽机效率提高后,英国煤耗不降反升,因为用得起的场景变多了。TypeSafe 的赌注一样,单次判断便宜两个数量级后,被塞进软件的调用量会指数级增长。
公司背景也不简单。Almeida 是 InstructGPT 论文联合作者,OpenAI 把他列进 GPT-4 贡献名单的「基础 RLHF 工作」一栏。TypeSafe 由他和 Erik Gafni、Sasha Sheng 在 2024 年创立,本次以 4000 万美元种子轮出场,DCVC 领投,Forbes 引述匿名信源称估值 2 亿美元。
三种判断原语
Jev 的全部能力只有三种问题,返回值固定,永远可解析。
原语 | 用途 | 返回值 |
Choice | 从一组选项里选一个 | 选中项、完整概率分布、置信度 |
Score | 沿一条有顺序的量表打分 | 分数(可落在两档之间)、置信度 |
Noul | 判断一个条件是否成立 | 一个 0 到 1 的概率 |
多个问题放进同一个请求会并行执行,互相看不到对方的答案,加问题几乎不增加延迟。官方在 GDPR 全文上做过一次 13 问合并实测,同一个动作带来 12.2 倍成本差和 10 倍时间差。
返回结构长这样,代码拿到就能写 if。
{
"department": {
"type": "choice",
"choice": "technical",
"probabilities": { "technical": 0.87, "billing": 0.09, "sales": 0.04 },
"confidence": 0.81
},
"is_urgent": { "type": "noul", "noul": 0.994 }
}为什么这么快
LLM 慢不在笨,在自回归。哪怕只要一个「是」,它也得先把 {"answer": " 这串字符逐个 token 生成出来。Jev 砍掉了这一步,一次前向对所有预定义位置同时打分,直接读概率头。输出只有一个决策,官方干脆按免费定价。
价格是 9 月 20 日前的口径,输入 $0.042/M token,输出免费,速率限制 250k token/s 加 1200 请求/分钟。官方称输入价比 Claude Fable 5.1 低 238 倍。上下文 64k,其中状态加最长问题占 32k。只吃文本,不支持图像音频视频,不支持微调,所有账户共享同一套权重。
项目 | Jev | 生成式 LLM |
输出 | 类型化决策,0 token | 字符串,需解析校验 |
端到端延迟 | 70 至 500 毫秒 | 官方引用口径 3 至 329 秒 |
输入价格 | $0.042/M | $0.20 至 $10/M |
训练目标 | RLCD,校准概率决策 | RLHF / RLVR |
训练方法叫 RLCD(Reinforcement Learning for Calibrated Decisions),优化目标不是人类偏好,而是报出的概率准不准。官方给了一组对比,LLM 自报 0.9 置信度的批次实际正确率 63%,校准过的概率说 0.9 的批次实际正确 89%。
快 200 倍要打折看
官网首页的「快 193.6 倍、便宜 444.6 倍」来自 TypeSafe 自己设计的 4 条工作流评测,参考答案是 GPT-6 Astra 与 Claude Fable 5.1 高推理档输出的平均。官方自己列了三条偏差说明,工作流出题、裁判、被测基线全是自家的,并承认这些是「现实收益的上限值」。同一份评测里,Jev 工作流准确率约 67.8%,前沿模型区间是 68% 到 74%,水平接近而非超越。
第三方实测支持「快和便宜」,但量级远没有 200 倍。评测站 Every.to 单组 777 次判断不到 0.7 秒,成本约四分之一美分,逐段判断中位 0.35 秒,对照模型 8.83 秒,故意植入的 7 处缺陷检出 6 处。Browser Use 的开源项目把 Jev 接进浏览器 Agent,任务中位耗时 9.45 秒降到 7.07 秒,浏览器协议调用从 1092 次砍到 101 次。Vercel 工程师称把命令安全分类从 GPT-5.6 Luna 换成 Jev 快 5 到 18 倍且更准,这条只有转述没有完整报告。
最扎的独立测试来自 backnotprop。作者用德州扑克 GTO 求解器当标准答案,150 个决策点 Jev 吻合率 63%。在真正有争议的 55 个点位上它只有 38%,而且只要把「对手成大同花、我方落后」这类已经得出结论的字段写进状态,它才肯改判。作者的结论是它确实在做事,但这些点位错得比对得多。
「零幻觉」的真实含义
官网最醒目的宣传是 Zero Hallucinations。它保证的只有一件事,输出分布永远定义在你给的选项上,不会编造字段、编造选项、编造 JSON。这是架构层面的结构性保证,官方也明说 0% 类型错误不是实测统计。
合法答案不等于正确答案。候选只有三个部门,它完全可能高置信度地选错。官方文档写得比宣传词诚实,校准是在一组预测上衡量的,不保证单个答案正确。Hacker News 上最典型的反驳是「约束解码也能让 LLM 输出合法结构」,Almeida 在评论区正面回应,称约束解码会让模型变笨,会给非法 token 分配概率的模型本身就是糊涂的。这个回应有技术依据,但也说明 Jev 的价值不在「不会错」,而在结构天生存在,不用拿模型能力去换。
冷水
「这不就是一个分类器吗」是发布后最常见的质疑。数学形态上确实接近,但传统分类器的标签在训练时固定,Jev 的标签和问题可以运行时定义,今天问三个部门,明天从两百个浏览器元素里选一个。Reddit 上比较中肯的说法是,它就是 BERT 式架构配上了现代 LLM 的数据、算力和训练配方,单拎出来没有革命性,但它把够聪明、够便宜、够快、够方便凑齐了,这是以前做不到的。
工程师 Sean Goedecke 的分析被广泛转发,核心三点。用约束解码加受限 logit 切片,现在就能复现类似的推理形状,他自己用 1.5B 小模型拿到 2 到 3 倍加速,Jev 未必有护城河。它没有思维链和测试时计算,智能上限可能锁在非推理 LLM 的水平。「零幻觉」是语义上的回避。
Agent 决策栈里的位置
理解 Jev 价值的方式,不是拿它替代 LLM,而是看 Agent 里有多少判断根本不值得叫醒推理模型。一个 100 步的 Agent,大部分动作只是这条信息是否相关、这个文件值不值得读、要不要重试、该路由给谁。未来的分工大概是这样的。
层 | 负责的判断 |
Code | 文件存在吗,HTTP 200 吗,exit code 是 0 吗 |
Jev | 这是哪类任务,风险属于哪一档,失败后重试还是降级 |
LLM | 任务怎么拆,参数怎么构造,这段代码怎么改 |
Human | 删文件,覆盖项目,发邮件,花钱 |
官方在 Doom 演示里让 Jev 每秒做约 10 次战术决策,一小时约 7 美元,一共 3.6 万个决策。游戏水平不如专门 bot,重点是「反应式智能」能进高频循环。TypeSafe 承认传统 bot 打得更好,演示卖的不是成绩,是形态。
发布 72 小时里长出来的生态也说明位置对了。LangChain 加了 TypeSafeClassifier 和用 Jev 做模型路由的中间件,Vercel AI SDK 新增的实验性 evaluate 接口第一个原生实现就是 Jev,社区已经有 jevlike、open-jev(Gemma 3 4B 底座)等复现,还有给两个模型同一批评论做对决的开源工具 jev-arena。
怎么用上
Jev 的接口不是 OpenAI 兼容的 Chat Completions,核心端点是 POST https://api.typesafe.ai/v1/systemone,请求体是 state 加 questions。国内中转站目前全部没有上架,因为它需要专门透传 /v1/systemone 路径。现实路径两条,官方直连最干净,或者走 OpenRouter,模型 ID typesafe/jev-1.13,9 月 18 日上架,价格与官方一致。
SDK 两条,Python 需 3.10 以上。
pip install typesafe-sdk export TYPESAFE_API_KEY="jev_你的密钥"
from typesafe_sdk import Choice, Noul, Score, TypeSafeClient
resp = client.system_one(
state=工单内容,
questions={
"department": Choice(
instructions="这张工单该由哪个团队处理",
criteria={
"billing": "付款或订阅问题",
"technical": "Bug 或集成故障",
"sales": "定价或账户咨询",
},
),
"frustration": Score(
instructions="客户表现出多大的不满",
criteria=["平静", "不满但克制", "非常愤怒"],
),
"is_urgent": Noul(instructions="这条消息传达了紧迫性"),
},
)
if resp.answers["department"].confidence < 0.5:
route_to_human()注意事项
中文是明确短板。官方口径是英语为主要训练语言,中日韩可用但不均衡,中文场景下概率校准本身会退化。接入前拿自己的业务数据小批量对拍,别直接上生产。
类型安全不等于事实正确。它只是不会编出选项之外的答案,不保证选对。
置信度是群体口径。说 0.9 的批次长期约九成正确,不代表手上这一条有九成把握。高置信自动执行、中置信复核、低置信转人工的阈值,必须用自己的数据调出来。
Noul 接近 0.5 是「是」「否」概率相当,不是程度中等。测程度用 Score。
别名会漂移,答案可能在无改动的情况下变化。调好阈值后钉住 jev-1.13.0,别用 jev-latest。
单字段基数上限 255,超过要改两段式流程,速度优势会被削弱。
官方承认无法证明定价没有被补贴,重度依赖此价格的架构要留预案。
官方不发布标准 benchmark,公开榜单上没有它的分数,判断是否适合你的业务只有一条路,拿真实数据跑。
未经允许不得转载:w3h5前端开发资源网 » 模型 Jev 爆火:不生成文字,70 毫秒返回判断,输入 $0.042/M、输出免费
w3h5前端开发资源网