2026 年 9 月 20 日——旧金山初创公司 TypeSafe AI 于 9 月 15 日结束两年隐身状态,发布首个「System One 模型」Jev:该模型不生成自由文本,而是对非结构化输入返回带校准概率的类型化决策。官方基准显示,端到端延迟为 70 至 500 毫秒,输入定价 0.042 美元/百万 tokens,官方称在同类工作流任务上较主流 LLM 最高快 193.6 倍、便宜 444.6 倍。
据官方公告,公司由前 OpenAI 研究员、InstructGPT 论文联合作者 Diogo Almeida 与 Erik Gafni、Sasha Sheng 共同创立,同批披露 4000 万美元种子轮融资,由 DCVC 领投;据媒体报道,投后估值约 2 亿美元。模型目前以 early access 形式开放,当前版本为 jev-1.13.0。
2026-09-20 · 决策模型 · AI Agent · 行业分析
1. 概览
Jev 与主流大模型的差异首先体现在输出形态上:主流 LLM 逐 token 生成自由文本,Jev 只返回结构化决策——一个概率值、一个选项或一个分数。官方将其定位表述为「前沿智能的函数调用:非结构化状态输入,类型化概率决策输出」,并明确表示该模型「面向机器而非人类」。
创始人 Diogo Almeida 在官方博客中说明了创业动机。他此前在 OpenAI 参与的研究工作「让语言模型学会遵循指令并与人类对话」,成果汇入了 ChatGPT。据其自述,四年来驱动他的核心问题是:「模型在聊天上已经超越人类多年,但自动化为什么没有随之而来?」他的结论是,聊天模型本身不会通向通用自动化,软件需要的是「一个软件可以依赖的接口」。
两个命名均有所指:「System One」取自心理学家卡尼曼提出的「系统 1 / 系统 2」认知框架,对应快速、直觉式的判断;「Jev」取自经济学家杰文斯(William Stanley Jevons),官方借杰文斯悖论表达其判断——智能成本每下降一个量级,都会解锁更多数量级的新用途。
| 时间 | 事件 |
|---|---|
| 2024 年 | TypeSafe AI 成立,进入隐身状态 |
| 2026 年 9 月 15 日 | 结束隐身,发布 Jev,披露 4000 万美元种子轮(DCVC 领投) |
| 2026 年 9 月 | 以 early access 形式开放,当前版本 jev-1.13.0,可经等待名单或 Vercel AI Gateway 接入 |
2. 产品定位:从「聊天模型」到「决策模型」
2.1 一类新的模型形态
官方将 Jev 归入其定义的新模型类别「System One Model」。按照官方文档的表述,这类模型的输入是一段非结构化文本(称为 state)加一组在运行时定义的类型化问题,输出是对每个问题的概率化答案。它与两类既有方案形成对照:
| 对照对象 | 差异 |
|---|---|
| 生成式 LLM(含 JSON mode / 结构化输出) | LLM 逐 token 生成,可能产生无法通过校验的输出,且自报概率未经过校准;Jev 的输出结构由构造保证,概率以校准为目标训练 |
| 传统分类器 | 传统分类器需要标注数据训练、每个任务一个模型;Jev 无需训练数据,问题在运行时用自然语言定义,直接处理非结构化文本 |
第三方评测者对 Jev 的定位概括较为一致:它位于 LLM 与分类器之间——像 LLM 一样接受运行时定义的非结构化问题,像分类器一样只返回封闭集合内的判断。典型用途是语义判断类分支:这封邮件是否为商务合作、这条工单属于哪个类别、这段代码改动风险有多高。
2.2 三种决策原语
Jev 的接口由三种问题原语构成,全部在一次请求中并行求值:
| 原语 | 含义 | 返回内容 |
|---|---|---|
| Noul | 是/否判断 | 「是」的概率(0-1),无独立置信度字段;0.5 附近表示「无法判断」而非中等 |
| Choice | 从预定义选项中选择 | 所选选项、完整概率分布、置信度;选项上限 255 个 |
| Score | 有序程度评分 | 概率加权均值分数(可落在等级之间)与置信度;等级 2-10 级,评判标准需用场景描述而非程度词 |
一次请求的示例如下,问题以自包含的自然语言指令定义,官方文档说明问题 ID 不会发送给模型,因此每条指令必须独立可理解:
{
"state": { "description": "你好,我想在贵站投放赞助广告..." },
"questions": {
"is_sponsor_inquiry": {
"type": "noul",
"instructions": "description 是否在请求赞助本站或本通讯?"
}
}
}
模型返回:
{
"is_sponsor_inquiry": { "type": "noul", "noul": 0.99 }
}
3. 技术分析
3.1 RLCD:面向校准决策的训练方法
官方称 Jev 采用全新架构、采样器与训练算法,其中训练算法命名为 RLCD(Reinforcement Learning for Calibrated Decisions,面向校准决策的强化学习),与主流 LLM 的 RLHF(人类反馈强化学习)和 RLVR(可验证奖励强化学习)相区分。官方的论点是:RLHF 优化的是人类偏好,产出的聊天模型存在「模式丢失、过度自信、可靠性不足」等缺陷,因此生产系统普遍需要人工兜底;RLCD 直接以「概率与实际结果吻合」为优化目标。
「校准」在此有明确的技术含义:如果一个答案标称 90% 概率,那么在大量同类预测中,其正确率应接近 90%。官方文档同时说明,校准是群体统计口径,不保证任何单条预测正确。
3.2 并行采样与结构保证
在推理机制上,同一 state 下的所有问题相互独立、并行求值,一个答案不影响另一个答案。官方称这一设计带来两重结果:一是批量化摊薄成本,第三方实测中一次请求并行携带 13 个问题,比逐个串行调用便宜约 12.2 倍、快约 10 倍(据 flaviocopes 实测数据);二是输出结构由构造保证——答案只能落在预定义类型与选项之内,不可能出现格式错误的字段或编造的选项,官方据此宣称 0% 类型错误率与「零幻觉」,并说明该数字是构造性保证而非实测统计。
需要区分的是,「零幻觉」仅指结构层面:Jev 不可能生成不存在的字段或选项,但完全可能在给定选项内高置信度地选错。官方自己也承认「决策伴随需要管理的不确定性」。
围绕这一点,Hacker News 社区提出了主要质疑:约束解码(constrained decoding)技术也能让现有 LLM 做到结构保证。据社区讨论记录,创始人 Diogo Almeida 的回应是约束解码会损失模型能力。关于模型架构,官方未公开细节,社区猜测方向为「BERT 式编码架构加上现代 LLM 的数据、算力与训练配方」,该说法未获官方确认。
3.3 接口与生态接入
据官方文档,Jev 的接入方式与限制如下:
| 项目 | 规格 |
|---|---|
| API 端点 | POST https://api.typesafe.ai/v1/systemone(另提供 GET /v1/models) |
| 当前版本 | jev-1.13.0(别名 jev-latest、jev-preview) |
| 上下文预算 | state 与问题合计约 64k tokens |
| 输入形态 | 仅文本,不支持图像、音频、视频 |
| 选项上限 | Choice 255 个(高基数场景采用两阶段 score-then-choose) |
| 评分等级 | Score 2-10 级 |
| 速率限制 | 250k tokens/秒,1200 请求/分钟 |
| 官方 SDK | Node.js(@typesafe-ai/sdk,Node 20+)、Python(typesafe-sdk,3.10+,含异步客户端) |
| 第三方渠道 | Vercel AI Gateway(typesafe-ai/jev)、Vercel AI SDK 7 的 experimental_evaluate() |
值得注意的是 Vercel AI SDK 7 的适配方式:同一组问题可以路由给 OpenAI、Anthropic、Google 的模型回答以做对比,但官方文档明确提示这些模型的答案未经过校准。
4. 性能与定价:官方口径与第三方口径
4.1 官方基准
官方公布的核心数字为:在自建的工作流评测中,Jev 较 LLM 快 193.6 倍、便宜 444.6 倍,并称其「在接近两个数量级的区间独占帕累托前沿」。一个代表性对比例为:Jev 单次调用成本 0.000081 美元、耗时 0.114 秒,对照 LLM 为 0.013880 美元、8.566 秒。延迟口径为端到端 70-500 毫秒(自美国西海岸测试),对照 LLM 为 3-329 秒。输入定价 0.042 美元/百万 tokens(42 美元/十亿 tokens),输出 tokens 免费,官方称输入单价较 Claude Fable 5.1 低 238 倍。
这些数字的口径需要注意。官方在公告中主动披露了四项限定:头条倍数取自真实收益区间的高端;评测工作流由官方自己的能力团队构建;评测以 GPT-6 Astra 与 Fable 5.1 两个模型的平均输出作为裁判答案,官方承认存在偏向性;延迟数据来自西海岸设备实测。此外,官方明确表示当前定价的可持续性未经证明,可能存在补贴。
4.2 第三方实测
发布后一周内出现了多批第三方实测,结果分化明显:
| 测试方 | 场景 | 结果 |
|---|---|---|
| Every.to | 37 份文档 × 21 个问题,共 777 次判断 | 总成本约 0.25 美分;中位延迟 0.35 秒(对照 LLM 8.83 秒);7 处植入缺陷检出 6 处 |
| Browser Use(开源项目) | 浏览器自动化流程替换 LLM 判断 | 通过率不变(3/3);中位耗时 9.45 秒降至 7.07 秒(约快 25%);协议调用次数从 1092 降至 101 |
| Vercel | 命令分类 | 官方转述称快 5-18 倍且更准确(完整报告未公开) |
| Bryo AI(个人自述) | 与 Gemini 对比 | Gemini 略更准确,但成本高 10-20 倍 |
| backnotprop | 德州扑克 150 个决策点 | 与 GTO 求解器吻合率 63%;争议点位上 Jev 38% 对简单规则 24% |
其中扑克测试对理解模型边界最有参考价值:实测显示 Jev 并不进行牌局推理,而是「读你写进 state 的结论」。在无同花可能的牌面且理应过牌的场景中,模型 16 次全部选择全下;只有把「对手持有 A 高同花」「我方牌力落后」等结论性字段写入 state 后,判断才被扭转。该实测者据此总结:Jev 适合做「判断」而非「推理」,推理结论需要由上游产出。
大规模标注是最直接的省钱场景:官方演示中对 1018 篇论文按 24 个主题做批量分类,成本 0.08 美元。另有实测演示包括以每秒约 10 次查询频率玩《毁灭战士》的游戏机器人(成本约每小时 7 美元)、shell 命令安全分类(对一条语义含糊的 rm -rf 命令返回「不可逆」0.56、置信度 0.33,触发人工复核)、以及免费级工具调用聊天机器人(约 300 毫秒响应)。
5. 局限性分析
综合官方文档披露与第三方实测,Jev 当前的边界集中在以下几项:
- 字面化理解:对否定词、限定词按字面执行,间接表达(双重否定、多跳指代)会显著降低准确率。
- 无数值能力:不做算术、计数与日期比较,此类运算需在代码层完成(可拆成逐项 Noul 判断后求和)。
- 分数不是测量值:Score 输出适用于阈值与排序,不适用于幅度插值等精细用途。
- 上下文污染:state 中无关内容积累会稀释判断质量;state 内的对抗性文本可能引导答案。
- 类型安全不等于正确:结构保证仅覆盖格式层,选错选项的风险由置信度机制缓解而非消除。
- 模态与能力限制:仅支持文本输入,完全不具备文本生成能力,不适合任何需要产出内容的环节。
官方在 FAQ 中留下了多个未正面回答的问题:Jev 是否只是一个小参数量 LLM、与 JSON mode 的本质区别、定价是否补贴、在哪些任务上表现挣扎。架构细节截至发稿未公开,官方也未在标准公开基准(如 MMLU 类榜单)上发布成绩,所有能力判断目前只能以自有数据实测为准。
6. 行业观察
6.1 Agent 决策栈的分层方案
第三方评测者与社区讨论中逐步形成的一个共识框架,是把语义判断从 LLM 推理链中拆出、按确定性程度分层调度:
确定性逻辑与运算] --> B[Jev 层
封闭集语义判断
约 100 毫秒 / 约零成本] B --> C[LLM 层
开放推理与内容生成] C --> D[人工层
低置信度复核与最终授权]
在这一分层下,分类、路由、护栏、打分等高频低风险决策下沉到 Jev,推理与生成留在 LLM,不可逆操作与低置信度结果上升至人工。Browser Use 的实测是这一方案的直接验证:判断环节替换后,LLM 调用次数下降一个量级,而任务通过率不变。
6.2 经济账:按「解决任务的成本」计算
多方评测指出了同一条成本核算原则:应按「单个被解决任务的总成本」而非单次调用价格评估收益。flaviocopes 的分析给出一个量化框架:假设月账单 1 万美元,其中分类类调用占 60%,替换为近零成本决策可省约 57%;若分类只占 10%,则无论单次降价多少倍,总账单降幅上限即为 10%。同时存在两类隐性成本:上游预处理(上述论文标注演示中,生成摘要的前置成本为 3.99 美元,远超 0.08 美元的分类成本)与模型版本漂移(jev-1.13.0 后续升级带来的行为变化需要重新验证阈值)。
6.3 后续关注点
综合各方信息,Jev 后续值得跟踪的事实节点包括:独立第三方在标准任务上的可复现基准(当前头条倍数均为官方自测口径);定价在 early access 结束后的走向(官方已自认可能补贴);架构与训练细节是否披露;以及 Vercel 等平台之外,主流 Agent 框架是否会原生集成这类决策接口。多个评测方给出的落地建议较为一致:先以影子模式(shadow mode)在生产流量旁路记录 Jev 的判断并与现有流程对照,标注对错、校准阈值后,再从低风险分支开始逐个切换。
举手提问