2026 年 9 月 20 日——旧金山初创公司 TypeSafe AI 于 9 月 15 日结束两年隐身状态,发布首个「System One 模型」Jev:该模型不生成自由文本,而是对非结构化输入返回带校准概率的类型化决策。官方基准显示,端到端延迟为 70 至 500 毫秒,输入定价 0.042 美元/百万 tokens,官方称在同类工作流任务上较主流 LLM 最高快 193.6 倍、便宜 444.6 倍。

据官方公告,公司由前 OpenAI 研究员、InstructGPT 论文联合作者 Diogo Almeida 与 Erik Gafni、Sasha Sheng 共同创立,同批披露 4000 万美元种子轮融资,由 DCVC 领投;据媒体报道,投后估值约 2 亿美元。模型目前以 early access 形式开放,当前版本为 jev-1.13.0。

2026-09-20 · 决策模型 · AI Agent · 行业分析


1. 概览

Jev 与主流大模型的差异首先体现在输出形态上:主流 LLM 逐 token 生成自由文本,Jev 只返回结构化决策——一个概率值、一个选项或一个分数。官方将其定位表述为「前沿智能的函数调用:非结构化状态输入,类型化概率决策输出」,并明确表示该模型「面向机器而非人类」。

创始人 Diogo Almeida 在官方博客中说明了创业动机。他此前在 OpenAI 参与的研究工作「让语言模型学会遵循指令并与人类对话」,成果汇入了 ChatGPT。据其自述,四年来驱动他的核心问题是:「模型在聊天上已经超越人类多年,但自动化为什么没有随之而来?」他的结论是,聊天模型本身不会通向通用自动化,软件需要的是「一个软件可以依赖的接口」。

两个命名均有所指:「System One」取自心理学家卡尼曼提出的「系统 1 / 系统 2」认知框架,对应快速、直觉式的判断;「Jev」取自经济学家杰文斯(William Stanley Jevons),官方借杰文斯悖论表达其判断——智能成本每下降一个量级,都会解锁更多数量级的新用途。

时间 事件
2024 年 TypeSafe AI 成立,进入隐身状态
2026 年 9 月 15 日 结束隐身,发布 Jev,披露 4000 万美元种子轮(DCVC 领投)
2026 年 9 月 以 early access 形式开放,当前版本 jev-1.13.0,可经等待名单或 Vercel AI Gateway 接入

2. 产品定位:从「聊天模型」到「决策模型」

2.1 一类新的模型形态

官方将 Jev 归入其定义的新模型类别「System One Model」。按照官方文档的表述,这类模型的输入是一段非结构化文本(称为 state)加一组在运行时定义的类型化问题,输出是对每个问题的概率化答案。它与两类既有方案形成对照:

对照对象 差异
生成式 LLM(含 JSON mode / 结构化输出) LLM 逐 token 生成,可能产生无法通过校验的输出,且自报概率未经过校准;Jev 的输出结构由构造保证,概率以校准为目标训练
传统分类器 传统分类器需要标注数据训练、每个任务一个模型;Jev 无需训练数据,问题在运行时用自然语言定义,直接处理非结构化文本

第三方评测者对 Jev 的定位概括较为一致:它位于 LLM 与分类器之间——像 LLM 一样接受运行时定义的非结构化问题,像分类器一样只返回封闭集合内的判断。典型用途是语义判断类分支:这封邮件是否为商务合作、这条工单属于哪个类别、这段代码改动风险有多高。

2.2 三种决策原语

Jev 的接口由三种问题原语构成,全部在一次请求中并行求值:

原语 含义 返回内容
Noul 是/否判断 「是」的概率(0-1),无独立置信度字段;0.5 附近表示「无法判断」而非中等
Choice 从预定义选项中选择 所选选项、完整概率分布、置信度;选项上限 255 个
Score 有序程度评分 概率加权均值分数(可落在等级之间)与置信度;等级 2-10 级,评判标准需用场景描述而非程度词

一次请求的示例如下,问题以自包含的自然语言指令定义,官方文档说明问题 ID 不会发送给模型,因此每条指令必须独立可理解:

{
  "state": { "description": "你好,我想在贵站投放赞助广告..." },
  "questions": {
    "is_sponsor_inquiry": {
      "type": "noul",
      "instructions": "description 是否在请求赞助本站或本通讯?"
    }
  }
}

模型返回:

{
  "is_sponsor_inquiry": { "type": "noul", "noul": 0.99 }
}

3. 技术分析

3.1 RLCD:面向校准决策的训练方法

官方称 Jev 采用全新架构、采样器与训练算法,其中训练算法命名为 RLCD(Reinforcement Learning for Calibrated Decisions,面向校准决策的强化学习),与主流 LLM 的 RLHF(人类反馈强化学习)和 RLVR(可验证奖励强化学习)相区分。官方的论点是:RLHF 优化的是人类偏好,产出的聊天模型存在「模式丢失、过度自信、可靠性不足」等缺陷,因此生产系统普遍需要人工兜底;RLCD 直接以「概率与实际结果吻合」为优化目标。

「校准」在此有明确的技术含义:如果一个答案标称 90% 概率,那么在大量同类预测中,其正确率应接近 90%。官方文档同时说明,校准是群体统计口径,不保证任何单条预测正确。

3.2 并行采样与结构保证

在推理机制上,同一 state 下的所有问题相互独立、并行求值,一个答案不影响另一个答案。官方称这一设计带来两重结果:一是批量化摊薄成本,第三方实测中一次请求并行携带 13 个问题,比逐个串行调用便宜约 12.2 倍、快约 10 倍(据 flaviocopes 实测数据);二是输出结构由构造保证——答案只能落在预定义类型与选项之内,不可能出现格式错误的字段或编造的选项,官方据此宣称 0% 类型错误率与「零幻觉」,并说明该数字是构造性保证而非实测统计。

需要区分的是,「零幻觉」仅指结构层面:Jev 不可能生成不存在的字段或选项,但完全可能在给定选项内高置信度地选错。官方自己也承认「决策伴随需要管理的不确定性」。

围绕这一点,Hacker News 社区提出了主要质疑:约束解码(constrained decoding)技术也能让现有 LLM 做到结构保证。据社区讨论记录,创始人 Diogo Almeida 的回应是约束解码会损失模型能力。关于模型架构,官方未公开细节,社区猜测方向为「BERT 式编码架构加上现代 LLM 的数据、算力与训练配方」,该说法未获官方确认。

3.3 接口与生态接入

据官方文档,Jev 的接入方式与限制如下:

项目 规格
API 端点 POST https://api.typesafe.ai/v1/systemone(另提供 GET /v1/models)
当前版本 jev-1.13.0(别名 jev-latest、jev-preview)
上下文预算 state 与问题合计约 64k tokens
输入形态 仅文本,不支持图像、音频、视频
选项上限 Choice 255 个(高基数场景采用两阶段 score-then-choose)
评分等级 Score 2-10 级
速率限制 250k tokens/秒,1200 请求/分钟
官方 SDK Node.js(@typesafe-ai/sdk,Node 20+)、Python(typesafe-sdk,3.10+,含异步客户端)
第三方渠道 Vercel AI Gateway(typesafe-ai/jev)、Vercel AI SDK 7 的 experimental_evaluate()

值得注意的是 Vercel AI SDK 7 的适配方式:同一组问题可以路由给 OpenAI、Anthropic、Google 的模型回答以做对比,但官方文档明确提示这些模型的答案未经过校准。

4. 性能与定价:官方口径与第三方口径

4.1 官方基准

官方公布的核心数字为:在自建的工作流评测中,Jev 较 LLM 快 193.6 倍、便宜 444.6 倍,并称其「在接近两个数量级的区间独占帕累托前沿」。一个代表性对比例为:Jev 单次调用成本 0.000081 美元、耗时 0.114 秒,对照 LLM 为 0.013880 美元、8.566 秒。延迟口径为端到端 70-500 毫秒(自美国西海岸测试),对照 LLM 为 3-329 秒。输入定价 0.042 美元/百万 tokens(42 美元/十亿 tokens),输出 tokens 免费,官方称输入单价较 Claude Fable 5.1 低 238 倍。

这些数字的口径需要注意。官方在公告中主动披露了四项限定:头条倍数取自真实收益区间的高端;评测工作流由官方自己的能力团队构建;评测以 GPT-6 Astra 与 Fable 5.1 两个模型的平均输出作为裁判答案,官方承认存在偏向性;延迟数据来自西海岸设备实测。此外,官方明确表示当前定价的可持续性未经证明,可能存在补贴。

4.2 第三方实测

发布后一周内出现了多批第三方实测,结果分化明显:

测试方 场景 结果
Every.to 37 份文档 × 21 个问题,共 777 次判断 总成本约 0.25 美分;中位延迟 0.35 秒(对照 LLM 8.83 秒);7 处植入缺陷检出 6 处
Browser Use(开源项目) 浏览器自动化流程替换 LLM 判断 通过率不变(3/3);中位耗时 9.45 秒降至 7.07 秒(约快 25%);协议调用次数从 1092 降至 101
Vercel 命令分类 官方转述称快 5-18 倍且更准确(完整报告未公开)
Bryo AI(个人自述) 与 Gemini 对比 Gemini 略更准确,但成本高 10-20 倍
backnotprop 德州扑克 150 个决策点 与 GTO 求解器吻合率 63%;争议点位上 Jev 38% 对简单规则 24%

其中扑克测试对理解模型边界最有参考价值:实测显示 Jev 并不进行牌局推理,而是「读你写进 state 的结论」。在无同花可能的牌面且理应过牌的场景中,模型 16 次全部选择全下;只有把「对手持有 A 高同花」「我方牌力落后」等结论性字段写入 state 后,判断才被扭转。该实测者据此总结:Jev 适合做「判断」而非「推理」,推理结论需要由上游产出。

大规模标注是最直接的省钱场景:官方演示中对 1018 篇论文按 24 个主题做批量分类,成本 0.08 美元。另有实测演示包括以每秒约 10 次查询频率玩《毁灭战士》的游戏机器人(成本约每小时 7 美元)、shell 命令安全分类(对一条语义含糊的 rm -rf 命令返回「不可逆」0.56、置信度 0.33,触发人工复核)、以及免费级工具调用聊天机器人(约 300 毫秒响应)。

5. 局限性分析

综合官方文档披露与第三方实测,Jev 当前的边界集中在以下几项:

  1. 字面化理解:对否定词、限定词按字面执行,间接表达(双重否定、多跳指代)会显著降低准确率。
  2. 无数值能力:不做算术、计数与日期比较,此类运算需在代码层完成(可拆成逐项 Noul 判断后求和)。
  3. 分数不是测量值:Score 输出适用于阈值与排序,不适用于幅度插值等精细用途。
  4. 上下文污染:state 中无关内容积累会稀释判断质量;state 内的对抗性文本可能引导答案。
  5. 类型安全不等于正确:结构保证仅覆盖格式层,选错选项的风险由置信度机制缓解而非消除。
  6. 模态与能力限制:仅支持文本输入,完全不具备文本生成能力,不适合任何需要产出内容的环节。

官方在 FAQ 中留下了多个未正面回答的问题:Jev 是否只是一个小参数量 LLM、与 JSON mode 的本质区别、定价是否补贴、在哪些任务上表现挣扎。架构细节截至发稿未公开,官方也未在标准公开基准(如 MMLU 类榜单)上发布成绩,所有能力判断目前只能以自有数据实测为准。

6. 行业观察

6.1 Agent 决策栈的分层方案

第三方评测者与社区讨论中逐步形成的一个共识框架,是把语义判断从 LLM 推理链中拆出、按确定性程度分层调度:

graph LR A[代码层
确定性逻辑与运算] --> B[Jev 层
封闭集语义判断
约 100 毫秒 / 约零成本] B --> C[LLM 层
开放推理与内容生成] C --> D[人工层
低置信度复核与最终授权]

在这一分层下,分类、路由、护栏、打分等高频低风险决策下沉到 Jev,推理与生成留在 LLM,不可逆操作与低置信度结果上升至人工。Browser Use 的实测是这一方案的直接验证:判断环节替换后,LLM 调用次数下降一个量级,而任务通过率不变。

6.2 经济账:按「解决任务的成本」计算

多方评测指出了同一条成本核算原则:应按「单个被解决任务的总成本」而非单次调用价格评估收益。flaviocopes 的分析给出一个量化框架:假设月账单 1 万美元,其中分类类调用占 60%,替换为近零成本决策可省约 57%;若分类只占 10%,则无论单次降价多少倍,总账单降幅上限即为 10%。同时存在两类隐性成本:上游预处理(上述论文标注演示中,生成摘要的前置成本为 3.99 美元,远超 0.08 美元的分类成本)与模型版本漂移(jev-1.13.0 后续升级带来的行为变化需要重新验证阈值)。

6.3 后续关注点

综合各方信息,Jev 后续值得跟踪的事实节点包括:独立第三方在标准任务上的可复现基准(当前头条倍数均为官方自测口径);定价在 early access 结束后的走向(官方已自认可能补贴);架构与训练细节是否披露;以及 Vercel 等平台之外,主流 Agent 框架是否会原生集成这类决策接口。多个评测方给出的落地建议较为一致:先以影子模式(shadow mode)在生产流量旁路记录 Jev 的判断并与现有流程对照,标注对错、校准阈值后,再从低风险分支开始逐个切换。