SevenTnewSAI 与科技新闻,深度解读
人工智能赞助内容

机器原生 AI 及其背后的基准测试

TypeSafe AI 称其速度比 LLM 快 193 倍,但它自己的「证据」只显示 75 倍

TypeSafe AI 称 Jev 是首个 System One Model:一个旨在向软件返回类型化决策的系统,并使用其命名为 RLCD 的算法训练。发布页面声称其零幻觉,并且相较单一指定基线 Claude Fable 5.1 具有 238 倍的价格优势。

Emmanuel Fabrice Omgbwa Yasse AI 辅助

2026-09-21 · 阅读需 5 分钟

TypeSafe AI 称其速度比 LLM 快 193 倍,但它自己的「证据」只显示 75 倍
来源 : TypeSafe AI lau…

TypeSafe AI 称其隐身研发了两年,并希望外界将其视为对聊天机器人时代的否定。其发布页面以一句话和一个两词短语开场:「我们选择了相反的研究方向」,紧接着是「不是聊天」。

这家页脚写着「Made in SF」的公司已推出 Jev,称其为首个公开发布的 System One Model。按该页面的说法,System One Model 的定位是在软件内部回答结构化问题,而非进行对话。围绕该产品有三项主张:类型化输出、每个决策都附带置信度估计,以及「零幻觉」。其下则是一项基准测试:比 LLM 快 193.6 倍、成本低 444.6 倍。

TypeSafe AI 实际发布了什么

该页面将 System One Model 描述为「一类为软件内部决策而构建的新型 AI 模型」,与之对立的是它所说的「为人类生成文字」的 LLM。Jev 返回附带概率的类型化决策,程序代码可据此分支。TypeSafe 称该构建基于三点对现行做法的背离:新架构、新采样器,以及一种名为「面向校准决策的强化学习」(Reinforcement Learning for Calibrated Decisions,RLCD)的新训练算法。结构化输出如今已是老生常谈的目标,这方面的提升往往以百分点计,而非数量级, , 正如 LFM2.5-350M 的 schema 结果所显示的

该页面标注版本 0.01,版权年份 2026。除公告之外,页面未列出任何配套论文、代码发布或模型卡。这种自信的发布与空白的证据链之间的落差并不陌生:三星的健康助手测试版发布时也曾承诺宏大而细节寥寥

基准测试:快 193.6 倍、便宜 444.6 倍

这些标题级的倍数位于页面标注为「(证据)」的单一算例之上。在该算例中,TypeSafe 的系统用 0.114 秒完成任务,成本为 0.000081 美元。标为「LLM」的一列完成同一任务耗时 8.566 秒,成本 0.013880 美元。

将两者相除,数字并不能复现标题。该算例暗示速度约为 75 倍、成本约为 171 倍。页面未解释 193.6 倍和 444.6 倍从何而来,也未定义其星号所指的「System One 任务工作流」。更大的数字可能是在比所示示例更广的任务集上汇总得出。页面也没有说明这一点。一旦细读随附结果就缩水的加速比并不新鲜,Hugging Face 的 2.57 倍 WebGPU 声明就附带了 176 项损失

指标TypeSafe AI(「证据」示例)LLM(同一示例)推算比值
每任务成本0.000081 美元0.013880 美元约便宜 171 倍
完成时间0.114 秒8.566 秒约快 75 倍
页面标题数据快 193.6 倍、便宜 444.6 倍未显示

零幻觉与置信度主张

「零幻觉」作为标题出现。其下的一行文字比这个词所暗示的要狭窄:Jev 的每个决策都附带置信度估计,因此软件可在置信度高时采取行动,在置信度不高时升级待审。页面告诉开发者要「设定何时自主行动、何时请求复核的阈值」。

这只是对不确定性做了路由,并不能保证模型是对的, , 自信的错误答案依然是错的。共识也无法解决:当误差相关时,一组 AI 智能体可能达成一致却依然是错的。该页面的 FAQ 中列出了「Jev 仍可能出错吗?」和「Jev 是确定性的吗?」等问题,而界线划在哪里的判断,最终落在设定阈值的人身上。

RLCD 与 RLHF

方法层面的主张是训练上的一次分岔。TypeSafe 将「基于人类反馈的强化学习」描述为一个针对人类偏好优化模型的过程,并催生了「在指令遵循上超越人类」的系统,它称之为聊天。它列出了代价:模式坍缩(mode dropping)、过度自信和不可靠,称这些使 LLM 依赖人工介入。

其替代方案 RLCD,仅被定义为「面向校准决策的强化学习」。这个名字直指页面在 RLHF 中指出的失败:过度自信。RLCD 是否真的是全新方法,页面并未展示。没有协议、没有基线、也没有对比。页面自己的 FAQ 提出「Jev 只是更小的 LLM 吗?」和「这与 JSON 模式或结构化输出有何不同?」这两个问题,正是区分一种新算法与一个调校良好的分类器的关键。提出训练方法的论文通常会把注意事项一并附上,就像一项 36 次中 33 次成功的蒸馏结果在发表时附带了作者自己的星号标注。

TypeSafe AI 背后是谁

该网站链接到一份宣言、一个团队页面,以及企业版和文档板块,并开放候补名单注册和职位申请。发布页面未列出任何创始人、投资者或此前发表的研究。联系方式仅有一个邮箱 hello@typesafe.ai,以及 LinkedIn 和 X 账号。

列出了三篇博客文章:《Introducing System One Models & Jev》《The Bitterest Lesson》和《AI: too good to be true, too bad to be useful》。第二篇附有一句摘要,讲算力推动进步,「但如果你做的不是正确的任务,进步又有何用」。第三篇追问,在训练出「取悦人类」而非「做出可靠的自主决策」的 RLHF 模型之后,下一步是什么。这样的框架是一份研究议程,但页面并未展示研究本身。

对比基线的难题

Jev 的价格标为每 10 亿输入 token 42 美元,被描述为「输入价格比 Claude Fable 5.1 低 238 倍」。一个基线、一个指标、一个方向:输入 token。任何标题级倍数都绕不开它是相对谁测量的这一问题,无论对手是否被点名都是如此,正如阿里云针对一个未具名对手的 9.27 倍内存声明所显示的。

由此产生两个缺口。类型化决策的每 token 价格与文本的每 token 价格可能并不衡量同一单位的工作量,因此 238 倍这个数字建立在两种不同的输出之上。而输入价格忽略了输出成本、重试,以及置信度机制本就会触发的人工复核。在这个页面上,42 美元是每输入 token 的价格,页面也就到此为止。

这一切并不说明 System One Model 就是错的。发布页面不是论文,TypeSafe 也还处在足够早期的阶段,可以用它接下来发布什么来评判。但它发布的最响亮的东西是一组倍数,而它称为「证据」的那一块算出来的倍数更小。在 RLCD 背后的方法公之于众之前,这些主张跑在了证据前面。

每天早晨用 3 分钟掌握科技要闻

每个工作日一封邮件,只讲真正重要的 AI 与科技动态。