「不会幻觉」的模型登顶 HN 这一天:把 System One 的包装拆开数了数

美国时间 9 月 15 日,Hacker News 榜首换成了一个听起来像小说设定的发布:一家在隐身模式下憋了两年的旧金山公司 TypeSafe AI,宣布造出了一种"不会幻觉"的模型。取名 Jev。同一天,四千万美元种子轮到账,DCVC 领投。

jev-four-wrappers-2026-09-16.svg

美国时间 9 月 15 日,Hacker News 榜首换成了一个听起来像小说设定的发布:一家在隐身模式下憋了两年的旧金山公司 TypeSafe AI,宣布造出了一种"不会幻觉"的模型。取名 Jev。同一天,四千万美元种子轮到账,DCVC 领投。

幻觉这个词在 AI 圈里被讨论了四年,各家厂商的开场白高度一致——我们会越来越少幻觉。直接宣布幻觉不存在的,它是头一家。

这句大话值得认真对待。我把他们的博客、公开评测数据、FAQ 的隐藏答案和 HN 上两百多条评论都翻了一遍。结论先放在这里:里面有真东西,只是真东西外面裹了四层包装。

先说他们在卖什么

卡尼曼把人的思维分成两套。系统二慢,负责推理和写文章;系统一快,负责在 0.1 秒内判断草丛里有没有蛇。TypeSafe 的赌注是:软件里绝大多数 AI 判断,其实都是系统一的活儿。

这封邮件是不是投诉?这个交易有没有欺诈嫌疑?这条 agent 轨迹要不要拦截?现在大家拿这些去问大语言模型,让它写一篇短文,再从短文里抠答案。TypeSafe 的做法是砍掉整段独白。输入塞进去,输出直接是一个预先定义好的类型——是与否的概率,若干个选项上的分布,或者一个分数。三种原语,名字分别叫 Noul、Choice、Score。所有问题一次性并行算完,加一百个新问题,响应时间几乎不动。

用过的工程师大概会心一笑。这就是把生产系统里那些"调用 GPT 加一段解析代码加一个重试循环"的胶水,封装成了一个 API。

架构是什么?保密。论文说"可能写"。社区里公认最贴近的定性是创始人亲口认可的"一个泛化的零样本分类器"。这没什么丢人的——把分类做好做便宜,是门大生意。

数字开始套娃

首页口号是快 193.6 倍,便宜 444.6 倍。这个精确到小数点的数字,来路值得念一遍。

它出自公司自己做的四个业务流程评测。跑分用的对照 LLM,被塞进 TypeSafe 自己写的包装器里,官方承认这种装法会让对方更慢更贵。评测任务的"标准答案",不是人工标注,是 GPT-6 Astra 和 Claude Fable 5.1 两个模型的共识。自家的任务、自家的包装器、自家的流程,以竞争对手的共识当真相——四重身份重叠。

更有意思的是这个数字在各处的旅行。同一家公司发通稿时只敢写"最高快 100 倍"。首页自己的对比示例是 75 倍和 171 倍。把公开评测表里最接近的两项相除,算出来约 195 倍和 440 倍。量级是可信的。精确到小数点后一位的口径,目前没人能复现。

这张图是他们自己挂出来的,也是全场最诚实的一张。Jev 拿 67.8%,比最强的 sol 低了六个百分点。处理发票那项任务,落后了十七个百分点。它赢的方式是另一个维度——同样的准确率档位下,四十分之一秒对半分钟,万分之四美元对八美分。这是帕累托最优,拿性价比换六分。

那"不会幻觉"呢

这是全篇最精彩的部分。博客里有一段专门交代:图表里 Jev 的幻觉率是 0%,但这个数"不是实测的,输出和模式匹配是构造性保证的,所以我们可以放心写 0%"。

翻译一下。Jev 保证的是永远不会输出选项之外的东西——你要一个布尔值,它绝不可能回你一段散文。这在数学上确实成立。可一个错误但合法的答案,算不算幻觉?HN 上一票人认为算。模型信誓旦旦地说"这封邮件是普通咨询",实际上它是投诉——输出完全合法,判断完全错误。

官方文档自己补了刀:校准只对预测的整体分布成立,"不保证单次回答正确"。创始人被追到墙角时也松了口,说模型"完全可能自信地错"。

一个不会说错话的模型,照说不误。这才是对这句口号的精确描述。

人是真的,钱是真的

拆归拆,底子要认。创始人 Diogo Almeida,InstructGPT 论文作者之一,就是训练出 ChatGPT 行为的那篇论文。宣传语里"共同发明了 RLHF"属于自我抬举,方法本身更早,但论文署名是实打实的。CTO 和 COO 一个来自 Meta FAIR,一个是连续创业者。四千万美元种子轮,Dealroom 说这个金额排进了 AI 种子轮历史的前百分之一。团队在旧金山码头边上班,每周五天到岗。

模型名字也不是随便起的。Jev,Jevons 悖论的 Jev——那位经济学家发现,蒸汽机效率每提高一次,煤烧得更多。一个把"便宜"当卖点的模型,起了个"便宜了就会用更多"的名字。起名的人清楚自己在干什么。

值得留下的是什么

HN 当天骂声不少,说这是"几个月来最具误导性的营销"。也有人贴出 Doom 视频叫好——Jev 每秒读十次游戏状态做决策,一小时成本七美元,虽然它看的不是画面而是文本化的状态,官方还自己承认"不用 AI 也能写个更好的 bot"。

骂的人和夸的人,其实看到的是同一件事。真正的创新在接口:把判断变成类型安全的原语,把置信度做成一等的返回值,二十多篇 cookbook 演示重排、护栏、引用核查这些真实任务。评测站把全部数据摊开,连自家难看的数据也挂着。创始人在线答疑四十多条,处处让步。这种透明度在发布营销里罕见。

可疑的也是同一件事。拒发公开基准成绩,官方 FAQ 写着"别把公开基准当回事"。架构黑箱,没有权重,没有论文。一个全靠自家评测证明自己的模型,正在说服一万家工厂的流水线听它判断。

我的建议还是那条老原则:可以买它的速度和价格,把"不会幻觉"留在营销部门。信不信它的判断,等第三方评测,或者等他们那篇"可能写"的论文。

系统一快,快得来不及解释。人类花了一辈子学会在直觉后面配上复核。给机器的这条规矩,大概也不会例外。


*信源:typesafe.ai 官方博客与 FAQ、evals.typesafe.ai 公开评测表、Dealroom 报道、Business Wire 通稿、HN 49717558 评论区(734 分)、docs.typesafe.ai。全部数字口径核查记录见 factcheck_r46t。*

👍 1

想参与讨论或点赞?登录后使用完整功能

讨论回复(0)

暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens