新智元报道
一个不会陪你聊天的AI,刚拿到8.7亿美元融资!
10月9日,TypeSafe AI宣布完成A轮融资,估值直接冲到75亿美元。a16z领投,红杉、DCVC等机构参投。
更有意思的,是这个团队的背景。
TypeSafe AI三位联合创始人合影,左起依次是Erik Gafni、Sasha Sheng、Diogo Almeida。
Erik Gafni是连续创业者,曾是Invitae和Freenome的早期员工;Sasha Sheng则曾在Meta/FAIR担任研究工程师。
而Diogo Almeida,曾在OpenAI参与ChatGPT的相关研究。
如今他出来单干,做出的新产品,竟然把老东家逼得火速跟进。
9月15日,Jev推出。
仅仅两周后,OpenAI就宣布推出Decisions API的有限预览,并在10月6日直接推向公开Beta。
负责API产品的Nikunj Handa毫不避讳地承认:Jev启发了这一切。
一个不会聊天的AI,究竟有什么本事,让投资人和OpenAI接连出手?
它不闲聊,也不直接执行任务,只做一件事:读懂内容,快速判断:
邮件要不要提醒?请求交给哪个工具?内容需不需要人工复核?
更多时候,它的「交谈对象」是软件,交出的结果可能只有一个选项,或一个概率。
软件拿到结果,就能按规则继续运行。
而你连它的回答都不用看。
Jev盯上的
是你每天的小判断
打开邮箱,成百上千条消息扑面而来。
促销、订阅、工作……一大堆信息混成一团。
你想挑出真正要紧的,却又不想一封封点开。
这类任务,以前用大模型也能做。
但问题在于,每来一封邮件就调用一次AI,等待时间和费用就会不断累积:
当同样的判断每天发生几千、几万次,每次调用在耗时和费用上的差别,都会被放大。
Jev瞄准的,正是这种高频发生的小判断。
以邮件筛选为例,开发者可以用自然语言写清楚标准:这封信是否涉及即将到期的账单?是否需要本人紧急回复?是否包含时间地点的变动?
Jev读取内容后,会直接向应用返回判断结果和对应概率。软件再按预设规则,自动归类或发出提醒。
Jev直接返回选项或概率,不用生成长篇回答。程序可以直接读取结果,不必再从一大段文字里提取结论。
据TypeSafe介绍,Jev还能并行回答多个问题,并以结构化格式返回结果,供软件直接读取和使用。
为此,公司采用了专门的模型架构和训练方法,重点之一,就是让概率估计更可靠。
调用AI的成本更是被打到了地板上:
每百万输入token只要0.042美元,输出完全免费。
调用门槛降下来后,许多原本不值得专门动用AI的小步骤,也有了尝试自动化的空间。
开发者的反应很快。
9月18日,Vercel披露,Jev接入其AI Gateway后,首个24小时内,就有接近13%的付费团队使用过。
首日使用它的付费团队数,超过此前任何模型发布首日使用团队数的两倍。
Jev接入Vercel AI Gateway后的首个24小时内,近13%的付费团队使用了它。
这只是一个平台的首日成绩,还不能代表长期留存。
但至少说明,开发者愿意为这种新用法上手试一试。
让AI替人处理琐碎小事,前提就是用得起、等得起。
两周之后
老东家就来了
Almeida早在OpenAI工作时,就萌生了这个想法。
据他在LinkedIn上的回忆,他曾琢磨过一个问题:如果AI真的改变了经济,未来大量调用AI的,究竟会是人,还是自动运行的代码?
他的判断是,后者将占绝大多数。
他把构想写成文档,拿给奥特曼看。
据他所说,奥特曼很支持,甚至建议他放下手头的工作,去探索这个方向。
后来,Almeida与Erik Gafni、Sasha Sheng共同创办TypeSafe。经过两年研发,Jev终于公开亮相。
这一次,老东家很快就跟了上来。
在Latent Space访谈中,Handa提到,Jev推出后,OpenAI的用户和内部团队纷纷提出需求:他们也需要更快的分类系统。
主持人追问,四周前,这个项目根本不在开发计划里,对吗?
Handa确认,当时完全没有。
OpenAI没有从零训练新模型,而是改造现有的GPT-6 Luna:让它直接给出判断结果,同时处理多个问题,再加快后台运算,让第一个结果更快返回。
Jev和OpenAI提供了相似的能力,但做法完全不同:
Jev主打专门的模型与训练方法;OpenAI先把现有Luna模型用起来,将其用于快速判断服务。
OpenAI还多了一项能力:支持图片输入,可以判断照片里的物品是否有可见损伤。
开发者可以把商品照片和检查要求一起发给Decisions API,比如判断物品有没有裂痕、撕裂或凹痕。
GPT-6 Luna根据图片作出判断,并返回损坏概率,应用据此筛出需要提醒或人工复核的商品。Jev目前只支持文本输入。
OpenAI文档演示用Decisions API识别商品照片中的可见损伤。
价格方面,Decisions API的基础输入价为每百万token 0.10美元,输出同样免费。
相比之下,Jev的0.042美元仍然更低。
至于OpenAI宣称的「最高快10倍」,比较的是通过自家Responses API调用同一模型时的表现。
前员工刚踩到痛点,就被老东家火速跟进了。
但谁能笑到最后,还要看每一次判断交出的结果。
答案只有几个选项
也可能选错
Jev的低成本,也得到了一项独立研究的初步验证。
9月29日,来自波恩大学、Lamarr研究所等机构的研究者提交了一篇预印本。
他们在37个数据集上测试Jev 1.13.0,完成346,009次请求,总花费不到10美元。
超过34万次请求,不到10美元。这笔账,确实让人眼前一亮。
Jev在8个选择题数据集上的选择性预测:只回答最有把握的问题时,准确率更高;回答范围扩大后,准确率整体下降。
测试覆盖了分类、阅读理解、内容审核和评分等任务。不过,这个成本对应的是特定评测,不能直接换算成任何工作都这么便宜。
研究也发现,Jev在选择题上的概率校准表现较好,但处理二元判断时,直接套用固定的0.5阈值,效果并不总是理想。在部分任务上,根据训练数据调整阈值,结果明显改善。
说白了,模型给出一个概率,软件还得决定:达到什么程度,才值得采取行动?
再看邮箱这个场景。
错把广告邮件当成重要通知,可能只是多打扰你一次。漏掉一封当天必须回复的消息,代价就大得多。
哪些能自动归档,哪些必须提醒,哪些拿不准时要交给人,都得结合实际效果来调整。
就连TypeSafe自己的文档,也没有回避短板:
计数不够可靠,日期先后比较可能出错,多层推理容易遇到困难。输入里一旦混入大量无关内容,也会影响判断。
答案只有寥寥几个选项,并不等于每次都能选对。
Jev适合接手哪些步骤,还需要一项项验证。算术交给普通程序,复杂问题交给更强的模型,重要又拿不准的判断,留给人来复核。
省下来的调用费,不能又变成用户收拾烂摊子的时间。
当AI便宜到可以随手调用
Jev这个名字致敬了经济学家William Stanley Jevons。
William Stanley Jevons
他提出的「杰文斯悖论」描述了这样一种现象:
资源利用效率提高、使用成本下降,可能刺激更大的需求,最终让总体消耗反而增加。
TypeSafe把杰文斯悖论的逻辑写进了AI应用:当调用AI的成本足够低,更多琐碎小事就值得交给AI处理。
过去,我们常常需要特意打开聊天窗口,贴材料、写要求,再把答案复制回原来的软件。
如果筛选、分类、检查这些能力能直接进入软件,许多步骤就可以在后台完成。
邮箱先筛出值得提醒的消息,写作工具先标出需要检查的句子,助手处理简单请求时快速响应,遇到复杂问题再调用更强的模型。
你不用每次都特意找AI,软件也有机会替你多做一步。
对用户而言,后台用的是Jev、Luna,还是别的模型,未必是最关心的事。
少等几秒,少点几次确认,少漏掉一条重要信息,这些变化才是最重要的。
8.7亿美元融资,给了TypeSafe继续研发的资金。OpenAI的快速跟进,也让竞争迅速升温。
接下来,Diogo和TypeSafe需要用实际表现证明:开发者为什么愿意继续选择Jev。
而普通用户的期待或许很简单:每天那些消耗耐心的琐碎判断,能有人替自己打理好。
等到真正需要我们拿主意时,AI再把决定权交回我们手中。
参考资料:
https://fortune.com/2026/10/08/jev-an-ai-for-making-quick-decisions-has-been-a-viral-hit-in-silicon-valley-but-openai-is-hot-on-its-heels/https://typesafe.ai/
https://developers.openai.com/api/docs/guides/decisions
https://www.understandingai.org/p/understanding-jev-the-new-model-everyonehttps://techcrunch.com/2026/09/18/a-new-kind-of-ai-model-from-a-chatgpt-inventor-is-thrilling-developers/
编辑:元宇

