JEV:炒作对现实检验人工生成
人工生成人工生成人工智能法案第50条要求,人工生成的图像、音频和视频必须可识别、可机读地标出。这个符号是欧盟委员会的官方基础图标。使用它是自愿的,标注义务不是。机器生成: 文字 · 图像. 有人在驾驭。McGrinsey Living Intelligence SystemsMcGrinsey Living Intelligence SystemsLI: 各种活的智能。 McGrinsey 把常规智能和新的智能收成活的智能系统。这些机器与人共生的系统一起工作,为每一种智能提供最精的认识。
McGrinsey Research · JEV · 2026年9月24日

JEV:炒作对现实检验

Jack Rudenko看了一周Launch-Demos。模型又快又便宜。可比较还是比错了对象。

JEV,TypeSafe AI的决策模型,于2026年9月15日结束隐身。Jack Rudenko在9月22日发表了他的解读。一次调用耗时70到500毫秒。输入每百万Tokens花费0,042美元。输出不花钱。他不跟速度争。他争的是对手。

01 · 演示周

线程里几乎没人想说那句话。

Jack Rudenko看了一周Launch-Demos,写下了线程里几乎没人想说的那句话:新模型又快又便宜,可大多数比较还是比错了对象。

他的文章叫 Jev: Solving yesterday's problems, faking wins with overengineered demos, and never facing the real competition 并于2026年9月22日发表。他描述的信息流整理了收件箱,标记了邮件,识别了语言,评估了情绪,还玩了Pong。每个片段都以同一个点收尾:又快又便宜,聊天模型做不到。

两个说法都可以成立。片段里的对手始终是一个大而全的通才。这就是全部的抱怨,而且值得慢慢读,因为片段下面藏着一种真正不同的形态。

02 · JEV返回什么

状态进去。一个类型化的决策出来。一次调用。

JEV是TypeSafe AI的System-One模型。你给它一个状态和一份类型化问题列表。返回的是决策:从列表里选一个,在你设定的量表上打分,或者带0到1之间概率的是或否。TypeSafe把最后这种叫Noul。全部在一次调用里完成。输出直接进代码。没有一段文字要你先把词抠出来。

机制、三种问题类型以及厂商的速度数字已经写在这个站点上了: Jev:不是聊天机器人。是决策模型。 这篇文章不再把那一页重写一遍。它只谈Rudenko,以及那个证明他有理的外部测试。

问一个文本生成器要“billing”这个词,是错误的游戏。

03 · 错误的游戏

幻灯片在跟一个小说作者较劲。这份工作是个标签。

他看过的每个公开片段都把 JEV 放在一个 GPT 级别的模型旁边。按他的转述,TypeSafe 自己的标题是:在四个内部流程上,比 GPT-6 Astra 和 Fable 5.1 的平均水平快 193 倍、便宜 444 倍。Ably 的 Pong 演示:每步 227 毫秒,而 Haiku、Gemini Flash 和 GPT-5.6 Sol 要 2.5 到 3.5 秒。

跟文本生成器比,差距是真的。一个分发工单的大模型要花好几秒,还按吐出的每个词计费。JEV 按每百万 token 输入 0.042 美元计费,输出为零。调用落在 70 到 500 毫秒之间。Arize 描述的是同一价签和同一时间窗口。以这些单位看,这个奇迹不是编出来的。

Rudenko 觉得这个奇迹对准了错误的对手。分类早就有答案。一个微调过的 BERT 从 2018 年起就是标准,自从 Jacob Devlin 和他的合著者发表那篇论文:小,大约 1.1 亿参数,在一台笔记本 CPU 上就够用。再早是词计数上的逻辑回归。再早是正则表达式,在真实路由器里跑的次数比演示愿意承认的还多。

04 · 分类器对分类器

把网络也算进去,一个无聊的 BERT 已经坐在房间里了。

他想要片段里缺的那一栏。对单次 CPU 调用,他把未优化的 BERT-base 估在大约 100 毫秒,蒸馏版大约 60,优化后低于 10。JEV 的 70 到 500 毫秒包含去到一台外来机器的路程。同一量级,有时更快,有时不然。你把本地模型放到 GPU 上批量跑,按他的算法每件时间会掉到一毫秒以下。那里会拉开大约一百倍的差距,而且是朝向你已经在跑的那台机器。

价格上也是同一刀。每百万输入 token 0.042 美元在 Opus 旁边显得小。在你已经付钱的硬件旁边,本地模型装好之后往往更赢。没有按 token 加价。没有绕网一圈。CPU 数字是他的,我们没有复跑任何一次。把它们当成他的估计来读。方向才是他要钉死的点:分类器对分类器。

外面有个团队发表了他要的那种对比。同一时间,在 Vlad Shulman 2026 年 9 月 18 日的一篇帖子里,他们让 JEV 跑了他们自称每天做几十亿次的工作。零样本重排序在 NDCG@10 上达到了 0.7,打平了他们自己的一个重排序器。主题分类,以及一次搜索是否需要新鲜结果:他们的模型赢了。每文档成本更高,他们也说了原因:跑他们分类器的机器是他们自己的。那里的总结和他的对得上。速度和价格的标题是对着自回归聊天模型的。专门的分类器在这两项上往往仍然更赢。

图 01 · 与参考的一致性,就像 Jack Rudenko 读 TypeSafe 的仪表板那样。黄:JEV。灰:Opus 5。一次运行。
05 · 他在哪里看到收益

没有标签。问题下周会变。

一个微调过的 BERT 没法在周四回答一个全新的问题,除非走一遍训练循环:例子,一次运行,一次检查,一次 Deploy,标签一漂移还得再来同一循环。JEV 在调用的那一刻把问题当字符串接住。

这样就描述了一整组真正的工作。一个路由器,只要你还不认识那些类别。研究,在分类法还在漂移的时候。那些永远不会去训练模型的人。给智能体的护栏,问题在工具之间切换的时候。Parallels 自己的结论是同一条规则:如果你需要一个分类器但还没训练过,从这里开始,并用你的例子检查质量。

他第二天早上就下车。在类别定下来、量涨起来的那天,JEV 刚生成的标签就是训练集。拿去,调一个属于你的小模型。API 是起点。运营路径是你机器上的那个模型。

06 · 一个数字不是评判

给出一个分数是一种格式。正确是一种产品。

演示把两句话混在一起。JEV 给出一个分数。分数不错。只有第一句是从产品推出来的。第二句是另一个问题,在这个问题上他称之为中等水平,和其他通才一样。

TypeSafe 自己的仪表板,按他的读法:在他们的流程上与参考有 67,8 百分比的一致性。Opus 5 在工作流模式下达到 74,1 百分比。在发票上差距更大,61,8 百分比对 79,1 百分比。他喜欢他们把这个公开,也喜欢他们把因素放到真实收益的上端,放到他们自己团队写的检查上。

同一训练数据家族上的新外壳长不出新味道。在 MadAppGang,他故意把潦草的文本给了 JEV、Opus 5 和 GPT-5.6 Sol,看着每个模型都打了高分。JEV 并没有站在旁边。“擅长评分”意思就是:擅长给出一个数字。

这段里有一个日期和其余文字对不上。他把写作测试放在 2024 年 5 月。把发布放在 2026 年 9 月 15 日。2024 年 5 月的测试不可能包含一个 2026 年 9 月才从隐身状态出来的模型。把分数读作他的主张。把月份读作笔误。

07 · Spec 对 Diff

他想要的工作不是收件箱。

把一份 Spec 放在一份 Diff 旁边,问它们差多远。一个微调过的 BERT 没有叫“你的 Spec 对你的实现”的数据集。一个聊天模型可以在一段你之后还得拆开的段落里做,又慢又是前沿价格。JEV 可以在半秒以内返回一个带类型的分数和概率,只要几分之一美分。

这就是他想要的检验皿里的形式。下面是没有模型的检验:对象差异、截图、按规则通过或失败。上面是一个裁判,提出几个打字的问题。改动是否覆盖了规格?它偏离了多远?它是否交付了规格从未要求的东西?最后一个问题是带有概率的幻觉检验。这就是他愿意付钱的问题。

他自己说出了界限。JEV 读文本和 JSON。表面检验需要 DOM,或者一个视觉模型,在 JEV 给描述打分之前先描述两个屏幕。状态加上最长的问题必须能放进 32.000 个 Token,所以单位是一个组件,不是一个代码库。他没有公布与 Opus 5 在实现质量上的比较。他公开提到这个比较,并说无论如何都会发表。在页面上线之前,第二个工作是一个带形式的建议,不是结果。

08 · 再多一列

保留片段。把 DistilBERT 放在旁边。或者一个正则表达式。

他对发演示的人的请求很小。保留这些片段。延迟是真实的,片段是新形式得以显现的途径。当基准升高时,会多出一列:一个微调过的 DistilBERT,或者一个正则表达式,如果工作这么小的话。如果 JEV 仍然赢,你就找到了一个用例。如果它输了,你在等候名单变成你的路由器之前就已经发现了。

一个返回决策而不是散文的模型,是正确的想法。拿它和一个小说作者比,然后在三行正则表达式就够用的地方放一个云调用,这才是错误。分类早就有了本地答案。JEV 解决了零样本版本,并打开了第二个工作:在没有人建训练集的时候,对照参考给结果打分。他认为这第二个工作才是值得测试的。

信息流的其余部分还在玩 Pong。

09 · 事实表
说法篮子来源
JEV 于 2026 年 9 月 15 日走出隐身。TypeSafe AI。由曾参与 InstructGPT 的 Diogo Almeida 创立。事实Jack Rudenko,2026 年 9 月 22 日。Parallel 的产品描述指向同一份 TypeSafe 文档。
调用耗时 70 到 500 毫秒。输入每百万 Token 0,042 美元。输出不收费。事实, 制造商数据Rudenko。同样的窗口和同样的价格出现在 Arize,2026 年 9 月 18 日。
比 GPT-6 Astra 和 Fable 5.1 的平均水平快 193 倍、便宜 444 倍,基于四个内部流程。事实作为制造商行Rudenko,关于 TypeSafe。没有来自外部的复述。
Pong 每步 227 毫秒,对比 Haiku、Gemini Flash 和 GPT-5.6 Sol 的 2,5 到 3,5 秒。作为描述的演示的事实Rudenko关于Ably的演示。我们没有重新停看该视频。
BERT-base大约100 ms在CPU上,蒸馏后大约60,优化后低于10。一次GPU冲刺每件低于1 ms。他的估计Rudenko。这篇文章里没有自己的运行。方向:本地分类器对API,一旦网络算进去。
Zero-Shot-Reranking在NDCG@10为0,7,可与内部Reranker相比。主题和新鲜度:内部模型领先。每文档成本更高。事实Vlad Shulman, Parallel, 2026年9月18日。Parallel自己运营这些分类器。
Dashboard:JEV在他们的流程上为67,8百分比,Opus 5为74,1百分比。账单61,8对79,1。报道Rudenko对TypeSafe-Dashboard的解读。我们没有打开该看板的第二个视图。
2024年5月的一次写作测试包含了JEV。矛盾文本把MadAppGang的笔记放在2024年5月,把发布放在2026年9月15日。两个句子都在里面。一次测试不能两者都描述。
仅文本和JSON。32.000 Tokens。没有已发布的关于实现质量的比较。事实,作为他的界限Rudenko。他公开说出与Opus 5在Spec对Diff上的比较。
10 · 来源
  1. Jack Rudenko,文本
    2026年9月22日。演示的那一周,Dashboard解读,Pong时间,关于2024年5月的那一行,Spec对Diff的提议。
    https://www.linkedin.com/pulse/jev-solving-yesterdays-problems-faking-wins-demos-never-jack-rudenko-0ss8c/
  2. Vlad Shulman, Parallel
    2026年9月18日。NDCG@10为0,7,主题和新鲜度,每文档成本,以及速度标题针对聊天模型的那句话。
    https://parallel.ai/blog/testing-jev
  3. Arize,关于JEV作为裁判
    2026年9月18日。相同的时间窗口,相同的输入价格,输出未计算。
    https://arize.com/blog/typesafe-jev-llm-judge/
  4. TypeSafe,介绍
    制造商关于决策模型的自己的页面。Parallel链接了它。
    https://docs.typesafe.ai/introduction
  5. Jev:不是聊天机器人。一个决策模型。
    我们的解释器,2026年9月22日。Choice、Score、Noul,以及制造商的速度数字。
    https://mcgrinsey.com/magazin/jev-entscheidungsmodell-typesafe/
  6. BERT、Devlin和其他人,2018
    “自2018年以来”这行背后的论文。用于语言理解的双向Transformer。
    https://arxiv.org/abs/1810.04805

剪辑:2026年9月24日。仪表板百分比是Rudenko的解读。Parallel的数字就是Parallel的数字。2024年5月这个日期留在事实表中,因为文本打印了它。