Back to News

TypeSafe AI's Jev structured-judgment model gains traction; LangChain tests it as agent evaluator

#ai#structured-judgment#agent-evaluation#langchain

TypeSafe AI released Jev on September 15, 2026, a model designed for fast structured judgments, and it has rapidly gained traction in developer communities, with related posts reaching 37 million views. LangChain published a Jev-as-a-Judge experiment on September 20 to test its performance as an agent evaluator. Jev offers three core judgment types—Noul, Choice, and Score—each returning probabilities or confidence scores.

Coverage timeline

  1. 机器之心机器之心

    最近,AI 圈又冒出了一个新名字:Jev。 https://typesafe.ai/blog/introducing-system-one-models-and-jev 过去几天里,Jev 在 X、GitHub 和 Agent 开发者社区迅速刷屏。有人拿它在 40 秒内分析 724 条实时广告,有人把它接进 Claude Code 清理上下文,有人用它给 AI Agent 做任务验收,还有开发者把 Jev 接入浏览器 Agent,用它决定下一步该点哪个按钮、进入哪个页面。 LangChain 也很快跟进,在 9 月 20 日发布了一项 Jev-as-a-Judge 实验,测试它作为 Agent 评估器的表现。 连 OpenAI「重置之神」Tibo 也为 Jev 宣传。 Jev 到底是什么? 简单来说,它是一种专门处理「判断题」的 AI。 9 月 15 日,TypeSafe AI 正式发布 Jev,并将这类模型称为「System One Models」。按照 TypeSafe 的定义,这类模型接收一段程序状态或文本信息,然后快速返回结构化判断结果以及对应概率。 Jev 刚发布时, 我们就报道过它 。几天过去,它的热度又上了一个台阶,相关推文已有 3700 万人围观。 举个例子,假设一个客服系统收到一封邮件,开发者可以让 Jev 同时判断:「这是销售线索吗?」「用户情绪是否激烈?」「是否需要人工介入?」「属于账单、技术还是销售问题?」 Jev 返回的可能是一组概率:销售线索:0.91;需要人工介入:0.12;技术问题:0.83。应用程序可以立刻根据这些数字进入下一步流程。 Wasp 联合创始人兼 CEO Matija Sosic 也在 X 上发布了一段 45 秒的 Jev 解读视频。 目前 Jev 提供三类核心判断形式:Noul、Choice 和 Score。Noul 负责 Yes/No 类型判断,Choice 从给定选项中选择答案,Score 根据预设标准进行评分。每个结果都会附带概率或置信度,多道问题还可以围绕同一份输入同时进行判断。 这套设计让 Jev 很快找到了一个爆发式增长的应用场景:给 Agent 当「裁判」。 今天的 AI Agent 经常需要连续完成几十甚至几百个步骤。写代码、调用工具、搜索网页、修改文件之后,系统还需要判断任务是否已经完成。这类问题恰好