TypeSafe AI's Jev model draws attention; NeurIPS 2025 ConfTuner explored similar probability calibration
TypeSafe AI's Jev model, which outputs decisions plus probabilities from input states, has gained attention for its focus on probability calibration. Coverage highlights its conceptual alignment with the NeurIPS 2025 paper ConfTuner, whose Tokenized Brier Score method trains the probability distribution over candidate confidence tokens to better reflect true accuracy. Jev is not open-sourced, and its architecture and training details remain undisclosed.
Coverage timeline
机器之心机器之心
最近,TypeSafe AI 推出的 Jev 模型火爆出圈,将「输入状态 → 输出决策 + 概率」的模型形态重新带回了大众视野。开发者只需提供状态和问题,Jev 就能直接返回预先定义的选项、分数或事件概率,且结果可直接被代码调用。 虽然 Jev 目前没有开源,架构和训练细节也未公开,但从其公开的 API 和特性来看,有四个核心亮点: ✨ 直接输出决策 + 概率 ⚡️ 支持并行概率预测 🎯 概率本身就是预测的核心,而不只是附属品 ⚖️ 追求概率校准:不只要选对,还要让给出的概率反映真实正确率 这些核心亮点,与 NeurIPS 2025 的入选论文 ConfTuner 不谋而合。两者在概率建模和校准上的技术直觉高度一致: 不仅关注模型最终输出了什么结果,更关注各个候选结果背后完整的概率分布。 新加坡国立大学团队在 ConfTuner 中提出的 Tokenized Brier Score 方法,正是通过直接训练候选置信度的概率分布,让模型表达的「把握」更接近其实际的正确率。 图源:ConfTuner 论文 Figure 1。论文用医疗场景说明,模型对错误答案表达过高置信度,可能影响人的后续判断。 论文:https://arxiv.org/abs/2508.18847 代码:https://github.com/liushiliushi/ConfTuner 延伸项目:JevTuner https://github.com/liushiliushi/JevTuner 把一句「我有 80% 把握」,变成一组可以训练的 token 概率 假设模型回答完一道题,接下来要输出「Confidence: 80%」。在生成置信度的这一步,模型已经为词表中的候选 token 计算了 logits。ConfTuner 从中取出代表 0 到 100 等置信度的候选 token,再在这些候选上做 softmax,得到概率分布。 这一步很关键:研究对象不再只是最终说出的「80%」,而是 0%、1%……100% 各个候选置信度对应的整组概率。这些候选值在 同一步计算中得到,不需要把每个数字分别生成一遍 。 图源:ConfTuner 论文 Figure 2。上半部分取得候选置信度 token 的分布,下半部分利用 Tokenized Brier Score 进行微调。 这就是两者在技术思路上
