Jev 决策模型:当 AI 只返回一个数字

TypeSafe AI 发布的 Jev 模型不输出文字而返回概率浮点数,可处理是非题、选择题和评分任务,语义搜索和网页质量打分等场景因此变得可量化,但黑箱化问题引发争议。
当 AI 不再说话,只说数字
2026 年 10 月,AI 圈最引人注目的新闻并非 GPT 或 Claude 的新版本,而是一家叫 TypeSafe AI 的公司发布了一个名为 Jev 的新型模型。它与传统大语言模型最大的区别在于:Jev 不返回文字,只返回一个浮点数,表示概率。
乍看之下,这似乎是一个退步——AI 不再"说话"了。但仔细想想,这个设计解决了一个长期被忽视的问题:如何让 AI 的输出变得可量化、可计算。
三种核心用法
Jev 模型支持三种任务模式,每种都围绕概率输出展开:
是非题(Binary):输入一个陈述句,模型返回 0 到 1 之间的概率值。例如问"明天下雨",返回 0.99 意味着 99% 的概率为真。
选择题(Multiple Choice):给定 A、B、C、D 四个选项,模型对每个选项分别返回概率,最高值即为最可能的答案。
评分(Score):提供一组评分标准,再给一段原始材料,模型根据标准自动打分。这在内容质量评估场景中尤其有价值。
两个实战案例
语义查找:Ctrl+F 的进化
有人用 Jev 改造了浏览器的 Ctrl+F 功能。传统的 Ctrl+F 只能做精确文本匹配,而改造后的版本实现了语义查找。
实现原理很直接:把网页的每个段落逐一喂给 Jev,问"本段落是否与用户的搜索词相关?"。Jev 返回相关度概率,按概率排序后,最高的几个段落就是语义匹配的结果。
举个例子,在一个名人传记页面上搜索"青少年时代",它找到的不是包含这个词的段落,而是真正讲述人物少年经历的段落。
网页质量自动打分
另一个案例是网页质量评分。作者定义了一组从低到高的评分标准:
- 论点缺乏依据,或纯粹堆砌辞藻
- 理由寥寥,论证松散、流于修辞
- 理由清晰,逻辑结构连贯
- 推理结构严密,有实据支撑,并回应了反方观点
让 Jev 按这套标准对打开的网页自动打分,用户无需阅读全文就能判断内容质量。
对开发者的实用价值
这两个案例揭示了一个关键洞察:当 AI 输出从自由文本变为量化数值时,许多以前无法数字化处理的任务,立刻就能用计算机来编排和自动化。
对开发者来说,Jev 的适用场景包括:
- 内容筛选与排序:对搜索结果、文档库按相关性打分排序
- 质量评估流水线:在 CI/CD 中自动评估生成内容的质量
- 规则引擎替代:用概率打分替代复杂的 if-else 规则判断
- 人机协作决策:为人类决策者提供量化的辅助参考
争议:黑箱化的倒退
著名开发者 Simon Willison 对 Jev 提出了尖锐批评。他认为 Jev 实际上代表了机器学习系统的一种倒退——走向黑箱。
他写道:以前的大模型虽然不能保证正确,但至少可以要求它们解释决策过程。而 Jev 只给你一个浮点数,这个数字怎么来的,完全不知道。
他特别担忧 Jev 被用于求职者排名:有了 Jev,公司筛选简历、挑选面试者变得前所未有的容易,复杂的评估被简化成一个评分题。这种简化是否公平、透明,值得深思。
总结
Jev 模型的核心价值在于将 AI 的输出从不可量化的文本变为可量化的概率,这为许多自动化场景打开了大门。但它的黑箱特性也带来了可解释性和公平性的隐忧。对于开发者来说,理解这个模型的能力边界和局限性,才能在合适的场景中用好它。