Jev模型已持续走红超过一周。从各种创意玩法到基础范式,围绕它的探讨仍在持续发酵。

Jev既不与人对话,也无法协助撰写文章或编写代码。它的功能非常单一:当开发者提供一组选项和当前状态时,它仅负责做出判断。

Jev的创造者Diogo Almeida曾是OpenAI的研究员,参与了InstructGPT、ChatGPT和GPT-4的相关研究。他过去教导大模型如何对话,如今却反其道而行之,打造了一个拒绝交流的模型。

Almeida为何要转变方向?Jev又击中了当前大模型行业的哪些痛点?将模型能力极致收窄,是否会成为未来模型行业的发展趋势?

有些任务,无需动用最强大模型

Jev的走红,首先切中了Agent时代最现实的问题:模型调用必须更快、更便宜。

开源项目Browser Use的创始人利用Jev搭建了一个浏览器Agent,在真实的Google Flights页面上查询从苏黎世到伦敦的机票。整个流程运行完毕耗时7.1秒,单次成本仅为0.0039美元,而Jev在循环中的中位延迟约为178毫秒。

Jev的定价也极具竞争力。目前,Vercel AI Gateway上Jev的输入价格约为每百万token 0.04美元,输出免费,这使得开发者可以无负担地频繁调用。

慢和贵已成为行业的共同焦虑,这与Agent正从代码场景向更广泛的办公场景扩展密切相关。

OpenAI的数据显示,从今年2月到6月,企业每周活跃的Codex用户数在法律、销售与招聘以及市场营销领域,分别增长至原来的108倍、41倍和26倍。

当模型演变为持续执行任务的基础设施时,调用频率和Token消耗也随之增加。模型厂商一方面在提升旗舰模型的能力上限,另一方面,面对Agent大规模调用的新需求,也必须考虑如何降低模型调用的成本和延迟。

因此,模型层已开始出现分化趋势。 如今,同一家厂商也会推出不同档次、不同价格的模型,导致Flash模型扎堆的现象。

Google在5月推出了Gemini 3.5 Flash,瞄准日常开发和工作场景。7月31日,DeepSeek发布了V4 Flash。8月下旬,Qwen3.8-Flash-Next和GLM-5.3-Flash也相继亮相。

这些模型未必追求在所有基准测试中达到最高分,但它们并非能力被削减的“阉割版”。 它们是针对高频、简单任务专门优化的新档次,且价格更为实惠。

以DeepSeek为例,它最近将V4 Flash更新至V4.1 Flash,并宣布在下一代Pro模型上线前,将V4 Pro的API请求路由到V4.1 Flash,并按Flash的价格计费。

过去,用户遇到任务时,第一反应是寻找那个最强的通用模型,能力越强越好。厂商的主线也是将一个旗舰模型打造得尽可能全能。

但现在,模型厂商开始根据任务的复杂度、调用频率、响应速度和成本等因素重新划分能力,推出不同档次,让不同的模型承担不同的工作。

这种分化还在持续深化。 从使用场景来看,代码、图像、语音等方向早已有专门优化的模型。办公、游戏等场景也正在逐步出现更贴合自身需求的模型。

毕竟,不同场景的任务结构、上下文以及对速度和成本的要求各不相同,模型也因此有了针对具体环节进行取舍的空间。

Jev是分化趋势中的一个极端案例

当其他模型还在通用框架内调整能力和价格时,Jev干脆将一类能力从通用模型中剥离出来,单独制作为一个模型。

开发者向Jev提供一段当前状态和一组预设问题,它返回的是Choice、Score或Boolean,并附带相应的概率。Jev不会解释自己为何做出这种选择,程序获得结果后便可直接继续执行。

这对Agent至关重要。在Agent中,模型的输出通常直接决定下一步行动。此时,系统需要的可能不是一段完整的自然语言回答,而仅仅是一个明确的信号。

这一设计背后,是Almeida对大模型训练方式RLHF的反思。他认为,人类反馈会促使模型生成更符合人类偏好的回答,但也容易让模型养成另一种习惯:在面对自己把握不大的问题时,仍倾向于给出流畅、完整且笃定的回答。

Jev试图让模型将不确定性写入输出结果。如果模型判断某件事有八成把握,那么在长期统计中,它的判断结果就应该接近八成正确。系统获得这个概率后,可以自行设定门槛,将把握高的任务自动放行,而把握不足的任务则转交给人类或更强大的模型。

不过,让模型实现可靠的自动化决策,是Almeida想要达到的方向,但目前Jev尚未实现。

有开发者测试发现,针对同一个判断,正着问一遍、再反着问一遍,Jev给出的两组概率相加,有时会超过1。一个校准得当的概率系统不应如此。Jev虽然避免了编造一段像样答案的风险,但它给出的概率仍然可能出错。

调用不同模型的Agent入口更加重要

即便Jev还存在不少问题,它仍让行业看到了另一种可能性:Agent中的智能也可以被拆解,一项复杂任务不一定由一个通用大模型包办。

例如,需要复杂推理时可调用强模型,而大量简单的判断和筛选,则可以交给像Jev这样更快、更便宜的模型。

Jev的名字也蕴含深意。经济学中有个“杰文斯悖论”(Jevons Paradox)的概念,意指一种技术变得更高效、更便宜后,其使用量反而会增加。那么,当Jev让“判断”这个动作变得更快、更便宜后,Agent在执行任务时就越有可能频繁调用它,从而优化整体任务的效率和成本。

也就是说,任务本身将逐渐成为Agent的核心。根据任务调用不同模型,Agent执行的效率和性价比可能会更高。

模型之间的关系也因此多了一种可能。过去,模型比拼的是谁更强,一个模型能力提升后,便替换掉上一个。现在,以任务为核心,不同模型可以各自承担自己更擅长的部分,在同一个Agent中协作。

如果这种分工继续发展,一个能够根据任务调用多个模型的Agent入口将会变得更加重要。

已有Agent产品朝这个方向迈进。在国内,腾讯WorkBuddy已支持在不同主流模型之间切换。WorkBuddy还具备Auto模式,系统会根据用户任务的类型、复杂度与上下文特征,自动选择当前最适合的模型进行响应。 当用户不知道该选择何种模型,或面对混合型任务时,可以交由系统来决定。

海外的Cursor也在做类似的事情。它在今年8月推出的Cursor Router,会在每个请求交给模型之前,先根据任务类型、复杂度、上下文等信息进行判断,再从多个模型中选择最合适的一个。基本原则是,简单任务交给快速、便宜的模型,而困难、长周期的任务则交给前沿模型。

这些产品的思路都是一致的:将调度模型这件事交给系统,按任务自动完成。用户只需提出任务,至于该派哪个模型上场,则交给入口去安排,从而提高Agent使用的效率并降低成本。

长此以往,当模型逐渐走向各司其职,一个能灵活调配它们的Agent入口,将变得越来越重要。

本文来自微信公众号“深流研究所”,作者:萧樱,36氪经授权发布。