经济学中的杰文斯悖论指出,当某种资源的使用效率提升、单位成本下降时,其总消耗量往往会增加而非减少。目前,大模型行业正完美诠释这一规律——模型价格越低、响应越快,调用量就会呈爆发式增长。
近期在硅谷引发热潮的新物种Jev,这一与杰文斯悖论同名的“大模型”,正将这一趋势推向极致。
它不会为你写诗,也不愿探讨人生,甚至不屑于生成一句完整的废话。然而,这个冷酷的“哑巴”模型,在发布不到48小时内,便在X平台上吸引了超过3000万的狂热关注,有2.5万名开发者涌入内测;上线大模型托管平台Vercel仅24小时后,近13%的付费团队迅速接入——这一渗透速度,是当年GPT-4的两倍。
天下武功,唯快不破。Jev的杀手锏正是如此:极速且极度便宜。作为前OpenAI核心研究员、RLHF技术的共同发明者,Jev创始人Diogo Almeida甚至放出豪言:“下一个时代并不属于Claude Code这类辅助工具,Jev才是未来!它比通用模型快200倍,便宜400倍,并且零幻觉。这将是继RLHF之后的next big thing。”
从毫秒级响应的浏览器插件,到高频执行的链上交易决策,再到每秒10次决策、碾压人类玩家的《毁灭战士》通关外挂,开发者围绕Jev打造的应用案例呈井喷之势。
然而,面对这个估值一夜之间飙升至2亿美元、却至今将训练方案与底层权重严密隐藏的“黑箱”,业界的好奇心与质疑声也达到了顶点:它到底是模型架构的革命,还是被营销包装的“分类器”?
就在昨日上午,国内人工智能企业APUS(麒麟合盛)旗下AI实验室,公开了全球最早一批针对Jev的独立开源复现成果,并将其封装为开箱即用的Agent Skill fast-browser-use。该项目支持纯本地模型离线执行,覆盖macOS、Linux、Windows三大桌面与服务器操作系统,甚至无需独立GPU,在普通Mac和PC上也能本地运行。
目前,该项目完整代码已通过MIT协议向社区开放。
张旭博士,清华大学本硕博连读,工学博士,APUS AI首席科学家
笔者第一时间联系到了该项目的负责人——APUS AI首席科学家张旭博士。我们围绕Jev的底层技术逻辑和路线、APUS的复现与改造逻辑、这类快速决策模型的应用潜力,以及Agent未来的“快慢分工”趋势等话题进行了详尽探讨。
准确来说,张旭团队并没有拿到Jev的模型权重、完整架构和训练方法;而是通过公开资料和实际输入输出反推其工作机制,基于Qwen3.5系列、Google Gemma系列等开源模型还原了Jev最核心的工作流,并在推理速度上实现了对标。
开源当天(9月20日)上午APUS公布首轮结果:真实浏览器任务中,维基百科检索约18秒完成,表单填写、站内跳转等更短链任务则在数秒内完成,全程无需调用云端模型;下午采访,张旭团队把测试迁移到了RTX PRO 6000,单次决策时间压缩到了79毫秒,与Jev响应时间70~500毫秒成功看齐。
他还透露,其内部自研模型可实现更小9B、4B参数规模复现Jev的性能,并将于近期开源。
以下为笔者与张旭博士的访谈精要。为便于阅读,本文对原始对话进行了提炼与整合。
拆解Jev的底层逻辑
AI前线:如果抛开官方的概念话术,您能不能用更直观的方式解释一下,Jev和今天常见的大模型到底有什么差别?它本质是什么?
张旭:理解这个问题的关键,在于看透大模型工作的两个基本步骤。第一步是Prefill,也就是输入处理;第二步是Decode,也就是自回归生成。
当大模型走完第一步Prefill时,它神经网络内部的“隐状态”其实已经理解了你输入的文字和图片细节。
第二步的Decode,是一个字一个字往外吐Token,这一步纯粹是为了“翻译给人看”。
但人类语言的带宽很窄,存在极高的信息损耗。比如这张包含猫、树枝纹理和复杂光影的图片,无论你怎么用文字描述,都不可能毫无遗漏地还原给另一个人。
Jev的核心本质,就是它砍掉了第二步(Decode),只保留了第一步。它不再为了迎合人类而去逐字生成文本,而是直接在模型理解完信息的“隐空间”里计算出结果。
AI前线:那它最后到底输出什么?就是Choice、Score/概率这类东西吗?
张旭:对。普通大模型每生成一个Token,本质上都是在十几、二十万词汇的词表里计算全量概率,再选择一个吐出来。
Jev则是把这个过程极度收敛,变成了对有限选项的概率测算。比如你问“这份提纲完整了吗”,只给“完整”和“不完整”两个选项,它只返回这两个选项的概率得分。
这也是为什么它说自己不会出现幻觉。并不是说它不会判断错,而是说你只给它A、B、C,它不会凭空给你编出一个D。
但不出现幻觉和不出错是两回事。
AI前线:既然只是给出固定选项的概率,业界有人质疑它只是被包装过的“动作分类器”,您怎么看?它到底新在哪里?
张旭:这么说也没错。但我觉得还要看到它背后更大的研究趋势。
比如一张图片里面包含非常丰富的信息,你不管用多长的文字去描述,都很难把全部细节还原出来。语言本身就会造成信息损失。
所以现在一个前沿方向是:既然模型内部已经有这些信息,我们是不是一定要先把它变成人类语言,再拿语言继续处理?
Jev可以看成这个方向里的一个具体特例。它把后面的语言生成省掉,直接从模型内部状态里去完成判断。
AI前线:所以您说的这个更大的方向,具体是什么?就是把“理解”和“生成”进一步解耦吗?
张旭:这是其中一个方面。行业里会把更大的一类思路叫作隐空间计算。
比如两个Agent之间通信,它们都不是人,为什么一定要把第一个Agent脑子里的信息翻译成人类语言,再让第二个Agent读一遍?理论上可以直接在模型内部状态之间做处理。
模型路由、Agent之间通信、模型内部思考,都可以沿着这个方向做。Jev只是拿这个思路去做了一件具体的事情:有限选项的概率判断和决策。
AI前线:作为行业共识,那目前头部大厂在这方面的探索进展如何?Jev的做法和他们有什么不同?
张旭:是的,比如DeepSeek-v4.1 Flash版本,就已经在尝试把Prefill和Decode的能力解耦。更典型的代表是目前最新的GPT-6(Astra),业界探讨的Loop Transformer机制,其本质就是让模型的思维链和思考过程,在“隐空间”内部进行循环计算,而不再转化为低效的人类文字吐出来。
对比而言,Jev则是把隐空间计算的成果,讨巧地“产品化”了,它说明,把隐空间的中间结果直接拿出来用,已经足以颠覆当下的应用形态。
AI前线:Jev最明显的特点就是快。除了省掉长文本生成,它为什么还能快这么多?
张旭:不生成文本是最大原因,因为相当于“只吐第一个Token”,只做判断。但除此之外,还有计算维度的降级。
第二个,原来是开放式生成,现在你给它的可能只有几个、几十个候选,计算范围更小。
第三个,这些候选之间相互独立,可以更多地并行判断;而传统的自回归生成前后有依赖,每一个Token都要等前一个。
我们自己的实现里也做了类似KV Cache广播这样的处理。所以总结下来就是:少生成、候选范围更小、还能并行。
AI前线:那除了速度,它还有什么本质上的性能优势吗?
张旭:其他方面在我们看来,它跟大模型没有本质区别。它其实也就是一个大模型,只是只用了一半。
效果好不好,最终还是取决于模型本身训练得好不好。
如何复现Jev
AI前线:Jev没有开源权重、完整架构和训练方案。在这种情况下,你们所谓的“复现”,严谨来说复现的是什么?
张旭:严谨来说,我们复现的是它的功能。
我把他们所有公开资料都看了一遍,也研究了创始人的背景,再自己实际调用Jev,看它的输入和输出。
可以理解成我把它当成一个黑盒。如果我可以实现相同类型的输入、相同类型的输出,那我们认为基本复现出了它公开出来的功能。
AI前线:那你们在千问上具体做了什么改动?
张旭:原版的Qwen3.5就可以。
模型本身不用改,主要是在外面的工作方式上处理。这次开源的东西,也是从我们公司已有的Agent Harness里抽了一部分出来,再精简以后放出来。
AI前线:那是不是随便拿一个小模型也能跑?对底座模型能力、参数规模有没有要求?
张旭:这个实际测试以后还是有要求。
我看到开源社区有人拿五六亿参数模型复现,确实能跑起来,“能用两下”,但你会发现它很傻,没办法真正实用。
所以我自己把千问从小模型一路往上试。最后看下来,9B基本上是最低的可用门槛,再小就很难实用;35B效果会更好。选9B也是因为希望普通网友自己的电脑就能运行,不需要特别好的设备。此外,我们也在训练自己的模型,很快也会开源,初步看已经超过了Jev的效果。
AI前线:这次复现有没有什么超出你预期的结果?比如原来以为很难,做完以后发现其实没那么复杂?
张旭:没有特别意外。
反而我们为什么能这么快做出来,就是因为过去在这个方向已经积累了很多,直接把已有的东西拿过来用了。
AI前线:所以反过来说,你们这么快就复现出来,是不是说明Jev目前公开出来的东西,本身并没有特别高的技术门槛?
张旭:更客观地说,它背后还有没有别的东西我不知道。
但至少目前拿出来的部分,在我们看来,就是这个研究领域里的一个特例,没有什么特别神秘的地方。
“79毫秒”能用在哪
AI前线:你们为什么第一时间把复现做成一个Browser Agent?
张旭:我们第一天先看了行业里大家拿Jev做什么,发现最多的就是操作浏览器。
而且我们希望开源出去的东西是有实际用途的,而不是一个技术Demo或者玩具,所以先把浏览器这个场景做出来。
以前很多Agent操作浏览器,需要让大模型先生成操作代码,再去执行。我们现在是把网页上可以交互的元素先列出来,比如输入框、链接、上下翻页,再让模型直接做选择:现在应该输入、点哪个链接,还是翻页。
后来模型本身已经做到毫秒级以后,我们统计发现,完整任务里大部分时间反而花在等网页加载、等网页刷新。
AI前线:那你们为什么长期会往本地模型、CPU、小算力、模型路由这些方向走?这些看上去是很多单点技术,背后的逻辑是什么?
张旭:核心还是AI普惠。
我们一直在想,模型能不能不用很昂贵的GPU,靠CPU也能有一个可以接受的速度和效果。因为绝大多数普通用户不会在电脑里装5090,更不可能买H100、B200。
如果AI最后真的要进入大规模C端产品,全部推理都依赖中心化大算力,本身会是一个限制。所以我们希望把一部分计算分散出去,分到CPU服务器,甚至分到用户手机上。
这也是我们做模型解耦、路由、本地推理这些事情背后的共同逻辑:用更高的性价比,让AI真正能够大规模普及。
AI前线:如果不只看浏览器,这种模型还能用在哪里?
张旭:其实能落的场景很多。
比如我们经常会访问到一些网站上显示大量的广告、欺诈信息、杂乱的内容,那么浏览器有了这个能力加持,就可以快速筛选和过滤。
开发者Movez基于Jev分析了10万条X帖子,耗时仅为20.4秒,花费0.67美元
推荐系统也是很典型的场景。A文章用户感兴趣的概率是多少,B是多少,再把概率高的内容推荐出来。
我还看到有人拿它批量审文档,因为很多判断可以并行,所以一次处理上千份文档,速度和成本会有优势。
AI前线:现在也有人拿Jev做炒股、交易。它因为决策快,会不会特别适合这一类场景?
张旭:快不代表它炒股水平高。
炒股最后还是看模型本身的智力水平,以及有没有针对金融这个方向做优化。Jev现在应该没有专门针对这个方向优化。
所以不能因为它能很快做决策,就认为它一定能赚钱。
AI前线:那再往长远一点看,还有什么你觉得值得关注的应用?
张旭:更长期可能会到工业自动化、智能家居这些领域,因为它们都需要很快做出行动。
现在不是已经有人拿Jev玩游戏了吗?
它能玩游戏,其实就能够操控机器人。
Agent走向快慢分工
AI前线:决策变得这么快以后,下一个挑战会在哪里?
张旭:一个很明显的问题,就是智力。
过去为什么大模型会吐很长的思维链?因为它要靠这些过程提升数学、编程、推理等复杂能力。
现在你把这部分砍掉,它就更依赖模型的“直觉”、第一反应。如果问题本身比较复杂,需要多步思考,那Jev当前的智力水平可能就不够。
AI前线:也就是说,它更适合规则比较清晰、候选明确的任务;如果需要真正复杂推理,就会出现准确率问题?
张旭:对。复杂问题本身就可能超出它现在的能力。
AI前线:为什么Jev一出来,开发者会这么兴奋?快思考、慢思考这套思想其实并不新鲜,去年OpenAI、DeepSeek、Qwen都尝试在基座模型里融入这套逻辑。
张旭:对,快思考和慢思考本身不是新东西。
以前很多模型也说自己有快模式、慢模式,但所谓“快”,本质上仍然是大模型一个Token一个Token生成,只是思维链短一些。从普通用户体验上看,它其实并没有真正快到像“本能”。
Jev为什么火,我觉得一个原因就是,它真的快到足够实用了。以前那个“快思考”,其实也不快。
AI前线:但这是不是意味着它没有办法单枪匹马完成一个长链条Agent任务,还是需要和完整的大模型配合?
张旭:我认为是两个类型互相需要。
比如机器人,如果所有操作都让大模型慢慢想,很难实用化。它一定需要一些非常快的模型去执行动作。
复杂任务规划、逻辑推演可以交给慢模型,而高频、原子化、环境交互类动作,就适合交给这种受限决策模型。
AI前线:那快思考和慢思考,最终有没有可能重新融进同一个模型?
张旭:完全有可能。
系统一、系统二首先是一种架构设计思想。可以是两个模型,也可以一个模型承担两个角色。
通用模型厂商以后完全可能把长生成那部分屏蔽掉,提供一个快速决策模式。
但分成不同模型以后,每个模型可以更专注,也可能效率更高。最终要看是不是一家公司能够把整个生态都吃下来。
AI前线:长远来看,Agent和模型到底是什么关系?模型越来越强,会不会最终把外面的Harness都吃掉?
张旭:我认为不会。
可以打个比方:模型是发动机,Harness是汽车的控制系统,Agent是整辆汽车。
发动机可以越来越强,但你不会因为发动机越来越强,就不要轮子、方向盘和控制系统。所以大模型会越来越强,但它本质上还是Agent里的驱动系统。
声明:本文为AI前线原创,不代表平台观点,也不构成投资建议,未经许可禁止转载。
本文来自微信公众号“AI前线”(ID:ai-front),作者:四月,36氪经授权发布。
BB Sports的开发者团队在分析Jev的应用时指出,这种快速决策模型在游戏操控和自动化领域具有巨大潜力。
李明
这篇文章对新手非常友好,把复杂的赛事数据讲得很清楚。我按照里面的方法分析了几场中超比赛,准确率提升了不少。
张伟
感谢你的认可!贝博体育团队会持续推出更多赛事分析内容,覆盖五大联赛和亚洲主流联赛,欢迎常来交流。
王芳
很实用的帖子!现在每次看球前都会先来贝博体育查数据,再结合自己的判断,观赛体验好多了。