EZ.AI Listen Daily
想象一位科学家,面对一个从未有人解答过的问题,需要自己决定研究方向、选择实验方法、动手验证猜想,最终得出可信的结论。这正是人工超级智能(ASI)理应具备的能力——不止掌握已有知识,更要探索未知、创造新知,并把新想法变成可检验的成果。然而,今天的AI系统,其能力大多建立在学习、压缩和应用人类已有知识之上。现有的评测基准,也主要考察AI能否根据学过的知识给出正确答案,或能否在大量人工指导下完成任务。AI距离真正自主的科学研究,究竟还有多远?
为了回答这个问题,一个由40多位专家参与、耗费超过31,000小时构建的评测体系——ASI-Bench——应运而生。这是第一个在通用研究领域同时评估AI“创新探索”能力与“自主科学执行”能力的基准,也是第一个在同一研究项目中逐步撤除人类方法论指导、测试AI究竟能独立走多远的基准。它包含60个来自11个科学领域的项目级研究任务,覆盖范围从基础科学到应用研究,难度远超传统的单步问答或代码生成。每个任务都经过专家评审、AI辅助审计、沙盒执行和评分者验证,确保结果可信。
ASI-Bench设计的核心,是对“指导程度”的精细控制。在一个研究项目中,AI会经历三种情境:完整方法论指导、仅指定方法、以及完全由AI自行决定方法。这就好比一位导师先手把手带着学生做实验,然后只提示“用这个方法试试”,最后干脆放手让学生自己设计整个研究方案。评测结果显示,18种当前最先进的智能体模型配置,在这三种情境下的平均得分依次为50.91分、29.10分和26.62分。当方法论指导被移除,AI的表现出现了断崖式下跌。
这意味着什么?即便经过大量训练、拥有海量知识,当前最顶尖的AI系统在失去人类的方法指引后,研究能力依然捉襟见肘。它们可以执行明确指令下分解出来的子任务,却难以独立完成一个完整的研究项目:从提出假设、选择实验路径,到分析结果并产出可验证的结论。50.91分到26.62分的差距,正是“人类指导”的价值尺度,也是AI迈向自主科研所必须跨越的巨大鸿沟。
ASI-Bench并不只是给AI“泼冷水”,它也为未来的发展指明了方向。所有任务与评测框架均已向全球开放,研究者可以不断提交新任务、挑战现有AI的边界。衡量进步,首先要敢于暴露不足。这条路还很长,但至少我们已经有了清晰的标尺——或许下一次技术跃迁,就能让我们看到AI在脱离人类指引后,真正迈出属于自己的那一步。
当强化学习在单轮对话的大模型微调中风光无限时,一个棘手的问题悄然浮出水面:面对长程智能体推理任务,那些需要层层决策、奖励稀疏且交互路径不断分叉的复杂场景,传统的强化学习开始力不从心。它的训练栈依赖繁重的反向传播,想要微调更大的模型几乎寸步难行;而随着轨迹拉长,信用分配的难题更是让算法陷入迷茫。
一篇最新研究却提出了一个大胆的转向:进化策略或许才是长程智能体微调的更优解。与基于梯度的强化学习不同,进化策略仅需推理级别的显存就能实现全参数优化,这让微调超大模型成为可能。它那轻量级的黑盒反馈接口也极具弹性,能与提示词空间的进化自然融合,比如同步优化技能与测试时计算。更关键的是,进化策略直接在轨迹层面进行参数归因,无需在时间维度上拆解奖励,随着任务视野不断延长,它的扩展性反而愈发突出。
基于这一洞察,研究者推出了Agentic ESOpt框架,一个支持参数与上下文协同进化的全参数智能体微调方案。每一步中,它都在当前模型参数周围采样扰动,让智能体与环境互动获得奖励,再据此进行在线加权更新。为了平衡探索与适应,框架还引入了扰动幅度σ的余弦衰减调度。在WebArena-Lite基准上,对Qwen-3.5-27B进行全参数优化,让无技能基线直接提升了6.69%;而在测试时自动启发式设计任务中,Agentic ESOpt通过在线提示词与参数协同进化,在36个设置中击败了匹配基线28个。
这项研究并非要全盘否定强化学习的价值,而是提醒我们:当任务变得漫长而复杂,或许轻巧而灵活的进化策略,能够走出一条更远的路。真正的好算法,不是永远追求更重的计算,而是在恰当的尺度上,找到最优雅的杠杆。
想象一个机器人,它不再被束缚在单一的躯壳里,而是能像大脑一样,将“看”“想”“动”融会贯通,灵活地驾驭从家庭服务到工业操作的各种任务。这,正是GigaBrain-0.7想要抵达的远方。
长久以来,视觉-语言-动作模型(VLA)被视为通用机器人的主流范式,它们能在结构化环境中完成复杂且长时程的任务。但一个关键问题悬而未决:现有的VLA系统,能否通过更精巧的架构设计、更海量多样的数据喂养,以及更广泛的跨任务、跨本体(即不同机器人形态)泛化,真正迈向通用?GigaBrain-0.7正是对这一问题的有力回应。
作为新一代具身基础模型,GigaBrain-0.7最引人注目的特色,在于其独特的“三系统架构”——将理解、预测与动作生成统一于一个框架内。这好比给机器人配备了一个分工明确又协同高效的中央决策机构:一部分负责理解世界,一部分负责推演未来,一部分负责生成具体动作。它不再是一个简单的“输入指令-输出动作”的黑箱,而是一个能主动感知、推理与行动的整体。
为了锤炼这个“大脑”,研究团队投入了超过37,000小时的多形态异质机器人数据进行预训练。这相当于让机器人在不同身体、不同环境、不同任务中持续“见习”数年,见多识广,方能处变不惊。更关键的是,他们引入了单阶段对齐训练方法,一举将视觉语言理解与多形态动作生成同步优化,避免了传统多阶段训练中可能出现的“理解”与“行动”脱节问题。
效果如何?与上一代GigaBrain-0系列以及包括π0.5在内的先前最先进模型相比,GigaBrain-0.7在多个维度上取得了显著进步:基础零样本能力大幅增强,这意味着它在面对从未见过的任务和环境时,能更从容地举一反三;语言条件指令跟随更加精准,使用者可以用更自然的话语指挥它;而在后续的任务微调(post-training)中,其任务成功率也明显提升。
尤其值得关注的是,在自研的Maker H01平台以及主流机器人本体上,GigaBrain-0.7都展现出强大的任务适应性和完成能力,无论是温馨的家庭场景,还是严苛的工业流水线,它都能找到自己的用武之地。这暗示着,一个能跨越机器人形态隔阂的通用“大脑”,或许并非遥不可及。
更为可贵的是,研究团队承诺将开放全部训练代码与预训练模型权重。这意味着,全球的机器人研究者都能基于这个强大的基座,打造属于自己的“超级机器人工匠”,从而加速整个领域从“专用”走向“通用”的进程。
当机器人的“大脑”不再依赖特定“肉身”,当它学会在千万种变化中捕捉动作与语义的关联,我们或许正站在一个新时代的门口:机器人不再是僵硬执行命令的工具,而是能理解世界、适应环境的伙伴。GigaBrain-0.7只是旅途中的一站,但它照亮了通往真正通用具身智能的方向——让智能挣脱形态的枷锁,在开放的天地间自由生长。
想象一下,一个机器人能够通过观看人体演示来理解并执行任务,甚至无需专门为每个任务收集专家示范数据。这正是Hydra-0所展现的惊人能力——一个以动作流为条件的通用世界模型。
Hydra-0的核心创新在于,它将机器人动作表征为像素运动,从而构建了一个共享的视觉接口。这听起来抽象,但本质上意味着:无论是不同形态的机器人、还是迥异的任务和环境,都能通过这一统一语言来“描述”动作的后果。研究人员发现,这种设计让模型能够跨实体、跨任务学习动作的因果链条,甚至能适配不同的视频生成骨干网络。
在性能测试中,Hydra-0的表现令人瞩目:相较于传统的以动作为条件的基线模型,它的机器人运动误差降低了90.4%,物体运动误差降低了60.2%。更重要的是,它支持零样本组合和数据高效适配——这意味着面对新场景时,它无需大量重新训练就能快速上手。在RoboLab基准测试中,Hydra-0的重放成功率与参考成功率之间达到了皮尔逊相关系数r=0.96,显示出极高的预测一致性。
最惊艳的发现来自一个意想不到的涌现现象:Hydra-0在训练中自发形成了一种“逆向模式”。它能从人类示范视频中提取期望的物体运动流,并据此预测出与之兼容的机器人动作。随后,一个训练好的动作头将这些潜在特征映射为可实际执行的命令。整个过程无需任务专属的专家机器人示范。换言之,人类只需演示“想要的结果”,机器人就能自行推演出该怎么做。
这一成果不仅为异构训练数据、开环策略评估和机器人控制之间架起了桥梁,更暗示了未来通用机器人学习的一种可能方向:动作流或许能成为沟通感知与执行的通用语言。当机器人学会从运动中理解意图,通用智能的边界或许比我们想象的更近。
在深度学习的世界里,Adam几乎成了大语言模型训练的默认选择,但这个广泛使用的优化器,其理论基础却一直被迷雾笼罩。它有时会发散,有时又奇迹般收敛,这种矛盾让研究者们争论不休。这背后,一场关于神经网络优化本质的探索悄然展开。
研究者首先重新审视了Adam的“发散—收敛”之争,发现答案并非非黑即白,而是存在一个依赖具体问题的相变现象。关键在于超参数的选择:若设定的超参数随批次大小合理调整,Adam便能稳定收敛;而在某些小β₂参数区域下,发散则成为必然。这解释了为何实践中Adam有时表现诡异,也为合理配置超参数提供了理论坐标。
更令人好奇的是,同样的优化器,为何在Transformer上大幅胜过传统的SGD?研究者将目光投向损失函数的曲率——Hessian矩阵。他们发现,随着训练推进,Transformer的Hessian矩阵会逐渐演化成一种近乎块对角的结构,同时不同块之间的差异性非常显著。这种特殊的曲率形态,恰恰让Adam基于对角近似的预处理策略大放异彩。为了解释这种结构从何而来,研究者将其追溯到神经网络中大型矩阵变量连续相乘的数学机制,并借助随机矩阵理论给出了严谨的论证。
这些洞察最终落地为一个新优化器——Adam-mini。它沿用了Adam的核心优势,却将优化器的内存占用削减了整整50%,且性能几乎不打折扣。对于动辄数十亿参数的大模型,这意味着可在相同硬件上训练更大的模型,或延长序列长度。
这项研究的价值不止于Adam本身。它揭示了矩阵型非凸优化问题中新的局部结构,为理解近年来涌现的新优化器(如Muon)提供了清晰的视角,也为未来设计更高效、更可靠的训练算法铺平了道路。看似稳固的优化器,其根基其实悬于微妙的结构与数学巧合之上;而正是对这些脆弱之处的追问,推动着AI基础设施一步步走向更坚实的地基。
Abstract:An essay, based on a public lecture delivered at the 2026 International Congress of Mathematicians, on how the mathematical community might respond to the arrival of artificial intelligence tools that are capable of performing research-level mathematical tasks. Rather than debating the capabilities of such tools, we condition on the hypothesis that these capabilities will arrive, and examine instead a question that is orthogonal to it: what the goals and values of mathematical research actually are. The problem-solving component of mathematics is used as a case study.
想象一下,无需任何植入设备,仅凭头皮上采集的脑电信号,就能大致还原出一个人刚刚听到的话语。这不再是科幻情节,而是神经科学和人工智能交叉领域正在攻克的前沿课题。然而,从非侵入性脑电图(EEG)中重建语音,历来困难重重:脑电信号的信噪比极低,且不同实验会话之间的信号波动大,就像在不同天气里收听同一电台,杂音和干扰总是让人难以听清。
传统方法会采用“试次平均”来提升信号质量,但这要求反复播放同一刺激并叠加信号,对持续的自然语音几乎不可行。于是,研究团队换了一个思路:既然同一个刺激在不同会话中会诱发相似的神经反应,那么干脆把这些重复出现的反应当作“正样本对”,用来训练编码器,让它学会忽略会话间的差异,只保留与刺激本身相关的特征。与此同时,他们引入了一种变分正则化手段,与对比学习目标相结合,防止编码器把特征空间压缩得过于狭窄,从而保留更多有效信息。
实验在日本语脑电数据集上进行。结果显示,这种结合“会话不变策略”和“变分正则化”的方法,显著改善了语音重建的字符错误率(CER),同时保证了梅尔频谱图的重建保真度没有明显损失。更关键的是,通过“会话探测”分析,研究者确认编码器提取的表征确实达到了会话不变性——也就是说,同一个脑电模式在不同时间、不同环境下,能被稳定地映射到同一语义空间。
这项研究的意义在于,它提供了一条无需侵入、无需试次平均的实时语音解码路径。脑机接口的实用化,或许不会因为我们能读懂多少神经元放电而突破,而在于我们如何巧妙利用信号中本就存在的重复结构。当机器学会跨过时间与环境的噪声,人的思想才真正开始被“听见”。科技的前行,往往不是靠堆砌更强的信号,而是靠更聪明的算法,去珍惜那些微弱却珍贵的重复。
在当代社会,民主制度正面临前所未有的挑战,而数学家们正在用他们的工具为民主注入新的活力。一篇最新的学术综述,将目光投向了这个看似跨界却充满潜力的领域,用三个生动的案例勾勒出数学与民主交汇的壮丽图景。
故事从最经典的投票理论讲起。人人都知道投票,但如何让投票结果真正反映民意,却是一个困扰数学家数百年的难题。当数据规模越来越大,社会偏好越来越多元,传统的投票规则开始显得力不从心。研究者们正在将真实世界的选举数据、制度约束和实施可行性纳入数学模型的考量,试图在理论完美与现实可行之间找到平衡点。
第二个案例将我们带入了参与式预算的现场。在这里,市民不再只是每隔几年投一次票,而是要直接决定公共资金如何分配。这听起来很美好,但操作起来却极其复杂——成千上万的项目提案,有限的预算盘子,不同群体的优先级差异,构成了一个多维度的优化难题。数学家们正在开发新的算法和决策框架,让有限的资源能够更公平、更高效地满足更多人的需求。
最令人深思的是第三个案例:协商民主。如果说投票是民主的"算术",那么协商就是民主的"对话"。当公民聚集在一起讨论公共议题时,如何确保每个人的声音都被听到?如何避免群体思维和信息茧房?如何从纷繁复杂的观点中提炼出真正的共识?这些看似社会学的问题,背后其实隐藏着深刻的数学结构。研究者正在尝试用网络科学、博弈论和计算模型来理解并改善协商过程。
贯穿这三个案例的主线,是数学研究从抽象走向现实的转变。当代民主的挑战不再只是理论上的完美公理,而是如何在现实世界中落地生根。研究者们不仅在学术前沿探索,也在积极寻求实际应用——他们的模型已经被一些城市和机构采纳,用于改进真实的决策过程。对于年轻的研究者来说,这个领域既充满智力挑战,也提供了改变社会的切实机会。
民主从来不是一件容易的事,但数学的介入让我们看到了一种可能:用严谨的理性,去驯服复杂的民意;用精巧的结构,去支撑包容的对话。当古老的民主理想遇上现代的数学工具,我们或许能够找到一条更稳健的前行之路,让每一个声音都更有分量,让每一次决策都更加明智。
在计算机科学的隐秘角落,一个看似简单的运算——矩阵乘法,却隐藏着深刻而迷人的难题。究竟需要多少次标量乘法才能完成两个矩阵的相乘?这个问题催生了“矩阵乘法指数”ω,而它的每一次微小改进,都会引发算法研究领域的震动。
此前,最好的上界是2.371339,由一系列精细化的“激光法”技术获得。激光法曾是破解矩阵乘法奥秘的利器,而近年来,研究者们引入了一种名为“组合损失分析”的进阶技巧,将优化问题推向了新的高度。然而,这个优化问题本身极为复杂,传统的求解方式已经触及了能力的边界。
在这项新工作中,研究者们决定换个思路。他们首先重新表述了优化问题的形式,使得求解可以覆盖比以往更广泛的设定。接着,他们大胆地将目光投向了机器学习——用智能优化算法来探索这个高维空间。但还不够,他们进一步引入了AlphaEvolve这一前沿工具,对优化算法本身进行精炼和进化。
三管齐下,最终的结果令人振奋:矩阵乘法指数的新上界被压缩至2.371177,一举超越了此前保持的2.371339。这一差距看似微不足道,但在理论计算机科学中,每缩小0.0001都代表着对计算本质更深一层的理解,也意味着更高效的矩阵乘法算法可能成为现实。
这项突破不仅是算法设计者的胜利,更是跨学科方法交融的生动例证——当传统的数学构造与机器学习的力量相遇,连最顽固的常数也会松动。它提醒我们,在看似枯燥的数字背后,往往藏着思想碰撞的火花,而下一场计算革命,或许就藏在这些小数点后的漫长跋涉之中。
在短视频统治注意力的时代,连以长文著称的Reddit也开始寻找新出路。最近,Reddit正在悄悄测试一项新功能:用AI生成的语音,把那些动辄几千条回复的帖子,变成几分钟的短视频和迷你播客。这意味着,你不再需要逐条滚动阅读,就能“听”完一个热门帖子的精华内容。
这项测试的细节颇为有趣。当用户打开某个被选中的帖子时,页面顶部会出现一个“阅读/播放”的切换按钮。点击播放,AI声音便会开始朗读原始帖子和评论区的高赞回复,屏幕上同时滚动着对应的文字和简单动画。最特别的是,音频开头会附上一句提示:“真实对话,由AI配音。”这既是对内容的说明,也透露出一丝坦诚——毕竟,那些充满人情味的帖子,如今将由机械的声音来讲述。
目前,Reddit的编辑团队正手动挑选参与测试的帖子,第一批数量不多,仅限英文内容。有意思的是,其中一个被选中的帖子已经有八年历史了。这或许表明,Reddit想从海量历史内容中挖掘“沉睡的金矿”。
这个思路并不新鲜。在TikTok和Instagram Reels上,早就有大量创作者用AI配音朗读Reddit故事,配上游戏画面或简单的背景视频,就能获得数百万播放。Reddit如今不过是把这个已经被验证的模式,收编为自己的官方功能。
为什么这一动作值得关注?因为Reddit最值钱的资产,正是那几十亿条真实的人类评论。这些评论构成了互联网上最丰富、最真实的讨论档案,但长线程的阅读门槛,显然不符合这个追求“快速消化”的时代。如果这项功能全面铺开,Reddit等于拥有了一座永不枯竭的AI视频弹药库——那些曾经被遗忘的老帖子,可以源源不断地变成新内容,吸引那些只想用碎片时间“听故事”的轻度用户。
当然,这背后也藏着一个问题:Reddit社区以对自动化高度敏感著称,用户反感营销号搬运、反感机器人刷屏。如今官方亲自下场,用AI重塑内容消费方式,这些“原住民”会买账吗?Reddit必须小心翼翼地平衡创新与社区感受,因为一旦失去用户信任,再酷的功能也只是空中楼阁。
这场实验,表面上是关于AI语音和视频格式,实质上却是Reddit在短视频时代的一次身份探索。它试图在不破坏原生讨论氛围的前提下,把“深度”翻译成“轻量”,把“阅读”变成“收听”。至于社区最终会拥抱还是排斥这个AI讲故事的未来,答案还没揭晓。但有一点很明确:互联网上最宝贵的内容,正被重新包装,以适应一双更有耐心的耳朵——不,是一双更匆忙的眼睛。
在费城郊区一座不起眼的实验楼里,一场医学试验的革命正在悄然发生。这里没有传统的实验鼠笼,取而代之的是数千个在培养皿中搏动的人类肝脏、肺脏和肾脏组织。Vivodyne公司将这些称作“HIVE”的实验室,它们不是普通实验室,而是专为人工智能设计的“数据工厂”——12个机器人实验室每年可运行超过300万次测试,在药物进入临床试验之前,先在人工培育的人类组织上预测它们的行为。
这家公司的野心在于彻底绕开动物试验。传统的药物研发流程依赖动物模型,但动物与人类的生理差异常常导致药物在人体中表现迥异,无数药物在昂贵的临床试验阶段才宣告失败。Vivodyne的思路是:既然AI需要海量数据来学习,为什么不让它直接从真实的人类组织中获取?它的核心设备TissueDisk能同时培育数百个活体组织样本,整个系统每年可执行310万次实验。机器人自动完成给药、扫描和分析,AI则设计实验、读取结果、再设计下一轮——形成一个高速反馈循环,目的是训练一个“人类生物学世界模型”。
这家公司宣称,已有8家大型制药公司付费购买早期使用权限。它们的商业逻辑朴素而诱人:在药物开发早期就筛选出无效候选者,减少对动物试验的依赖。Vivodyne并非孤军奋战,Emulate、MIMETAS、CN Bio等公司也在向同一方向探索,但Vivodyne的下注更大胆——把活人组织变成自动化、面向AI规模的训练数据源。
这一路径面临诸多挑战:体外组织能否真正模拟人体复杂环境?监管机构是否接受这类数据替代传统临床前数据?但不可否认,当AI遇见生物工程,人类或许正在裁剪一张更精准的药物筛选地图。在动物试验争议不断、药物研发成本飙升的今天,用技术改写实验伦理与效率的平衡点,也许正是这一代人最值得期待的医学突破之一。这场变革的终局,可能不是简单的替代,而是让每一颗药丸在进入人体前,都先经历一次属于它自己的“预演”。
一场本不该发生的“剧透”,藏在苹果最新系统深处。有用户在macOS Tahoe 26.7的系统文件里,发现了一段被埋没的视频,画面中,有人戴着AirPods,对着Siri说“帮我保存这本书”——没有掏出手机,没有打开App,耳机就通过视觉智能识别了眼前的书本,并默默记住了它。
这段视频被MacRumors率先挖出。从外观来看,这套AirPods和现有的AirPods Pro几乎一模一样,只是耳机柄略微粗了一点点,摄像头则巧妙隐身,肉眼几乎无法察觉。更有意思的是,系统提示信息显示,如果头发挡住了耳机,软件会主动提醒佩戴者拨开遮挡物,以确保获取的信息准确无误。这意味着,苹果不仅想让耳机“看见”,还想让它“看得清楚”。
事实上,AirPods这些年一直在悄悄加装“感官”——麦克风、运动传感器、心率监测,如今又加上视觉。假如传闻成真,这将是AirPods第一次拥有“眼睛”,成为一块环绕你世界的无屏AI界面:看到餐厅,它能识别菜单;看到路牌,它能翻译文字;看到陌生人,它甚至可以告诉你对方在聊什么——当然,前提是苹果允许这些能力被解锁。
根据此前的报道,这款摄像头AirPods最快可能在今年九月的苹果硬件发布会上亮相,但苹果官方对一切细节守口如瓶。视频的出现究竟是系统工程师的手滑,还是一次精心设计的预热伏笔,目前无从知晓。
但问题也随之而来。把摄像头放进耳机,这个人类几乎24小时佩戴的贴身设备,听起来很科幻,却也让“永远在注视”的隐私焦虑变得更加真实。当你的耳朵开始“看”世界,谁又能保证它没有在看别人?苹果一边强调端侧处理和隐私保护,一边又让设备离你的生活更近一步——这枚小小的摄像头,或许会成为苹果在隐私牌桌上最锋利的一张牌,也可能是最烫手的那一张。
技术的演进从来都是双刃剑:它让AirPods从听声音的耳机,变成理解世界的入口,也把“看见”的权利交给了每一个佩戴者。当你的耳机比你自己更记得你见过什么,我们或许该问一句:未来,是我们在使用设备,还是设备在替我们定义生活?
在俄亥俄州派克县,一片曾被冷战时铀工厂污染的土地上,一场规模空前的AI基建正在酝酿。OpenAI与英伟达联合宣布,将在这里建设一座近乎8吉瓦AI算力的大型园区,而英伟达不仅包揽所有芯片供应,更掏出高达1050亿美元自有信贷为工程背书。这片土地在工厂关闭后,将由联邦政府完成环境清理,再交付给项目使用。
项目的第一个里程碑定在2028年,届时只会先建成并运营800兆瓦的算力模块。而这座园区并非由OpenAI直接持有,而是从SB Energy手中租赁而来。值得玩味的是,英伟达刚刚向SB Energy投资了15亿美元,这家公司此前已获得过OpenAI和软银的投资。换句话说,一场由OpenAI、英伟达、软银系资本交织的算力棋局,在这里悄然落下关键一子。
消息公布的同时,英伟达CEO黄仁勋发表文章,直言前沿AI实验室的瓶颈不在需求,而在基础设施与融资能力。针对外界质疑英伟达正通过“循环融资”为自己创造订单——即一边投资客户,一边让客户买自己的芯片——黄仁勋给出简短回应:“不。OpenAI会支付租金。”
这桩交易的微妙之处在于,SB Energy是一家早期由OpenAI创始人萨姆·奥特曼参与投资、且现由软银控股的公司。这样的背景恐怕难以平息外界对“循环交易”的猜疑。但不可否认的是,这一项目已是迄今最大规模的AI算力建设之一。更值得注意的是,它并未被纳入Stargate计划——而那个备受瞩目的AI基建项目,在2026年却一直走得磕磕绊绊、悄无声息。
从冷战的核原料遗址,到AI时代的算力心脏,这片土地的命运变迁本身就是个隐喻:每一次技术跃迁,都会重新定义资源的坐标。而资本、芯片与算力之间的纠缠,恐怕才刚刚浮出水面。当巨额投资与亲密关系交织,真正值得追问的,是这艘巨轮最终会驶向技术的星辰大海,还是在资本的循环中打转。
一段由AI生成的汤姆·克鲁斯打斗视频在网络上病毒式传播,画面逼真到足以以假乱真。这段视频出自字节跳动的Seedance 2.0模型,却意外点燃了一场版权火药桶——好莱坞电影协会向这家中国科技巨头发出了史上首张针对主流AI公司的停止函。
面对来势汹汹的法律警告,字节跳动选择了让步而非对抗。他们推迟了Seedance 2.0的全球发布,并在随后推出的2.5版本和Seedream 5.0 Pro中加入了更严格的版权防护措施。本月,双方终于达成正式框架协议,将电影和电视版权保护机制直接嵌入到Seedance和Seedream模型中。
这项协议的覆盖范围远超单个产品。所有运行这些模型的应用程序都将受到约束,包括剪映、Dreamina,甚至TikTok及其美国分拆版本。这意味着,今后即使用户试图生成受版权保护的影视角色或片段,系统也会自动拦截或限制。
这场纷争背后,是AI视频生成技术的狂飙突进。几年前,AI视频还只是充满滑稽缺陷的 meme 素材,如今却能产出堪比电影级的高质量画面。最新的威尔·史密斯吃意大利面视频就是例证——细节真实到令人不安。更让好莱坞头疼的是,推动这一技术浪潮的实验室大多来自中国。字节跳动只是倒下的第一块多米诺骨牌,可灵、阿里巴巴的万相模型等对手依然虎视眈眈。
版权保护的框架协议可以约束一家公司,却难以阻挡整个行业的进化速度。当AI电影制作成为常态,传统影视工业与生成式AI之间的博弈,或许才刚刚拉开序幕。
就在GitHub遭遇大范围服务中断、用户焦头烂额的那一天,AI编程平台Cursor悄悄放出了一个大招——它推出了名为Origin的早期测试版,一个直接对标GitHub的代码托管服务。时机巧得让人怀疑是故意为之。
一直以来,AI已经彻底改变了程序员写代码的方式,但代码托管这块地盘,始终牢牢攥在微软旗下的GitHub手里。Cursor这次的动作,相当于在对手家门口摆了一张擂台。Origin不只是简单地存放代码仓库和拉取请求,它把Cursor自家的智能代理和代码审查工具直接嵌进了托管流程里。开发者可以在同一个界面里浏览代码、让AI跟进修改、再交给人工确认,整个流程一气呵成。
更妙的是,用户可以直接从GitHub同步已有的代码库,生成一个实时镜像,一边在GitHub上继续工作,一边在Origin上试用新平台。这种"先试试看"的策略,降低了迁移门槛,也给了开发者一个充足的理由去体验新东西。
而GitHub那边可就有点狼狈了。这已经是它本月第二次重大故障,某些功能卡了六个多小时还没缓过劲来。虽然GitHub的宕机与Cursor的发布没有因果关系,但在用户正在为托管服务心烦意乱的时候,一个更AI原生的替代品突然出现,吸引力无疑被放大了。
Origin目前只向Cursor的付费客户开放测试,但官方表示,针对大规模智能代理工作负载的功能"很快就会"上线。显然,Cursor的目标不只是做一个代码编辑器,而是想成为整个开发流程的底座。
这件事的意义在于,AI浪潮已经席卷了编程的方方面面,唯独托管这一层还赖在微软的旧铁轨上不愿挪窝。现在,GitHub终于也尝到了微软其他产品早就领教过的滋味——被AI新势力盯上,一场围绕开发者基础设施的攻防战,已经正式打响。
不知道GitHub这次宕机,算不算给Cursor送上的一份大礼。但有一点很明确:当代码本身开始由AI生成,托管这些代码的平台,也该换换血了。
想象一下,你让一个AI助手去厨房“把杯子放进洗碗机”,它可能说得头头是道,但真动起手来,要么把杯子塞进烤箱,要么对着一把椅子喊“杯子”。这正是当前语言模型和视觉语言模型在实体世界中执行长期任务时的尴尬:它们能生成看似合理的计划,却常常违反环境规则,或认错对象。为了破解这一困局,研究者开发了一个神经符号代理,将复杂的家务任务拆解为两个阶段:首先,用视觉语言模型进行“目标驱动的视觉探索”,从第一人称视角的观察和实际操作中,提取与任务相关的状态信息和对象绑定关系,构建出符号化的初始世界状态;接着,一个PDDL(规划领域定义语言)过渡模型登场,它像一位严格的裁判,在生成每一步动作时,只允许解码出那些能扩展合法动作的token,从源头杜绝“违反物理规律”的行为。
但仅有约束还不够,代理还引入了蒙特卡洛树搜索,用领域无关的规划启发式来评估各种可能延续的优劣,从而筛选出真正可执行的计划。这套“先探索、再规划、后搜索”的组合拳,让计划的每一步在构造上就保证了可执行性——前提是视觉定位准确。实验数据相当亮眼:在VirtualHome和ALFWorld两个基准环境中,开源的4B到27B参数模型都超越了90%的成功率;即便最小的代理,也大幅胜过27B参数的直接视觉策略模型。更有意思的是,约束与搜索并非可互相替代的“备胎”,而是互补的“搭档”——在ALFWorld中,单独使用任一种方法只能解决不到三分之一的任务,但两者结合后,成功率飙升至95%以上。
此外,这个神经符号代理还相当“节俭”:它生成的token数量比扩展思考模式少好几倍,需要给模型“看”的图像也远少于直接交互的方法。而剩余的失败案例,大多集中在初始状态获取环节,而非计划生成阶段——这提示我们,未来一旦让感知和探索更精准,这套系统的上限还能再抬高。整项工作不需要任何专门训练,却让模型在家庭任务中从“纸上谈兵”走向“身体力行”。或许,让AI真正融入生活,秘诀不是让它学会更多“漂亮话”,而是帮它搭一座从符号世界通往物理现实的桥——每一步都踩在世界的规则上,才算真正的“知道”。
在机器人研究领域,一个长期存在的痛点终于有了新解法。传统上,具身智能体依赖端到端策略模型,但执行环节却始终是“开环”的:机器人按照预设技能行动,直到整个回合结束后才进行反思。这种事后诸葛式的反思,根本无法应对物理世界中瞬息万变的状态——当机械臂需要以远超大模型推理频率的速度追踪环境变化时,任何延迟都可能让任务功亏一篑。
Zetta的出现改变了这一局面。这个全新的闭环具身执行框架,创造性地将“批评者”和“恢复技能”的进化过程搬到线上,却始终保持底层策略模型冻结不动。它通过三个不同时间尺度的循环协同工作:最内层以动作频率提供实时治理,中层在回合级别提出批评与恢复方案,外层则通过验证门控来更新技能库。这样的设计让机器人不再是一台只会机械执行预设程序的机器,而是在执行过程中就能根据实时反馈动态调整自身行为。
支撑Zetta高效运转的,还有一套名为Z-Infra的底层设施。它将智能体逻辑与异构执行资源彻底解耦,使得AI的“思考”与硬件的“行动”可以并行不悖,避免了算力等待的浪费。在当前的预算条件下,Zetta在LIBERO-Pro和RoboCasa两个基准测试中分别取得了90.8%和93.6%的顶尖成功率,同时推理速度提升了11.1倍。更令人振奋的是,随着自我探索经验的积累,成功率仍在持续攀升,而且学到的技能可以零样本迁移到新场景。
研究团队在实验中观察到了清晰的机器人“顿悟时刻”——这并非科幻式的意识觉醒,而是系统在自我进化过程中突然找到更优解的表现。这个发现暗示着,闭环执行框架的自我进化,可能为可靠的物理智能开辟出一条全新的规模化路径。当机器人不再需要停下来思考“我刚才做错了什么”,而是能在行动中即时修正自己时,我们离真正灵巧的机器助手又近了一步。
在人工智能的疆域里,大模型智能体正借助越来越复杂的工具链(harness)完成长周期任务,比如操控计算机或调用外部软件。然而,一个关键难题始终悬而未决:当智能体被包裹在层层嵌套的“工具链”中时,强化学习该如何稳定高效地训练它?传统方法要么让优化过程被工具链的复杂性吞噬,要么在漫长任务中失去稳定性。
一项来自研究团队的新框架给出了答案。他们构建了一套基于沙箱的执行基础设施,将任务环境和工具链彻底隔离,从而支持大规模并发采样。更精妙的设计在于,他们把策略优化的视角从“操作过程”挪到“模型调用边界”上——一个轻量级代理服务器安静地守在模型接口前,捕获每一次模型调用,再将这些调用组织成前缀树。这样一来,多轮交互轨迹被完整还原,而PPO与GRPO这两种经典的强化学习算法也能在树状结构上无缝适配,既保留基于评判者的精确反馈,也支持无评判者的简洁优化。整个训练过程中,训练与推理的配置始终保持一致,避免了“训练时一套,部署时另一套”的隐性偏差。
最吸引人的部分在于混合工具链训练:同一个模型可以同时吸收多个不同工具链的经验,仿佛一位学徒同时跟随几位风格迥异的师傅。实验数据印证了这套方法的威力——基于Qwen3-30A3B模型,搭载OpenClaw工具链时,在ClawGym-Bench基准上的Pass@1指标提升了9.98个百分点;换成Claude Code工具链,更是提升了14.81个百分点。更难得的是,在长达200到400个优化步骤中,训练过程始终稳定。而在更具挑战性的JobBench和OfficeQA任务上,框架也持续带来正向收益。
这不再是一台只能在实验室里小心翼翼运转的精密仪器,而是一个可以同时驾驭多种异质执行系统的通用训练框架。当智能体不再被工具链的复杂度所禁锢,强化学习的力量才能真正延伸到那些真实世界里的漫长任务中去。或许,距离让AI在人类复杂环境中自由学习的那一天,我们又近了一步。
想象一下,机器人要完成一项复杂的长期任务,比如整理房间或组装物品。它不仅要可靠地执行每个单一技能,还要在漫长的过程中将它们连贯地串联起来。然而,大多数层次化的视觉-语言-动作模型(VLA)每次决策都只进行一次前向计算,就像凭直觉快速做选择,没有机制为困难或关键的决策分配更多思考时间。这项研究带来了一个新模型τ0-VLA,它把高层子任务生成变成了一个可通过世界模型引导的测试时计算来扩展的推理问题。在每一步推理中,高层策略会利用执行记忆来生成子任务,并且在必要时,会在多个备选方案中搜索后,才最终确定输出。随后,低层策略负责跨多种机器人形态执行这个子任务。该模型在40115小时的多样化真实世界数据上训练,并采用了多模态联合训练方式。实验显示,在域内和分布偏移的场景下,增加测试时计算量显著提升了下一步子任务的预测准确率,这些改进最终转化为了长程机器人操控任务中更高的闭环成功率。这启示我们,让机器人在关键决策上“多想想”,或许是提升复杂任务能力的一条有效路径。
在攀登人形智能这座高峰的征途中,数据始终是那道最深的鸿沟。互联网上浩如烟海的视频虽然记录了人类活动的万千姿态,却缺少精确的物理状态与交互反馈;而实验室里高精度的动作捕捉数据虽忠实可靠,覆盖的行为范围却过于狭窄。这种割裂,让人形机器人的策略学习长期徘徊在瓶颈之中。
如今,一项名为HiPHI的研究带来了破局的思路。这是一个规模超过六百小时、覆盖全身的高保真人形运动数据集,其设计目标只有一个:系统性地穷尽人类运动与交互的广阔空间。它的理论基础来自语言学中的FrameNet框架,这一框架将人类行为组织为清晰的基本单元,为数据的采集提供了严谨的导航图。借助光学动作捕捉流水线,HiPHI实现了亚毫米级的空间标记追踪精度,不仅记录全身骨骼的细微动作,连物体的网格级运动轨迹也一并纳入其中。
在此基础上,研究者还构建了一套基准测试体系,从动作空间多样性、交互接地、物体一致性以及物理AI应用等多个维度拷问数据的质量。分析结果显示,相较于现有数据集,HiPHI显著拓宽了动作覆盖的版图,同时并未牺牲高保真的交互品质。它为人形策略在真实世界任务中的训练、评估与泛化,铺设了一条可扩展的数据通路,而这套方法同样能反哺计算机图形学中的运动先验模型。
当数据不再是桎梏,人形智能触达真实世界的脚步或将从此加速。想要跨越鸿沟,或许先要回答一个问题:我们是否已经足够完整地记录下人类自身的每一种动作与触碰?
在计算机辅助设计的世界里,边界表示(B-Rep)的生成一直是核心挑战——它既要精准刻画几何形状,又要保证拓扑结构的合法性。然而,现有的深度生成方法始终被两种“脆弱性”困扰:一是表征脆弱,源于填充噪声与潜在空间中的特征污染;二是生成脆弱,来自序列化错误累积和训练与推理阶段因不可微的有效性约束而产生的失配。这些问题让高保真、结构合法的B-Rep合成举步维艰。
为了打破这一僵局,研究者提出了HiFi-BRep框架。它拿出两把“钥匙”:第一把是拓扑感知编码器,通过可学习查询消除填充噪声,再依靠拓扑引导的注意力机制阻止特征污染,从而在潜在空间里构建出干净、高保真的表征;第二把是单阶段解码器,不再串行地先几何后拓扑,而是并行联合预测两者,并将核心流形约束嵌入为可微的学习目标,让几何与拓扑在生成过程中彼此引导、互为校验,彻底绕开了级联错误的陷阱。
实验数据显示,HiFi-BRep在结构合法性和几何保真度上均显著超越现有最先进方法,为高质量B-Rep合成提供了稳健的解决方案。代码与模型也已公开,供研究者复现与拓展。
当边界不再模糊,生成便有了坚实的依托。这项研究提醒我们:有时真正的突破不在于更深的网络,而在于厘清表征的纯度与生成路径的协同。
文生图模型的飞速发展,让“画出像素”本身不再是难题。如今,真正的挑战变成了如何满足用户越来越复杂、越来越个性化的请求——有人只想画一只猫,有人却想要一张带考据、带推理的新闻插画。面对这些差异巨大的需求,现有的智能体图像生成工作流往往各自为战,用一成不变的“万能流水线”处理所有请求。结果便是严重的算力错配:一个简单到可以秒出的请求,也被迫塞进重型的多步骤管线,既烧钱又耗时。
为了打破这种僵局,研究人员提出了GenRouter——一个面向智能体图像生成的统一工作流路由框架。它首先构建了名为GenCanvas的标准化体系,把五花八门的智能体管线拆解成一组通用的基础构件和可执行模板。在这个统一的操作空间里,GenRouter不再“一刀切”,而是通过三个关键步骤——需求画像、经验匹配和帕累托过滤——为每条提示词动态挑选最合适的工作流。简单请求走轻量捷径,复杂请求上重型装备,一切自动完成。
实验数据十分亮眼:在多个基准测试中,GenRouter不仅能实现更优的视觉对齐效果,还将执行成本削减了超过95%,延迟降低了65%,对比的是那些笨重的静态管线。更值得一提的是,GenRouter拥有自我进化能力——随着经验的不断积累,它能在面对全新类型的请求时,自动实现零样本的泛化,在保持效果不掉线的同时,把计算开销再砍一半。
这像是一位越来越聪明的调度员:它不需要学会自己画画,但它知道哪条路最快、哪条路最省、哪条路画得最像用户想要的。当生成质量不再是唯一瓶颈,如何聪明地分配算力,就成了下一场竞赛的胜负手。GenRouter提供了一个令人兴奋的答案,也让人忍不住想象:未来的图像生成,或许会像导航软件一样,在出发之前,就已为你规划好了最省油的路径。
生成式建模的舞台上,一场关于“像素空间”与“潜空间”的较量正在上演。长期以来,潜空间模型凭借其成熟的训练流程占据主导地位,而直接在原始像素上训练的扩散模型虽令人向往,却因收敛缓慢、算力消耗巨大而难以规模化应用。研究者们发现,直接对像素空间进行大规模预训练,其收敛速度远逊于潜空间,这几乎成了一道难以逾越的鸿沟。
然而,一项系统的实证研究改变了这一困局。他们提出了一种巧妙的“潜转像素”策略:先在高效的潜空间中获取生成先验,再在后期训练阶段转向像素空间精调。这一过程看似简单,实则暗藏玄机。研究团队逐一剖析了权重初始化、数据配比、预测目标、解码器架构以及噪声调度等关键设计选择,最终提炼出一套实用配方。
正是这套配方,让像素空间模型在图像质量上追平甚至超越了潜空间对手,同时带来了惊人的端到端推理加速——每张图像的生成速度提升了3.18到4.75倍。这一成果不仅打破了像素空间模型“中看不中用”的刻板印象,更为未来生成模型的设计提供了清晰的路标:有时候,绕一段路再回头,反而能更快抵达终点。当我们在效率与质量之间反复权衡时,这项研究提醒我们,真正的突破往往藏在对固有路径的重新审视之中。
记忆须渐进,模型更聪明原文
想象一下,你正在阅读一本超长的书籍,大脑需要不断记住前面的内容,同时还要理解新出现的信息。如果一开始就把所有记忆空间塞满琐碎的细节,等到关键情节到来时,大脑早已不堪重负。这正是当前人工智能长文本处理面临的困境:基于注意力机制的模型虽然强大,但处理长上下文时计算成本呈平方级增长,于是研究者们转向记忆型模型,希望将上下文压缩成一个紧凑的状态。然而,大多数现有记忆模型在整个序列中暴露的是静态记忆——早期词元没有压缩压力,它们占据了过多的自由度,“污染”了记忆状态,留给后续上下文的空间所剩无几,新旧信息之间也彼此干扰。
为了破解这一难题,研究者提出了一种全新的“渐进式记忆激活”范式:记忆的有效容量随着上下文增长而逐步扩展。早期设置一个瓶颈,迫使模型更高效地压缩历史信息;随着时间推移解锁新的容量,从而减少干扰,更好地保留后面的内容。这个范式被实现为一个名为“Proteus”的简洁机制,可以无缝嵌入到多种神经记忆架构中,且不增加额外计算成本。
研究者将Proteus应用到了当前最先进的模型上,包括SWLA、Comba、Titans和Hope-Attention,并在标准语言建模、推理、长上下文检索和理解任务上都观察到了一致的性能提升。更值得关注的是,随着上下文长度增加,提升幅度也随之变大——这意味着在更长的序列中,动态记忆容量的优势愈发明显。
这项研究揭示了一个重要事实:静态记忆并非最优选择。通过调度有效的记忆容量,我们可以让模型在长文本中表现得更好。这就像给人工智能装上了一个会呼吸的记忆系统,它知道何时该紧锁大门,何时该打开新窗。面对越来越长的文本和越来越复杂的世界,也许“渐进”才是通往智慧的关键一步。记忆的边界不是固化的墙壁,而是可以灵活延伸的疆域。
当评估一个世界模型时,分数本身只是结果,真正让评测可信的是分数背后的推理链——为什么物理规律、因果关系和世界状态演化是正确的?人类能自然发现这些破绽,但现有的基准测试只是机械地计算指标,从不留下可检验的推理痕迹。这个问题一直悬而未决,直到一种名为HarnessEval-W的新评估管线出现。
这套方法借鉴了大语言模型生态中的“护栏”理念,将评测本身智能化和代理化。它不再套用固定评分表,而是先理解每个评测案例的具体语境,把大问题拆成可测量的小问题,再派出多个分工明确的子代理——每个子代理带着专属的诊断工具和上下文去审视自己的问题。随后,父代理汇总所有证据,反复验证,最终形成判决。整个过程就像一棵透明的证据树:每个分支都是依据,每个结论都有来路。
研究团队用这套流程检验了18个有代表性的世界模型,覆盖330个评测案例。结果显示,HarnessEval-W的判断与人类偏好高度一致,同时还能为每一次生成的展开提供细粒度、可核验的诊断报告,而不是简单给个分数。团队已经将完整流程开源,将其构建为一个可持续生长的实时基准,邀请社区共同扩展新技能和评测案例,让世界模型的评测随模型本身一同进化。
这提醒我们:一项能力的价值,不仅在于它能做什么,更在于我们能不能看懂它为何能做成这样。当评测从“打分”变为“举证”,我们对模型的信任才真正有了依据。世界模型在加速演进,而值得信赖的评测方式,正从背后悄悄成为这场变革的基石。
当AI生成的视频已经能以假乱真地呈现战争、灾难和公共危机,人类对信息的辨别力正面临前所未有的挑战。然而,现有检测工具在真实危机场景下的表现究竟如何?一项名为RA-Bench的新基准试图回答这个问题。
这个基准的独特之处在于“以真实视频为锚点”。研究团队构建了包含17,886个视频的数据集,其中1,830个真实视频锚点覆盖战争、灾害、公共卫生事件等10类社会风险场景,另有16,056个由4个开源和5个闭源生成器制作的AI视频片段。基于这一规模庞大的测试场,研究人员从三个维度展开了系统性评估。
第一轮测试聚焦检测器的泛化能力。他们考察了7种传统检测器、10种零样本多模态模型(在三种审查设置下),以及2个专门针对AI生成视频检测微调的多模态大语言模型。结果令人不安:没有任何一个检测器家族能在RA-Bench的各类测试实例中保持一致的表现。这意味着,在真实、复杂的危机场景面前,现有的检测工具往往失灵。
第二轮测试探讨了生成条件对可检测性的影响。团队分析了生成质量、条件信息和采样种子等因素,发现不同生成属性对不同类型检测器的影响各异,但来自同一生成器的视频在采样种子变化时,其源级检测特征保持稳定。这提示检测器可以识别特定生成器的“指纹”,却难以应对不断变化的生成条件。
第三轮测试则深入到人类感知与社交传播环节。研究人员发现,那些能够成功误导人类判断的视频,同样难以被当前检测器识别。更糟糕的是,经过社交平台的传播和压缩处理后,检测的可靠性进一步下降。这意味着,在信息扩散最迅速的节点上,技术防线反而最为薄弱。
RA-Bench的结论清晰而沉重:现有的AI生成视频检测方法,在应对逼真且不断演化的生成器时,几乎全面陷入被动。当虚假画面可能引发恐慌、冲突或误导公共决策时,检测技术必须加速进化,而不能止步于实验室的理想条件。未来,检测器需要具备更强的泛化能力,以及抵御社交传播损耗的韧性,方能守护真实信息的最后一道防线。
熵减奖励:让AI推荐更懂你原文
面对琳琅满目的商品,AI推荐系统常常只会机械地询问“您想要什么”,却很难真正理解你的潜在需求。如今,大语言模型的崛起让对话式推荐成为可能,但如何让AI在自然的闲聊中高效获取用户偏好,仍然是一道难题。
传统方法要么用模板化的交互配合强化学习,显得生硬刻板;要么让另一个大模型来评判对话的互动性,却无法衡量AI究竟从对话中获得了多少有效信息。研究人员另辟蹊径,提出了一种全新的思路:用“熵”来衡量推荐的不确定性,AI每问一个问题,若推荐结果的熵显著降低,说明这次提问真正触及了你的内心。
这一灵感来自信息论,助手的不确定性越高,熵就越大;随着对话深入,候选推荐逐渐收窄,熵值随之下降。研究者将每一次交互带来的熵减作为奖励信号,用以微调大语言模型,引导它生成更具策略性的提问——整个过程无需依赖真实推荐标签,而这在现实场景中往往难以获取。
实验在INSPIRED和ReDial两个数据集上展开,结合监督微调(SFT)和直接偏好优化(DPO)两种技术,结果显示,该方法不仅提升了推荐的精准度,也显著提高了对话的效率。也就是说,AI学会了“问对问题”,用更少的对话步骤,触及更懂你的推荐。
这或许预示着,未来的智能助手将不再只是被动回应,而是能像一位敏锐的朋友,在寥寥数语间洞察你的喜好。当机器学会了如何更聪明地提问,人与AI的对话,也将从单调的指令变成了真正有温度的交流。
在物理学与信息论的交叉地带,熵始终扮演着神秘而核心的角色。这篇综述性文章开启了一段穿越概率论与量子理论的旅程,试图回答一个根本问题:我们如何度量不确定性与信息?文章从历史出发,将经典与量子熵统一在概率论的框架下,为读者铺开了一幅从宏观热力学到微观量子态的完整图景。
经典熵的章节从大偏差理论切入,引入了桑诺夫定理、克拉默定理、格特纳-埃利斯定理和瓦拉丹定理。这些数学工具并非抽象摆设,而是连接微观统计规律与宏观热力学行为的桥梁。玻尔兹曼熵与吉布斯熵在应用中展现出各自的威力,它们告诉我们,为什么气体分子虽然各自随机运动,整体却遵循确定的热力学定律。大偏差理论提供了精确的概率估计,解释了罕见事件如何影响系统行为,也让人们从数学上理解"熵增"为何成为压倒性的趋势。
当视角转向量子世界,故事变得更加微妙。经典相对熵是库尔贝克-莱布勒熵,它以优雅的公式度量两个概率分布的差异;其量子对应物由梅垣雄介引入,而这只是起点。雷尼提出的熵的变形版本也自然融入这个框架,形成一套丰富的谱系。量子熵面临的真正挑战在于:如何定义并计算一个子系统上一对量子态的相对熵?这不能简单地套用经典公式,而需要一种更深层的数学结构——冯·诺依曼代数。原有的密度矩阵和迹运算在无穷维或更复杂的代数结构下不再够用,模理论应运而生,它就是所谓的托米塔-竹崎理论。这个框架为荒木和乌尔曼引入的量子相对熵提供了严格的数学基础,而库尔贝克-莱布勒熵和梅垣熵都只是它的特例。为了在密度算子和迹的物理语言中重新定义并计算这些熵,高鲁普的非交换L^p空间被引入,它像是为量子熵量身打造的"坐标系",让抽象的代数概念变得可操作。
文章并未止步于此,还探讨了动力系统与遍历理论中的量子版本——科涅斯-斯托默-纳恩霍费尔-蒂林熵,它可以看作是经典柯尔莫哥洛夫-西奈熵的量子延伸。这一连接使得量子熵不仅适用于静态的量子态,也能描述量子系统随时间的演化,为量子混沌和量子信息扩散的研究提供了工具。
值得一提的是,这篇课程的灵感来源于黑洞热力学,虽然文章并未讨论黑洞本身,也未涉及热力学第二定律的哲学争论,但读者能感受到这一应用背景的牵引力。全文力求数学上的严谨,同时希望引起理论物理学家的兴趣,它预设的读者只需要具备本科水平概率论、泛函分析和量子理论的基础知识。
熵的故事远未结束。从经典统计力学到量子场论,从信息论到黑洞物理,熵这个概念像一根贯穿始终的丝线,将看似无关的领域编织在一起。当我们试图理解宇宙最基础的秩序与无序时,熵或许正是那把钥匙——它既是我们认识世界的工具,也是世界对我们认知能力设下的永恒谜题。
在视觉策略蒸馏的领域,一个长期被默认的“铁律”是:要让学生模型进步,教师必须拥有“特权”——要么教师本身更强更大,要么它能看到参考答案、真实标注等学生看不到的信息。这种不对称被认为是学习信号的根本来源。但一个尖锐的问题随之而来:如果没有任何特权信息可用,不对称又从何而来?一篇新研究给出了一个反直觉的答案——不去给教师“加料”,而是给学生的输入“减料”。
研究者提出的方法名为S²VOPD,全称“自监督视觉在线策略蒸馏”。它的操作看似简单:对同一张原始图像,教师模型看到的是未经处理的清晰画面,而学生模型看到的则是经过强烈数据增强后的扭曲版本。教师基于原图生成行为分布,学生则被迫去拟合这个分布,即便自己眼前的画面已经被旋转、裁剪、模糊或变色破坏。关键在于,这种视角的不对称,竟然完全不需要任何人工标注、奖励函数,甚至不需要一个额外的强教师模型——它就那么“免费”地产生了与特权监督等价的学习信号。
为了验证这一原理,团队系统性地探索了视觉增强设计的广阔空间,得出了三个耐人寻味的发现。第一,不对称本身至关重要:四大类增强方式(如颜色扰动、几何变换等)都能提升性能,而如果两边都做同样的增强、搞“对称自蒸馏”,效果反而会变差。第二,强度存在最优区间:增强程度太弱,形不成有效差距;太强,任务相关的视觉线索被彻底摧毁,学生虽然会“慌”,但慌乱中难以学到有用的东西。只有适中强度,才能让性能达到峰值。第三,差距必须保证任务一致性:如果增强手段把回答问题的关键证据完全抹掉,那么教师与学生之间的分歧会变得巨大,却毫无信息量,徒增噪音而已。
在六个细粒度感知基准上,S²VOPD的表现令人瞩目。它把Qwen3.5-4B模型的准确率从70.7%拉到77.4%,这一成绩不仅超越了所有参与对比的开源模型,甚至超过了参数量高达235B的Qwen3-VL,还超过了GPT-5.4。更值得玩味的是,在与那些确实使用了特权信息的顶尖方法对比时,S²VOPD仅凭“减法”就恢复了对方96%的性能提升,而且训练数据一字未改。
这让人不禁重新思考“信息不对称”的本质。原来,智慧并不总在于看到更多,有时恰恰在于让一部分人看得更少。当眼前的路径被遮挡,另一条路反而会被迫开辟出来。对模型如此,对人,又何尝不是呢?有时候,正是那些被强行拿走的“便利”,逼着我们找到了更强大的自己。
在人工智能领域,如何让更小的模型获得更强的推理能力,一直是研究者们追逐的目标。一种名为“在线蒸馏”的技术为此带来希望,它让强大的“教师模型”将推理能力传授给轻量的“学生模型”。然而,当教师模型擅长处理长文本,而学生模型只能处理短文本时,这条传授之路便布满了荆棘。
想象一下这样的场景:一位精通高等数学的教授,正在给一位只学过基础代数的学生讲课。教授习惯于长篇大论、层层推导,而学生的笔记能力有限,很容易跟不上节奏。更麻烦的是,教授和学生甚至使用着不同的“符号系统”——他们的分词器不同,导致同一个数学符号在双方眼中被切分成了不同的片段。这就像教授用拉丁字母写公式,而学生只认识希腊字母。
这正是本次研究要攻克的难题。研究者们将目光锁定在一个名为SU-01的长上下文推理模型上,它是一个出色的“教授”,擅长处理需要大量背景知识的证明推理。而他们的目标是让一群短上下文的“学生”模型——包括Qwen3、Qwen3.5、Intern-S2、GLM-4.7、Gemma-4等——也能学会这种推理能力。
首先要解决的是“语言不通”的问题。研究者们选择在共享的文本空间中进行在线蒸馏,只对齐那些在教师和学生分词器下占据相同文本片段的词元。这就像在两种语言之间找到了共同的“翻译锚点”,确保知识传递不失真。
更大的挑战在于训练过程中的不稳定。教师模型动辄生成超长回答,而学生模型上下文有限,经常遭遇截断;同时,教师和学生的分布差异会导致训练崩溃,学生模型可能“学偏”,生成冗长却无意义的推理。为了应对这些问题,研究者们引入了一项关键策略:学生参考KL损失。这个技术术语听起来复杂,但其核心思想很朴素——在训练时约束学生模型,不让它偏离自己最初的“思维习惯”太远。同时,他们刻意降低了特殊终止符(如和<|im_end|>)的奖励权重,防止学生为了尽快结束而偷懒。这一系列操作就像给学生的成长过程装上“稳定器”,既鼓励它探索更长的推理链,又不至于让它失去根基。
实验结果令人振奋。在多个不同架构的学生模型上,数学推理能力尤其是自然语言数学证明能力都出现了显著提升。最亮眼的表现来自Intern-S2-Preview:在ProofBench基准测试上,它的得分从34.0跃升至55.2,整整提高了21.2分,首次超越了以强大推理能力著称的Gemini-2.5-Pro。不仅如此,这种能力还“溢出”到了其他领域——在科学基准测试HLE和HiPhO上,受训模型同样取得了进步。这说明在线蒸馏传递的不只是死记硬背的解题套路,而是一种可以泛化的推理能力。
这项研究的意义在于,它用一种优雅的方式调和了长上下文与短上下文模型之间的矛盾。教师可以尽情展现深邃的思考,学生也不必囫囵吞枣。通过精心的对齐设计和稳健的训练策略,知识的涓流得以穿越模型架构的差异,在更轻量、更高效的实体中重新扎根。
或许,智能的传承从来不是简单的复制粘贴,而是找到一种平衡:既让学生聆听高远的智慧,又不让它迷失在冗长的思考中。当小模型也能在数学证明和科学推理的舞台上大放异彩时,我们离“人人可及的高水平AI”又近了一步。
想象两个数字角色在游戏世界里并肩漫步,起初一切正常。但如果你放任它们自由行动,它们会不知不觉地越走越远,最终相隔21米,甚至半个身子陷进地面——这不是游戏里的搞笑彩蛋,而是当前交互式世界模型面临的真实困境。传统方法尝试让神经网络直接预测每一帧像素,或者在高维潜空间里“想象”下一个画面,但游戏中角色的姿态、几何形状和遮挡关系,全都混在同一串生成信号里。时间一长,这些隐含属性就像没人记账的家庭开支,逐渐累积出错,让整个世界模型变得脆弱不堪。而且,一旦生成出了错误的画面,你几乎没有任何办法从内部修正它。
马里内特(Marionette)提出了一个截然不同的思路:让神经网络只管“画皮”,把“算骨”的活儿交给数学上精确的解析工具。它首先用一个两阶段的自回归动力学模型,预测一个可解释的276维显式三维世界状态,其中包含多实体铰接骨架的关节位置、度量轨迹的根节点移动,以及旋转信息。这些数字直接描述“角色此刻站在哪里,胳膊抬多高,头朝哪边”。紧接着,一个零参数的图形渲染桥梁登场。它不学习、不训练,纯粹用封闭形式的几何公式,把刚才预测的状态转换成带姿态控制信号的视频骨架。最后,一个用控制信号条件化的视频扩散模型接管,基于这些结构化控制信号,渲染出逼真的红绿蓝彩色观察画面。整条流水线各司其职:神经网络负责外观的细节与多样性,而几何与遮挡计算则被剥离出来,交给永远不犯“幻觉”的固定渲染器。
实验中,马里内特的“状态可控性”体现得相当直白。研究人员故意把一段错误的动作流强加给模型,于是预测结果中,根对齐的关节误差在48段测试片段上发生了31%的变化。这说明三维世界状态不是纸老虎,它真真切切地响应了外部指令。更有意思的发现是,长期行为中的偏差可以在状态层面被“修复”。当模型自由发挥时,两个生成角色之间的平均距离漂移到了21.2米,而录制好的真实会话里,它们始终保持在5米左右;同时,每三帧里就有一帧出现脚踩入地面的穿透问题。研究人员仅仅在显式状态上添加了两条简单规则——一个地形碰撞器,一个角色之间的距离上限——穿透问题立刻减少了66%,两个角色也重新回到了“亲密伙伴”的社交距离。整个过程没有改动视觉观察模型一个字,也就是说,长期行为的问题完全可以在低维、可解释的状态空间中解决。
至于图像质量,显式状态这条路并没有让模型付出代价。测量视频生成保真度的FVD指标上,马里内特录得831分,而用真实录制姿态作为参考的得分为799分——差距微小到难以察觉。用状态预测来控制外观生成,并没有牺牲可以在实验里观测到的画质。
马里内特的启示在于:当世界模型开始学会“分账”,把精确的几何计算与灵活的外观合成分开管理,虚拟世界的长期稳定性就不再是天方夜谭。或许,未来的游戏智能体将不再靠猜像素来理解世界,而是像导演一样,先摆好舞台上的每一个坐标,再让光影为它披上外衣。这间无形的3D账房,正在为机器人的想象世界打下更稳固的地基。
机器人评测新尺度:过程见真章原文
机器人到底行不行,传统评测只看“成功与否”,可这就像用及格线衡量一场考试,掩盖了太多细节。一套名为PRM-as-a-Judge 1.5的工具包,正试图把评测从“给结果打分”推向“给过程画像”。
它将机器人的操作视频转化为一条连续的进度曲线,并从中提炼出三个精细指标:一是失败侧的进展,看机器人在没完成任务时到底走了多远;二是受挫后的恢复能力,观察它跌入低谷后能否重新爬起;三是成功侧的执行质量,即便完成了任务,动作是否干净利落、效率如何。这三个维度共同拼出一张更立体的能力图,让研究者看清模型的长处与软肋。
基于多个基准的演示视频,该工具对现有具身模型展开了全面评估,得出了若干细粒度结果与关键发现。为了检验这套评测体系本身是否可靠,团队还推出了RoboPulse++平台,用于验证过程奖励模型的稳定性,给评估者提供一个更准确的“试金石”。
整套评估套件已开源,涵盖基准、指标实现与可视化工具,方便社区复现和扩展。这不仅是方法的升级,更是一种态度的召唤:当机器人从实验室走向真实世界,我们不能再满足于“做没做成”的二元答案,而应建立起透明、可复现、重视过程的评测规范,让每一小步进展都得到应有的标注,也让每一次回退都成为理解的契机。毕竟,智能的跃迁,往往藏在那些未被计分的细节里。
北京某医院神经外科住院医师单木槿,竟在一天之内破解了困扰数学界二十年的Crouzeix猜想。这道矩阵理论难题自2004年提出以来,无数数学家折戟沉沙,而破解它的并非数学教授,而是一位白天做脑超声研究、业余自学高等数学的年轻医生。
单木槿的学术背景颇具戏剧性:本科读地质学,后又接受医学训练,从未系统攻读数学。他在研究脑超声时偶然碰触到这道难题,从此一头扎进矩阵理论的深水区。没有导师指点,没有同行讨论,他选择了一条更狂野的路——让AI替自己思考。
他使用的工具是OpenAI最新模型GPT-5.6 Sol,运行于ChatGPT Work环境。整个证明过程持续16小时,单木槿设置了严苛条件:切断所有网络访问,让数十个AI子代理相互攻击、彼此检验。这套“以子之矛攻子之盾”的策略,据说源自OpenAI官方数学提示词中的配方。
当结果浮出水面时,连单木槿自己都愣了。他随即把证明提交给学界,目前正式同行评审尚未完成,但三位重量级人物已经点头:康奈尔大学的Alex Townsend、数学家Anne Greenbaum,以及Crouzeix猜想本身的提出者——他们都验证了证明的正确性。
这个夏天,数学界正经历一场狂野的AI热潮,而突破不再只属于殿堂内的专家。对职业数学家而言,这或许有些刺痛,但他们的角色正在转变,而非萎缩。当一个拥有ChatGPT订阅的普通人就能产出证明时,验证一项证明的真伪,反而成了稀缺且炙手可热的技能。
从地质学到医学,再到借AI之手攻克纯数难题,单木槿的故事像一则荒诞又真实的寓言:知识的壁垒从未如此脆弱,而好奇心与工具的结合,正在重写谁配得上“发现者”之名。也许,未来的数学史会把这一天记为分水岭——不是AI取代了人类,而是人类重新定义了思考。
在人工智能行业掀起激烈争论的当下,一条来自投资圈的消息悄然点燃了火药桶。知名投资人Gavin Baker在X平台上爆料,称Anthropic的CEO Dario Amodei有一个隐秘野心——让公司成为“世界上唯一一家私营企业”。这个说法立刻引来反驳,Anthropic的同事Sholto Douglas直截了当地回应:“完全错误”。但真正让这场对话升温的,是Baker随后抛出的更尖锐判断:Dario在AI监管的辩论中“已经输了”,他那些关于AI风险的警告,正在给美国国内反对建设数据中心的势力递上弹药。
这场交锋的特别之处在于,一向极少公开发声的Dario Amodei罕见地亲自下场回应。他没有接过“唯一私营公司”的话题,而是把矛头指向了更根本的分歧:有人认为应该严控AI,有人主张通过开源模型广泛传播,但在Dario看来,这根本是一个“虚假的选择”。他解释,Anthropic提出的方案旨在减缓大型实验室的步伐,同时给小机构留出空间,并非要一刀切地锁死技术。这番话既是在澄清公司立场,也是在回应外界对Anthropic“过度安全主义”的批评。
真正耐人寻味的是Dario对AI形象问题的回应。当被问及AI行业近来遭遇的公关挫折时,他没有试图辩解,也没有拿出营销话术,而是坦言:那些负面印象,靠宣传是扭转不了的。他提到,自己在生物学和医学领域的合作项目已经出现“早期微光”,这些实实在在的成果——哪怕只是初步的进展——对公众情绪的正面影响,将远超任何广告攻势。在他看来,AI赢得信任的唯一路径不是说服,而是攻克癌症这样的真实难题。
这场对话之所以值得关注,不仅仅因为Dario的罕见露面,更因为它揭示了AI行业当前的核心焦虑。一边是监管压力、社会疑虑和反数据中心运动的兴起,另一边是技术巨头之间关于开源与闭源的路线之争。Dario的回应其实是一种姿态:他拒绝承认“风险警告”是失败的策略,也拒绝接受“安全”与“进步”必须二选一。他的潜台词是——如果AI最终能治愈癌症,今天所有的骂名都会烟消云散;如果不能,那说什么都是徒劳。
这场争论没有赢家,但它留下了一个值得反复咀嚼的信号:在一个充满不确定性的技术时代,最有力的辩护可能不是逻辑或数据,而是那些让人亲眼看见希望的结果。当公众不再恐惧AI,而是感激AI的时候,信任自然会回归。而通往那条路的过程,注定比任何口头承诺都漫长,也比任何公关危机都更有分量。
在大模型的世界里,知识存储与推理计算往往纠缠在一起,像一对形影不离的双胞胎——这带来了巨大的算力消耗和知识冗余。然而,一种名为Mobius-v0的全新架构,正试图将这对双胞胎拆开,让各自发挥专长。
Mobius-v0的核心理念,是将全局共享的“记忆模块”(即前馈网络,FFN)与多个“推理模块”(即自注意力机制,Self-Attn)彻底分离。想象一座巨大的知识仓库,里面整整齐齐地码放着无数知识向量;而一群灵活的“推理者”手持隐藏状态作为“提货单”,反复进出仓库,精准提取自己需要的知识,再将材料带回推理工坊进行组合加工。知识负责存储,推理负责计算,二者通过隐藏状态这一“缓存与信使”循环往复,互不干扰。
这种“知识-推理分离”的设计,带来了两个直接好处:更好的知识压缩率,以及更高的推理效率。论文给出的数据颇具说服力:基于Mobius-v0架构,一个从头训练的70亿参数模型,仅用Transformer基线模型62.6%的训练数据,就达到了与之相当的下游任务得分。这意味着,同样的数据量,Mobius学得更快、记得更牢。
更令人惊讶的是持续预训练的表现。研究团队将Intern-S2-Mobius基于Qwen3.5-35B进行持续预训练,在取得与基线相当的下游得分的同时,端到端推理速度竟然提升了近4倍。想象一下,在相同的硬件条件下,原本需要等四秒钟的答案,现在一秒就能生成——这种速度飞跃,对于实际部署而言意义重大。
当然,Mobius并不是要完全颠覆Transformer,而是提供了一种新的组织思路:让知识沉淀在记忆模块中,让推理在多个推理者之间分布式推进。这种架构启发我们,或许大模型的瓶颈不在于“更大”,而在于“更有序”。当记忆与推理各司其职,模型不仅更轻快,还可能离真正的智能更进一步——毕竟,高效的思考,从来不是把图书馆背在身上,而是知道该去哪本书里找答案。
当我们看一张照片时,大脑能瞬间判断出物体的远近、前后关系,甚至想象出从另一个角度看到的样子。但让机器做到这一点,却一直是个难题。过去的研究者往往把空间感知拆成几个独立任务:有的专门重建三维模型,有的专门匹配图像对应点,还有的专门回答空间关系问题——就像让三个不同的人分别学画画、认脸和算距离,他们各自练得不错,却难以互相借鉴经验。
现在,一个名为SPARGen的新框架试图打破这种割裂。它的核心思路很直白:既然这些任务都是在理解同一个物理场景,为什么不放进同一个模型里一起学?SPARGen把三维重建、密集对应和空间推理统统改写成“按指令生成”的任务——模型不再是针对每个任务训练专门的网络,而是像同一位学生,根据不同的考题要求,从同一个知识库中提取答案。它能把紧凑的结构化信息和语言描述编码成统一的token序列,同时以图像对齐的方式生成密集的几何场,让空间监督信号共同塑造共享表征。
换句话说,SPARGen让模型在做“三维建模”时积累的几何直觉,也能用来回答“哪个物体在另一个物体后面”之类的问题。实验显示,在三维重建、对应点匹配和空间推理等多个基准测试上,这套统一的原生多模态生成框架取得了有竞争力的表现,证明不同空间任务之间确实存在可以共享的底层理解。
这项研究的意义或许不在于某个具体指标,而在于它提示我们:空间智能可能不是一个需要被拆分成无数小块的问题,而是一棵可以从同一根系生长出不同枝叶的大树。当机器真正学会用统一的方式感知空间,它们离理解这个三维世界就更近了一步。
想象一下,你走进一个虚拟世界,不是旁观一段预设好的视频,而是亲自转动视角、推开房门、踏入溪流,看看水花是否会真实溅起。这正是视频世界模型的目标:根据你此刻的观察和动作,实时生成未来画面。然而,一个棘手的问题摆在研究者面前——不同的模型,其“通关方式”截然不同。你绕场一周检查场景是否穿帮,它可能只需转向九十度;你走进水里观察波纹,它或许轻点脚步就能模拟。动作序列千差万别,用固定的指令序列去评测不同模型,显然有失公允。
为此,研究者提出了一种新思路:不再用脚本化的动作去催动模型,而是派遣“多模态智能体玩家”去与模型互动,让它们主动追求一个长期目标,比如“环绕环境确认一致性”或“涉水检查涟漪”。在这一范式下,全新的基准平台PlayWorld应运而生,它包含171个精心设计的场景,每个场景都附带一个明确的目标,从几何连贯性、交互真实度、视野外演变到内在演变四个核心维度,外加视频质量和可控性的基础指标,全面考察模型的表现。
研究人员对九个最先进的世界模型进行了严格测试。结果令人警醒:在长期交互目标的挑战下,这些模型依然显得“不靠谱”——空间一致性时常崩塌,状态演变更难持久。当世界在你转身后悄然静止,或在你触碰后缓慢遗忘,这种体验与真实的物理世界相去甚远。这项研究不仅为世界模型画出了一张“体检报告”,更提醒我们:一个真正可信的虚拟世界,不能只美在当下,更要稳在远方。模型的进化之路,仍需要从“能看”走向“能活”。
想象一位画家,想要在画布上均匀地撒下数万个墨点,既不能聚成团,也不能排成栅格。这种被称为“蓝噪声”的分布,在计算机图形学里随处可见——从点画、半调色到多类采样,它决定了图像的质感。但长久以来,生成蓝噪声的两种主流思路各有短板:全局优化方法能得到高质量点集,却必须把所有的点“绑定”在一起计算,内存和耗时随着输出规模暴涨;而局部的程序化或瓦片法虽然轻快,输出质量却只能隐式地定义,难以控制和预测。
这篇研究将蓝噪声的生成问题,巧妙地转化成了统计物理中的“吉布斯分布”采样问题。研究者把二维网格上的每个位置看作一个二元变量:要么被点占据,要么空缺。点与点之间,存在一种成对的“排斥力”——这正是蓝噪声“相互远离却又均匀”的本质。密度、排斥强度、作用尺度、核的软硬,都成了这个分布的可调参数,仿佛给美工提供了一套调节明暗、疏密、硬边柔边的旋钮。
更精妙的是采样算法。由于能量只按点对求和,相距太远的相互作用可以被安全地截断,整个网格因此变成一个“有界度的马尔可夫随机场”——每个点只受它局部邻居的影响,让一切变得可控。采样时,研究者采用了一种“从未来回溯过去”的马尔可夫链蒙特卡洛方法:不是从头开始演化到目标状态,而是从想要的状态出发,倒着追踪链条,并固定回溯深度。于是每个样本的计算代价有上限,它依赖的区域也有边界。一个拥有足够“光环”区域的瓦片,单独生成后,与在全图范围内生成的同一区域,逐位完全相同——无论瓦片之间如何拼接,无论生成顺序如何,都不需要任何通信。
这意味着,内存不再取决于输出总大小,而只取决于单个瓦片的尺寸。精度与成本之间的权衡,也变成了有严格误差界的参数调节,而不是切换算法,仿佛用同样的手艺,既雕得出硬币,也刻得成巨碑。
研究者分别验证了模型、采样器和这些理论保证:生成的集合重现了标准蓝噪声频谱,并能随着参数变化连续过渡;采样器的工作量与内存符合预测;拼接瓦片与整体生成的输出被逐位验证一致。最终,他们在14000像素级别的画布上实现了自适应点画,而传统方法在此规模下需要与输出成正比的内存。研究还顺带展示了多类别扩展,让不同“物种”的点各自保持蓝噪声的分布。
这项工作的意义,不只是让大尺度蓝噪声生成变得可行。它把统计物理、马尔可夫随机场和图形学中的采样问题缝合在一起,给出了一种“条条大路通罗马”的新范式——当你能从分布中采样,你便拥有了流动的、可调节的、无穷扩展的点云。也许,下一次你在屏幕上看到一幅精致的点画时,它的每一颗墨点,都已不再是孤立的像素,而是一次从未来向过去的优雅追踪的产物。
在人工智能的深水区,一个看似简单的问题困扰着研究者:为什么有些任务,模型能“举一反三”地处理比训练时更长的序列,而另一些则彻底崩溃?这篇研究从计算理论最基础的“正则语言”入手,试图给这个问题一个精确答案。
正则语言是形式语言中最简单的一类,相当于计算机科学里的“入门语法”。过去人们只知道Transformer有时能长度泛化,但究竟哪些语言它能做到、哪些不能,始终是一团迷雾。这项研究给出了首个完整回答:他们找到了一个多项式时间算法,能根据语言“语法幺半群”的大小,自动判断该语言是否具备长度泛化能力。
关键在于一个名为C-RASP的形式体系——它恰好表达了Transformer能够长度泛化的那些语言。此前没有人能更好地刻画C-RASP,因为经典工具失灵了。研究团队发现,克罗恩-罗兹分解理论——这套统治了有限半群半个世纪的经典方法——在C-RASP面前完全不够用。它的基本构件(触发器与单群)在C-RASP中根本无法表达;而C-RASP的真正基本构件“无界计数”,又超出了克罗恩-罗兹有限半群的表达能力。
换句话说,长度泛化的底层机制,被一种经典有限分解理论看不见的代数性质所控制。为了突破,研究者将经典分解理论从有限半群推广到整数上的无限加法群,用整数迭代圈积来刻画C-RASP,由此推导出可证明的多项式时间判定算法。他们还将理论应用于大量正则语言测试集,结果显示,这一新分类比以往任何模型都更准确地预测了Transformer的真实长度泛化行为。
这场跨越形式语言、代数与深度学习的对话,让一个长期悬而未决的问题首次有了清晰轮廓。它也提醒我们:深度学习的行为边界,有时需要回到最古老的计算理论中去寻找。理解了“哪些简单语言能泛化”,或许就离“哪些复杂任务能泛化”更近了一步。而真正的泛化,从来不是一项技能,而是藏在代数结构里的一把钥匙。
在人工智能的深层世界里,大语言模型的内部运作一直像一座迷雾笼罩的迷宫。最近,一项针对层间交错混合架构大模型的研究,首次系统性地揭开了“大规模激活”现象的神秘面纱——这些惊人的数值尖峰并非随机涌现,而是遵循着一种与架构精密对齐的规律。
研究人员发现,在全注意力层之前,激活值会规律性地猛然飙升,形成所谓的“前注意力尖峰”;而在相邻的线性注意力层之间,这些尖峰有时并不会立刻消退,而是持续延伸,形成“尖峰间平台”。随着全注意力层变得密集,这些尖峰逐渐通过平台连接成片,最终呈现出纯全注意力模型那种熟悉的稳定形态。
这一规律并非巧合。研究团队在五种线性注意力架构、六种混合配置、五个数据领域以及参数规模从12亿到3970亿不等的多个开源模型中,反复观察到了相同的组织模式。更令人惊讶的是,即使在受控的预训练实验中,仅13亿参数的混合模型也早早展现出这两种形态,仿佛它们是大模型与生俱来的“本能”。
输出门控的存在与否,则扮演了关键的调节角色:全注意力输出门控能大幅削弱激活的绝对强度,却无法改变其层间分布;而移除门控,则只会带来相对适度的放大。从机制上看,这些形态遵循着统一的生命周期——大规模激活的“取消时机”决定了它们的命运:前注意力尖峰遵循局部的“写入-沉淀-取消”过程,而尖峰间平台的持续存在,则源于延迟取消的效应。当全注意力比例趋向极限,这一逻辑最终收敛到纯全注意力模型的特征形态。
这项研究不仅为理解混合注意力模型提供了清晰的内部图景,也为未来设计更高效、更可解释的大模型指明了方向。代码已在公开平台发布,等待着更多探索者踏入这片新开辟的认知疆域。当我们逐渐读懂这些数字脉冲的律动,或许就离掌控人工智能的“意识流”更近了一步。
想象一下,一个智能体不仅能从成功中学习,还能从每一次尝试的轨迹中汲取教训,甚至无需人类为其设计复杂的“特权信息”——这正是自我进化AI领域面临的核心挑战。传统的方法,如同策略自蒸馏(OPSD),虽然通过一个“特权教师”在智能体自己的轨迹上提供密集监督,效果显著,但它们严重依赖设计者预先指定的特权工件,比如标准答案、反馈、技能或示范轨迹。这种依赖限制了端到端的可学习性,也阻碍了智能体持续自我改进的规模化能力。
在这项工作中,研究者提出了潜在同策略自蒸馏(LOPD),一种颠覆性思路:不再设计另一种手工定制的OPSD变体,而是让教师使用的“特权上下文”本身从经验中端到端地学习。具体而言,LOPD会检索相关经验,并将它们组合成连续的潜在标记,这些标记为自我教师提供条件;与此同时,学生根据任务和交互历史生成轨迹,并在每一个访问过的前缀处获得密集的标记级监督。为了稳定和规范潜在上下文的学习,研究者还引入了一个“特权边际”目标。实验结果令人瞩目:在智能体工具使用和代码生成两大任务上,LOPD不仅性能强劲,超越了RLVR以及OPSD、SDPO、Skill-SD等代表性OPSD方法;更展现出惊人的学习效率——仅用不到GRPO和Skill-SD 30%的采样预算,就达到了超越它们的性能。消融研究进一步提供了直接证据:让特权上下文变得可学习,是实现这些收益的必要条件。这些成果将LOPD定位为迈向更可扩展、更自主的智能体进化范式的重要一步。当智能体不再依赖人类预设的“特权”,而是学会自己从过往经历中构建智慧,那或许才是真正的自我进化开始。
自主智能体:优化器而非研究者原文
在大模型能力飞速跃升的当下,一个关键问题浮出水面:这些自主智能体究竟能不能像人类研究员一样,通过长周期实验持续改进模型、系统和各类技术产物?要回答这个问题,只看最终得分远远不够——分数既看不出进步发生在哪一步,也看不出失败卡在哪个环节,更无从判断积累的经验是否真的让后续决策更聪明。
为此,一项系统性研究构建了全新的评估框架,对七个前沿模型在36个长周期任务中的表现进行了深入剖析。该框架借助基于规则的指标,将智能体在任务中的行为拆解为三个维度:问题构建、执行和反馈控制。同时,研究还设计了受控对比实验,专门考察智能体在同一任务内及跨任务间的经验复用能力。
结果令人深思:当前智能体的行为模式更像“工程优化器”,而非“自主研究者”。它们能够成功构建并实施可行的技术方案,但不同运行之间的表现波动极大;最强方案大多是对已有技术的适配或组合,真正意义上的方法论创新仍然十分罕见。进一步分析揭示,最终成绩背后由多种因素交织决定:相似的最终结果可能源于完全不同的过程瓶颈;经验复用既可能提升后续任务表现,也可能误导决策方向;甚至模型外在的“夹持”设计——即系统如何约束和引导智能体的工作流程——都对性能稳定性有显著影响。
这项研究的意义超越了单纯的打分排名。它绘制出一幅更精细的智能体行为图景,明确指出性能瓶颈并非均匀分布,而在不同阶段各有侧重。研究者据此提出了具体改进方向:优化模型训练策略、增强推理时决策、更科学地管理经验积累,以及重新设计智能体的外部框架。这些发现为通向真正自主的研究型智能体提供了可操作的路标。
当人工智能从“能做事”走向“会研究”,我们或许该重新审视:优化的极限,究竟离创造还有多远?
Abstract:GPU kernel agents and GPU programming languages have advanced separately, leaving expert kernels difficult to reproduce. Agents usually treat the compiler as a fixed black box and receive only errors, correctness outcomes, and timing, while existing DSLs either hide critical scheduling decisions or expose them through difficult layout abstractions. We present CAKE, a compiler-agent co-design in which agents author CAKE IR, a typed, hardware-explicit schedule representation. CAKE exposes warp roles, memory movement, synchronization, and pipelines while supporting verification, cost modeling, and localized diagnostics. The harness itself evolves: recurring failures become verifier rules, IR primitives, model calibrations, and reusable optimization tactics. In matched implementation-hidden Flash-KMeans clean starts on B200, the best CAKE IR candidate at an 80-million-token budget runs at 1.144x the tuned FlashML baseline, compared with 0.928x for direct CUDA/PTX. Beyond this benchmark, agent-generated Kimi Delta Attention achieves a 2.05x geometric-mean speedup over official FlashKDA and passes end-to-end serving validation. Dispatcher-backed KNN and KMeans improve performance by 1.42x to 2.12x across more than 400 shapes, and four kernel changes are available as upstream PRs. CAKE targets NVIDIA GPUs from Ampere through Blackwell and separates single-shape evolution from library generalization and dispatch.
在人工智能探索真实世界模拟的征途中,一个两难问题长期困扰着研究者:交互式世界模型既要记住漫长的过去,又要对当下做出即时反应,还要能畅想遥远的未来。然而,这三重需求彼此拉扯——若将全部历史堆进模型的上下文或缓存,计算成本会随会话变长而无限膨胀;若追求低延迟的快速生成,又受限于“教师模型”的能力上限,难以驾驭长期连贯的叙事。
名为Evoke的新方案,选择了一条截然不同的路径:把“世界状态”从模型内部剥离出来,放在外部。它建立了一个以相机视角为索引的“世界状态库”,随着场景推进,模型只需从库中检索与当前视角相关的碎片信息,而非背负全部历史。如此一来,无论会话如何无限延伸,去噪器的上下文始终被牢牢约束在一个固定范围内,记忆不再成为负担。
但这只是第一步。Evoke没有将教师模型视作一个固定的“生成器”,而是将它重新设计为“长程监督者”。它的稀疏注意力机制融合了三种策略:将序列按块分组、检索选中的远距离帧、借助线性注意力维护全局状态。当处理超长时序时,其内存与计算的增长仅是线性的,从而让模型能够跨越超长距离进行监督——这暴露了“短窗口内看似合理、长程上却不断漂移”的内容偏差,也让逐块的条件控制变得可能:用户可以在序列的任意位置改变提示或触发事件。
为了让这些能力真正落地,研究者引入了一项长达30秒的分布匹配目标,并配合自我强制的滚动生成训练。这套方法将教师的长程稳定性和事件控制能力,完整迁移给了一个仅需三步推理、且无需无分类器引导的学生模型。最终,这个轻量级的学生模型不仅显著提升了对长期漂移的抵抗力,还保留了灵敏的交互响应能力。
实验数据证明了它的实力:在单块英伟达H200加速卡上、分辨率为384×640的条件下,Evoke生成1.5秒的视频块仅需2.11秒,足以支撑开放式、不断演化的生成。作为三步推理的世界模型,它在WBench基准上达到了当前最优水平,同时在VBench-Long和VBench-2.0上亦保持领先地位。
当模型的内部不再试图记住一切,而是学会“外挂记忆”和“选择性回想”,长期生成与实时交互之间那道看似不可逾越的鸿沟,便被悄然架起了一座桥。也许下一个真正能够“持续陪你走下去”的虚拟世界,并非源于更大的参数或更长的缓存,而在于如此轻盈而通透的架构之思。
想象一位科学家,不仅能读懂论文和代码,还能亲眼“看见”图像、信号、音频、视频、三维结构乃至轨迹数据。如今,这种能力被赋予了一个名为OmniScientist的AI系统。它不再依赖预计算好的摘要或标量特征,而是直接从异构的原始证据出发,完成从提出假设、设计实验到撰写论文的完整科研流程。
OmniScientist由感知层和三个自主智能体构成,分别负责构思、实验和写作,它们运行在一条确定性的流水线中,让观测数据能够实时影响研究问题、实验决策和最终结论。系统还在代码层面执行想法检查、严谨性检查和声明检查,确保新颖性筛选、统计有效性、执行溯源和数值可追溯性都得到硬性保障。
研究团队在跨越5个学科家族、4类科学证据的36个真实数据案例上进行了测试,涉及的模态包括图像、信号、音频、视频、三维结构、轨迹、表格、公式和图。结果令人振奋:OmniScientist在所有36个案例中都成功走完了从原始数据到可编译论文的全过程,在参考推理骨干下平均论文得分为6.3分。更关键的是,在与一个只接收预计算标量特征的“盲版”系统进行配对比较时,直接感知在所有7个评估维度上都占优,并在85%的面对面评判中胜出。
这组对照实验揭示了一个核心洞见:科学发现要立足证据,就不能把感知环节切掉。全程感知不是锦上添花,而是让AI真正理解世界、产出可靠知识的必要前提。当AI学会了“亲眼观察”而非仅靠二手数据推演,科学发现的新大门或许才刚刚打开。
在科学的漫长征程中,论文的可复现性始终是知识大厦的基石。它既保障了已有结论的可靠,又为后续实验铺平道路。然而,复现往往比原创更难——那些原文中语焉不详的细节,需要研究者像探索未知一样,带着假设去填补空白。如今,一项新的研究试图把这件事交给AI。
研究人员构建了一个名为Replica的可扩展论文复现任务空间,并设计了一套自动生成的规则评估系统作为奖励信号。这套评估器的噪声很低,与人类对复现质量的判断高度一致。基于此,他们训练了名为Faraday的27B参数“AI科学家”智能体,它能调用编码工具作为辅助,在留出的复现任务上,表现超越了Claude Opus 4.8和GPT-5.5。
定性分析个别运行轨迹时,研究者发现Faraday采用了更符合科学原则的方法。它不满足于机械地跑通代码,而是像真正的科学家那样审视问题、设计路径。这项研究或许预示着,在不远的未来,AI不仅能辅助分析,更能独立承担起验证与创新的长周期科学任务。当机器开始严谨地复现人类的实验,我们或许正在见证科研方式的一次静默转向。
想象一下,你手头有一个强大的降噪工具,它能把一张布满噪点的照片变得干净平滑,但你却不敢轻易使用——因为它可能会“自由发挥”,把原本的细节改得面目全非。怎样让这个“黑盒子”在降噪的同时,又不偏离原始输入的忠实度呢?研究者们提出了一个聪明的办法:不需要重新训练模型,只需要在输出和输入之间做一次“线性混合”,然后找到一个关键的最大混合系数。这个系数由用户指定的局部保真度约束来决定,而衡量保真度的标尺,就是大家熟悉的PSNR或SSIM指标。
如果选择PSNR作为约束,研究者发现,在一个局部常数混合的假设下,可以直接推导出闭式解,几乎不费吹灰之力。若选择SSIM,则要复杂一些——他们基于同样的假设,推导出一个逆SSIM的可处理形式,然后用迭代求根的方法高效求解。这样,无论哪种指标,都能帮你找到一个恰到好处的混合点,既保留降噪效果,又不让图像偏离原图太远。
为了验证这个“锚定”策略,研究者在DIV2K图像上用合成高斯噪声进行测试,并分别使用了Real-ESRGAN和非局部均值降噪器。结果显示,这种方法确实能有效地控制保真度,同时还能在降噪性能和统计自然度之间取得平衡——后者用残差噪声的超额峰度来度量。有趣的是,基于SSIM的锚定在不同噪声水平下表现得比基于PSNR的更稳定,这为实际选择提供了有价值的参考。
最终,这项研究像是在黑盒降噪器的输出上系了一根无形的线,让它无论如何也不敢飞得太远。在图像处理中,保真与美观往往难以兼得,但一根合适的“锚绳”或许能让你在两者之间找到属于自己的平衡点。当技术既懂克制又懂自由,图像处理的艺术才算真正开始。
人类的眼睛仿佛一架精巧的时光机,既能捕捉此刻的瞬息变化,又能将久远的画面沉淀为记忆。然而,当人工智能尝试在视频流中同时做到这两件事时,却常常顾此失彼。过去的流式视觉语言模型面临一个两难困境:若压缩上下文,对当前画面的感知会更敏锐,但追溯早期情节的能力便大打折扣;若保留冗长的历史信息,注意力又被稀释,实时感知变得迟钝。
为了解开这个死结,研究人员提出了StreamTTT。它的思路颇为巧妙:不再把漫长的视频历史塞进注意力机制的上下文窗口,而是将其写入一组随视频在线更新的“快速权重”中。这样一来,原本拥挤的上下文只留下一个短小的滑动键值缓存,专门负责近期的视觉证据,既保住了对当下的敏感,又不牺牲对过去的追忆。
为了让模型真正学会这种能力,团队采用了双管齐下的训练策略:一边用离线长视频问答数据夯实基础,一边构建了全新的实时问答语料库,模拟真实场景中“边看边问”的挑战。在OVO-Bench基准上,StreamTTT-4B的表现令人瞩目:实时感知成绩比同规模的SimpleStream-4B高出1.4个百分点,而回溯过去的能力更是领先3.7个百分点。即便面对更大体量的SimpleStream-8B,StreamTTT-4B在StreamingBench的实时视觉理解子集上依然不落下风。
这项研究揭示了一个朴素而深刻的道理:记忆不必成为当下的负担。把历史写入另一套参数,就像把旧日记收进抽屉,桌面只留一本当前的手账。当模型不再需要背负全部往昔去注视眼前,它反而能看得更清、记得更远。或许,这正是通向更自然视频理解的又一块基石——让机器像人一样,既活在当下,也拥有昨天。
在电动垂直起降飞行器(eVTOL)的赛道上,Joby Aviation是声名最响亮的玩家之一,但它也面临一个尴尬的现实:飞行出租车还在烧钱,收入却主要靠“买来的”直升机业务撑场。最新一个季度的3860万美元收入里,有3620万美元来自去年收购的直升机公司Blade,自己的空中出租车业务依然处于投入与亏损的深水区。
为了让公司活下去,并拥有一个真正能自己造血的家底,Joby作出了一次大手笔决定:支付5亿美元,其中包括约4.5亿美元现金和5000万美元股票,收购俄亥俄州代顿的Resonant Sciences。这是一家拥有250名员工的国防科技公司,超过90%的员工持有安全许可,身份特殊,技术敏感。交易预计在2027年上半年完成,完成后Resonant将保留自己的名字和CEO,成为Joby的专门防务部门。
这笔收购并非简单的“买买买”。Resonant年收入超过1亿美元,核心业务已经实现盈利,而Joby自己的飞行出租车业务还在持续失血。Joby预计,在2026年下半年还将使用3.85亿至4.15亿美元的现金储备。所以,Resonant就像一个稳定的输血站,给Joby带来了它目前最缺的东西:一笔规模可观、实实在在赚钱的生意。
与此同时,Joby原有的防务相关项目,包括涡轮电动、氢电动和防务自主计划,都会并入这个新部门。这意味着,Joby并不是单纯找一个赚钱工具,而是要把自己的飞行技术延伸到国防领域,让技术积累和商业回报形成协同。
从行业视角看,这起收购也透露出一丝信号:eVTOL距离大规模载客飞行仍有距离,企业必须找到现实路径来支撑梦想。防务订单通常稳定、利润高,加上Resonant深厚的政府背景和保密