EZ.AI Daily
每日 AI 新闻与论文精选
Zatom-2:原子级多任务预训练模型
正在播放 1/10
0:000:00
2026年10月11日
在化学、材料科学和生物学的交叉领域,统一原子级建模被视为加速科学发现的关键。然而,现有的原子级生成方法往往局限于特定学科,例如仅针对化学或生物学,未能充分利用高容量的有机分子数据和无机材料数据进行通用预训练。为了解决这一瓶颈,研究团队推出了Zatom-2,这是一个基于约五百万个结构进行预训练的原子级生成模型,数据源来自OMol25和OMat24电子结构数据集。Zatom-2的核心架构结合了多尺度Transformer与条件流匹配技术,支持力条件控制以及生成、结构预测、分子和材料能量与力预测等基础预训练任务。在实证表现上,Zatom-2在分子分布保真度上优于前代模型Zatom-1,并在现有的分子和材料生成基准测试中展现出强劲性能。特别值得注意的是,该模型能够控制低力和高力环境下的样本生成,并通过联合生成-预测预训练和迁移学习,在低数据场景下显著提升了蛋白质生成能力。在长度外推设置中,经过在2000个蛋白质结构域上的微调,蛋白质骨架的可设计性从未经预训练的67.8%提升至74.8%。这一进展表明,跨领域的多任务预训练不仅能提升单一学科的性能,更能通过知识迁移解决数据稀缺领域的难题,为原子级建模的未来发展提供了新的范式。
2026年10月11日
在生成式人工智能的领域里,如何让模型既快又好一直是研究者追逐的目标。传统的流匹配模型(Flow Matching Models)虽然强大,但在引入预训练表示(如DINO)进行协同去噪时,往往面临复杂的挑战。现有的方法虽然能显著提升训练速度和生成质量,但代价是引入了第二条去噪轨迹,并且需要精心设计针对特定表示的去噪时间表,这使得整个系统变得异常繁琐且难以优化。
为了解决这一痛点,研究人员提出了一种更为简洁且高效的替代方案:Dino Forcing Flow Models。其核心理念颠覆了传统的协同去噪思路,不再对预训练表示进行复杂的去噪处理,而是直接预测这些预训练表示。随后,模型以自身的预测结果作为条件进行后续生成。这一看似简单的改变,彻底移除第二条常微分方程(ODE)的需求,同时也摒弃了那些令人头疼的、针对特定表示的去噪时间表设计。
尽管方法简化,但效果却令人惊喜。这种新方法不仅保留了表示引导带来的所有优势,更在收敛速度和生成质量上实现了双重突破。在ImageNet数据集的测试中,该方法在潜在空间(latent space)的表现超越了当前最先进的方法,而所需的训练轮数(epochs)仅为先前方法的一半。这意味着训练效率提升了整整一倍。更令人瞩目的是,在像素空间(pixel space)中,该方法的FID分数(衡量图像生成质量的关键指标)相比同类先前方法提升了超过20%。这一显著的性能提升证明了“直接预测”策略的有效性。
这一成果背后支撑着一个简单而深刻的原则:不要对你能够预测的东西进行去噪。通过直接利用预训练表示的可预测性,模型得以摆脱冗余的计算负担,从而在更短的时间内达到更高的生成标准。目前,该研究的代码已开源,为社区提供了进一步探索和应用这一高效生成范式的工具。这一进展不仅优化了现有模型的性能,也为未来生成式模型的设计提供了新的思路:有时候,简化流程并直击核心预测目标,比复杂的工程堆砌更能带来质的飞跃。
2026年10月11日
在人工智能探索具身智能的浪潮中,如何让多个虚拟智能体在共享环境中进行细腻、真实的互动,一直是一个被忽视的难题。现有的多智能体世界模型往往局限于粗略的动作指令,如移动或相机控制,难以捕捉真实世界中复杂且细微的肢体交互。为了解决这一痛点,研究团队提出了名为ME-World的多智能体第一人称世界模型,旨在填补这一技术空白。
ME-World的核心创新在于将多智能体第一人称世界建模定义为一种同步的“自我流”生成任务。在这个共享世界中,多个智能体通过细粒度的动作进行互动。为了实现这一目标,模型必须同时满足三个关键的一致性要求:跨视角的动作一致性、共享环境的一致性,以及由交互引起的状态更新的一致性传播。这意味着,当一个智能体做出动作时,其他智能体的视角必须能准确反映这一变化,且整个环境的物理状态要保持逻辑连贯。
在技术实现上,ME-World采用了一种联合去噪机制,在共享的令牌序列中同时处理多个智能体的自我流。每个智能体的视角流不仅依赖于自身的动作,还以所有智能体的目标视角位姿为条件,并通过共享的环境记忆来锚定生成过程。这种设计确保了不同视角之间的紧密耦合,使得生成的视频在逻辑和视觉上更加统一。
研究团队在真实和合成的多智能体数据上对ME-World进行了训练和评估,并引入了一套新的“共享世界一致性”指标,专门用于衡量环境、更新和身份的一致性。实验结果令人振奋:与现有方法相比,ME-World在共享世界一致性、动作控制、身份保持以及视频质量方面均取得了显著提升。这表明该模型能够更准确地模拟多智能体在复杂环境中的动态交互,为具身智能的研究提供了强有力的工具。
这一进展不仅提升了视频生成的真实感,更揭示了多智能体协作中状态同步的重要性。当虚拟世界中的多个角色能够像真实人类一样,通过细微的动作和共享的环境记忆进行无缝互动时,我们距离构建真正具备社会交互能力的具身智能体又近了一步。未来的研究或许可以进一步探索这些模型在复杂社交场景中的应用,让虚拟智能体不仅能“看见”世界,更能“理解”并“回应”其他智能体的存在。
2026年10月10日
在人工智能飞速发展的今天,让机器不仅理解语言,还能将其转化为可物理构建的实体结构,一直是极具挑战性的前沿课题。近日,研究团队提出了名为BrickBench的全新基准测试,旨在评估智能体(Agentic)在基于文本指令进行乐高套装设计方面的能力。这一基准的核心在于,它要求AI代理在接收到一段提示词后,不仅要生成符合语义和设计标准的作品,更关键的是,这些作品必须能够被真实地物理搭建出来。为了实现这一目标,AI需要从离散的零件库中精心挑选组件,并同时对局部细节和全局约束进行联合推理,这极大地考验了模型的逻辑规划与空间想象能力。BrickBench通过三个不同规模和零件可用性的设置,对设计的合法性、对齐度以及设计质量进行了多维度的评分。为了支持这一评估过程,研究团队还开发了BrickAgent环境,允许编码代理在其中构建、检查并验证其设计成果。研究发现,尽管目前领先的AI代理在满足可验证的物理和语义要求方面表现不俗,能够构建出结构合理且符合指令的作品,但在整体设计水平上,它们与人类设计师的作品相比仍存在明显差距。这一发现揭示了当前AI在复杂创造性任务中的局限性,同时也为未来的研究指明了方向。BrickBench基准及其配套环境已公开发布,为学术界和工业界提供了一个评估和推进AI物理设计能力的重要平台。这一进展不仅关乎乐高设计的自动化,更象征着人工智能在从数字世界向物理世界延伸过程中迈出的坚实一步,预示着未来人机协作在创造性工程领域拥有广阔的应用前景。
2026年10月10日
在复杂的现实世界中,一个通用的机器人不仅要能执行多样化的任务,更应具备从经验中学习和进化的能力。然而,如何让机器人将执行过程中学到的知识转化为可复用的能力,一直是人工智能领域的核心挑战。传统的基于代码的机器人代理虽然能根据执行反馈修复程序,但往往缺乏对任务结构的深刻理解,导致经验难以被有效组织和复用。为了解决这一难题,研究团队推出了RoboRSI,一个基于“自顶向下技能精炼”(Top-Down Skill Refinement, TSR)的机器人自我改进系统。
RoboRSI的核心创新在于其独特的任务分解机制。TSR将复杂任务拆解为复合技能、原子技能和基础技能,并为每个层级设定明确的责任范围和输入输出契约。这种结构化的方法使得每一次执行结果都能被精准归因到负责的技能分支,且修订操作被严格限制在该分支内,从而确保了改进的准确性和稳定性。在这一架构之上,系统由管理者、规划者、工程师和审查者四个角色协同工作,分别负责规划、执行、诊断以及新技能的验证与发布。人类则通过设定目标和提供纠正来引导整个过程,而稳定的技能序列会被进一步整合为可复用的复合技能,形成良性循环。
为了验证这一系统的有效性,研究团队在移动操作平台上进行了长达104轮的测试,成功开发了多目标家庭清洁任务。在模拟环境中,RoboRSI的表现更是令人瞩目。在LIBERO、LIBERO-PRO、LIBERO-Plus和RoboTwin等多个基准测试中,它均取得了最高的成功率,比最强的基线模型高出2.7至11.0个百分点。这一结果不仅证明了RoboRSI在复杂环境下的稳定性和效率,也展示了其在技能复用方面的巨大潜力。
RoboRSI的出现,标志着机器人自我进化技术迈出了重要一步。它通过结构化的技能管理和严格的验证机制,解决了经验复用中的关键瓶颈,为通用机器人的发展提供了新的思路。未来,随着类似技术的不断成熟,我们或许能看到机器人真正具备从失败中学习、从成功中进化的能力,从而在更广泛的场景中发挥重要作用。这不仅是一个技术突破,更是通向通用人工智能的重要里程碑。
2026年10月10日
在通用机器人领域,从敏捷运动到灵巧操作,强化学习(RL)一直是核心驱动力。尽管从仿真到现实(sim-to-real)的RL技术已展现出巨大潜力,但当前的训练流程往往依赖于繁重的工程化先验知识,如精心设计的奖励函数或演示数据。近期研究表明,结合多样化的仿真器重置机制与大规模并行仿真,可以在某些操作任务中显著减轻这一工程负担。然而,当我们将这一范式应用于更精确或动态性更强的问题时,挑战随之而来。研究发现,简单地扩大这一范式规模并非易事。虽然仿真器重置有助于探索,但在这种分布上进行均匀采样,会导致越来越多的学习经验被浪费在策略已经掌握或尚无法尝试的任务配置上。这意味着,在训练过程中,批次中大量的学习信号被无效化,使得我们难以看到并行环境规模化带来的预期收益。
为了缓解这一探索瓶颈,研究团队提出了一种名为“成功引导采样”(Success Guided Sampling, SGS)的简单自适应采样器。SGS的核心思想是将RL训练集中在策略能力边界附近的任务配置上。通过这种方式,大规模仿真RL能够最大化利用批次中的经验,从而实现对大规模并行仿真的更有效扩展。在实验中,研究团队使用了多达2的20次方(超过一百万)个并行环境。结果显示,SGS使RL能够解决此前方法无法解决的具有挑战性的多地形四足运动学和接触密集型装配任务。此外,研究团队还将学习到的操作策略蒸馏为基于RGB的策略,并在真实硬件上实现了针对多个具有挑战性的装配任务的零样本迁移。这一成果不仅展示了SGS在提升训练效率方面的优势,也为通用机器人在复杂环境中的自主学习能力提供了新的技术路径。
2026年10月10日
在人工智能的强化学习(RL)领域,长期存在样本效率低下和迁移能力不足的痛点。基础模型虽然能提供先验知识来缓解这些问题,但其逐token生成的特性导致查询过程串行且成本高昂。近期发布的决策模型Jev提供了一种全新的解决思路:它不生成任何内容,而是通过单次前向传播返回经过校准的、带有类型的精确答案。然而,现有的研究要么将基础模型视为需要训练的对象,要么视为用于提示的生成器,Jev此前仅作为单一领域的黑盒存在,其在RL环境中独立决策的能力以及如何作为训练组件提升RL性能,一直未被充分探讨。
本研究旨在填补这一空白,首先分析了RL系统中各个对象对消费答案的具体要求,并证实Jev能够满足除价值函数核心用途之外的所有需求。基于此,研究团队构建了三种算法,将Jev分别部署在参考策略、探索裁判和重放评级这三个关键位置,以分别提升样本效率、探索能力和学习性能。实验在九个MiniGrid任务和三个Atari游戏上进行,结果显示,结合Jev的训练方法显著优于标准RL学习者,甚至在标准学习者无法取得进展的场景下,Jev依然能有效推动学习,且在此过程中Jev模型本身保持冻结状态,未进行任何额外训练。这是首次将Jev应用于RL学习过程,确立了冻结决策模型作为RL训练可用组件的地位,为探索Jev及其他高级决策模型如何改进RL开辟了新的方向。这一发现不仅展示了决策模型在强化学习中的巨大潜力,也暗示了未来AI系统可能通过更高效的组件化协作,突破传统训练范式的局限,实现更智能、更高效的决策进化。
2026年10月10日
在人工智能的探索之旅中,递归自我改进(RSI)一直是一个充满挑战的领域。当模型面对开放式研究等无法简单验证的任务时,往往陷入监督瓶颈:模型的输出复杂程度甚至超越了人类专家的评估能力,使得模型自身成为唯一的优化者和评估者。然而,单一模型实例在这种同质化循环中,往往难以有效批判和改进自身的复杂推理。为了解决这一难题,研究人员提出了一种名为多智能体自我监督(MASS)的新方法,旨在通过多智能体协作打破单一模型的局限。
MASS的核心机制在于交替进行演化工作流优化和基于自生成轨迹的监督微调。受多智能体拓扑结构在复杂推理中表现优异这一早期发现的启发,MASS引导单一基础模型迭代地提出、执行并自我评估多智能体工作流。通过受结构护栏约束的演化搜索,模型优化了类似计算图的编排结构,从而发现针对特定任务最有效的不同角色分工和信息路由方式。这种机制让模型不再孤立地思考,而是学会如何组织“虚拟团队”来共同解决问题。
实验结果显示,在使用Qwen3.6-27B模型进行两轮MASS循环后,模型在四个开放式公共基准测试中实现了显著的性能提升。具体而言,每输出一个token所获得的性能提升了1.2至1.6倍。更令人兴奋的是,由于改进后的模型随后能充当更优秀的优化者和评估者,这种交替框架使得模型的能力能够持续、递归地自我引导和增强,形成了一种正向反馈循环。
此外,研究还揭示了一个重要的效率发现:多智能体轨迹在训练上更为高效。基于多智能体轨迹训练的学生模型,其表现优于基于单智能体轨迹训练且使用了多1.4倍训练token的学生模型。这表明,从多智能体轨迹中联合学习编排和受限的子智能体执行,为RSI提供了有效的信号。
这一研究不仅展示了多智能体系统在提升模型推理能力上的潜力,更暗示了未来AI发展的一个重要方向:通过结构化的自我协作,模型或许能突破当前人类监督的极限,实现真正的自主进化。当机器开始学会如何组织自己的“思维团队”时,我们离通用人工智能的边界又近了一步。
2026年10月9日
在人工智能领域,如何让视觉语言模型(VLM)智能体更高效地学习复杂任务一直是一个核心挑战。现有的技能增强型智能体虽然能通过蒸馏成功轨迹来提升样本效率,但大多局限于文本中心的方法。这些传统方法往往将空间布局和行动状态对应关系线性化为语言,导致关键的几何结构信息在转化过程中丢失。尽管近期已有尝试引入视觉证据,但技能构建与策略优化通常是分离的,两者之间的相互改进潜力尚未被充分探索。
为了解决这一痛点,研究团队提出了ViSkill,一个视觉原生的技能学习框架。该框架的核心创新在于将成功的交互直接编码为复合视觉技能卡片,这些卡片可以被VLM智能体直接访问。与以往不同,ViSkill构建了一个闭环反馈系统:检索到的技能不仅指导推理过程,还参与奖励塑形;同时,成功的轨迹会被蒸馏回技能库,形成技能积累与策略改进相互强化的良性循环。此外,框架还包含一个可选的冷启动机制,旨在加速早期阶段的 learning 过程。
在Sokoban、FrozenLake和PrimitiveSkill等基准测试中,ViSkill展现了卓越的性能。其整体成功率达到了0.89,而在启用冷启动初始化后,这一数字进一步上升至0.91。这一成绩不仅超越了所有评估过的专有和开源基线模型,而且其收敛速度也优于标准的PPO算法。ViSkill的代码已公开,为研究者提供了进一步探索视觉原生智能体能力的工具。
这项研究揭示了视觉信息在智能体技能学习中的关键作用,证明了保留几何结构对于复杂任务解决的重要性。当智能体不再仅仅依赖文本描述,而是直接通过视觉卡片理解世界时,学习效率与最终性能均得到了显著提升。这或许预示着未来AI智能体将更加依赖多模态的直接感知,而非抽象的语言中介,从而在更复杂的现实环境中展现出更强的适应力和解决问题的能力。
2026年10月9日
在大语言模型(LLM)服务化的浪潮中,如何在成本与质量之间找到最佳平衡点一直是行业关注的焦点。传统的会话级或查询级路由虽然已被广泛采用,但最新的研究表明,更细粒度的Token级路由能带来显著的效率和质量提升。然而,这种细粒度路由对现有系统提出了严峻挑战:基于单一LLM假设的传统架构在面对Token级路由时,会出现严重的步骤不同步和频繁的批次准入延迟,同时给开发者带来了极高的实现复杂度。
为了解决这一痛点,研究团队设计了TokenRouter,一个专为Token级路由LLM推理打造的高效且对开发者友好的服务系统。TokenRouter的核心设计理念是“请求中心编程,模型中心执行”。在这一架构下,开发者只需从单个请求的视角描述路由逻辑,无需深入底层调度细节;而运行时系统则为每个LLM启动一个子服务器,并异步分发请求。这种解耦设计极大地简化了开发流程。
在调度层面,TokenRouter的每个子服务器都采用了延迟批处理调度器。其关键超参数并非通过盲目调参获得,而是源自对系统数学吞吐模型的推导,从而确保了理论上的最优性能。实验结果显示,在多种路由算法、工作负载和模型组合下,TokenRouter相较于现有系统,解码吞吐量提升了2.01至64.15倍。这一突破性的性能提升,不仅大幅推进了Token级LLM路由的服务效率,也为未来更复杂、更精细的大模型服务架构提供了坚实的技术基础。代码已开源,供社区进一步探索与应用。