EZ.AI Daily
每日 AI 新闻与论文精选
BrickBench:AI乐高设计基准挑战
正在播放 1/10
0:000:00
2026年10月10日
在人工智能飞速发展的今天,让机器不仅理解语言,还能将其转化为可物理构建的实体结构,一直是极具挑战性的前沿课题。近日,研究团队提出了名为BrickBench的全新基准测试,旨在评估智能体(Agentic)在基于文本指令进行乐高套装设计方面的能力。这一基准的核心在于,它要求AI代理在接收到一段提示词后,不仅要生成符合语义和设计标准的作品,更关键的是,这些作品必须能够被真实地物理搭建出来。为了实现这一目标,AI需要从离散的零件库中精心挑选组件,并同时对局部细节和全局约束进行联合推理,这极大地考验了模型的逻辑规划与空间想象能力。BrickBench通过三个不同规模和零件可用性的设置,对设计的合法性、对齐度以及设计质量进行了多维度的评分。为了支持这一评估过程,研究团队还开发了BrickAgent环境,允许编码代理在其中构建、检查并验证其设计成果。研究发现,尽管目前领先的AI代理在满足可验证的物理和语义要求方面表现不俗,能够构建出结构合理且符合指令的作品,但在整体设计水平上,它们与人类设计师的作品相比仍存在明显差距。这一发现揭示了当前AI在复杂创造性任务中的局限性,同时也为未来的研究指明了方向。BrickBench基准及其配套环境已公开发布,为学术界和工业界提供了一个评估和推进AI物理设计能力的重要平台。这一进展不仅关乎乐高设计的自动化,更象征着人工智能在从数字世界向物理世界延伸过程中迈出的坚实一步,预示着未来人机协作在创造性工程领域拥有广阔的应用前景。
2026年10月10日
在复杂的现实世界中,一个通用的机器人不仅要能执行多样化的任务,更应具备从经验中学习和进化的能力。然而,如何让机器人将执行过程中学到的知识转化为可复用的能力,一直是人工智能领域的核心挑战。传统的基于代码的机器人代理虽然能根据执行反馈修复程序,但往往缺乏对任务结构的深刻理解,导致经验难以被有效组织和复用。为了解决这一难题,研究团队推出了RoboRSI,一个基于“自顶向下技能精炼”(Top-Down Skill Refinement, TSR)的机器人自我改进系统。
RoboRSI的核心创新在于其独特的任务分解机制。TSR将复杂任务拆解为复合技能、原子技能和基础技能,并为每个层级设定明确的责任范围和输入输出契约。这种结构化的方法使得每一次执行结果都能被精准归因到负责的技能分支,且修订操作被严格限制在该分支内,从而确保了改进的准确性和稳定性。在这一架构之上,系统由管理者、规划者、工程师和审查者四个角色协同工作,分别负责规划、执行、诊断以及新技能的验证与发布。人类则通过设定目标和提供纠正来引导整个过程,而稳定的技能序列会被进一步整合为可复用的复合技能,形成良性循环。
为了验证这一系统的有效性,研究团队在移动操作平台上进行了长达104轮的测试,成功开发了多目标家庭清洁任务。在模拟环境中,RoboRSI的表现更是令人瞩目。在LIBERO、LIBERO-PRO、LIBERO-Plus和RoboTwin等多个基准测试中,它均取得了最高的成功率,比最强的基线模型高出2.7至11.0个百分点。这一结果不仅证明了RoboRSI在复杂环境下的稳定性和效率,也展示了其在技能复用方面的巨大潜力。
RoboRSI的出现,标志着机器人自我进化技术迈出了重要一步。它通过结构化的技能管理和严格的验证机制,解决了经验复用中的关键瓶颈,为通用机器人的发展提供了新的思路。未来,随着类似技术的不断成熟,我们或许能看到机器人真正具备从失败中学习、从成功中进化的能力,从而在更广泛的场景中发挥重要作用。这不仅是一个技术突破,更是通向通用人工智能的重要里程碑。
2026年10月10日
在通用机器人领域,从敏捷运动到灵巧操作,强化学习(RL)一直是核心驱动力。尽管从仿真到现实(sim-to-real)的RL技术已展现出巨大潜力,但当前的训练流程往往依赖于繁重的工程化先验知识,如精心设计的奖励函数或演示数据。近期研究表明,结合多样化的仿真器重置机制与大规模并行仿真,可以在某些操作任务中显著减轻这一工程负担。然而,当我们将这一范式应用于更精确或动态性更强的问题时,挑战随之而来。研究发现,简单地扩大这一范式规模并非易事。虽然仿真器重置有助于探索,但在这种分布上进行均匀采样,会导致越来越多的学习经验被浪费在策略已经掌握或尚无法尝试的任务配置上。这意味着,在训练过程中,批次中大量的学习信号被无效化,使得我们难以看到并行环境规模化带来的预期收益。
为了缓解这一探索瓶颈,研究团队提出了一种名为“成功引导采样”(Success Guided Sampling, SGS)的简单自适应采样器。SGS的核心思想是将RL训练集中在策略能力边界附近的任务配置上。通过这种方式,大规模仿真RL能够最大化利用批次中的经验,从而实现对大规模并行仿真的更有效扩展。在实验中,研究团队使用了多达2的20次方(超过一百万)个并行环境。结果显示,SGS使RL能够解决此前方法无法解决的具有挑战性的多地形四足运动学和接触密集型装配任务。此外,研究团队还将学习到的操作策略蒸馏为基于RGB的策略,并在真实硬件上实现了针对多个具有挑战性的装配任务的零样本迁移。这一成果不仅展示了SGS在提升训练效率方面的优势,也为通用机器人在复杂环境中的自主学习能力提供了新的技术路径。
2026年10月10日
在人工智能的强化学习(RL)领域,长期存在样本效率低下和迁移能力不足的痛点。基础模型虽然能提供先验知识来缓解这些问题,但其逐token生成的特性导致查询过程串行且成本高昂。近期发布的决策模型Jev提供了一种全新的解决思路:它不生成任何内容,而是通过单次前向传播返回经过校准的、带有类型的精确答案。然而,现有的研究要么将基础模型视为需要训练的对象,要么视为用于提示的生成器,Jev此前仅作为单一领域的黑盒存在,其在RL环境中独立决策的能力以及如何作为训练组件提升RL性能,一直未被充分探讨。
本研究旨在填补这一空白,首先分析了RL系统中各个对象对消费答案的具体要求,并证实Jev能够满足除价值函数核心用途之外的所有需求。基于此,研究团队构建了三种算法,将Jev分别部署在参考策略、探索裁判和重放评级这三个关键位置,以分别提升样本效率、探索能力和学习性能。实验在九个MiniGrid任务和三个Atari游戏上进行,结果显示,结合Jev的训练方法显著优于标准RL学习者,甚至在标准学习者无法取得进展的场景下,Jev依然能有效推动学习,且在此过程中Jev模型本身保持冻结状态,未进行任何额外训练。这是首次将Jev应用于RL学习过程,确立了冻结决策模型作为RL训练可用组件的地位,为探索Jev及其他高级决策模型如何改进RL开辟了新的方向。这一发现不仅展示了决策模型在强化学习中的巨大潜力,也暗示了未来AI系统可能通过更高效的组件化协作,突破传统训练范式的局限,实现更智能、更高效的决策进化。
2026年10月10日
在人工智能的探索之旅中,递归自我改进(RSI)一直是一个充满挑战的领域。当模型面对开放式研究等无法简单验证的任务时,往往陷入监督瓶颈:模型的输出复杂程度甚至超越了人类专家的评估能力,使得模型自身成为唯一的优化者和评估者。然而,单一模型实例在这种同质化循环中,往往难以有效批判和改进自身的复杂推理。为了解决这一难题,研究人员提出了一种名为多智能体自我监督(MASS)的新方法,旨在通过多智能体协作打破单一模型的局限。
MASS的核心机制在于交替进行演化工作流优化和基于自生成轨迹的监督微调。受多智能体拓扑结构在复杂推理中表现优异这一早期发现的启发,MASS引导单一基础模型迭代地提出、执行并自我评估多智能体工作流。通过受结构护栏约束的演化搜索,模型优化了类似计算图的编排结构,从而发现针对特定任务最有效的不同角色分工和信息路由方式。这种机制让模型不再孤立地思考,而是学会如何组织“虚拟团队”来共同解决问题。
实验结果显示,在使用Qwen3.6-27B模型进行两轮MASS循环后,模型在四个开放式公共基准测试中实现了显著的性能提升。具体而言,每输出一个token所获得的性能提升了1.2至1.6倍。更令人兴奋的是,由于改进后的模型随后能充当更优秀的优化者和评估者,这种交替框架使得模型的能力能够持续、递归地自我引导和增强,形成了一种正向反馈循环。
此外,研究还揭示了一个重要的效率发现:多智能体轨迹在训练上更为高效。基于多智能体轨迹训练的学生模型,其表现优于基于单智能体轨迹训练且使用了多1.4倍训练token的学生模型。这表明,从多智能体轨迹中联合学习编排和受限的子智能体执行,为RSI提供了有效的信号。
这一研究不仅展示了多智能体系统在提升模型推理能力上的潜力,更暗示了未来AI发展的一个重要方向:通过结构化的自我协作,模型或许能突破当前人类监督的极限,实现真正的自主进化。当机器开始学会如何组织自己的“思维团队”时,我们离通用人工智能的边界又近了一步。
2026年10月9日
在人工智能领域,如何让视觉语言模型(VLM)智能体更高效地学习复杂任务一直是一个核心挑战。现有的技能增强型智能体虽然能通过蒸馏成功轨迹来提升样本效率,但大多局限于文本中心的方法。这些传统方法往往将空间布局和行动状态对应关系线性化为语言,导致关键的几何结构信息在转化过程中丢失。尽管近期已有尝试引入视觉证据,但技能构建与策略优化通常是分离的,两者之间的相互改进潜力尚未被充分探索。
为了解决这一痛点,研究团队提出了ViSkill,一个视觉原生的技能学习框架。该框架的核心创新在于将成功的交互直接编码为复合视觉技能卡片,这些卡片可以被VLM智能体直接访问。与以往不同,ViSkill构建了一个闭环反馈系统:检索到的技能不仅指导推理过程,还参与奖励塑形;同时,成功的轨迹会被蒸馏回技能库,形成技能积累与策略改进相互强化的良性循环。此外,框架还包含一个可选的冷启动机制,旨在加速早期阶段的 learning 过程。
在Sokoban、FrozenLake和PrimitiveSkill等基准测试中,ViSkill展现了卓越的性能。其整体成功率达到了0.89,而在启用冷启动初始化后,这一数字进一步上升至0.91。这一成绩不仅超越了所有评估过的专有和开源基线模型,而且其收敛速度也优于标准的PPO算法。ViSkill的代码已公开,为研究者提供了进一步探索视觉原生智能体能力的工具。
这项研究揭示了视觉信息在智能体技能学习中的关键作用,证明了保留几何结构对于复杂任务解决的重要性。当智能体不再仅仅依赖文本描述,而是直接通过视觉卡片理解世界时,学习效率与最终性能均得到了显著提升。这或许预示着未来AI智能体将更加依赖多模态的直接感知,而非抽象的语言中介,从而在更复杂的现实环境中展现出更强的适应力和解决问题的能力。
2026年10月9日
在大语言模型(LLM)服务化的浪潮中,如何在成本与质量之间找到最佳平衡点一直是行业关注的焦点。传统的会话级或查询级路由虽然已被广泛采用,但最新的研究表明,更细粒度的Token级路由能带来显著的效率和质量提升。然而,这种细粒度路由对现有系统提出了严峻挑战:基于单一LLM假设的传统架构在面对Token级路由时,会出现严重的步骤不同步和频繁的批次准入延迟,同时给开发者带来了极高的实现复杂度。
为了解决这一痛点,研究团队设计了TokenRouter,一个专为Token级路由LLM推理打造的高效且对开发者友好的服务系统。TokenRouter的核心设计理念是“请求中心编程,模型中心执行”。在这一架构下,开发者只需从单个请求的视角描述路由逻辑,无需深入底层调度细节;而运行时系统则为每个LLM启动一个子服务器,并异步分发请求。这种解耦设计极大地简化了开发流程。
在调度层面,TokenRouter的每个子服务器都采用了延迟批处理调度器。其关键超参数并非通过盲目调参获得,而是源自对系统数学吞吐模型的推导,从而确保了理论上的最优性能。实验结果显示,在多种路由算法、工作负载和模型组合下,TokenRouter相较于现有系统,解码吞吐量提升了2.01至64.15倍。这一突破性的性能提升,不仅大幅推进了Token级LLM路由的服务效率,也为未来更复杂、更精细的大模型服务架构提供了坚实的技术基础。代码已开源,供社区进一步探索与应用。
2026年10月9日
在机器人研究领域,一个长期存在的难题是如何让单一模型适应多种不同形态的机器人。由于不同机器人的动作空间差异巨大,传统方法往往难以实现跨形态的泛化。为了解决这一挑战,研究人员提出了一种名为LAC-WM(潜动作条件机器人世界模型)的新方法。该模型的核心创新在于构建了一个共享的统一潜动作空间,使得不同形态的机器人能够在同一个抽象层面上进行交互和学习。
为了验证这一方法的有效性,研究团队将LAC-WM与另一种基于显式动作标签的模型EAC-WM进行了对比。EAC-WM依赖于明确的运动标签作为条件,但这种做法导致不同机器人之间的动作表示彼此割裂,形成了互不兼容的“孤岛”。这种割裂严重限制了模型在适应新机器人时的下游性能。相比之下,LAC-WM通过统一的潜动作空间,打破了这种壁垒,使得模型能够更流畅地迁移知识。
在具体的实验评估中,研究团队在灵巧操作任务和经过修改的LIBERO基准测试上对两种模型进行了全面测试。结果令人振奋:在灵巧操作任务中,LAC-WM的下游性能比EAC-WM最高提升了46.7%;而在LIBERO基准测试中,性能也提升了11.7%。更关键的是,LAC-WM展现出了一种积极的扩展性:随着预训练阶段使用的机器人形态数量增加,其下游性能也随之正向提升。这意味着,引入更多样化的机器人数据不仅不会造成干扰,反而能增强模型的通用能力。
相反,EAC-WM的表现则呈现出相反的趋势。由于其动作空间是割裂的,当预训练中加入更多不同形态的机器人时,模型的性能反而下降。这一对比鲜明地揭示了统一动作空间对于高效跨形态学习的重要性。LAC-WM的成功表明,通过构建共享的潜动作空间,可以有效解决机器人领域跨形态泛化的关键挑战,为未来构建更通用、更灵活的机器人基础模型提供了新的思路。这一发现不仅提升了当前任务的性能,更暗示了通过统一抽象层来整合异构系统的可能性,为机器人智能的规模化发展奠定了坚实基础。
2026年10月9日
在机器人学习领域,如何从昂贵且耗时的人类演示中高效提取技能一直是个难题。传统的模仿学习方法往往陷入“死板”的困境:它们严格复刻视频中展示的动作轨迹,导致机器人只能处理与演示完全一致的初始物体姿态、目标位置和抓取方式。一旦场景发生微小变化,这些机器人便束手无策。另一方面,虽然强化学习(RL)具备强大的泛化能力,但在缺乏先验指导的情况下,面对复杂的多阶段高维任务时,其探索过程往往效率低下且难以收敛。
为了解决这一“泛化”与“探索”的双重挑战,研究团队提出了名为 Dex-One2Many 的新框架。这是一个从真实世界到仿真再到真实世界(real-to-sim-to-real)的系统,其核心目标是从单个人类视频中学习出具有广泛泛化能力的灵巧操作策略。该框架的关键创新在于将视频抽象为“顺序场景图”(sequential scene graphs)。这些场景图不再约束具体的坐标或姿态,而是约束物体间的关系,从而为强化学习提供了高效的引导。
具体而言,这些场景图充当了生成式约束,用于采样多样化的重置状态。由于约束的是关系而非精确姿态,这些重置状态涵盖了视频中未展示过的物体姿态和抓取方式。同时,场景图为每个操作阶段提供了密集奖励,使得机器人从这些多样化状态初始化时,探索过程既短又受引导。这种机制让机器人在保持广泛泛化性的同时,实现了高效的探索。
Dex-One2Many 完全在仿真环境中训练,并成功零样本(zero-shot)迁移到真实的多指机械手上。在涵盖工具使用和操作的五个任务中,该框架表现卓越。在与基线方法的对比中,在已见配置下,Dex-One2Many 的性能高出 6.5%;而在未见过的场景中,其强大的泛化能力使得优势扩大至 71%。这一结果证明了通过抽象场景关系而非模仿具体动作,机器人能够真正理解并适应复杂多变的现实世界操作需求。从单一视频到无限可能,Dex-One2Many 展示了将人类智慧高效转化为机器灵巧性的新路径,也为未来低成本、高泛化的机器人技能学习提供了重要参考。
2026年10月9日
在人工智能深入科学研究的浪潮中,一个核心问题始终困扰着研究者:当大型语言模型(LLM)作为科学智能体参与实验时,它们究竟是在盲目依赖初始的任务上下文,还是能够根据实验反馈灵活调整决策?这项关于神经算子适应的研究深入探讨了这一谜题,揭示了LLM在有限试验预算下选择微调配置时的独特行为模式。
研究聚焦于偏微分方程(PDE)家族的神经算子适应任务,对比了LLM、随机搜索和贝叶斯优化三种策略。令人惊讶的是,在几乎所有匹配的对比中,LLM在留出测试集上的归一化均方根误差(nRMSE)都低于随机搜索和贝叶斯优化。然而,仅仅看最终的性能指标并不能完全解释LLM内部发生了什么,因为不同的决策机制可能殊途同归。为了揭开黑箱,研究人员设计了受控干预实验,以验证LLM决策背后的真实逻辑。
首先,研究考察了LLM的“初始偏见”。在观察任何验证分数之前,LLM提出的第一个配置就已经在对应的随机搜索池中排名靠前。这表明LLM并非随机起步,而是携带了一种有用的、基于任务描述的初始先验知识。进一步的冷启动干预显示,LLM选择的基础学习率会随着PDE描述的变化而改变,证实了其决策对任务特征的敏感性。
其次,研究重点检验了LLM对实验反馈的反应能力。当验证分数可用时,研究人员重新分配了已评估配置的验证分数。结果显示,在所有测试案例中,这种分数重分配都改变了LLM的下一个提案。相比之下,一种保持数值不变但仅改变表述的“值保持重写”并未产生类似的聚合效应。这一对比有力地证明,LLM的决策级行动确实对观察到的结果做出了响应,而非仅仅对文本表面特征做出反应。
综合这些干预结果,研究得出结论:LLM在科学适应任务中并非单一地依赖先验或反馈,而是巧妙地将任务依赖的先验知识与对实验反馈的敏感度相结合。它既利用了对PDE类型的直觉理解来缩小搜索空间,又通过实时反馈不断修正和优化后续策略。这种“先验+反馈”的双重机制,使得LLM在复杂科学优化任务中展现出超越传统优化算法的潜力。
这项研究不仅为理解LLM作为科学智能体的认知机制提供了实证依据,也为未来设计更高效的AI辅助科研系统指明了方向。它提醒我们,在评估AI科学家的能力时,不能仅关注最终结果,更要深入剖析其决策过程的动态适应性。当机器学会像人类科学家一样,既凭借经验直觉起步,又根据实验数据不断修正假设时,人工智能在科学发现中的角色将从简单的工具演变为真正的合作伙伴。这种对先验与反馈的平衡利用,或许是AI突破当前性能瓶颈、实现更深层次科学洞察的关键所在。