EZ.AI Listen Daily

全球AI新闻,耳听为快
2026年7月28日

机器人要学会在现实世界中操作,不仅要听懂语言指令,更得预判场景会如何动态变化。最近大热的视觉-语言-动作模型虽然借助海量数据预训练,却像看静止照片学世界——它们的训练目标过于“静态”,对物理规律和时间因果的理解十分有限,真正操作所需的知识还得靠下游机器人演示数据从头学起。视频生成模型倒是带来了转机,它们通过预测未来帧,天然编码了丰富的时空先验。但现有的视频-动作模型要么把视频和动作预测塞进同一个主干网络,导致策略微调极其困难;要么在引导动作分支时,浪费了大量视频信息。

为此,来自北京大学、阿里巴巴等机构的研究者提出了DeVA——一个解耦的视频-动作模型。它的核心是“分而治之”:视频专家和动作专家各司其职,再通过多层次特征传输实现信息融通,并额外引入物理显著性引导(如物体可供性、深度图)。这种设计让策略学习更高效,同时保留了丰富的视觉表征交换。

实验在多个模拟基准和真实场景中展开。结果显示,DeVA仅用少量数据就展现出强劲性能,收敛速度远快于传统统一架构,而物理引导带来的性能提升清晰可辨。这提示我们:当机器人学着像人类一样预判“摸起来会怎样”“动起来会如何”,解耦与物理先验的结合,或许正成为通向通用操作的关键钥匙。

2026年7月28日

在概率论领域,一个困扰学界多年的Feige猜想近期迎来了突破口。研究人员提交了一份简短证明,直指这个看似简单的命题:对于n个独立的非负随机变量,每个变量的期望值都为1,那么这些变量之和小于n+1的概率,至少是(n/(n+1))^n,这个数值总是大于或等于1/e。令人惊讶的是,这个证明的诞生离不开一位特殊助手——GPT-5.6 Sol,它在一个关键环节提供了思路启发。

这项工作的起点并非凭空而来。此前,Vlassis和Thomas刚刚攻克了Gaffke猜想,该猜想关于一种无需分布假设的p值的有限样本有效性。正是这一突破为Feige猜想的证明搭起了桥梁。研究者巧妙地将原问题转化为一个关于次序统计量的问题,并利用Gaffke猜想的结论,为每个随机变量赋予了一个适当的随机排序,进而完成了最终的概率下界估计。

更值得注意的是,这项研究也引发了连锁反应。Ming、Ramdas、Shen、Wang和Waudby-Smith等人随后开展的工作,进一步揭示了这一证明背后更广泛的统计推断意义。从无分布假设的p值到非负随机变量的和概率,看似离散的数学问题,在AI的辅助下串联成了逻辑严密的链环。

数学本身是一场耐心的博弈,那些看似遥不可及的猜想,往往在无数步递进后豁然开朗。GPT-5.6 Sol的参与并非取代人类的智慧,而是在推演路径上提供了另一种可能性的镜片,让研究者得以看清原本隐没在迷雾中的桥梁。

2026年7月28日

数学界长期悬而未决的Feige猜想,最近被一项新研究彻底解决。该猜想由Feige于2004年提出,涉及独立非负随机变量和的概率下界。设X₁,...,Xₙ为独立非负随机变量,每个期望不超过1,记它们的和为S。研究证明,对于任意正数δ,事件S小于其期望加上δ的概率至少为某个明确的下界bₙ,δ。下界公式分为两种情况:当δ小于1时,bₙ,δ等于δ乘以(n/(n+δ))的n次方;当δ大于或等于1时,bₙ,δ等于(1-1/(n+δ))的n次方。这个下界对于每个n和δ≥1都是最优的,意味着存在某些随机变量分布使得该下界恰好被取到。特别地,由于当δ≥1时bₙ,δ至少为e⁻¹(约0.3679),研究结果肯定了Feige猜想在δ≥1情形下的成立。该证明由ChatGPT 5.6 Pro发现,它创新性地结合了两个领域的成果:一个是Vlassis和Thomas的精确Dirichlet校准定理(该定理解决了统计学中的Gaffke猜想),另一个是凸几何中的Grünbaum质心定理及其由Letwin和Yaskin在2024年给出的推广。这项研究不仅为概率论中的一个重要猜想画上了句号,也展示了人工智能在数学证明中的潜力。它告诉我们,在最不确定的概率世界里,看似微小的下界也能揭示出深刻的确定性结构。

2026年7月28日

在机器人操控领域,让模型学会触觉信息并有效融入预训练的视觉-语言-动作(VLA)模型,是数据层面和建模层面的双重挑战。数据层面,任务演示样本有限,限制了触觉表征质量,而大规模预训练又成本高昂。建模层面,现有方法要么只关注瞬时接触状态,要么用六维力/力矩序列建模时序交互动态,但高维触觉信号仍被忽略。为解决这些问题,研究团队提出了τ框架——一种受联合嵌入预测架构(JEPA)启发的触觉增强VLA模型。该框架从未来视觉监督中学习动作条件的时空触觉表示,并在有限数据下将触觉特征与视觉语言特征融合,用于动作生成。这种监督仅在训练时作用于潜在空间,部署时无额外开销。他们还发布了TacAura数据集,包含四种典型接触密集操控任务的同步视觉、本体感觉和基于视觉的触觉信号。实验表明,τ不仅超越现有模型,还能泛化到未见过物体和场景,显著提升操控性能与鲁棒性。从如何让机器人像人类一样借力触觉的疑问出发,这项研究在数据稀缺与高维信号间找到了突破口,证明未来视觉的引导能让触觉学习更高效。或许,触觉与视觉的真正协奏,才刚刚开始。

2026年7月28日

大语言模型在科学计算中常常“即学即忘”——从一道题获得的反馈经验,很难成为解题下一道题的持久能力。研究者发现,问题在于经验只是临时拼凑的代码修补,而非可迁移的计算逻辑;同时,弱模型可能无法直接理解抽象的解题步骤,形成“抽象-执行鸿沟”。为此,团队提出SciConsolidate框架,通过对比成功与失败轨迹提炼出跨任务的通用过程,并用失效驱动的无答案查询合成大量训练数据。更巧妙的是,他们让强模型将这些抽象过程具体化为可执行的代码,再用于标准微调。在SciCode评测中,直接注入过程让Qwen3.6-27B模型提升3.85子步骤和6.26主问题得分,但Qwen3.5-9B模型几乎无收益——验证了鸿沟的存在。然而,经过过程指导的具体化后,9B模型在无过程直接部署的条件下,比单纯微调控制组提升3.89子步骤和6.25主问题得分,比原始模型提升5.62和11.25分。这一方法为科学计算的自改进助手打开了实用之门。真正的能力增长不在于临时记忆,而在于将经验转化为可传承、可执行的智慧。

2026年7月28日

想象一下,当你输入一段文字,AI不仅能为你生成同步的音频与视频,还能让声音和画面在时间与语义上完美对齐——这正是当前多模态生成领域的前沿挑战。然而,大多数现有方法将音频和视频的变分自编码器(VAE)分开训练,导致两个潜在空间各自为政,缺乏跨模态对齐,使得后续的生成模型必须从零学习同步能力。为此,研究团队提出了OmniVAE,一个联合训练的音频-视频VAE,旨在精细学习音视频潜在表征之间的语义对齐。它不仅通过重构任务保持信息完整性,还引入段级音频-视频对比学习目标,捕捉时序语义对应关系,从而对齐两个潜在空间。同时,OmniVAE从各自模态的预训练语义编码器中蒸馏特征,增强每个潜在空间在下游任务中的可学习性。大量实验表明,这两种目标一致地提升了潜在空间的质量,直接转化为更高质量的文本到音视频生成结果,以及更精确的跨模态同步。这些发现凸显了学习统一表征作为全模态建模基石的重要性。当技术的洪流将每一种感官数据融为一炉,对齐不再是补丁,而是根基。

2026年7月28日

多轮长程规划是基础模型智能体的核心能力,但现有模型在不可控的互联网数据上训练,规划能力如何被获取、塑造和整合始终是个谜。为了解开这个谜题,研究者引入了一个统一可控的多轮环境,系统性地探索了规划能力形成的三个阶段。

在预训练阶段,他们发现数据格式、分布和质量至关重要。采用显式世界模型构建(通过链式思考状态转换建模)能显著提升长程泛化能力。有趣的是,仅靠原子技能不足以实现组合泛化,但少量的长程数据就能带来突破。不过,次优轨迹会严重损害性能——因为误差在长程中会不断放大,如同多米诺骨牌般连锁崩塌。

进入后训练阶段,研究者通过互信息区分了通用规划模式和任务特定规划知识。对于规划模式,他们识别出三种后训练应用区域:不必要的区域(已有良好基础)、有效区域(需要微调)和区域(现有方法无法支持)。在低质量和长程设置下,OPD(离线策略蒸馏)比GRPO(群体相对策略优化)拥有更广的有效区域,因为OPD能提供更一致的更新方向。而对于规划知识,从拥有不同知识的教师模型中蒸馏未见过程时,可能会损害学生原有的世界模型,而无法完全建立新知识——就像试图用陌生的解题思路去替换已经熟练的思维习惯。

最后是规划能力的整合阶段。多教师同策略蒸馏(MOPD)通过收敛到跨环境的共享规划模式来整合能力。兼容模式能实现跨环境泛化,部分共享模式支持持续学习,而完全冲突的模式则会导致严重的相互干扰。

这项研究揭示了长程规划能力形成的系统规律,从数据配比到训练策略,从单一能力获取到多元能力融合,每个环节都充满精妙的权衡。无论是模型的训练设计者还是智能体的应用开发者,都能从中找到清晰的路径指引——但切记,不同知识之间的冲突需要格外小心,因为并非所有的经验都能简单叠加。

2026年7月28日

在视频编辑的世界里,调整摄像机的内外参数——比如改变镜头焦距、移动拍摄位置——通常需要昂贵的3D重建或繁琐的人工操作。现有技术要么只能控制摄像机的位置和旋转(外参),要么依赖复杂的空间建模才能实现完整的相机功能,而且内外参数相互影响,让分离建模变得极为困难。

研究者提出了一个名为CameraAnything的统一框架,首次实现了对视频编辑中摄像机内外参数(包括位置、焦距、分辨率)的联合控制。他们采用了一种巧妙的“逐像素Plücker射线”注入技术,结合分辨率感知的3D旋转位置编码(3D RoPE),在自注意力机制中同时构建了相机条件和空间位置编码。这意味着模型能够在不裁剪或外扩画面的前提下,直接对目标潜空间进行编辑,同时控制相机位置、焦距及原生分辨率。

为了克服配对训练数据极度匮乏的难题,研究团队开发了一套可扩展的合成数据管道:通过结构化多摄像机录制构建动态场景,生成带有各种相机配置参数的同步视频。再配合正交训练策略,最终使CameraAnything能够在单一生成过程中实现富有表现力的视频“重拍”——包括任意视角控制、焦距调整、分辨率适配以及多镜头之间的过渡切换。

这一成果对电影级视频编辑和跨平台内容适配具有重要的实用价值。当创作者可以像操控真实摄像机一样灵活调整虚拟相机的内外参数时,那些过去需要昂贵实拍或复杂后期才能实现的镜头语言,或许将变得触手可及。技术的进步往往在不经意间拓宽了想象的边界。

2026年7月28日

想象一下,一段高质量视频的生成过程——它依赖于强大的扩散变换器模型,但其中隐含着一个巨大的瓶颈:注意力机制。当视频的每一帧都需要处理数以千计的图像块时,这些块组成的序列极长,导致注意力计算耗时惊人。为了破解这一难题,研究人员尝试了“训练-free动态稀疏注意力”,即只计算部分关键块,但现有方法始终难以兼顾效率与精度。

问题出在哪里?第一,现有方法需要为每个块计算一个“代理分数”,然后硬性选择固定数量的高分块——这像逼着厨师用固定比例的食材做菜,要么浪费要么不够。另一种是按累积分数动态选择,但预算分配失衡,而且计算代理分数本身消耗不菲。第二,被舍弃的块彻底丢失信息,就像删掉照片中的大部分像素,导致画质严重下降。

那么,有没有更聪明的办法?最新提出的Sol-Attn方法给出了答案:它将动态路由、稀疏计算和近似校正统一到了一个“在线softmax”过程中。核心机制是在softmax计算时实时设定一个阈值,只保留代理分数超过阈值的块——这相当于在烹饪时根据火候动态调整食材,不预先规划,但确保每一勺都恰到好处。更重要的是,它巧妙复用了那些被舍弃块的代理分数来近似它们的贡献,避免了信息完全丢失。

在图像和视频生成任务中,Sol-Attn展现出惊人的效率:对于视频生成,端到端加速达2.1倍;对于视频编辑,加速达2.3倍,同时视觉质量几乎不受影响。这意味着,在同样的时间预算下,创作者可以生成更流畅、更清晰的视频,或者更快地迭代想法。

这项工作的启示在于:在追求极致效率的领域,有时最浪费的不是计算本身,而是为了决定“算哪里”而产生的额外开销。真正的创新,往往藏在对“无用功”的再利用之中。

2026年7月28日

研究人员在探索扩散模型的在线策略蒸馏时,发现了一个隐藏的陷阱。传统方法直接对齐教师和学生模型在分类器自由引导下的预测速度,但这种方式在分支层面存在根本缺陷——正分支与负分支的误差可以相互抵消,导致看似良好的结果实则暗藏失衡。通过两种截然不同的实验场景,团队揭示了症结所在:当教师与学生的负条件分支共享相同信息时,朴素匹配尚能奏效;然而,一旦教师的负分支保留学生无法获取的特权信息,两者误差的同步下降就会被打破,出现正分支误差减小而负分支误差增大的恶性循环。这种失效模式被命名为负分支不对称。针对这一问题,研究者提出了正方向匹配策略,将正预测与CFG条件方向分别约束,从而切断误差补偿的路径。在密集到稀疏视频控制任务中,该方法显著降低了推理引导尺度的敏感性,实现了更稳定高效的知识迁移。这提醒我们,在模型压缩的微观细节中,分支间的隐秘互动可能成为性能瓶颈,而区分对待不同分支的贡献才是突破之道。

2026年7月28日

电影制作人发现,市面上所有的AI视频评测基准都无法衡量真正的电影工艺——那些获奖影片中精心设计的镜头语言、动态美学和节奏张力。北京电影学院与互金数字传媒集团联合成立了一个研究团队,从20种电影类型的获奖影片中逆向工程出1169个提示词,其中1056个是多镜头脚本,摒弃了以往单镜头测试的简单化倾向。他们建立的FilmBench基准引入了电影学院传统的三层专业分类体系:3个轴、12个组件、35个文本到视频指标和3个额外参考到视频指标。团队还开发了内部专业级自动评估代理FilmOps,在测试9个文本到视频模型和7个参考到视频模型时,该评估器在模型级别与人类排名的一致性达到Spearman相关系数0.95和0.96。结果令人警醒:所有模型的得分远低于以往网络风格基准,动态美学方面存在持续差距,并且从单镜头到多镜头的性能显著下降,较弱的模型差距更明显。这意味着,当AI视频生成技术宣称取得突破时,真正的电影级制作门槛依然未被跨越,而FilmBench成为了第一把精准测量这道鸿沟的专业标尺。

2026年7月28日

互联网上的海量图文,足以让多模态基础模型学会“看”和“说”。但对机器人这类具身智能体而言,这条路却走不通——它们需要的,是能够将感官与物理状态、动作行为紧密耦合的特殊数据。幸运的是,这些信号可以从五种互补的数据源中获得,它们共同构成一座“数据金字塔”。这座金字塔的底层是通用视觉-语言数据(互联网图文),最易获取但离真实机器人操控最远;向上依次是仿真数据(模拟环境下的动作日志)、第一人称和第三人称视频数据(记录人类操作的录像)、UMI式数据(通过便携式设备采集的示范操作),以及塔尖数量最少却“含金量”最高的真实机器人数据。

每一种数据源都有其独特价值,也伴随着缺憾:真实机器人数据与物理世界精准对齐,但采集成本极高,难以规模化;仿真数据可以大量生成,却往往存在仿真与现实的“鸿沟”;第一人称视频能捕捉人类灵巧操作的精髓,但缺乏精确的力觉和触觉信息;通用图文数据规模巨大、知识面广,却无法直接指导机械臂如何抓取一个鸡蛋而不捏碎。

在这座金字塔中,不同的“数据食谱”催生了三类具身基础模型:视觉-语言-动作模型、视觉-语言模型充当“大脑”策略,以及世界-动作联合模型。前两类模型善于感知、推理与规划,却需要在动作生成上进行妥协;后一类模型试图同时理解世界运行规律并生成动作,对数据多样性与对齐性提出更高要求。研究表明,混合使用多种数据源、并按特定比例进行预训练对齐,能显著提升模型在零样本或少样本场景下的泛化能力。

然而,构建下一个世代具身系统的路仍布满荆棘。六个待解的难题摆在面前:如何建设大规模触觉数据集,让机器人真正“感受到”物体材质与压力?如何收集失败与恢复数据——毕竟机器人犯错后如何自救,比完美执行一次任务更具学习价值?如何打造可扩展的数据采集流水线,让普通人也能像录制视频一样轻松为机器人贡献训练数据?如何跨过不同形态机器人之间动作空间不一致的鸿沟,让数据实现一次采集、多方复用?如何借助第一人称视频数据,攻克机械手灵巧操控的难关?以及,能否设计出更科学的数据配方,让有限的资源发挥最大效用?

当机器人不再只是互联网知识的复读机,而是开始从真实世界的每一次抓握、每一次跌倒与爬起中学习,我们或许正在见证一个新时代的起点——数据金字塔的每一层,都将成为具身智能通往自由的阶梯。

2026年7月28日

在人工智能迈向更大规模与更强能力的征途中,混合专家架构成为突破瓶颈的关键方向。如今,一款名为Kimi K3的新模型横空出世——它拥有惊人的2.8万亿参数,但每次推理仅激活1040亿参数,凭借原生视觉能力和百万token的上下文窗口,试图在编程、代理、推理和知识任务中占据一席之地。

Kimi K3的核心创新在于三大技术:首先,它采用Kimi Delta Attention(KDA)和Attention Residuals架构,确保信息在长序列和深层网络中顺畅流动,避免梯度消失或记忆稀释。其次,Stable LatentMoE机制让模型在896个路由专家中仅激活16个,大幅降低计算成本的同时保持表达力。最后,经过精心设计的训练策略和数据配方,使整体扩展效率相比前代Kimi K2提升了约2.5倍——这意味着用更少资源实现更强性能。

后训练阶段,Kimi K3经历了强化学习的全面洗礼。它不仅覆盖通用、代理和编码三大领域,还支持多个推理努力级别,从而学会在不同复杂度任务间灵活切换。这种训练方式带来了组合泛化能力:模型能将在编程中学到的逻辑迁移到代理场景,并稳健执行需要数百步的长周期任务。

为支撑如此庞大的模型,研发团队在基础设施层面也做了多项突破:算法与系统协同设计KDA以获得最佳硬件利用率;完美平衡的专家并行训练实现高效内存管理;针对百万token代理强化学习,他们设计了持续化沙盒状态和滚动的执行环境,确保智能体在长时间交互中不丢失上下文。

在全面评测中,Kimi K3的表现令人印象深刻:长程编程任务中,它能够生成完整且自洽的代码库;代理场景下,它能自主规划并执行多步骤操作;在知识问答和数学推理上,得分接近前沿水平;视觉任务方面,得益于原生视觉能力,它能够理解并分析图像内容。然而,开发者坦诚指出,其综合性能仍落后于目前最强大的专有模型——Claude Fable 5和GPT-5.6 Sol。不过,在所有纳入测试的其他开源及专有模型中,Kimi K3均实现了稳定超越。

最值得注意的是,团队决定完整公开Kimi K3的模型权重。这一举措不仅为学术界和产业界提供了研究超级混合专家模型的宝贵标本,也加速了前沿智能技术的普及与落地。当一个拥有2.8万亿参数的大脑被开源,它不会立刻颠覆行业格局,却为后来者点亮了一条通往更高山峰的路——而路的那边,或许就是人人可及的通用智能。

2026年7月28日

就在AI安全界还在热议上周OAI与Hugging Face的意外事件时,微软悄然抛出了一枚重磅炸弹——MAI-Cyber-1-Flash。这是微软首个专为网络安全打造的模型,直接嵌入其MDASH代理系统,目标只有一个:像猎犬一样搜寻软件漏洞。CEO萨提亚·纳德拉称它带来了“半价的前沿级安全”。

这个模型的表现堪称惊艳:在针对大型代码库的CyberGym安全基准测试中,MAI-Cyber-1-Flash与MDASH联手拿下了96%的得分,比Anthropic的Mythos高出整整12个百分点。更让企业心动的是成本——相比顶级模型,它宣称能将费用削减50%,同时在工作流中高效处理90%的任务。微软AI CEO穆斯塔法·苏莱曼直言:“代币成本现在才是防御者真正的枷锁。”他呼吁行业拥抱“持续、实时、成本高效的代理”。

微软还同步推出了Project Perception,一套由多个代理组成的团队——它们能自主模拟攻击、调查威胁,并修复漏洞。这意味着安全团队不再需要日夜盯着仪表盘,而是可以交给这些数字守卫去演戏、找茬、修补。

这场发布的时间点耐人寻味。一周前,OAI和Hugging Face的安全风波还在业界回响,微软的MAI-Cyber-1-Flash仿佛踩准了节拍——它可能是第一波聚焦型AI安全模型的先声,让企业手中的漏洞检测与修复变得更快、更便宜,也更自动化。安全竞赛的规则正在被重写:不再是堆砌算力,而是比拼每一枚代币的效能。

2026年7月28日

在人工智能开放权重模型的激烈争论中,Anthropic一直是关键的缺席者。直到最近,其CEO达里奥·阿莫迪终于打破沉默,发表了一篇长文,明确表明公司立场。他首先澄清了一个误解:“Anthropic从未主张禁止开放权重模型。”即使这样做“能保护美国AI公司免受竞争”,他们也不支持。相反,他真正推动的是芯片出口管制、蒸馏技术打击以及更广泛的安全测试——这些才是Anthropic一贯倡导的议题。

阿莫迪的发言恰逢一场风暴:由英伟达主导的、捍卫开放模型的一封公开信,签署者已从最初的25人增至50人,包括OpenAI和谷歌这样的重量级玩家。阿莫迪承认他“在很大程度上同意”这封信的内容,但他不认为开放权重模型会带来更好的安全保障,或者能真正帮助防御者。

为什么他的立场值得关注?因为随着中国AI初创公司K3逼近技术前沿,以及美国可能出台禁令的传闻四起,开放权重的争论已经变得非常喧嚣,而Anthropic此前一直缺席。阿莫迪的核心论点是:权重本身不是威胁,真正让独裁政权获得其担忧的AI力量的,是芯片获取渠道和蒸馏技术。他坚持,只有掐住这两个环节,才能有效管控风险。

在这场博弈中,阿莫迪试图走一条中间路线:不反对开放,但主张更精准的管控。这既不同于英伟达倡导的全面开放,也不同于某些激进派要求的全面禁止。AI的安全与竞争,从来不是一道非黑即白的选择题,而是需要更细微的认知和更聪明的平衡。

2026年7月28日

一场无声的AI军备竞赛迎来了一个意想不到的转折点。中国初创公司Moonshot AI近日正式公开了其最强模型Kimi K3的权重与技术报告,任何人都可以下载并运行这个拥有2.8万亿参数的庞然大物——这是迄今开源权重中规模最大的模型。而就在本月早些时候,K3刚刚发布便在多项基准测试中与Claude Fable 5和GPT-5.6-Sol激烈交锋,引发业界瞩目。

然而,“免费权重”并不意味着“免费运行”。这台模型的需求相当惊人:必须配备远超普通消费级硬件的重型GPU才能实现本地部署。与此同时,Moonshot还将核心组件如注意力机制内核和智能体基础设施一并开放,并采用许可协议允许任何人托管K3甚至对外销售使用权,这一步直接打破了传统大模型封闭授权的壁垒。

这场开源狂潮背后是政治与地缘的暗流。美国官方指责Moonshot通过“蒸馏”美国模型(即复制其输出)来构建K3,而北京方面则反驳称这是“典型的AI霸权行径”。当大洋彼岸还在争论如何应对中国开源模型的崛起时,K3已经以近乎前沿的水平,让用户无需等待权限或审批即可直接运行。前沿实验室仍在吝啬地限制顶级模型的使用,而Moonshot却将这样的系统无门槛地交到了所有人手中。

这或许会是未来人们回望时,认为行业真正发生转折的那个时刻。当技术不再被少数巨头垄断,当开放的力量与政治博弈交织,AI的未来将走向何方?我们能做的,也许只是握紧手中的算力,见证这场巨变。

2026年7月28日

SpaceX的星舰再次书写航天史新篇章,但完美与遗憾仅一线之隔。在最近一次试飞中,编号40的飞船成功部署了20颗星链V3卫星——这是星舰首次执行真实卫星载荷任务——并在太空中重新点燃发动机,最终顺利完成印度洋溅落。这一壮举标志着星舰具备了在轨交付载荷的实战能力,人类离太空大规模运输的梦想又近了一步。

然而,这场胜利并非毫无阴影。当飞船优雅地滑向海洋时,那枚巨大的超重型助推器却未能如愿完成着陆反推。由于“猛禽”发动机重启数量不足,助推器以惊人速度撞击墨西哥湾,瞬间化为碎片。这是继五月试飞中飞船级间分离失败后,助推器连续第二次遭遇着陆失败。SpaceX创始人埃隆·马斯克在数小时后迅速发表最新计划:在第十四次飞行中,将尝试用星舰基地的巨型金属机械臂直接捕捉飞船——这一“筷子”式回收技术此前仅用于助推器。

值得关注的是,这次试飞实现了三大核心突破:飞船完好无损地穿越大气层、释放真实卫星并完成轨道机动、在真空中成功重启发动机。这些技术节点是星舰从“能飞”迈向“能用”的关键阶梯。但助推器着陆意外的反复出现,暴露出猛禽发动机在极端工况下仍存在可靠性的隐忧。无论是对飞船还是助推器的“筷子”捕捉,每一个动作都建立在高精度的时序控制和发动机零故障的基础上。

资本市场迅速做出反应。SpaceX股价在试飞日收于115美元,较IPO后200美元以上的峰值已缩水近半,助推器坠毁消息传出后盘后继续下跌2%。投资者显然对连续两次的着陆失败保持着警惕。

星舰的故事从来都不是一帆风顺的直线上升。每一次爆炸都在重新定义工程极限,每一次成功都是对质疑者的有力回击。当一艘真正能运载卫星往返太空的庞然大物出现在地球轨道上,证明了比“成败”更重要的东西:人类正在以前所未有的速度将想象中的未来变为触手可及的日常。而阻碍这艘巨轮最终靠岸的,也许不是材料或设计的瓶颈,而是一台小小的发动机在毫厘之间的精准抉择。

2026年7月28日

在密歇根州一个名叫多瓦吉亚克的小镇,一场关于噪音的战争正悄然升级。街对面的30兆瓦AI与比特币数据中心自2022年起,像一台堵住的真空吸尘器,发出持续不断的尖锐嗡鸣——即使关上窗户、开着电视,那声音依然钻入耳朵。一位住了几十年的居民形容,这感觉就像是隔壁有台机器永远全速运转,从不停歇。

忍无可忍的居民们近日提起了拟议的集体诉讼,将运营商Alliance Cloud Services(母公司为Hyperscale Data)告上法庭,指控其构成妨害与过失。小镇直到今年3月才通过了首部工业噪音法规:白天65分贝、夜间55分贝。很快,市政就对Hyperscale开出了罚单。但CEO威廉·霍恩表示,这个站点正从加密货币转向AI和机器人领域,投资高达1亿美元,并已买下相邻土地作为声音缓冲带。

这起案件并非孤例。微软在威斯康星州投资73亿美元的数据中心附近,居民也提起了类似的集体诉讼。更令人担忧的是,其他地方的投诉指向一种“次声波”——它从来不会被分贝计捕捉,却在室内让人感到胸闷、烦躁。面对质疑,Hyperscale提出回购那些被噪音赶走的居民的房产。但对这条住了近百年家庭的街区来说,这个方案更像是一纸空谈。

当数据中心的算力轰鸣推进社区,数字繁荣的另一面是普通人关门也挡不住的生活侵蚀。技术的高速运转能否与静谧共存?这不仅是分贝数字的博弈,更是一种对居住尊严的拷问。

2026年7月28日

周一,苹果股价收盘创下历史新高,市值飙升至约4.93万亿美元,正式从英伟达手中夺回全球最有价值上市公司的桂冠。这一变化终结了英伟达长达13个月的市值榜首统治——正是这家芯片制造商点燃了人工智能浪潮,却在短短一天内跌落了宝座。

当天,苹果股价上涨约1%,而英伟达股价暴跌近5%,市值缩水至约4.78万亿美元。事实上,两家公司的市值在近期一直围绕5万亿美元大关反复拉锯:7月17日,苹果曾短暂超越英伟达,但随后双方再次易位。如今,苹果以更稳固的姿态重新登顶。2026年以来,苹果股价累计上涨约24%,而英伟达仅上涨5%至6%。这一逆转令人惊讶,因为在过去两年里,华尔街一直将苹果视为人工智能浪潮中的“落后者”,而将英伟达奉为AI基础设施爆发的最大赢家。

英伟达的最新下跌,源于市场传出其可能为OpenAI的数据中心提供约2500亿美元的财务支持。这一消息重新点燃了投资者对AI建设成本过高、回报不确定的担忧。过去两年,华尔街慷慨地奖励那些在AI基础设施上投入最多、销售最积极的公司。英伟达正是其中代表。然而,苹果的逆袭暗示了市场风向的转变:投资者开始青睐一种更“轻资本”的策略——通过将AI功能嵌入现有设备和服务,来获取价值,而不必像英伟达那样砸下重金去建设数据中心。

这场市值冠军的交替,不仅是数字的拉锯,更是两种商业哲学的对决。一边是押注于向世界卖出“AI铲子”的芯片帝国,另一边是用AI默默升级自家产品生态的消费科技巨头。市场的选择告诉我们,当狂欢的浪潮逐渐退去,那些懂得在喧嚣中静默耕耘的公司,可能才是最终的赢家。

2026年7月28日

当你在咖啡馆与朋友闲聊时,邻桌那副看似普通的黑框眼镜,可能正在默默记录你的每一个表情和每一句话。Meta的Ray-Ban智能眼镜终于实现了谷歌眼镜未能完成的梦想——让摄像头穿戴设备看起来如此自然,以至于几乎无法被察觉。然而,这种“正常化”正在引发一场关于隐私的恐慌。

在纽约、伦敦和华盛顿特区的街头,活动团体直接将Meta的广告海报覆盖上新的警告:这些眼镜是“监控设备”。他们用醒目的标语提醒行人,那枚微小的LED指示灯是旁观者唯一能意识到的录制信号——如果你没有注意到那点微弱的白光,你的一切都可能被记录。

Meta似乎意识到了危机。最新的隐私补丁规定,如果物理篡改眼镜的隐私灯,摄像头将自动禁用。但批评者认为,这不过是亡羊补牢。更令人担忧的是,Instagram已开始移除那些利用眼镜偷拍、骚扰不知情者的视频——这为社交媒体监管开辟了一个棘手的战场。

问题的核心在于,Meta自己正削弱着隐私保护。他们不仅探讨面部识别功能,还考虑引入始终开启录制模式,并放松对语音数据训练的控制。这意味着,一副眼镜不仅能记录你看到的,还可能识别你是谁,甚至收集你日常对话的语音样本。

Meta用时尚设计让谷歌眼镜的失败实验重获新生,但代价可能是将“任何人随时可能被录制或识别”的社会现实常态化。当技术隐入日常,信任便成了最脆弱的商品。如果不能在产品中建立可靠的同意机制,Meta不仅会丢掉用户信任,还会为苹果和谷歌打开一扇隐私之门的窗口——毕竟,谁都不想让自己的咖啡馆时光成为别人云端素材的一部分。

2026年7月27日

想象一下,你让一个机器人去拿起桌子上的杯子——这个看似简单的指令,背后却隐藏着两个截然不同的过程:首先,机器人需要驱动自己的电机、关节和控制器,将“拿起”这个抽象命令转化为真实的机械运动;其次,机械臂与杯子接触后,场景才会因为受力、碰撞而发生改变。传统的视频世界模型在预测未来画面时,往往试图同时学习这两个过程——但这样做既困难又容易出错。

研究者们提出的新思路是:把这两个机器人专属环节从世界模型中“拆”出去。就像搭积木时先把底座建好一样,他们设计了一套“机器人分解世界模型”。核心方法包括两步。第一步是“动作实现分离”:每个控制指令不再直接输入模型,而是先通过机器人自身的控制器和运动学计算,输出一条机器人现实可达的“名义轨迹”——这条轨迹位于控制信号与真实物理响应之间,既不会让模型去硬学如何驱动电机,也不会提前泄露机器人最终的真实位置。第二步是“机器人渲染分离”:这条名义轨迹再通过机器人的统一描述格式(URDF)渲染成可直接看到的几何图像,把机器人的形状、关节、外观全部变成显式的视觉元素。

为了让模型理解深度关系,研究者还特别采用了“末端深度+场景深度”的双通道策略——就像给模型配了一副能看清远近的眼镜,让它分清楚机器人的“手”是碰到了物体,还是仅仅在画面中和物体重叠。最终,不同视角、不同型号的机器人,都能被映射到一个共享的视觉世界里:这个世界的输入只有静态的RGB/深度背景图,以及渲染出的机器人几何图形。模型不再需要处理抽象的动作向量,只需要学习物体如何对“看到的机器人形状”做出反应。

实验结果显示,这种以渲染图像为接口的方法,显著优于传统的向量输入方案,甚至能泛化到训练中从未见过的机器人形态。更令人兴奋的是,它还能直接利用人类演示视频——通过将人的手部动作重新映射为机器人几何图形,模型就可以生成机器人执行相同操作的视频。

这或许意味着,未来的机器人学习不再需要依赖完美的动作编码,而是可以像人类观察别人做事一样——你不需要知道对方如何发号施令,只看他身体如何移动,就能学会模仿。当机器人的“身体”和“大脑”真正解耦,机器理解世界的方式,才更接近直觉本身。

2026年7月27日

想象一下,一个大语言模型能写出流利的文章,却在看到一张猫的图片时完全无感——这就是单模态预训练的局限。传统的多模态方法往往是在语言模型上后期拼接视觉模块,但这样做容易导致优化不对称,就像给一个只会识字的人临时配上一副眼镜,却期待他瞬间看懂世界。而原生多模态预训练,从零开始同时学习文字和图像,试图让模型从一开始就拥有“通感”能力。

然而,这种新范式的扩展规律一直是个谜。研究人员在固定计算预算下,系统探索了基于Transformer的视觉-语言模型的最佳规模:模型该多大?数据该用多少?他们发现,模型的最小损失遵循一条可预测的计算定律,而计算最优的模型大小和token数量则呈幂律缩放。有趣的是,语言目标与多模态目标展现出截然不同的扩展行为。语言分配律几乎不受数据组成影响——无论文本与图像的比例如何,语言学习稳定如常;但多模态分配律却高度敏感,甚至可以说“善变”。特别是,当数据中文本占比较大时,只有把模型做得更大,计算效率才会真正显现,最优资源配置因此向模型容量倾斜。

更深入的分析显示,数据组成不仅影响计算定律,还改变了分配指数。研究者由此推导出一条效率边界,能够精确指定模型大小、token数量和数据混合比例的最优组合。下游评估进一步证实:原生多模态预训练带来了正面的跨模态迁移——它提升了纯文本的空间推理能力,也让多模态上下文学习变得稳健。

这些发现意味着,从一开始就让模型“看”与“读”同时学习,不是浪费算力,而是对未来智能的巧妙投资。没有哪种感官可以孤立地成长,多模态世界终将返回一个简单的道理:融合,才是最高效的起点。

2026年7月27日

47家科技公司、风投机构和非营利组织联合签署了一封公开信,敦促美国政府不要限制开源AI模型。英伟达CEO黄仁勋率先在X平台发布这封信,最初只有25个签署方,OpenAI等关键角色缺席。但短短一天内,签署方数量翻倍,OpenAI、谷歌、AMD、思科等纷纷加入,唯独Anthropic未参与。信中指出,开源模型能扩大AI经济参与度、维持竞争活力、拓宽网络防御,并避免供应商锁定。他们还强调,模型蒸馏不应与盗用混为一谈,呼吁避免过早限制将AI创新推向海外。这封信的背景是中国实验室被指控从美国模型中提取情报,包括Anthropic的Fable模型。华盛顿的回应尚不明确,但压力已落在唯一未签署的实验室——也是从打击中获益最大的机构。人们已经开始要求答案。这场博弈表明,开源与安全的平衡仍是AI治理的核心难题,过于激进的政策可能适得其反。

2026年7月27日

当AI巨头们竞相追逐“最强模型”的桂冠时,Anthropic却悄然祭出一张反直觉的牌。它刚刚发布的Claude Opus 5,没有像以往那样在价格上层层加码,反而以Fable 5的一半成本,提供了近乎同等的智能水平。这个被官方称为“深思熟虑且积极主动”的新模型,旨在让那些被高昂定价挡在门外的人们,也能触摸到顶级AI的边缘。

在性能上,Opus 5交出了一份令人瞩目的成绩单。它在代理终端编码、知识工作、代理搜索以及计算机使用任务上,均达到了行业顶尖水平(SOTA),甚至碾压了Fable 5和GPT-5.6 Sol这两大劲敌。更惊人的是,在衡量通用智能的ARC-AGI-3基准测试中,它斩获了30.2%的得分——这几乎是第二名模型的整整三倍,并顺势登上了Artificial Analysis Intelligence Index排行榜的榜首。

如果说基准测试尚有争议,那么国际数学奥林匹克竞赛(IMO)的表现则更具说服力。Anthropic将Opus 5丢进了2026年IMO的难题中,结果它拿下了满分42分——远高于金牌线29分。这意味着,这个模型不仅能解题,还能像真正的人类数学天才一样,在高压下保持近乎完美的推理。

不过,Anthropic自己也承认,Opus 5并非在所有方面都无懈可击。他们形容新模型是“迄今为止最对齐的AI”,在发现软件漏洞方面,它和Mythos 5水平相当——但在编写漏洞利用代码时,明显落后于后者。这种坦诚的自我剖析,让Opus 5更像是一个温顺的巨人:它拥有强大的头脑,但更愿意用它来建设,而非破坏。

这背后的战略意图很清晰。Anthropic此前一直用Sonnet来对标Opus,现在,他们用Opus来对标Fable。Opus 5的定价为每百万tokens(输入/输出)5美元和25美元,与4.8版本完全相同。对于那些舍不得为Fable开出高价的人来说,一个可靠而强大的替代者终于出现了。

这不仅是技术的跃进,更是AI民主化进程中一次关键的破局——当最聪明的头脑不再只属于最有钱的买家,或许才是智能真正释放潜能的开始。

2026年7月27日

机器人想在复杂环境中完成精细操作,必须依赖触觉——那些摄像头捕捉不到的物理接触信号。但问题是,真实世界的触觉交互数据又贵又难收集,不同的机器人、不同的任务,数据差异巨大,难以规模化。面对这个困境,研究人员提出了ViTacWorld,一个动作条件的视觉-触觉世界模型。它的核心思路很巧妙:触觉信号直接源于物理接触,从模拟到现实的差距,比纯视觉观测要小得多。于是,团队一方面利用公共的真实触觉数据集,另一方面搭建模拟环境,生成了大量视觉、触觉和动作轨迹数据,先做大规模预训练,再用真实世界的策略运行结果进行微调,让模型更贴合下游操作任务。

ViTacWorld的工作机制类似一个预言家:给定机器人的动作序列,它能预测出时间对齐的视觉画面和触觉反馈,从而生成完整的视觉-触觉-动作轨迹。据团队所知,这是第一个用世界模型来生成机器人触觉轨迹并评估策略的框架。它兼任两个角色:通过合成新的轨迹来增强下游触觉策略的训练数据;同时,在受控的动作序列下,预测策略执行后的视觉-触觉结果,用于评估策略的好坏。在接触丰富的操作任务实验中,ViTacWorld生成的轨迹物理意义清晰,数据增强显著提升了策略表现,并且动作条件的策略评估也起到了有效作用。

触觉是机器人理解世界的另一种语言。当视觉的盲区被指尖的感知填补,机器人才真正学会“握得住”和“放得稳”。这项探索的意义或许在于:让数据自己说话,让模拟与现实之间的鸿沟,在触觉的桥梁上变得触手可及。

2026年7月27日

多模态模型试图为理解和图像生成找到共享的视觉token空间。离散方法通过共享码本统一接口,而连续管道却常依赖两套割裂的表示:用于理解的语义特征(如ViT)和用于合成的低层潜在特征(如VAE),导致潜在空间不匹配。为此,研究者提出Twins,一个通过通道维度串联ViT和VAE特征、并保持在相同token网格上的连续token空间——序列长度不变,注意力计算成本不增。然而,在扩散Transformer中联合建模Twins时,暴露出严重的优化失衡:模型能很好拟合ViT分量,却难以匹配VAE潜在分布的分布。这种失衡源于三个异质性来源:频率偏好、内在维度、以及条件对齐与条件无关不确定性。为解决该问题,团队为流匹配引入聚焦回归目标,加大VAE大误差维度的权重,从而在ViT和VAE分量间更好地平衡优化。在ImageNet上,该方法在没有无分类器指导的情况下,相比朴素MSE损失带来了高达10.57 gFID的提升。Twins还在多模态理解基准上表现出竞争力,并改善了重建保真度,缩小了理解导向与生成导向表征之间的差距。

理解与生成之间的鸿沟,并非天然不可逾越;当模型学会在频率与维度的棱镜中重新分配注意力,两种世界的边界便开始悄然消融。

2026年7月27日

在计算机视觉领域,单目3D重建已取得长足进步,但如何从一段普通RGB视频中同时理解三维世界的动态变化——即4D理解——仍是根本性挑战。现有方法大多将运动视为独立点的位移,例如稀疏点跟踪或稠密光流,却忽略了现实世界中运动的本质结构。想象一下,一辆汽车驶过、一个人挥手,它们身体上的所有点其实是一起移动的,遵循刚体运动的规律。这种运动本身具有几何结构:物理对象经历的不是混乱的位移,而是一组由SE(3)刚性变换支配的整齐轨迹。

基于这一洞察,研究者提出了SM4RT——一种结构化运动4D重建Transformer,它从端到端地完成三维重建与结构化运动感知。SM4RT的核心创新在于“运动的结构化表达”:它将场景中复杂的动态分解为一组紧凑的“运动基”,每个基对应一个随时间变化的6维旋量(即SE(3)中的旋量)。场景中每一像素的运动,则由这些稀疏的运动基和共享时间的逐像素分配权重来恢复。这就保证了同一物体上的点共享相同的刚体运动轨迹,而不是各自为政。

具体实现上,SM4RT设计了一个并行的运动几何编码器-解码器架构,能够从单目RGB视频的一次前向传播中,同时推断三维几何、世界坐标系下的运动以及场景的运动学结构。实验表明,SM4RT在运动重建性能上表现强劲,同时完美保留了场景运动的内在几何结构。它告诉我们:当计算机学会理解物体“如何作为一个整体移动”时,动态世界的感知将变得更加优雅和可靠。

我们不应再把运动看成无数个点的随机舞蹈,而应看到其中隐含的刚性骨架——那是物体在时空中的统一旋律。

2026年7月27日

大语言模型的训练正在经历一场静默的革命——从依赖人工设计和标注,转向一种由交互驱动的自我进化。但这场革命很快撞上了一堵墙:如何在保证任务多样性的同时,又能获得可靠的验证?现有方法要么被困在狭窄的领域里,靠环境反馈获得精确但局限的学习;要么打开自我生成的大门,却让不可靠的奖励信号像病毒一样污染训练循环。研究人员发现,“智能体技能”恰恰是那个被忽视的中间地带——每个技能都能在特定场景中提供深度、可验证的执行,而技能之间的动态路由则像变戏法一样,保持了任务空间的开放性。

基于这个洞察,他们提出了一个名为“技能自博弈”的协同进化框架。这个框架由三个角色组成:一个负责出题的提议者,一个负责解题的求解者,还有一个掌控全局的动态技能控制器。三者在一个强化学习的闭环中不断自我博弈:提议者根据动态抽取的技能,生成具有挑战性的任务;求解者在探索候选解决方案的过程中,不断突破自己的能力边界;而技能控制器则收集执行反馈,实时更新和扩展技能库。这种交互式的协同进化,巧妙地填补了结构化验证与开放式探索之间的鸿沟。

在工具使用和推理基准测试上的实验表明,作为一套强大的进化引擎,技能自博弈能够持续提升骨干模型的表现天花板。即便对于初始阶段与任务严重错位的模型,它也能催化出令人瞩目的逆转——就像在失败的棋局中突然发现一招妙手,扭转整个战局。相关代码已在GitHub上开源。

当AI自我进化的道路陷入两难,没有谁注定要被困在窄巷。技能的存在,让验证与探索不再是零和博弈,而成为彼此成就的共生伙伴。

2026年7月26日

想象一下,你只需说出“一个红色液体从斜坡流下,撞到蓝色方块”,电脑就能自动生成一段动态、符合物理规律的3D场景——这不是科幻电影。过去,这种4D世界的构建完全依赖人工:设计师要手动建模、调整材质、设置运动轨迹和光影,复杂又耗时。即便近年来AI生成模型发展迅速,它们仍难以保证生成内容在物理上的合理性和可控性。而现在,GS-Agent的出现可能改变这一切。

GS-Agent是一个端到端的多智能体框架,它的灵感来源于人类构建4D世界的过程,但用AI实现了全流程自动化。具体来说,GS-Agent将任务拆解为两大模块:实体管理和渲染配置。实体管理负责3D资产的挑选、材质调整、空间放置和运动控制;渲染配置则决定相机角度和灯光效果。多个具备不同专长的智能体通过代码与物理引擎实时交互,还能从多模态反馈中学习,不断迭代调整,直到最终生成的4D世界与自然语言描述高度吻合。

在实验中,GS-Agent展现了令人印象深刻的能力:它能从文字描述中生成包含液体、可变形物体和刚体之间丰富互动的场景,比如水流冲击布料、小球弹跳,并且这些物体的运动都遵循了物理定律。更值得一提的是,它还能实现电影级的相机运动和光照控制——这意味着创作者不仅能指定“发生什么”,还能控制“如何拍摄”。

GS-Agent的意义在于,它为4D世界生成提供了一种全新范式。它不再试图“凭空想象”一个世界,而是像人类工匠一样,按步骤、有逻辑地一步步搭建,同时借助物理引擎保证真实性。这或许预示着未来内容创作和物理人工智能的一条更可靠的道路:智能体不仅会模仿,更懂得如何协作与构建。当语言真正成为创造物质世界的工具,想象力与现实的边界正在模糊。

2026年7月26日

在真实世界中,AI agent的学习常常卡在昂贵的环境交互上——比如运行一次实验要几天,或者寻求人类反馈又慢又贵。上下文学习提供了一条捷径:agent能直接从自己的交互历史中学到东西,样本效率极高。但有个致命缺陷:一旦那些经验从上下文中移除,增益就消失得无影无踪。换句话说,它像临时的“作弊纸条”,看完就忘。

另一边,上下文蒸馏能把上下文信息“刻”进模型权重里,变成永久记忆。但人们一直没想清楚:怎么把它用在agent的交互历史上,同时又不需要牺牲环境交互的效率?这个问题被正式命名为“经验蒸馏”(Experience Distillation)。研究者开发了一套具体实现,核心要求是:只使用已经收集到的经验,不再额外和环境打交道。

他们用749个软件工程任务和6个文本冒险游戏做测试。结果是,经验蒸馏保留了上下文学习至少64.8%的收益——在两个领域表现都很稳。而传统的直接监督微调(把历史经验当标签硬学)只恢复了3.8%的收益,几乎等于白费劲。再跟经典强化学习基线对比:先用试错经验做上下文学习,再执行经验蒸馏,最终性能持平,但环境样本量少了至少9.6倍。

这意味着什么?Agent不再需要反复在真实世界里碰壁才能学会东西。它们只需要一次高质量的自省式试错,就能把教训真正记住。当记忆不再依赖临时“粘贴板”,学习才真正进入下一步:把一次的经历,变成永久的智慧。

2026年7月25日

在生成式建模的广阔天地中,如何对离散结构进行高效而灵活的概率生成,一直是一个核心挑战。离散流匹配框架提供了一种优雅的解决方案,它通过连续时间马尔可夫链来模拟离散数据的动态演变。然而,标准的因子化训练目标存在一个隐藏的问题:它暴露给模型的目标难度参差不齐,就像把正确答案和模糊线索混在一起——那些信息丰富的预测性token与高熵值、高度不确定的token被同等对待。研究人员通过实验发现,每个token的不确定性与其附近可用上下文的密度密切相关:当周围上下文丰富时,token的预测变得简单;而当上下文稀疏时,则如同在浓雾中猜字母。

基于这一洞见,研究者提出了一项极为简单的修改:对底层连续时间马尔可夫链进行上下文加权。这个上下文加权采样器几乎不增加计算开销,却能显著提升生成质量。同时,他们还设计了一种缩放交叉熵损失函数,重新平衡不同token的训练信号。在OpenWebText数据集上,这一方法将生成困惑度降低了高达63%。更令人印象深刻的是,该方案在生成质量上与强大的半自回归块扩散基线模型不相上下,同时保留了任意顺序生成的能力——这意味着模型不再被局限于固定的生成次序。

这项研究的核心在于揭示了局部上下文在离散生成建模中的关键作用。它证明,简单的上下文感知改进就能同时提升采样和训练效率,而无需复杂的架构创新。这似乎是一个温柔的提醒:在追求复杂算法之前,或许先听听数据本身在说什么——每个token周围的上下文密度,就是它自己的声音。

2026年7月25日

在生产环境中,AI代理的失败往往不是因为它们不会推理,而是因为它们在管理“思维上下文”时手足无措。想象一下,你正在和一位智能助手聊天,它不仅要记住你们聊过的每一句话,还要处理你给的复杂指令、调用各种工具,以及应对工具返回的冗长结果。随着对话深入,这些信息像滚雪球一样膨胀,代理逐渐被自己的历史记录淹没,每个来回的Token成本陡增,甚至开始遗忘关键细节——用户问过什么,工具返回了什么信息,跨对话的回忆更是支离破碎。久而久之,代理变得迟钝、答非所问,成为一个既贵又低效的“记忆黑洞”。

常见的解决思路是把这看作一个存储和检索问题:把历史记下来,需要时再找。但研究者认为这种视角太狭隘了。代理的“思想”不是一个静态的仓库,而是一个动态的生命周期——从决定记住什么,到提取和结构化信息,为不同类型的数据选择合适存储,在保留来源的同时进行整合和遗忘,判断当前什么最相关,预判下一步需要什么,最后在预算限制内压缩上下文而不丢失关键内容。更重要的是,在严肃的生产环境中,这些操作不是为单个用户服务,而是跨越组织层级的复杂协作。

研究者将这门新学科命名为“Agentic Context Management”(ACM),并把它分解为五个核心原语:架构(规划上下文的结构和流动)、摄取(提取并结构化信息)、范围界定(确定哪些上下文在当前和未来相关)、预测(主动预判下一步所需)、以及压缩与整合(在保留精度的前提下精简上下文)。他们同时做了经济分析:朴素地累积所有信息,Token成本会随对话长度呈二次方增长;简单的摘要虽然能把成本降到线性,却会带来精度断崖式的下降;只有经过验证的压缩方法才能真正实现线性成本与保真度兼得。

作为实现范例,研究者介绍了名为“Maximem Synap”的多租户服务,它把上述五个原语落地为统一平台。在配置说明的设定下,该服务在LongMemEval数据集上取得了92%的准确率,在LoCoMo数据集上取得93.2%。但研究者也指出,现有基准测试还没有覆盖三个关键维度:延迟(上下文管理是否足够快)、Token效率(能否以更少Token做更多事)、以及上下文抗腐化能力(随着时间推移,上下文信息是否会被错误信息污染)。而更大的前沿在于决策级和组织级上下文管理——让代理不仅能管理当前对话,还能在多个决策点之间、甚至在整个组织层面协调记忆与遗忘。

一句话,不能让代理背负不该背的包袱,也不能让它丢掉该记住的钥匙。学会管理“想什么”,和学会“怎么想”同样重要。

2026年7月25日

在量子计算的竞技场上,中性原子技术正悄然绘制一条通往“实用量子优势”的路线图。这并非简单的性能竞赛,而是一场从硬件到理论的系统性跃迁。科学家们首先厘清了“实用量子优势”的真正含义——不是证明量子比经典计算“更快”,而是解决那些对人类社会真正有价值、但经典计算无法胜任的问题,比如新药研发、材料设计或大规模优化。为了不让这种优势沦为空中楼阁,研究者同步制定了验证标准:任何宣称的“优势”必须通过透明、可复现的测试,杜绝“自说自话”式的论断。

在算法层面,团队不再迷恋抽象的量子加速,转而设计那些能够直接与产业需求对接的算法,确保每一次量子计算都脚踏实地。硬件革新是这场战略的核心:中性的原子处理器正在从数百量子比特向数千规模迈进,同时探索多种量子比特编码方式——比如将信息编码在原子能级或里德堡态中,以适应不同应用场景。逻辑量子比特的性能被要求“越挫越强”,即便在噪声环境下也能通过纠错稳定运行。更令人振奋的是“连续重载”技术:不再一次性地制备所有原子,而是像给打印机加纸一样,边计算边补充新鲜原子,从而突破计算时间的物理极限。快速读出技术则让每一次测量结果能以纳秒级速度获取,为实时纠错铺平道路。

光学控制的集成化是另一大突破。传统的光路系统庞大且不稳定,而片上集成光子技术将激光、分束器、探测器压缩到毫米级芯片上,不仅降低了系统复杂度,还提升了控制精度。与此同时,量子纠错与电路编译的理论创新成为“硬件之外的翅膀”:新的纠错码能更高效地对抗相位噪声,而编译工具则将复杂的量子算法自动映射到真实硬件布局上,自动规避物理限制。

最后,研究团队预见了单一系统的天花板。一台量子计算机无论多强大,都可能受限于量子比特数量或相干时间。因此,分布式量子计算被纳入蓝图:通过量子网络将多个中性原子处理器互联,让它们像超级计算机集群一样协同工作,既克服了单个系统的规模瓶颈,又为大规模容错计算提供了冗余路径。这相当于从“单兵作战”转向“联网军团”,为量子计算的未来打开了更多可能性。

即便前路漫长,这份规划透出一种审慎的乐观:中性原子技术凭借其天然的长相干时间和高保真度操作,正从实验室的“潜力股”变为产业化的“实战派”。当硬件、算法、网络三者形成闭环,实用量子优势或许不再是遥远的预言,而是正在发生的变革。

2026年7月25日

理解视频中的运动是视觉学习的一项基础挑战,因为帧与帧之间的变化交织着两种动态来源:相机运动和物体运动。长期以来,这种分解在表示学习中未被充分探索,部分原因在于这些因素在自然视频中紧密耦合,难以分别进行监督。然而,恢复这种分解对于学习鲁棒的运动表征至关重要——它能将有意义的物体动态与相机引起的视觉变化区分开来。

本研究探索了能否从预训练图像视觉 Transformer(ViT)的冻结特征中恢复出这种结构化的运动表示。研究者提出了结构化动力学模型(SDM),它通过未来特征预测,显式地将时间变化的主导来源与残差动态分离开来,而不是用单个纠缠的潜变量或非结构化的、空间密集的过渡令牌来表示视频变化。训练过程结合了真实视频上的自监督学习与合成Kubric数据上场景动力学的弱监督。

为了评估SDM,研究者构建了名为ProbeMotion的新评估套件,涵盖合成和真实视频,包含相机运动、物体运动以及两者组合的动态场景。实验结果显示,SDM在使用全局CLS或平均池化特征的骨干基线中表现更优,并且在多个探测任务上与强监督表示(如VGGT)相比毫不逊色——尽管其使用的监督信号要弱得多。这些结果表明,预训练的图像模型可以很容易地被重新用于结构化的视频动态表示,为学习和分析潜在视频动态提供了有用的归纳偏置。

每一次镜头移动与物体运动交织的瞬间,都藏着理解世界变化规律的密码。当模型学会区分“谁在动”与“怎么动”,距离真正理解视觉叙事就更近了一步。这或许意味着,我们不必从零开始构建视频理解体系,而是让沉睡在静态图像中的知识,被时间之河唤醒。

2026年7月25日

摘要

在生成式AI领域,流模型一直是可控生成的有力工具,但一个根深蒂固的局限始终存在:它们要么只能在固定维度的连续空间中运作,要么只能处理固定长度序列。想象一下,当你希望模型生成一张图片,但输出图片的尺寸根本无法预先知晓;或者你想让模型写一段文字,但句子的长度也是生成过程中自动决定的——这恰恰是当前方法难以跨越的障碍。

一项新研究提出了一个优雅的解决方案——Expanding Generative Flows(EFlows)。核心思想非常直接:让生成过程本身具有“可扩展性”。传统流模型在固定维度空间里推动概率密度,而EFlows定义了一组跨越维度逐渐增加的分布之间的流。这个“扩展插值”通过向当前状态添加条件噪声来扩充状态空间,相当于在生成路径上不断打开新的坐标。

基于这一构造,研究者进一步推出了Expanding Flow Maps(EFMs),一种更高效的几步生成模型。EFMs的核心创新在于将任意两个时间步之间的映射拆解为两个可学习的操作:一个是“扩展算子”,根据当前状态向状态空间添加新的坐标或令牌;另一个是“传输算子”,将扩展后的状态沿插值路径向前推送。两者组合,就形成了既扩展又去噪的统一映射。当扩展算子被简化为恒等映射时,现有固定画布的流模型就成了它的特例。

值得注意的是,该框架不仅适用于连续空间,还被推广到了离散单纯形上,从而能够生成可变大小的图结构和可变长度的序列。这意味着,无论是图神经网络要预测不同大小的分子,还是语言模型要生成不同长度的文本,输出尺寸本身变成了一个可学习、可控的自由度。

这套方法将生成模型从“固定画布”的束缚中解放出来,为需要动态输出规模的任务提供了理论基石。它提醒我们,真正的生成自由不仅在于内容,更在于形式——当模型可以自主决定输出的大小,它才更接近人类创作中那种随需而变的灵活性。

2026年7月25日

现代AI代理,比如Claude Code、Codex和OpenClaw,都依赖一套精心设计的“推理框架”来驱动多轮对话、调用工具和连接外部系统。这些框架功能强大,却也成了训练时的绊脚石——开源基础设施的SFT/RL(监督微调/强化学习)堆栈根本没法原生处理那种带状态、多进程的推理过程。OpenForgeRL正是为此而生,一个开源的端到端训练框架。

它怎么做到的呢?核心思路是“解耦”。OpenForgeRL用一个轻量级代理来拦截推理框架的模型调用,一边正常服务,一边这些调用被记录下来,转化成标准RL代码库(比如veRL)能用的训练数据。同时,它用Kubernetes编排器把每次模型生成都跑在独立的远程容器里。这样一来,无论推理框架多复杂、环境多多样,都能大规模训练。

研究人员终于可以在真正的部署环境里,直接训练、研究并改进自己的代理了。OpenForgeRL在多种复杂场景下做了验证:从基于工具/爪子的代理,到多模态GUI浏览器和电脑操作代理。只用了几百到几千个任务,就取得了亮眼成绩:OpenForgeClaw在ClawEval上达到31.7的pass^3和55.9的pass@3,在QwenClawBench上达到33.7。OpenForgeGUI在OSWorld-Verified上拿下37.7,在Online-Mind2Web上达到63.0,在WebVoyager上冲到72.3。几乎所有基准测试中,它都超越了同等规模的开源模型,在GUI任务里甚至能打平或超过比它大好几倍的模型。

更有趣的是框架选择带来的差异。研究者发现,有些推理框架(比如ZeroClaw、OpenClaw、Codex)学起来比另一些难得多。强化学习则显著提升了代理的可靠性——它会自我验证、覆盖更多工具、一步步完成复杂计划。但有一个关键能力依然薄弱:错误恢复。代理一旦跑偏,就很难自己拉回来。

技术的边界在不断扩展,但真正让AI从“会干活”到“能纠错”之间,还有一段漫长的路要走。

2026年7月24日

当前多数视觉语言模型虽能识别图像,却难以理解物体间的深度、距离和立体关系。研究者从这一痛点出发,提出VLM-IE3D框架,让模型仅通过观看RGB视频,就能获得两种互补的3D知识:隐式几何令牌(IGT)从连续帧中提炼出高层空间规律,比如“车辆在路口转弯”;显式几何令牌(EGT)则通过3D重建捕捉精确的坐标与轮廓。一个3D感知适配器将这两种知识与2D视觉特征巧妙融合,使模型不再需要昂贵的3D传感器作为额外输入。实验覆盖4类任务:3D视频目标检测、3D视觉定位、3D密集描述和空间推理,VLM-IE3D均稳定领先。当模型不再依赖昂贵传感器,而是从日常视频中学会感知深度与位置,这或许正是让机器真正理解立体世界的关键一步。

2026年7月24日

在知识蒸馏的世界里,自蒸馏一直是个诱人的方向——它不需要额外训练一个大老师,可惜现有方法往往需要特权答案或视觉证据来维持“老师比学生强”的不对称性。能不能把这两样都扔掉,只靠输入本身制造差异?新提出的视觉对比自蒸馏VCSD回答了这个问题。

想象一下,一个视觉语言模型正在根据图片和问题生成回答。研究者让一个指数移动平均教师同时做两件事:一次看完整的原图,一次看内容被擦除后的控制图。两个分布一对比,那些因为图片实际内容才被额外提高的候选词立刻现形——就像在一堆沙子中筛出金子。然后,这个对比信号被用来锐化教师基于原图输出的分布,再蒸馏给学生模型。

整个过程只用到了输入层面的条件操控,没有任何外部教师、特权答案、视觉证据或推理痕迹。在ViRL39K数据集上,VCSD在Qwen3-VL上把7个基准的聚合分数提升了4-7个百分点:2B模型从62.27%跳到67.04%,4B从71.30%到73.16%,8B从72.51%到76.26%。更重要的是,它在推理阶段不增加任何额外开销。

当自蒸馏不再需要复杂的非对称设计,当简单的输入对比就能让模型自我进化,我们或许正在接近一种更本质的学习方式——不是借助外力,而是让模型在与自身不同视角的对话中,自己教会自己哪些信息才是真正重要的。

2026年7月24日

想象一下,用舌头轻轻一顶,就能滑动手机屏幕、点击电脑链接,甚至用耳语般的音量完成语音输入。这不再是科幻小说,而是美国初创公司Augmental最新推出的产品——MouthPad。这家从MIT媒体实验室孵化出的公司,刚刚开始在美国销售这款定制牙套,它颠覆了人机交互的传统方式。

MouthPad的核心是一个厚度仅1毫米的定制牙套,通过3D打印技术用牙科树脂制成,完全贴合用户的口腔扫描数据。牙套的上颚部分嵌入了一块压力感应触控板,配合运动传感器,可以将舌头的按压、吸吮动作以及头部运动转化为光标控制信号。它通过蓝牙连接手机、平板或电脑,自动识别为鼠标。用户可以用舌头按压或做出吸吮手势来模拟鼠标点击,既能用舌头驱动光标,也能用头部控制,全部由设备内部的压力感应垫和运动传感器完成解析。

Augmental的初衷是服务于那些无法使用传统鼠标和触摸屏的人群,如四肢瘫痪患者、渐冻症(ALS)患者或严重运动功能障碍者。目前已有超过100人成为产品测试用户,部分人每天使用长达16小时。为了进一步拓展使用场景,Augmental还同步推出了VOX——一款形似听诊器的200美元麦克风,它能通过身体传导拾取用户的声音,让人即使以耳语音量也能实现语音输入。

这些设备共同构成了Augmental所说的“Skinware”新品类——一种皮肤穿戴设备,旨在让残障人士无需接受侵入性脑机接口手术,就能获得计算机控制能力。然而,现实门槛依然很高。MouthPad售价高达1400美元且不在保险覆盖范围内,从口腔扫描到成品交付需要6个月的生产周期,用户还必须具备足够的舌头灵活度和良好的口腔健康状况才能符合使用条件。

当舌头成为操控世界的工具,科技对残障人士的关怀不再停留在想象中。但高昂成本与漫长的定制过程仍在提醒我们,平等的科技之路尚需更多努力。

2026年7月24日

在电动车初创公司普遍选择深耕单一车型的当下,加拿大企业Envo却走了一条截然不同的路。它刚开放了一款名为Utility Personal Transporter(UPT)的模块化电动平台预购,并宣称用户能将其配置成多达18种车型,从高尔夫球车、全地形车,到货运车甚至日常通勤车,几乎无所不包。

UPT的核心是一副铝合金T型槽框架,这种框架的长度和宽度都能自由调整,悬架、电机和各种功能模块通过螺栓直接固定,完全不需要焊接。这意味着车辆可以彻底拆解,方便运输,也能根据需要随时“长大”——加装驱动系统、电池组、车轮、座椅或货斗,就像拼乐高一样灵活。用户既可以在Envo官网上自由配置自己的专属版本,也可以直接购买厂方预设的配置方案,未来还能单独购买零部件进行升级。

Envo计划在2027年初交付首批车辆,而整个平台的研发从2023年就已启动。此举背后的商业逻辑很直接:大多数电动车公司只押注一个细分市场并努力防守,而Envo试图用一个平台同时覆盖农业作业、机场物流到最后一公里配送等多个场景。这样做的好处是将单个平台的研发成本摊薄到多个原本规模太小、不值得单独开发车型的市场中,但挑战也随之而来——每个买家对“够用”的定义各不相同,如何同时满足农夫、快递员和高尔夫球场管理者的差异化需求,将成为Envo必须跨过的坎。这种充满野心的模块化思路,既是机遇,也是检验公司耐心与智慧的试金石。

2026年7月24日

在一段最新公开的视频中,埃隆·马斯克的脑机接口公司Neuralink展示了一个令人惊叹的场景:一名瘫痪的临床试验参与者,仅凭大脑的念头,就驱动了电动轮椅——前进、后退、转向,动作流畅自如。

这背后是一套精密的工程:Neuralink植入大脑的芯片拥有超过1000个电极,当参与者思考某个方向移动时,这些电极会记录运动皮层中神经元的放电信号。随后,一个解码算法将这些脑电信号转化为屏幕上的光标移动。在定制App中,光标前方是实时摄像头画面,光标的位置被转换为模拟信号,直接驱动轮椅——向上前进、向下后退、左右转向。参与者Alex表示,使用脑机接口驾驶轮椅在几分钟内就变得“像第二天性一样自然”,而且这比他以前使用的摇杆控制器舒服得多——摇杆迫使他一直弓着背。

从“意念控制光标”到“意念控制真实硬件”,这是Neuralink迈出的重要一步。这项技术有望帮助全球数百万瘫痪患者重获行动自由。然而,竞争对手Synchron也在追求同样的目标,但它采用的方式是不开颅、通过血管植入电极。这留下了一个关键问题:Neuralink植入物带来的更丰富信号,是否真的值得患者接受一次开颅手术?选择,从来不只是技术的较量,更是风险与回报的权衡。

2026年7月24日

美国国防部高级研究计划局(DARPA)最近向一家量子计算初创公司PsiQuantum砸下1.25亿美元,触发了一场关于“量子霸权何时落地”的重新想象。这可不是普通的科研拨款——它属于DARPA的量子基准测试计划,目标只有一个:检验这家公司基于光子的量子计算机能否从设计图纸变成真正的实用级机器。

PsiQuantum选择的道路有点特别:他们用单个光子作为量子比特,也就是存储和处理量子信息的基本单元。这个选择带来两个关键优势:芯片可以在标准半导体工厂里制造,不用像超导路线那样需要极度冷却——竞争对手们往往得用接近绝对零度的巨型冰箱,而PsiQuantum的系统相对“温和”得多。拿到这笔钱后,他们计划在米尔皮塔斯和芝加哥的设施里砸下重金搞基础设施,并在硬件、组件和软件层面全面测试。

目前,PsiQuantum是仅有两家进入该计划最终阶段的公司之一(另一家是微软)。在这个阶段,DARPA的科学家会直接入驻创业公司内部,像贴身教练一样盯着每一个技术细节。这种深度参与意味着美国军方对实用量子计算的渴望已经迫不及待。

量子计算机常常被形容为“永远还有十年”。但美国正在拼命打破这个魔咒,确保造出来的机器确实能派上用场。虽然没人知道真正可用的量子计算机何时才能诞生,但仅美国就有几十家创业公司在搞,科技巨头也纷纷涌入,这场竞赛已经白热化。光子路线或许能避开超导的工程噩梦,但大规模制造单光子源和低损耗开关仍是悬而未决的难题。无论成败,这次豪赌都在提醒世界:量子时代的地平线,正在被真金白银一步步推近。

2026年7月24日

想象一下,你正在玩一款复杂的Minecraft游戏,两个玩家在不同的视角下同时探索同一个世界。你看到前方有矿洞,队友看到后方有怪物,但你们的世界必须是同一个——矿洞里没有怪物,后方也没有矿洞。这就是多智能体交互世界模型面临的核心挑战:如何让不同视角的智能体在一个一致的世界中行动,而不仅仅是各自生成看似合理的视频片段。

现有视频生成模型通常只是把过去观察到的画面作为上下文输入,像流水账一样往前推演。但在多智能体、多视角的场景下,这种简单叠加历史帧的方式根本无法维护一个共享的、动态变化的世界状态。每个智能体看到的世界可能逐渐走向分裂,就像两个讲故事的人说着说着就各说各话了。

来自研究团队的WorldWeaver(简称W^2)给出了一种优雅的解法。他们提出了一种流式多智能体视频扩散模型,核心创新是在模型内部加入了“跨智能体世界状态寄存器”——一组可学习的向量。这些向量就像模型脑海里的笔记本,记录着当前世界的共享信息:地面是平坦还是崎岖、哪里有树木和高山、每个智能体目前的位置和状态。每当模型生成一段新的视频帧后,这个寄存器就会被动态更新,确保所有智能体的下一段观察都基于同一个最新的世界状态。

为了让这些寄存器真正学会记录有意义的信息,研究人员设计了多层监督信号。除了每个智能体自身的状态信息(如坐标、移动方向)外,模型还要学习生成全局鸟瞰图——从上帝视角俯瞰整个场景。更特别的是,场景中出现的文字标记也被纳入监督,比如某个建筑物上的告示牌写着“基地北面有钻石矿”。这样,世界状态寄存器不仅能记录物理空间,还能捕捉语义信息。

在架构层面,WorldWeaver采用了混合Transformer设计——将世界状态建模和视频帧生成分开处理,使用不同的参数权重。这就像让一个团队分别负责“记忆世界”和“绘制画面”,避免两者干扰。这种分离设计使得模型在保持逻辑一致性的同时,也提升了生成画面质量。

在双智能体Minecraft视频生成实验中,WorldWeaver展现了明显优势。当两个智能体分头探索时,它们对同一区域的描述(比如森林里是否出现了新的建筑)高度一致,而传统方法则频繁产生矛盾——比如左视角的玩家看到岩浆湖,但右视角的玩家在同一位置却看到一片草地。

世界状态建模不只是技术细节的改进,它回答了一个更根本的问题:当我们让多个智能体在模拟世界中互动时,它们凭什么相信彼此看到的是同一个世界?WorldWeaver用显式的世界状态寄存器给出了一个直接而有效的答案。这种思路或许能启发更广泛的领域——在自动驾驶、机器人协作、虚拟现实等应用中,如何让不同视角的智能系统共享一份关于世界的“共同记忆”,将是通往真正协同智能的必经之路。

2026年7月24日

深度神经网络的内部知识一直是研究者试图解构的谜题。一个关键线索是,学习与压缩之间存在内在联系——网络压缩或许能成为剖析这一知识的透镜。然而,传统的压缩方法往往受限于尺度对称性和架构偏见。为此,研究人员提出了一种名为“希尔伯特渐进编码算子”(HOPE)的数学框架,能逐步解构已训练网络权重中的表征。

HOPE的核心创新在于,它将网络压缩从离散域转移到连续函数的希尔伯特空间。具体来说,它将单个神经元建模为秩为1的希尔伯特-施密特算子,从而将剪枝和神经元合并统一为低秩子空间投影。基于这一公式,HOPE进一步引入“宏块剔除”机制,将同一统一度量框架扩展至涵盖多层结构(如整个残差路径)。这种统一方法使得跨不同类型和尺寸的层都能进行无偏的架构决策。

值得注意的是,HOPE是一个无需数据、无需超参数的框架。研究团队在模型压缩和微调中进行了概念验证实验,展示了这一理论的实际潜力。例如,通过HOPE,可以更公平地比较不同层的重要性,并识别出那些对最终性能贡献最小的神经元组合。实验结果表明,HOPE在保持模型准确率的同时,显著减少了参数数量,为未来高效神经网络的构建提供了新思路。

这一框架的提出,不仅解决了传统压缩方法中的偏差问题,更开启了理解神经网络内部表征的全新视角。或许,我们离真正“读懂”这些黑箱模型,又近了一步。

2026年7月24日

想象一下,你正在玩一款游戏,角色的每一个动作、场景的每一次切换,都由一个学习过海量视频数据的AI实时生成,而非预设动画。这便是ABot-World-0试图实现的目标——一个能够根据用户键盘操作,在单张消费级显卡上以16帧每秒的速度流式输出720P视频的世界模型。

这个模型的背后,是一套多源数据基础设施。团队从AAA游戏、模拟引擎和互联网视频中抓取素材,再通过一个名为WorldExplorer的智能体,以训练反馈为指导进行自主数据采集。所有数据需经过14项确定性质量检查与VLM(视觉语言模型)评估,并同步标注动作与文本,确保最终用于训练的数据干净、可控。

在模型训练上,研究团队采用渐进式蒸馏策略:先训练一个双向动作条件教师模型,再通过教师强迫和常微分方程蒸馏技术,将其知识迁移至一个因果学生模型。为了解决长时间自滚动中的分布偏移与自回归漂移问题,他们引入LongForcing机制,让学生的长程自生成与扩展视野的教师模型保持对齐。控制接口方面,原始键盘动作被用作统一的控制信号,既支持场景漫游,也支持第三人称角色交互;而参考角色记忆机制则通过持续的外观提示,保证了角色在长时间滚动中的身份一致性。

部署层面,团队协同设计了流式推理栈,包括轻量级VAE解码器、高效注意力机制、内存感知调度和低位DiT推理。在优化后的低位配置下,ABot-World-0在单张NVIDIA RTX 5090桌面GPU上实现了720P视频16 FPS的实时生成,动作到首帧延迟仅1.2秒,峰值显存约19GiB。实验在WorldRoamBench和扩展交互滚动任务上验证了其可控性与长程世界演化的连贯性。

当世界模型能够在消费级硬件上实时响应人类指令,虚拟世界的边界正在从“预设路径”走向“即兴叙事”。这不再是预渲染的循环,而是每一次键盘敲击都能触发新的可能。

2026年7月24日

在构建长程智能体模型的征途中,一个名为Solar Open 2的250B参数(15B激活)MoE语言模型横空出世。它最大的野心,是将一整个智能体执行轨迹塞进单一上下文——为此,工程师们设计了一套混合注意力机制:每四层中插入一层softmax注意力,其余三层采用线性注意力,去掉位置编码,并用扩展到负特征值的门控delta规则来增强记忆。就这样,1M token的上下文窗口被拿下了。

但更大的挑战在于训练。固定算力预算下,团队走了两条捷径:更强的起点,和更高价值的数据。起点方面,他们从前辈Solar Open 1(也就是Solar Open 100B)出发,迁移了那5.69B参数共享骨架——尽管架构已变,但骨架存活下来,其余部分则从头预训练。数据方面,则是一场精打细算的筛选:基于质量和稀有度的数据策展,加上混合比率优化,把20T token池提炼成10T混合体。相同token预算下,这套“食谱”效果比Solar Open 1更好。

智能体技能的塑造,更是一场多路并进的“特训营”。团队先为十二个场景训练了领域专家,然后用多教师同策略蒸馏(MOPD)将它们合并成一个统一模型。在英文基准上,Solar Open 2在MMLU-Pro、LiveCodeBench和APEX-Agents智能体套件中拔得头筹,与DeepSeek-V4-Flash、MiMo-V2.5等其他强手不相上下。而在韩文基准中,它更是拿到了所有对比模型的最高平均分——包括那些快速闭源API。甚至在自家韩文办公智能体基准Ko-GDPval上,它仅用不到六分之一的参数量,就能与DeepSeek-V4-Pro(1.6T)掰手腕。

这趟旅程揭示了一个朴素道理:当资源有限时,聪明的起点和更挑剔的数据,能让小而精的模型跑赢大而全的对手。而混合注意力与蒸馏策略的结合,或许正为下一代长程智能体点燃新的火种。

2026年7月24日

想象一下,你正在训练一个超级智能的语言模型,希望它像人类一样推理。传统方法往往从零开始优化所有参数,但一个被忽视的秘密是:模型权重中隐藏的光谱结构可能才是关键。最近的研究揭示了强化学习与可验证奖励(RLVR)中的一个缺失环节——优化层。研究者发现,RLVR在训练过程中并非彻底改变模型的光谱(即奇异值),而是巧妙地“继承”了基础模型的光谱结构,同时调整与之关联的输入和输出奇异帧。这就像你改造一栋房子时,保留坚固的地基,只重新设计内部布局。

基于这一洞察,研究者提出了一个名为“等谱优化”(ISO)的固定光谱优化框架,包含离线与在线两种实现。离线版本ISO-Merger,能够将多个共享基础模型的专业能力合并到一个单一固定光谱模型中,无需额外的数据、运行、梯度更新或强策略蒸馏。实验显示,它实现了最强的聚合性能,胜过其他无数据合并方法。

在线版本ISO-Optimizer则更令人兴奋。它允许使用AdamW或Muon等优化器来调整帧变量,而基础光谱保持不变。在从1.5B到8B参数的推理与编程任务中,ISO-Optimizer不仅提升了准确率,还大幅减少训练步骤。例如,Qwen3-8B-Base模型:标准AdamW需要270步才能达到0.495的聚合准确率,而ISO-AdamW仅用100步就达到相同水平,并在210步后进一步提升至0.509。这相当于用更少的资源撬动了更大的进步。

这个发现给出了RLVR优化层的一个具体答案:与其全盘继承预训练的优化方式,不如围绕奖励驱动的适应结构来设计后训练——继承光谱,优化帧。在追求更高效人工智能的路上,有时候保留比推翻更重要。

2026年7月24日

在企业数字化深水区,程序员、运维人员、办公职员和安全专家面临着同一种焦虑:AI编码代理究竟能否在真实工作场景中可靠执行任务?腾讯最新开源的WorkBuddy Bench评测套件,给出了一个反直觉的答案——与其依赖封闭测试集,不如把题目和评分标准全部公之于众。

这套评测体系覆盖了代码工程、前端开发、办公流程和安全攻防四个领域,每一个任务都不是从公开问题库中筛选,而是从真实的代码提交、拉取请求或业务场景逆向推导而来。研发团队将原始的专业指令改写成口语化、带有角色扮演的简短请求,使得通过搜索引擎无法直接回溯到原问题帖子的答案。评分标准因领域而异:代码子集关注工程复现能力,Web侧重前端功能实现,Office考验业务流程自动化,安全则模拟红蓝对抗的渗透与防御。

核心创新在于彻底的开源透明。所有任务目录、环境镜像、评估工具、测试用例和参考答案全部公开,版本化控制代替了数据保密,对污染的免疫力来自“从任务设计上就无法作弊”这一方法论。两个代理框架(CodeBuddy Code和Claude Code)在统一可复现的协议下运行,任何第三方都可以逐任务复现并审计内容。由于各子集评分工具不同,最终不报告跨域平均分,而是给出多模型在各自领域的横向比较。

这不仅仅是一个榜单,更是一次关于评估伦理的实践:当AI代理的测试题与真实工作流紧密耦合,且所有底牌都摊在阳光下时,模型能力的可信度反而获得了前所未有的提升。它提醒我们:在人工智能的评价世界里,真正的背书不是保密,而是可验证的诚实。

2026年7月24日

要教会机器人掌握灵巧的操作技能,首先需要海量且高质量的演示数据。然而,现有的数据采集流程往往依赖专门的硬件、固定的任务集和集中式的操作员,导致规模难以扩展。AXIS应运而生,它是一个可增长的、由社区驱动的数据引擎和基准,旨在通过“浏览器远程操作”让任何人都能轻松贡献演示数据。

这套系统不仅能自动生成和验证新的操作任务,还通过自动化成功检查、质量过滤、轨迹平滑,以及基于视觉和物理的数据增强,将社区收集的原始演示转化为可直接用于训练的优质数据。目前,AXIS数据集已经包含了207个不同的任务和超过5万条轨迹。为了公平评估,AXIS将所有任务整理成“任务快照”,并采用系统化的留存协议来测试不同策略的性能。

在统一的AXIS评估套件下,研究者对比了多种视觉-语言-动作(VLA)策略,并分析了它们在不同数据量上的缩放行为。实验结果显示,在AXIS上进行持续预训练能够显著提升模型表现:π0.5模型的整体成功率提升了5.8%,比在RoboCasa365上预训练的模型高出37.3%。更重要的是,随着数据量的增加,模型性能呈现出稳定的缩放趋势,且在布局变化、传感器噪声和相机扰动等挑战性场景下,性能提升最为明显。

当机器人不再依赖固定实验室里的昂贵装置,而是从全球各地普通用户的浏览器中汲取学习素材时,一个更开放、更可持续的机器人学习生态正在悄然成形。

2026年7月24日

深度研究往往需要找到同时满足多个约束条件的答案,但寻找答案的成本极高,而验证答案却可以分解为逐个约束条件的检查。这种发现与验证之间的不对称性,催生了全新的研究代理设计理念:与其简单地延长搜索时间,不如让代理在验证中间结果后,利用部分验证的状态来引导后续的改进。这就是AREX系列模型的核心思想——递归自我改进。

AREX构建了双循环架构:内部研究循环负责收集证据并构建初步答案,外部自我改进循环则逐条审核答案,识别尚未解决的争议点,并启动针对性的后续研究。这种设计让代理能够持续迭代,而不是一次性地给出最终答案。

为了支撑漫长的自我改进过程,AREX学习了一个自主的上下文更新工具。这个工具不依赖外部模型,而是将不断增长的交互历史压缩成一个紧凑的改进状态,其中既保留了已验证的证据,也记录了未解决的约束条件。这种压缩机制让代理在长时间跨度内保持对研究进展的清晰认知。

在训练方面,研究人员通过代理中端训练和长时域强化学习,在经验证的合成任务和高质量轨迹上训练AREX。为了解决长时域学习中最终奖励稀疏的问题,他们特别强调那些获得决定性证据或纠正错误研究方向的关键步骤。最终,他们训练了两种规模:一个密集的40亿参数模型,以及一个1220亿总参数(其中100亿为激活参数)的混合专家模型。

在多个权威基准测试中,AREX展现出显著优势。在BrowseComp、WideSearch、DeepSearchQA、人类最后考试(HLE)以及其他推理和工具使用基准上,AREX大幅超越了同等规模的基线模型,并且与使用更多激活参数的模型相比仍具竞争力。

答案不是一次搜索就能找到的,而是在一次次验证与改进中逐步浮现。这种递归自我改进的理念,或许正是通向更强人工智能研究能力的关键路径。当机器学会像人类一样审视自己的思考,深度研究的边界将被重新定义。