EZ.AI Listen Daily

全球AI新闻,耳听为快
2026年8月27日

想象一下,你正与一个AI助手对话,它既能依靠自身知识回答,也能随时调用外部工具获取最新信息。但麻烦在于,它常常在需要工具时犹豫不决,又在不需要时多此一举——每次多余的调用都意味着延迟、成本和潜在的副作用,而漏掉的调用则让它自信满满地给出错误答案。如何精准控制这个“工具开关”,成了大模型落地的一道坎。

过去,人们靠后期训练或精心设计提示词来改善,但既昂贵又难以在推理时动态调整。而一项新研究揭示了一个惊人的发现:这个“开关”竟藏在模型内部一条极细的“神经方向”里。研究者们从模型自身的工具偏好信号中提取出一条线性方向,不需任何训练,只在推理时轻轻施加一个强度系数α,工具调用率就能从接近0%平滑攀升到90%以上,且生成的调用依然规范有效。更妙的是,这个方向可以双向调节——调低它,模型变得“矜持”;调高它,模型会在那些它确实答不上来的问题上精准地“出手求助”。

这项方法不仅对已知工具有效,还能泛化到从未见过的工具,且不会特别偏袒某一种选择。在真实的工具执行环境中,仅用一次强度扫描,就能绘出一条成本与精度的帕累托前沿,将开放域问答的准确率从0.29拉升到0.56,近乎翻倍。更令人振奋的是,这一配方跨越了多种主流架构——密集模型、MoE模型、多模态模型——通通适用,全程无需任何训练。

这像是给大模型装了一个可微调的“工具直觉旋钮”。当调用与沉默的边界不再依赖庞大的训练成本,而只是模型内部一个可插拔的方向向量,我们或许正在见证一种更轻量、更可控的智能操作方式。未来,每一个AI助手都可能拥有一个精确的“行动力调节器”,在谨慎与果断之间,找到最佳的那个平衡点。

2026年8月27日

当大模型面对一道难题时,给它更多“思考时间”确实能提升表现,这正是所谓“测试时扩展”的魅力。但代价也很沉重:模型的每一步推理都像在纸上完整写下草稿,整段记忆都留在内存里,想得越久,账单越吓人。尤其碰上需要长考的高难度任务,光是保存中间推理过程就可能让算力成本高到难以承受。

然而,一篇最新研究却提出了一个反直觉的观察:随着模型持续推理,那些早先产生的中间思维标记,大部分变得不再重要。既然它们已经完成了历史使命,为什么还要让它们占据宝贵的内存?基于这个洞察,研究者设计出一种名为“前缀滑动”的机制——在推理过程中,果断丢弃那些既不属于前缀、也不属于最近几千个标记的中间内容。前缀负责保留关键指令和可用工具,而最近的标记则是模型当下正在推进的思路。这样一来,无论模型思考多久,内存占用都被限制在一个固定范围内,长时程的测试时扩展因此变得高效可行。

更令人惊喜的是,这项方法无需额外训练,就能让现有模型的推理速度提升三倍,同时保持原有性能。而如果配合强化学习进行训练,它还能进一步解锁超过十万个标记的推理轨迹,取得更加出色的结果。对比实验也显示,“前缀滑动”比“总结中间步骤”或“普通滑动窗口”都更有效。这项研究像是给“长跑型”大模型卸下了历史的包袱,让它们能更轻快地奔向更深的思考——也许未来的智能,不是记住所有走过的路,而是懂得适时放下那些已经不再重要的过往。

2026年8月27日

当AI代理还在云端奔跑时,一场悄然的反向迁徙开始了。Perplexity与Nvidia联手发布了名为Portable Computer的全新设备端AI代理,它不再将你的文件送往远方服务器,而是让一切计算发生在你的桌面硬件内部,并且完全免费运行。

这台“便携电脑”并不便携,它栖身于Nvidia售价4699美元的DGX Spark桌面超级计算机中,只需一次点击即可完成安装。用户可以在Qwen 3.8 27B和Perplexity自研的PPLX 27B之间选择本地模型,而当本地能力不足以应对复杂任务时,系统也能调用超过15种云端模型——但每次调用前都必须经过你的明确批准。这意味着,你的私人文件默认留在本地,云端只是偶尔的备选项,而非默认路径。

设备端的工作完全免费,不消耗任何积分,连接器还能与主流应用无缝集成。那些涉及敏感数据、隐私要求极高的任务,如今可以在不联网的情况下完成,像是给AI装上了一道物理隔离的保险栓。

这一发布时机耐人寻味。就在几天前,有报道称Nvidia正与Perplexity洽谈新一轮投资,金额高达数十亿美元,估值超过300亿美元。硬件巨头与AI新贵的紧密联手,让这次产品发布更像是一场战略宣言:未来的AI竞争,不仅拼模型大小,也拼数据主权和运行成本。

值得一提的是,Perplexity此前已将代理带到Mac平台,名为Personal Computer,但那依然依赖云端算力。Portable Computer的不同之处在于,AI的实际推理工作从云端转移到了本地硬件上,真正实现了从“租用智能”到“拥有智能”的转变。

随着更小、更高效的开源模型不断进化,这种本地优先的模式会愈发强大。前沿AI或许不再是日常依赖,而是关键时刻的增援力量。当你的AI不再需要把秘密讲给云端听,你与机器之间的信任,才真正开始建立。本地智能的浪潮,也许正在从这台小盒子开始,悄悄改变整个行业的游戏规则。

2026年8月27日

当大多数目光还停留在英伟达的GPU如何主宰人工智能世界时,OpenAI悄悄亮出了一把“辣椒”——代号Jalapeño的自研芯片。这颗芯片并非为了训练模型,而是专攻推理,也就是让AI真正“跑起来”回答问题的环节。根据OpenAI刚刚公布的首次基准测试结果,这颗与博通联手打造的700瓦芯片,在面对英伟达自家1200瓦的旗舰产品时,不仅没有怯场,反而给出了惊人的答案:响应速度快了最多3.6倍,每瓦功耗完成的工作量最多高出1.9倍。换言之,更少的电,更快的AI,这几乎击中了行业最敏感的神经。

更耐人寻味的是Jalapeño的诞生过程。OpenAI透露,他们动用了尚未发布的Astra模型和Codex工具来协助芯片设计,从最初图纸到具备制造条件只花了九个月——这个速度在芯片行业堪称闪电战。负责硬件的副总裁Richard Ho表示,OpenAI不会对外出售这颗芯片,因为内部“太需要它了”。即便如此,OpenAI在训练新模型的环节上,依然要依赖英伟达的GPU。也就是说,Jalapeño目前只负责“动脑”之后的那部分工作,而不是“学习”本身。

放眼整个行业,自研芯片的俱乐部正在快速膨胀。谷歌的TPU早就证明了实验室拥有自有硅片的甜头,如今Anthropic、亚马逊、微软也纷纷亮出各自的芯片计划。Jalapeño如果真的经得起大规模部署的考验,那么OpenAI将迎来几个立竿见影的变化:更低的token成本、更快的推理速度,以及一个完全围绕自家模型量身定制的设计闭环——每代新模型都能与芯片深度咬合,而不是被动地适配别人的硬件。

目前,Jalapeño的后续两代产品已经在路上,预计今年晚些时候进入OpenAI的数据中心,2027年逐步放量。这颗芯片究竟会不会成为AI推理时代的“持剑人”?至少从眼下的数据看,英伟达的宝座旁,已经多了一位攥着辣椒的挑战者。当算力的军备竞赛不再只靠堆料,而是开始比拼每瓦特的智慧,整个行业的游戏规则,或许正在悄然改写。

2026年8月27日

山姆·奥特曼终于给通用人工智能(AGI)定下了一个日期。在一篇《时代》杂志的深度专访中,这位OpenAI的首席执行官表示,一个符合他个人标准的AGI模型——能在几乎所有任务上与人类匹敌或超越人类——将在今年年底前在实验室内部诞生。

这并非孤立的豪言壮语。OpenAI的研究主管马克·陈给出了一个更量化的判断:实验室已经“走完了通往AGI的80%路程”。而联合创始人格雷格·布罗克曼则大胆猜测,未来人们回望这段时间,会将其视为AGI真正降临的时刻。

真正让业内人士侧目的,是首席科学家雅库布·帕乔基披露的细节。他提到,公司的Astra模型如今已能独立阅读一篇论文,并完成相当于研究员一周的工作量——这恰好达成了OpenAI在2026年实现“自动化实习生”的目标。这意味着AI不再是简单的问答工具,而开始扮演真正的初级科研助手角色。

奥特曼对Astra的期许更高。他称Astra将是第一个“以有意义的方式真正发明新事物”的模型,并直言创造新知识是“非常接近AGI的事情”。当模型不仅能处理既有信息,还能产出前所未有的洞见时,人类与技术的关系将进入一个无人涉足的领域。

《时代》的报道还回溯了今年七月发生的一起安全事件,OpenAI为此发布了更详尽的报告,并试图将重心重新拉回安全与放缓前沿模型竞赛之上。

AGI向来是个闪亮却定义模糊的词,各路人马各执一词。但OpenAI的这番表态,听起来像是一场正式宣言的前奏。相比“AGI”这个标签本身,帕乔基的自动化研究员里程碑和奥特曼的“发明新事物”论断,或许才是更值得细读的注脚——这些门槛一旦跨过,模型能力将真正踏入未知水域,而我们所有人,都是这场航行的乘客。

2026年8月27日

过去一周,一个名为Ox Alpha的匿名免费模型忽然席卷互联网,在OpenRouter平台上一举拿下使用量第一,数据翻倍于第二名DeepSeek,平台官方称这是有史以来最火爆的首秀。无数人猜测它的来历,有人说是OpenAI的测试版,有人说是谷歌的隐藏项目,甚至谷歌员工诡异的态度又给谜团添了一把火。然而猜来猜去,答案其实在最开始就被怀疑过的那位手里——中国AI实验室Z AI。

如今谜底正式揭晓:Ox Alpha正是Z AI新发布的GLM-5.3-Flash模型。Z AI不仅公开了模型权重,还把定价压到了极低——在Artificial Analysis的评测中,该模型以每个任务0.045美元的折扣价拿到了智能指数57分,价格比同等水平的竞争对手便宜约十倍。用行内话讲,这个智价比堪称降维打击。

更令人惊讶的是技术层面的细节。Z AI透露,Ox Alpha免费试用那一周,全部算力都跑在中国自研芯片上。他们声称这套纯国产芯片的推理系统,现在服务token的成本已经接近英伟达硬件的水平。如果属实,这意味着一件大事:中国AI产业链最被人担心的算力瓶颈,可能已经被松动了一个口子。

一个匿名模型引爆全球围观,最终发现是国产芯片加低价策略的组合拳。Z AI用一场漂亮的谜题营销向世界展示了两个事实:智能可以很便宜,国产算力也可以很能打。当推理成本被打到低谷,AI的普及门槛正在以超乎想象的速度崩塌。或许接下来的问题不再是谁能造出最聪明的模型,而是谁能把聪明变得最便宜。

2026年8月27日

当人们谈论智能体(Agent)的能力时,往往第一时间想到底层大模型。但一项新研究揭示了一个常被忽视的事实:智能体的表现并非由模型单独决定。承载记忆管理、规划策略、行动协议与工具调用的智能体“操控框架”,有时甚至比基础模型贡献更大。然而,这样的框架设计长期依赖人工、针对单一任务定制,从根本上难以规模化扩展。

为此,研究团队提出了JIT-Agent——一个专门训练出来的“操控框架智能模型”。它能把智能体操控框架形式化为一种可组合、可机器生成的构件,并遵循固定的四模块协议。JIT-Agent的核心本领在于:为手头任意任务即时定制框架,在运行中修复框架以保证稳定可靠,还能从过往大量框架配置中提炼性能信号,实现自我进化。

这项能力带来的提升相当直观:搭载JIT-Agent作为框架助手后,DeepSeek-V4-Flash在DeepSearchQA上超出GPT-5.6达9.1分,在OdysseyBench上超出4.3分;原本已很强的GLM-5.2也额外获得了最高20.2分的增长。在受控评测中,JIT-Agent生成的框架与成熟的智能体运行时OpenCode、Claude Code不相上下,并且对DeepSeek V4、Mimo-V2.5、Qwen3.6等多个尺寸的模型家族均有持续改进。

据研究者称,JIT-Agent是首个专为即时操控框架生成而设计的模型。它把“框架智能”确立为一个可训练、可迁移、可累积的智能体能力维度,与模型规模的扩展相互独立。换句话说,与其无休止地堆叠模型参数,或许我们该把目光投向那层连接模型与任务的“隐形骨架”——它可能才是让智能体真正聪明起来的关键。

2026年8月27日

想象一下,不同形态的机器人——机械臂、人形机器人、甚至人类的手——都能共享同一种“动作语言”来学习操作技能。长久以来,多形态机器人数据的异质性,就像不同方言之间的隔阂,让通用策略的联合学习举步维艰。传统方法要么依赖显式的动作重定向,要么生成人类到机器人的视频,或为每个数据集设计特定适应分支,这些做法都从根本上阻碍了统一策略的形成。

为此,研究者提出了一种名为UCAG-P的相机中心统一动作公式,从结构上将异构的具身数据集对齐到一个共享的几何动作空间。UCAG-P不再把机器人专属命令当作统一策略的学习目标,而是通过图像平面和相机坐标系中可观测的锚点运动来表示操作任务,把机械臂、人形机器人和人类双手都视为同一种动作模式的“不同化身”。一个几何条件化的动作翻译器,将预测的运动与目标机体的运动学相结合,生成可执行的控制指令。这种解耦的架构,让共享的视觉-语言-动作策略在学习可迁移的操作几何的同时,保留机体特定的可控性。

UCAG-P在4030小时机器人和仿真数据以及2340小时人类演示数据上完成训练。单个检查点在LIBERO上达到98.3%的成功率,在RoboTwin Easy和Hard上分别为88.7%和89.2%,在LIBERO-Plus上零样本达到82.0%,在RoboCasa GR-1上达到62.0%,且无需针对特定基准进行微调。

这项研究揭示了一个朴素而深刻的道理:当我们不再执着于每种机器人的“母语”,而是找到它们共同的身体几何规律,跨形态的智能或许水到渠成。数据的碎片化并非不可逾越,统一动作公式的钥匙,可能就藏在最朴素的相机视角之中。

2026年8月27日

在多模态检索的世界里,一种新的思路正在打破传统。过去,许多方法用固定数量的向量来表示每个样本,以为这样就能捕捉到跨模态的细节信息。但现实是,不同样本的检索需求各不相同,有些简单,有些复杂,用同样的容量去应对所有情况,难免顾此失彼。于是,研究者提出了“样本自适应多向量表示”——SAMVR,一种让表示容量随样本特性而灵活变化的新问题设定。

在这个框架下,每个样本不再被硬性分配相同数量的向量,而是拥有一个“内容自适应嵌入集”,其容量大小由这个样本在检索中额外向量能带来的实际效用决定。为了落地这一设想,研究者开发了AdaptiveEmbed框架,通过多组对比学习和对称的集合间相似度来学习结构化的多向量表示,同时引入效用策略优化,基于边际效用分配机制为每个样本量身定制合适的表示容量。

实验覆盖了图像、文本、视频和音频等多个模态的检索基准,结果显示,这种自适应容量分配比固定容量的多向量表示取得了更好的整体检索性能。这意味着,让表示容量“随需而变”,确实是提升多模态检索效果的可行路径。

不难看出,当技术开始尊重每个数据点的独特性,或许我们离真正的智能理解又近了一步。

2026年8月27日

Sam Altman终于给“通用人工智能”按下了一个具体的日期。在一篇深度专访中,这位OpenAI首席执行官放话:到今年年底,内部将会出现一个模型,达到他个人对AGI(在几乎所有任务上匹配或超越人类的人工智能)的定义标准。这不再是一个模糊的远景,而是一张贴在墙上的倒计时表。

OpenAI的研究主管Mark Chen更直接,他给出一个量化乐观:实验室已经走在通往AGI的路上“80%的路程”。而联合创始人Greg Brockman则做了一个大胆的预言,当未来的人们回望此刻,会意识到AGI正是在这个时期真正到来。三位核心人物,三种表述,指向同一个信号:那个曾被反复争论的“奇点时刻”,在他们眼中已经近在咫尺。

真正值得玩味的细节藏得更深。首席科学家Jakub Pachocki透露,他们的Astra模型已经能够独立拿到一篇论文,然后像一名研究员一样连续工作一周,完成一整段科研任务。这恰好命中了OpenAI在2026年实现“自动化实习生”的目标,而且进度似乎比预期更快。与此同时,Altman给Astra赋予了一个更耀眼的定义:它将是第一个“以一种重要方式真正发明新事物”的模型。在他眼中,生成新知识本身就是一种“非常接近AGI”的特质,这比单纯处理文本、图像或代码要沉重得多。

当然,这份豪言并非没有阴影。专访也披露了去年七月发生的一场安全事件,OpenAI随后发布了详细报告,并试图重新聚焦安全议题,放慢前沿模型的推进节奏。故事的另一面是:冲刺与刹车同时进行,而AGI的倒计时并不会因为安全考量而停下。

关于AGI的定义,人们至今无法达成共识,这个闪亮的术语更像是一面镜子,人人看到自己想要的答案。但无论定义为何,OpenAI显然准备抢先宣告它的到来。当自动化研究员开始独立产出知识,当模型开始“发明”事物,那些我们曾以为隔着千山万水的门槛,正在被悄然跨过。而门槛之后的领域,对于人类与机器来说,都是一片从未踏足的未知之地。

2026年8月27日

一个匿名免费模型Ox Alpha突然席卷互联网,在OpenRouter平台上一举登顶,使用量竟是第二名DeepSeek的两倍,被平台称为史上最火爆的首秀。整个AI圈都在猜测它的来历,有人怀疑是谷歌,有人猜是海外实验室,甚至谷歌员工还放出过烟雾弹。一周之后,谜底终于揭晓——中国AI实验室Z AI承认,Ox Alpha就是他们新发布的GLM-5.3-Flash模型。

更让人惊讶的是,Z AI不仅公开了模型权重,还把价格定得极低,只有顶级对手的零头。根据Artificial Analysis的评测,这个模型在智能指数上拿到57分,而每次任务成本仅0.045美元,比同级别对手便宜了整整十倍。

但真正重磅的消息藏在细节里:这一周的免费使用,全部跑在中国自研芯片上。Z AI声称,这套国产芯片方案已经能把服务token的成本做到接近Nvidia硬件的水准。如果属实,这意味着中国AI产业最关键的算力瓶颈,可能正被悄悄突破。

Ox Alpha的故事不仅仅是又一个AI模型的走红,它像一扇突然打开的窗户,让人看到另一个可能:当芯片不再是天花板,智能的定价权、供应链的主动权,或许都会迎来新的格局。而这场由匿名模型引发的狂欢,也提醒着我们——AI世界的下一次震惊,也许就藏在某个看似不起眼的权重文件里。

2026年8月27日

在人工智能的演进中,视觉推理一直是个难题。传统方法把图片和视频当作“输入素材”或“输出结果”,而一项名为VBVR-Pro的研究试图颠覆这一思路:让视觉生成本身成为推理的媒介——图像和视频不再是语言的附庸,而是解决问题的“第一公民”。

然而,这条路并不平坦。研究者们面临三大瓶颈:缺乏可扩展的训练任务、缺乏可靠的反馈信号、以及难以在不同生成方式间进行受控对比。为此,他们搭建了一个闭环测试平台,从三个层面破局。

第一,任务规模化。VBVR-Pro将视觉推理转化为一个包含300个程序化生成任务的受控任务空间。模型在此训练后,展现出强大的迁移能力,在RISE-Video、MME-CoF-Pro、BabyVision等七个外部视觉推理基准上表现亮眼,证明这些任务不是“纸上谈兵”,而是能触类旁通的实战训练场。

第二,可验证的奖励机制。研究团队为每个任务设计了基于确定性规则的奖励评分器,实现细粒度的任务评估。他们还系统考察了当下流行的“多模态大模型当裁判”范式,发现这种VLM-as-a-judge模式存在反复出现的失败案例。相比之下,基于规则的评分器与人类判断高度一致,并且能在大规模多任务强化学习中充当可靠的奖励信号——训练后的模型在各类视觉推理任务上性能更上一层楼。

第三,机制研究。平台支持超过30种图像、视频和交错生成器的受控对比实验。分析显示:对于需要持续追踪时空状态的任务,视频生成依然是最强选项;而交错式生成则提供了计算效率更优的替代方案。更关键的发现来自消融实验和探针分析——研究中隐约浮现出“视觉原生轨迹”的存在,这类轨迹对视觉推理至关重要,或许正是突破瓶颈的钥匙。

研究团队已公开全部数据、模型、评分器和代码,为后续探索铺平道路。当生成不再只是输出结果,而是成为一种思维方式,视觉推理的边界或许将被重新定义。真正的智能,也许就藏在那条无须语言中转的轨迹里。

2026年8月27日

计算机视觉领域正站在一个十字路口:当语言模型凭借Transformer架构和互联网级文本数据横扫千军时,以图像、视频和几何为输入的视觉智能,能否同样孕育出通往通用人工智能的火种?

这篇来自多位不同立场与机构学者的联合思考,提出了一个大胆的概念——视觉通用智能。它无意给出一个标准答案,而是试图厘清在AGI时代,计算机视觉究竟应当追求怎样的原则。从语言模型的成功经验出发,研究者们看到一条清晰的逻辑链:大规模自回归建模加上激进的规模扩展,让GPT系列在未见过的任务上展现出惊人的迁移能力。那么,如果视觉模态也遵循相似的规律,是否也能激发类似的智能涌现?

问题的关键不在于为视觉智能下一个唯一定义,而在于探索几个根本性的议题:视觉作为核心智能来源,应处理哪些输入模态?如何构建真正考验智能的基准测试?学习范式应当如何设计?以及与语言等其他模态的关系又是怎样?这些问题交织在一起,构成了VGI研究的基本框架。

文章没有给出确切的答案,但它暗示了一个可能性:视觉不仅仅是为语言模型提供附庸的“眼睛”,而可能是一条独立且深刻的智能路径。当语言试图描述世界时,视觉早已在无声地理解世界。在通往AGI的征途上,我们或许需要更多这样的反思——智能的形态是否被我们过早地限定在了文本的疆域里?对于机器而言,看见,或许不只是识别,而是一种更原始、更本质的思考方式。

2026年8月27日

想象一下,你从未教过机器人如何“把积木放进盒子里”,但只需给它看一段人类演示的视频,它就能照着做。这听起来像是科幻,但一项新研究正把这种能力变成现实。长期以来,机器人学习的一大难题是“跨任务泛化”——训练时见过的任务可以完成,一旦遇到全新任务,往往就束手无策。大型语言模型给了研究者灵感:它们无需更新参数,只要在上下文中给出任务描述,就能执行从未见过的新任务,这就是“上下文学习”。于是,一个问题浮现出来:对机器人操作而言,最自然的“任务描述”是什么?答案不是语言,而是人类视频——视频里包含了任务如何演变的丰富视觉线索。

基于这一思路,研究者提出了Zero-WAM,一个因果视频-动作模型。它通过观察人类视频指令,就能执行训练时从未见过的操作任务。但实现这个目标有个现实障碍:同时包含人类演示和机器人操作的配对数据极其稀缺。为此,研究团队设计了一条自动化流水线,把任务采样的机器人轨迹自动转换成语义匹配的人类视频,构建出包含8.6万个任务、7.42万对人类-机器人上下文学习配对的数据集HumanGen。为了让模型真正从视频提示中提取任务信息,而不是偷懒走捷径,他们又提出了一种名为“上下文未来块预测”的训练目标,有效抑制了模型从已见任务中学到的捷径,迫使它把注意力放在视频指令上。

效果如何?在RoboTwin 2.0模拟环境的七个全新任务中,Zero-WAM达到了47.0%的平均成功率,比最强的视频-动作基线方法高出了29.5个百分点。在真实世界的评估中,它也能跟随人类视频引导,成功泛化到多物体场景、长时程操作和精细插入等未见过的任务配置。这项研究的意义在于,它把机器人泛化问题变成了一个“任务描述”问题——只要把人类视频当作一种强大的任务规范,机器人就能举一反三。或许未来,教机器人做事就像给朋友发个视频那么简单,而每一个演示片段,都可能成为机器人的新技能钥匙。

2026年8月27日

想象一个世界模型,它不仅“看见”万物如何变化,更“懂得”变化背后的规则。现有视频类世界模型,大多只从视觉画面里学习动态——它们看到苹果落地,却不知道万有引力;看到日出日落,却不懂地球自转。这种仅靠“看”的学习方式,让模型难以维持长期一致的变化,也无法支撑开放式的世界演化。如今,一项名为“Code World Model”的新框架,尝试为世界模型装上“代码大脑”,让AI从“预测画面”转向“编写规则”。

这个框架的核心思路很巧妙:把“世界如何演化”和“画面如何呈现”彻底分开。语言模型扮演“世界大脑”,负责推理事件与因果,并生成可执行的代码,来持续记录世界状态、推进符合规则的演化。而视频模型则扮演“视觉画师”,负责将状态渲染成逼真的画面。但难题在于,代码状态和图像之间隔着一条鸿沟。研究团队引入了一个“代理表征”(proxy representation),将每一帧中的时空约束编码成一种可编译的“代理视频”,视频模型再根据这份规格说明书,生成高保真的视觉画面。

为了让这套系统真正运转,他们还搭建了数据流水线,从游戏实录和真实世界视频中,构建对齐的“代理—观测”数据对。经过配对游戏数据的微调,模型MiniMax-H3能够遵循代理生成的时空规格,在由代码代理搭建的简单交互世界中,生成既符合规则又保留丰富细节与动态的画面。实验结果表明,将代码的持久化世界演化能力,与视频模型的灵活视觉呈现能力相结合,是一条通往开放式世界模型的可行新路径。

或许未来的世界模型不再只是“眼见为实”的模仿者,而是能像程序员一样,编写出万事万物运行脚本的创造者。世界不再是模糊的像素流,而是一部可调试、可扩展的代码史诗。

2026年8月27日

当大语言模型学会推理,人们首先想到的是解数学题、写代码。但这项能力能否延伸到物理世界,帮助机器人完成复杂操作?答案似乎正在被改写。一篇来自研究团队的最新工作,提出了一个名为R3的简单后训练方法,让现成的视觉语言模型(VLM)变身“机器人推理器”,用自然语言直接指导底层操纵策略。

过去,机器人学习大多依赖“指令-模仿”模式:给机器人看示范,让它照着做。但面对长时程任务——比如整理货架、打包杂货——机器人需要追踪进度、理解物体关系、从错误中恢复,还要驾驭充满噪声的低层策略。单纯模仿往往力不从心。R3的思路则截然不同:它让VLM先生成专家风格的推理轨迹,再用基于评分规则的强化学习离线优化推理器,最终让模型产生自由形式的语言推理,在测试时实时引导动作。

在Language Table和模拟双臂杂货打包这两个受控测试平台上,R3展现出显著优势。相比只靠指令模仿学习的基线,R3在未见任务上探索更充分、泛化更强,表现大幅领先。研究者的分析还暗示,自由形式的语言推理可以充当一种“测试时计算”机制,帮助低层策略避开歧义、做出更明智的决策。

这项研究的妙处在于,它没有重新设计复杂的网络结构,也没有依赖昂贵的真实机器人数据,而是巧妙地利用了VLM已有的知识和推理潜力。就像给机器人装上了一副“思考的眼镜”,在动手之前先想清楚步骤、预判困难。这或许预示着,语言不只是人与机器人的交流工具,更可能成为机器人自身规划与纠错的内部思维语言。未来,当机器人在厨房里从容地准备晚餐时,它的“内心独白”也许正是源于这样一段训练出来的推理能力。

2026年8月26日

想象一个机器人正在学习操控物体,它不仅要预测画面下一秒的变化,还要决定如何行动。世界动作模型正是将这两者融合,用视频动态作为表征学习的信号,让机器人在预测未来的同时学会操控。然而,这类模型的视频潜在表征主要服务于视觉预测,并未被明确鼓励去保留多视角间的几何结构,或是空间上局部的、与物体相关的语义信息。这就像一个人虽然能看懂画面,却对物体之间的空间关系和细节语义缺乏感知。

为了解决这一问题,研究者提出了GaussianWAM,一个在训练阶段增强表征的框架,巧妙地将几何与语义监督组织在一个三维高斯场中。具体来说,给定同步的多视角观测,冻结的几何和视觉基础模型会提供深度、相机参数以及密集语义特征。GaussianWAM将这些异构信号绑定到共享的高斯原语上,渲染出空间对齐的语义、深度和覆盖目标,再将这些目标蒸馏进世界动作模型当前观测的表征中。整个过程完成后,所有教师模型、高斯组件和辅助预测头都会被移除,留下的是原本的推理路径,无需增加任何额外模块或计算量。

实验数据令人印象深刻。在LIBERO-Plus基准上,GaussianWAM将FastWAM的性能从52.05%提升至71.29%,将Cosmos Policy从71.52%提升至77.30%。值得注意的是,仅仅直接蒸馏CLIP和VGGT特征,就已经能建立起69.37%的强基线,而通过高斯场的统一组织,成绩进一步提升到71.29%。这有力地证明了将异构教师信号进行空间组织的价值。此外,该方法在标准LIBERO上也带来了性能提升,并在RoboTwin和真实世界操控任务中展现出积极的迁移趋势。

这些结果指向一个务实的路径:在训练阶段通过三维高斯蒸馏注入几何与语义相关的监督,不必改变部署时的架构,就能显著增强世界动作模型的表征能力。或许,未来的机器人学习,正是在这种看不见的“场”中,悄然构建起对物理世界的更深理解。

2026年8月26日

想象一下,你每天上班都要重新摸索路线,哪怕已经走了上百遍。这正是当前许多智能体在规划动作时的真实写照:它们拥有强大的“世界模型”——一个能把图像像素转化为抽象潜在表征的编码器,但每次面对新的状态和目标,却仍要从零开始,反复迭代优化动作序列,把世界模型当作一个黑盒模拟器来“试错”。每重新规划一次,就要支付一次昂贵的迭代优化成本,过去积累的规划经验完全派不上用场。

那么,能不能在世界模型学会之后,把规划这件事本身也“摊销”掉?LeFlow给出了肯定的答案。它像一个聪明的老司机,在世界模型的潜在动力学空间中,学习了一个可复用的潜在轨迹先验。具体来说,LeFlow把规划重新定义为条件式潜在轨迹生成:一个修正流模型(rectified-flow model)在当前的潜状态和目标潜嵌入之间“想象”出一条未来的潜路径;接着,一个逆动力学解码器把这段潜路径上的动作变成连续的动作块;最后,被冻结的世界模型通过自回归滚动评估每个候选方案,就像考官一样严格把关。

在四个主流的以目标条件为驱动的像素控制基准测试中,LeFlow彻底告别了传统“动作空间里的迭代优化”,改用摊销式的潜规划加固定预算的滚动选择。结果令人印象深刻:成功率稳定提升,而规划时间却降低了一个数量级。这不仅是一次速度的胜利,更启示我们——潜在世界模型的价值不应止步于“预测未来”,它还能孕育出可复用的规划先验,让智能体真正学会如何高效地“思考下一步”。也许,通往通用智能体的路上,缺的不是更快的搜索,而是一个能“凭直觉”规划的大脑。

2026年8月26日

一场无声的攻防战正在数字世界的阴影中加速演变。台湾研究机构TeamT5在最新的报告中揭示了一个令人侧目的趋势:中国关联的黑客组织在将DeepSeek等开源AI模型纳入攻击工具包后,其发动的网络攻击次数比此前翻了一倍还多。

这些黑客组织为何偏偏选中DeepSeek?TeamT5首席分析师Charles Li给出了直白的答案:“DeepSeek是中国黑客的首选AI,因为它相对强大,且网络防护护栏极低。”在成本与安全约束的天平上,DeepSeek以低廉的价格和宽松的规则限制,成为了攻击者眼中的“趁手工具”。相比之下,像Kimi K3这样定价更高的模型,至今尚未在攻击活动中被研究人员捕获。

报告披露了这些黑客组织的具体作案手法:利用DeepSeek编写入侵代码,成功攻破一家台湾企业的电子邮件系统,并通过分析上千个IP地址来精准测绘攻击目标。这些案例表明,开源AI的赋能已不再是理论上的担忧,而是正在发生的现实威胁。

值得警惕的是,这场技术军备竞赛的节奏正在加快。英国AI安全研究所早在五月就发出警告:AI的网络攻击能力每隔几个月就会翻一番。如今,攻击次数的倍增似乎正在与AI能力的跃升同步发生。当人们的目光聚焦在顶级闭源模型如Mythos可能带来的风险时,那些便宜、可下载、防护更少的开源模型,或许才是更难解决的安全难题。

技术本身并无善恶,但它的易得性与低门槛,正在让网络世界的攻守平衡变得更加脆弱。当一把智能的钥匙可以轻易落入任何人之手,锁匠与盗贼之间的赛跑,恐怕才刚刚进入下半场。

2026年8月26日

在AI浪潮席卷全球的当下,许多企业选择直接租用现成的顶级模型,但法律信息与新闻业的百年巨头Thomson Reuters却走了一条截然不同的路。他们耗费两年时光、投入四千万美元,并非从零开始,而是巧妙借助了阿里巴巴开源的Qwen模型作为底座,用自家数十年的独家内容精心调教,最终训练出了第一个完全属于自己的AI模型。

这笔账看似惊人,却藏着精明的算盘。四千万美元,对普通公司而言是天价,但对这个长期依赖昂贵商业API的庞然大物来说,不过是相当于以往一年多的账单。更令人惊叹的是,最新一轮训练成本已骤降至45万美元,AI训练的门槛正在以前所未有的速度降低。内部基准测试显示,这个名为Thompson的模型在某些领域竟超越了Claude Opus 4.8、Gemini 3.1 Pro和GPT-5.5等明星产品——尽管目前还仅限于内部测试。

Thomson Reuters的首席技术官Joel Hron用一个精妙的比喻解释了为何要如此大费周章:租AI就像租房子,每月付了钱,却永远无法累积成属于你自己的资产。他们追求的是那种能随时间复利增值的"权益"。这个选择背后,是一场关于AI时代核心资产的深层思考:当你的知识库本身就是最稀缺的资源,为什么还要把钥匙永远交给别人?

目前,这个模型仅覆盖了公司全部内容库的不到10%,研究用的开放权重版本也已计划发布。这或许只是一个开始,但它向所有拥有深厚内容积累的企业发出了一声意味深长的叩问:当训练成本日益亲民,强大的开源底座触手可及,是继续为别人的房子付租金,还是咬紧牙关,盖一栋真正属于自己的楼?答案,也许正在改写AI应用的商业逻辑。

2026年8月26日

2025年,当人们还在为地面AI数据中心的耗电量和散热问题争论不休时,SpaceX突然投下了一枚重磅炸弹——它宣布将基于英伟达最新的Vera Rubin NVL72机架系统,打造名为"Starmind"的太空数据中心,并计划在明年第四季度将一台瘦身版的系统送入轨道。

这套系统有多强悍?每个机架集成了72颗芯片,它们协同工作,相当于一台巨型计算机。英伟达方面表示,单颗芯片的算力是上一代H100的25倍。更令人惊讶的是,马斯克透露,太空版本经过特殊改造,比地面常规硬件"更简单、成本更低、密度更高、重量更轻",同时还针对太空中严酷的辐射和散热环境做了专门优化。

马斯克一直称Vera Rubin是"最好的AI计算机",而SpaceX据称将把从Grok大模型到轨道舰队管理的全部计算任务,都押注在英伟达的这套系统上。这意味着,未来的太空探索和AI训练,可能都在太空完成。

当然,成本是个绕不开的话题。分析师估算,目前轨道计算的价格是地面计算的4倍以上。但马斯克却信心满满,他认为这个差距会在未来几年内逆转,太空计算将变得比地面更便宜。

有意思的是,今年早些时候,OpenAI的首席执行官萨姆·奥尔特曼还曾公开吐槽太空数据中心"荒谬可笑"。但现在,随着SpaceX等公司加速推进,这个曾被嘲笑的设想正在快速变成现实。地面AI基础设施的建设正遭遇前所未有的批评和瓶颈,从能源消耗到环境争议,负面声音越来越多。对那些希望继续推动AI规模扩张的人来说,轨道解决方案来得再及时不过了。

当人类把最先进的算力送上星空,AI的边界也随之拓展。或许有一天,我们抬头仰望时,那些闪烁的"星辰"中,就有AI在默默思考。而这场关于算力、成本与未来的竞赛,才刚刚拉开序幕。

2026年8月26日

当AI代理还在云端争抢算力时,一场关于“隐私与成本”的变革正在悄悄落地。Perplexity与英伟达刚刚联合发布了一款名为Portable Computer的新设备端AI代理,它不再依赖云端,而是直接把AI工作装进你的硬件里。这意味着,你的文件、对话和任务处理都能留在本地,彻底告别上传服务器的担忧。

这套系统最吸引人的地方在于灵活性:用户既可以选择开源的Qwen 3.8 27B模型,也可以使用Perplexity自家的PPLX 27B模型,两者都能在本地流畅运行。如果遇到更复杂的任务,系统还能调用超过15种云端模型作为后备,但每次调用都必须经过你的批准。换句话说,你的数据大门只有你自己能打开。

更让人心动的是,所有本地处理都不消耗任何积分,还能与主流应用无缝连接。安装过程也极其简单,只需一次点击,就能在英伟达售价4699美元的DGX Spark桌面级“超级电脑”上运行。虽然目前仅限于这台高端设备,但官方透露,未来部分PC也能加入支持行列。

这款产品的出现,正值一个微妙的节点。就在发布前几天,有消息称英伟达正与Perplexity洽谈新一轮投资,金额高达数十亿美元,估值超过300亿。这桩合作显然不只是技术层面的联动,更是双方在AI布局上的一次深度绑定。

此前,Perplexity已经通过Personal Computer把AI代理带到了Mac上,但Portable Computer的意义在于,它把真正的AI计算从云端搬到了本地硬件上。随着小而精的开源模型不断进化,云端大模型或许会从日常主角变成偶尔救场的备胎。这既是一次隐私的胜利,也是一次成本的解放——AI的未来,或许不在遥远的服务器机房,而在你桌面上那台安静运转的机器里。当数据不再需要远行,当计算不再依赖云端,个人AI的边界正在悄悄改写。

2026年8月26日

想象一个智能体要完成一项漫长的任务,就像一位厨师准备一顿几十道菜的晚宴。随着时间推移,每一道菜的做法、火候和调味都成了记忆中的一部分,但如果每次做新菜都要翻遍所有历史记录,效率会急剧下降,甚至会忘记当下做到哪一步。这正是人工智能在长时程任务中面临的困境——历史信息越积越多,任务状态被淹没,技能调用也变得错位。

Recuris架构提出了一种全新的解决方案:将记忆分为“工作记忆”和“经验记忆”。工作记忆像一张临时便签,实时追踪任务进度,并据此从经验记忆中挑选最合适的技能;经验记忆则像一本不断更新的菜谱,存储着经过验证的操作技巧。这种耦合设计让智能体不再需要翻阅全部历史,而是聚焦当前需求,同时把执行过程转化为结构化证据,一旦出错,能快速定位到是哪个记忆环节出了问题。

更巧妙的是,Recuris构建了一个有边界限制的递归记忆进化循环:一个固定的元智能体(Meta-Agent)分析执行中产生的证据,对技能记忆进行局部、经过验证的更新,这些更新又重塑后续执行,产生新的证据,如此循环往复。整个系统不是无限膨胀,而是保持在一个可控的范围内持续优化。

在四个长时程基准测试和十个模型的实验中,Recuris在37个完成的模型-基准组合中提升了其中35个任务的成功率,将前沿模型推向了新的高度。例如,在tau-bench上,它为GPT-5.6 Sol增加了17.8个百分点,为Claude Opus 5增加了15.6个百分点,将Opus 5的成功率提升至87.9%;在SkillFlow上,Qwen3.6-27B和35B分别提升了16.6和13.5个百分点。随着任务交互时长的增加,优势更加明显——在最长任务上,Recuris带来了32.2个百分点的提升,常见的长时程失败率下降了最多80%。

这些数字背后是一个更深刻的启示:当智能体能够将积累的经验不断转化为更高效的长时程行为时,递归自我改进就不再是空中楼阁。它意味着,AI的成长不必依赖无穷无尽的扩展,而是可以通过精炼记忆、聚焦当前、循环验证,在既有的历史中不断汲取力量。真正的进步,往往不是记住更多,而是学会如何忘记那些不再重要的,并让每一次经验都成为下一次行动的阶梯。

2026年8月26日

在人工智能的世界模型训练中,海量视频数据是宝贵的燃料,而互联网上丰富的游戏实况视频,因其多样的环境和复杂的交互,成为极具潜力的训练来源。然而,一个隐藏的障碍始终存在:游戏画面中密密麻麻的界面元素——血条、地图、技能栏——这些屏幕上的“杂质”与游戏世界本身纠缠在一起,引入了与物理规律无关的噪声,严重干扰了模型对真实动态的学习。

为了攻克这一难题,研究团队提出了一个名为GameUI-Taxonomy的分类体系,并构建了一套名为G2WEngine的全栈工具链。这套工具的精妙之处在于,它能自动从真实游戏视频中提取可复用的UI组件,并将其合成到干净的画面上,生成时间上连贯的UI叠加层。基于这个引擎,团队构建了名为Game2World的大规模数据集,其中包含9.6万段合成的成对视频,并提供了精确的重建目标;同时还包括来自303款游戏的1079段真实场景视频,用于评估模型在复杂环境下的表现。数据集的资产库则收录了从1010个代表性游戏画面中提取的5132个经过验证的UI元素,覆盖了21个分类类别。

在此基础上,团队推出了GameCleaner——一个无需掩码的游戏界面去除模型。与依赖分割掩码的传统方法不同,GameCleaner结合了多模态语义理解与视频编辑能力,能够直接识别并移除各类HUD元素,同时保留底层场景内容和时间动态。在受控试验中,使用去除UI后的视频训练世界模型,整体VideoReward评分比使用原始带UI视频训练的模型提升了6.83%。在专门的界面去除评测中,GameCleaner在合成视频上的平均AAR(准确率)达到95.36,比最强的时间掩码基线高出57.3%;在真实视频上则取得了80.05的最佳AAR,同时保持了99.8%的背景完整性。

这些数字背后,是研究团队对“如何将互联网上海量游戏视频转化为高质量世界模型训练数据”这一规模化路径的有力探索。当游戏世界的边界被清理干净,模型看到的不再是混乱的符号叠加,而是背后那个连续、可预测的物理空间。或许,这正是迈向更强世界模型的关键一步——先学会忽略无关的干扰,才能看见真正的本质。

2026年8月26日

在智能体决策的幕后,世界模型正悄然成为越来越重要的角色。它被用来当“学习模拟器”,替AI在想象中预演未来,从而评估和改进策略。然而这一切都建立在一个未被验证的假设之上:模型对未来场景的预测,真的能忠实反映任意给定的动作吗?现实中,绝大多数评测只覆盖专家示范,一旦动作偏离常规,模型能否跟得上,至今是一笔糊涂账。

为了填补这一空白,研究者提出了WorldEcho。它把测试范围扩大到了更广阔的动作分布,并借助视觉完整性和SE(3)轨迹对齐这两把“尺子”,细致衡量世界模型对动作的响应能力。诊断结果引人深思:面对专家的动作,当前世界模型还算可靠,而一旦遇到五花八门的非专家轨迹,它们就明显露怯——要么对指令动作视而不见,要么干脆生成视觉上乱七八糟的未来帧。这样的模型,作为通用模拟器的可信度难免让人捏一把汗。

为了让世界模型真正“听懂”动作指令,研究者进一步提出WorldSync,在三个互补方向上协同发力。首先是分布覆盖:拓宽训练样本中动作后果的分布范围,让模型“见多识广”;其次是表征基础:借助一个被称为Action-Forcing Expert的机制,将中间视频表征锚定于由动作引发的真实机器人动力学上;最后是干预效果对齐:确保在动作干预下,模型预测产生的变化与真实未来中观测到的变化保持一致。三条路径相互补充,如同为世界模型装上了更敏锐的“耳朵”、更踏实的“根基”和更精准的“因果扳机”。

在RoboTwin基准测试以及真实机器人任务中,WorldSync带来了令人振奋的结果:它显著提升了WorldEcho的各项评估指标,也让世界模型成为迭代策略改进中更可靠的“陪练”。最终,智能体在真实任务中实现了更高的成功率。

这项研究提醒我们,衡量模拟器好坏的标尺其实就藏在对动作的“忠诚”里。对未来的世界模型而言,看得见未来固然重要,更关键的是,别歪曲那通向未来的每一步指令。唯有既能听清、又能跟紧每一个动作,模拟世界里的千里之行,方能始于足下、抵达彼岸。

2026年8月26日

在语言模型预训练的迷宫中,研究者们长期被一个现象困扰:学习率与参数范数,这两个看似独立的旋钮,究竟如何共同操控损失曲线的起伏?一篇新研究揭开了其中的深层机制——两者并不各自为政,而是通过它们的比值,即“有效学习率”(ELR),联袂主导一切。

故事始于一个大胆的实验:当研究者将不同的学习率和参数范数组合,却刻意让它们的比值保持一致时,奇迹发生了。原本分道扬镳的损失轨迹,竟在整个训练过程中高度重合,仿佛被同一只手牵引。即使个别运行采用截然不同的学习率和参数范数,只要ELR相同,损失曲线便如孪生兄弟般并肩前行。这种“ELR坍缩”(ELR collapse)现象并非偶然,而是在多种优化器、模型架构、数据集和模型规模下反复上演。平均坍缩误差通常仅有10的负三次方量级,甚至低于同一配置下不同随机种子之间的自然波动。换句话说,ELR的预测力比随机性本身还要精确。

研究者进一步通过系统性消融实验,锁定了影响坍缩精度的两个关键因素:归一化设计,以及学习率与范数变化的时间尺度。这意味着,并不是所有设置都能完美体现ELR的作用,某些设计会让轨迹略显松散,但核心规律依然清晰。更有趣的是,当研究者主动施加权重衰减或调整参数范数约束时,他们发现这些干预手段并非直接重塑损失曲线,而是通过改变ELR的调度来间接发力。这就像调音师并不直接拨动每根琴弦,而是调整整个乐团的指挥棒节奏。

这一洞察催生了实用工具:用ELR替代传统学习率,可以让一个拟合好的函数缩放律(FSL)在不同范数控制方法之间自由迁移。原本需要分别校准的经验公式,如今有了统一的坐标轴。ELR还解释了一个长期困扰学界的怪象——延迟加速(delayed acceleration),即参数范数控制有时会推迟损失下降的加速节点。在ELR的透镜下,这不过是调度曲线形态的必然结果。

这场发现将学习率调度、参数范数控制和损失动态串联成一幅自洽图景。它提醒我们,高维优化中看似独立的旋钮,可能只是同一个底层变量的不同投影。当你找到那个真正的公共坐标,许多混沌的表象便会自然归位。对于大模型预训练的实践者而言,ELR或许是那把尚未被广泛握住的钥匙。

2026年8月26日

在大语言模型的后训练阶段,两种范式逐渐占据主流:一种是基于可验证奖励的强化学习,它用任务级别的成败信号来引导模型;另一种是同策略蒸馏,它提供密集的逐词指导,却对生成轨迹的对错浑然不觉,最终只能逼近教师模型的水平。聪明的做法是把两者结合起来,让蒸馏提供细粒度监督,让强化学习提供任务正确性。但现有的融合方式往往依赖加权或启发式切换,引入一堆额外超参数和权衡。

一项新研究提出了OPDVR,即“带可验证奖励的同策略蒸馏”。它先根据轨迹正确性重新定义采样词元蒸馏的隐式奖励,再用一个ReLU门控机制,让正确的轨迹获得非负奖励,错误的轨迹获得非正奖励。这样一来,蒸馏信号既与任务成功对齐,又保留了教师模型的分布指导。更妙的是,这个改动把采样词元蒸馏变成了一种真正的可验证奖励强化学习方法,可以直接搭配任何策略梯度算法,比如GRPO。在六个推理基准上,OPDVR始终优于标准同策略蒸馏,而无需增加任何超参数。

这项工作的意义在于,它不止提供了一种更优的训练方案,还展示了一个思路:将两种看似互补的信号,通过巧妙的奖励重塑,消除调参负担,让模型在推理时既听得进老师的话,也看得清对错的路。当稀疏的任务级反馈和密集的标记级指导不再互相妥协,后训练的天平或许能真正实现双赢。代码已经开源,等待着更多探索者去拨动下一个齿轮。

2026年8月26日

当AI代理还忙着把数据送上云端时,Perplexity和英伟达悄悄换了个方向——把AI的工作搬到你的电脑上。他们刚刚推出了名为Portable Computer的本地设备端代理,承诺文件私密、无需联网,还能在英伟达的DGX Spark消费级硬件上免费运行。

这枚"便携电脑"并不像名字听起来那样是个硬件,而是一个可以装在本地的人工智能代理。用户可以选择Qwen 3.8 27B或Perplexity自家的PPLX 27B作为本地模型,遇到复杂任务时,也能按需调用超过15种云端模型——不过每一次云端请求都需要用户点头同意,本地的运算则完全不消耗任何积分。

安装方式简单得惊人:在售价4699美元的英伟达DGX Spark桌面超级计算机上,一键即可完成。未来,部分普通PC也能运行它。英伟达与Perplexity的关系显然不止于此——就在发布前几天,有消息称英伟达正洽谈以超过300亿美元的估值,向Perplexity投资数十亿美元。

Perplexity此前已经把代理带到了Mac上,名为Personal Computer,但Portable真正让AI的算力从云端下沉到硬件本身。这是一次关于隐私与成本的豪赌:当小型开源模型越来越强,前沿大模型或许会退居二线,从默认选项变成偶尔动用的备用工具。

本地AI的种子已经种下,未来你还会把每个问题都交给云端吗?

2026年8月26日

在人工智能竞相追逐“下一个词”的时代,加州理工学院教授阿尼玛·阿南德库马尔和工程师贝内迪克特·耶尼克却选择了一条截然不同的路。他们刚刚创立了初创公司Accelerated Understanding,目标是训练AI预测物理世界如何演变,而不是预测下一个单词是什么。

这两位研究者原本可以拿到杰夫·贝索斯旗下人工智能公司Prometheus的高管职位,以及35%的公司股份——那意味着来自全球最富有者的巨额财富。但他们拒绝了。这个决定后来显得更加惊人:Prometheus已经筹集了120亿美元,追逐着类似的目标。放弃如此可观的一笔股份,背后是他们对技术路线的坚定信念。

他们的AI模型没有沿用传统的Transformer架构,而是基于“神经算子”设计。这是一种基于物理学的方案,能够在三维空间和时间中追踪事件的演变,而非像大语言模型那样仅处理文本序列。在一项测试中,他们的模型单次运行处理了5万亿个数据点,大约是谷歌和Anthropic顶尖模型处理量的500万倍——这个差距令人咋舌。

Accelerated Understanding目前瞄准的商业方向包括芯片材料研发、极端天气预测和机器人技术。与许多押注于消费者端大模型的AI公司不同,他们更专注于企业级应用。在他们看来,物理AI竞赛正在升温,多个实验室都押注“世界模型”,但阿南德库马尔和耶尼克认为,真正的答案不是文本或视频,而是物理学本身。

放弃贝索斯的橄榄枝,押注一种完全不同的AI范式,并且用惊人的数据规模证明其潜力——这不仅是技术选择,更是一场豪赌。当大多数AI公司都在教机器读懂语言时,他们选择教会机器理解世界运行的基本法则。也许,预测飓风比预测一个句子更具价值,而他们正用行动证明这一点。

2026年8月26日

在大规模机器人控制领域,世界动作模型(WAMs)通过预测环境未来变化来提升操控能力,但一个现实瓶颈是:测试时生成未来观测会带来高昂的计算延迟。为了追求效率,研究者提出了Fast-WAM,它直接跳过未来预测环节。然而,在公平对齐实现条件下,Fast-WAM的泛化能力却明显逊色于那些“预知未来”的模型,尤其在机器人演示数据稀缺和分布外场景下,差距进一步拉大。

为了兼顾效率与泛化,一种名为LAWA的新架构应运而生。它的核心思路是:不再生成完整的未来图像,而是用紧凑的潜在动作作为“未来意图”的压缩表征。打个比方,LAWA学会了用一组简练的内心草稿预演未来,而不必在脑中播放完整电影。具体而言,LAWA先通过无需动作标签的预训练增强一个离散分词器,生成面向操控任务的码本目标;在训练时,它联合去噪一个锚定到这些目标的连续潜在状态,同时输出可执行的动作块,而在推理阶段彻底抛弃未来视频分支。

在RoboCasa基准上,LAWA展现出了亮眼成绩:少样本设置下平均成功率达到65.6%,全量数据设置下达到80.8%,分别比匹配的Fast-WAM基线高出9.6和4.5个百分点。同时,它保持了与联合式WAM(Joint-WAM)相当的性能水平,却将推理延迟降低了42.9%。在LIBERO-Plus上,LAWA展示了具有竞争力的零样本鲁棒性,在真实世界任务中也表现更优。

这一系列结果传递出一个重要信息:对未来的想象并非可有可无的累赘。只要找到合适的轻量表征方式,我们既能留住“预测未来”带来的泛化优势,又能满足实时控制对速度的苛刻需求。LAWA用紧凑的潜在动作重新定义了“远见”的成本,让机器人既能抬头看路,也能脚下生风。在迈向通用具身智能的路上,这种权衡或许不是权宜之计,而是一种更本质的智慧。

2026年8月26日

在生成式模型的竞技场上,如何让扩散模型不仅画得美,更画得“对”?传统方法往往只给出最终奖励——一张好图或一个高分,却说不清每一步去噪过程该往哪个方向调整。这就像教练只告诉运动员“你赢了”或“你输了”,却不指出每个动作如何改进。

如今,一项名为DiffusionOPSD的新框架打破了这种模糊。它把图像级别的奖励信号,转化成了每一步清晰可见的训练目标。研究人员设计了一个“行为策略”作为教练,冻结不动,负责生成轨迹并提供参考锚点。奖励梯度在锚点周围构建出有界的正负目标,而可训练的学生模型则努力拟合这些目标。每完成一轮有限步的拟合,指数移动平均更新就会刷新教练,让指导标准始终与时俱进。

这种设计带来的直接好处是:目标构建和实际训练效果可以被分别测量。有意思的是,同一查询下的对照实验揭示了一个反直觉现象——更大的目标构建增益,并不一定在一次拟合更新后转化为更大的实际收益。这种“知行不一”的发现,为后续优化打开了新的思考空间。

在实战检验中,DiffusionOPSD展现了惊人实力。在SD 3.5-M和经过步蒸馏的Z-Image-Turbo两个模型上,覆盖十个评估器的二十种奖励匹配设置里,它拿下了十九项最高分。相比最强竞品,其领先幅度最高达44.0%;训练所需的GPU时间也比DiffusionNFT大幅缩减——SD 3.5-M上节省40%,Z-Image-Turbo上节省63%。

效率与效果兼得,让这种“在线自我蒸馏”方法显得尤为亮眼。它把模糊的终极目标拆解成明确、可更新、可诊断的过程督导,让扩散模型的后训练不再是一趟黑箱旅程。当每一步都有了可循的方向,生成的每一张图像便更接近人类真正想要的答案。这或许预示着,在追求对齐的道路上,我们不仅需要更强的模型,更需要更清晰的教学方式。

2026年8月26日

在人工智能研究的世界里,数据如同燃料,而高质量、大规模的数据集往往决定模型的性能上限。如今,一个名为LAION-BVD的开放视频数据集横空出世,它以前所未有的规模,为多模态学习注入了新的活力。

这个数据集的起点,是CommonCrawl网络档案中挖掘出的13亿条平台专属视频链接。研究团队没有止步于链接清单,而是实际下载了其中8000万个视频,累计时长达到惊人的1000万小时。这一规模,让LAION-BVD成为目前最大的开放多模态视频数据集之一。

数据集的设计初衷,是为视频、音频和图像三种模态的预训练提供支持。研究团队采用内容感知的场景检测技术,将长视频切分为更精细的片段,并为每个片段自动生成对应的视频描述和音频描述。这种合成字幕的方式,避免了人工标注的巨额成本,也让数据规模得以迅速扩张。

实验结果显示,基于该数据集训练的模型,在标准的视频-文本和音频-文本基准测试中表现出极具竞争力的成绩,并且随着训练数据量或模型参数的增大,性能持续稳步提升。这意味着该数据集不仅体量庞大,而且具备良好的扩展性。

更有趣的是,研究团队还探索了视频帧的“跨界”价值——通过提取场景变化的关键帧,构建出另一组图像-文本数据。这些帧所呈现的视觉分布,与常规网络图片语料有明显差异,这为图像-文本检索模型提供了独特的训练素材。在该数据集上训练的模型,同样展现出了强大的图像-文本检索性能。

如今,LAION-BVD已向全球研究社区开放。它的意义,不仅在于提供了海量视频数据,更在于开拓了多模态学习的多种可能性——从视频到音频,从场景帧到图像检索,每一个维度都蕴藏着值得深挖的研究方向。当数据的大门不再紧锁,智能的边界也将不断拓宽。在通往通用人工智能的道路上,这样一块坚实而开放的路石,或许正是未来突破的起点。

2026年8月25日

从一张静态图片出发,机器要预测未来几秒的物体运动,靠的是隐藏在神经网络深处的一种“世界模型”。传统方法会把观察到的信息编码成稠密向量,像一张满是刻度的地图,每个角落都写着细节。但最新的研究却提出了逆向思考——如果地图换成一连串稀疏的坐标点,只标记关键地标,预测未来会不会更容易?

这项研究聚焦于联合嵌入预测架构(JEPA),一种通过预测潜在动态来规划行动的自监督模型。它的核心难点在于防止表征坍缩,即不同输入最终被映射到同一个无意义的点。此前常见做法是将特征对齐到最大熵分布,比如各向同性高斯分布,从而得到稠密表征。然而,新的问题浮出水面:稠密表征真的最适合建模动态吗?如果换成稀疏表征,因果动态会不会变得更清晰?

研究者的理论给出了肯定答案。他们证明,在足够高维的one-hot潜空间里,任何非线性Lipschitz动态都可以被动作条件线性动态无限精确地逼近,随着维度增长,展开误差逐渐消失。简而言之,极端的稀疏编码——每个状态激活一个维度——能让复杂的非线性变化“降维”成简单的线性规则。但one-hot编码过于苛刻,现实中没有哪个网络能轻松做到,于是研究者提出了一个更实用的松弛方案——分布式稀疏表征。

为此,他们构建了LpWorldModel这一新模型,用修正分布匹配正则化(RDMReg)把编码器输出引导到修正广义高斯分布上,从而产生非负稀疏编码。听起来很技术,但实验结果非常直观:稀疏表征大幅降低了对预测器复杂度的要求。在PushT任务上,中间容量预测器条件下,稀疏LpWM比稠密基线LeWM的规划成功率最高提升了57%,而且这个优势在不同预测器家族中都成立,甚至超越了稠密的VICReg表征。

更有趣的是,稀疏表征天然地展现出一种“模式分解”的结构。它的支撑集编码了离散的动态模式,好比把场景划分为“向左移动”和“静止不动”的选项;而特征数值则连续刻画了模式内部的具体状态,比如运动的幅度和方向。这样,模型不再是黑箱预测,而是把未来拆分成了可解释的模式和连续变量。

研究者总结,稀疏表征能减少控制所需的预测器复杂度,同时揭开可解释的潜在动态结构。这项探索也提醒我们,表征的几何形状并不只是数学细节——如果方法得当、学习空间足够高维,稀疏可能比稠密更接近构建智能预测世界的捷径。每个维度都是一根细小火柴,而它点燃的,可能是未来规划与决策的更清晰的路径。

2026年8月25日

想象一下,给人工智能一段视频,然后问它一个需要“额外知识”才能回答的问题——比如视频里那个一闪而过的建筑是什么风格?背景音乐出自哪部作品?传统模型往往束手无策,因为它们要么只盯着画面,要么只依赖内部记忆,无法在看视频的同时主动查阅资料。如今,一个名为VideoRover的新框架试图打破这一僵局。

它的核心思路很巧妙:把两种本应协同的能力——主动感知和深度研究——真正融合起来。过去,“边看边想”让模型能对视频进行时间维度的主动定位,找到关键瞬间;而“深度研究”则让模型在互联网上多步搜索、浏览网页获取信息。但这两者通常各自为政。VideoRover却让它们像齿轮一样咬合转动:给定一段视频和一个问题,它会循环执行三个动作——裁剪视频片段、进行多模态搜索、浏览网页。每一步的结果都成为下一步决策的依据:局部视频片段指导外部检索,而检索到的证据又反过来触发对视频的进一步检查与验证。这种迭代回路,让模型不再“盲人摸象”。

为了训练这样的能力,研究团队搭建了一条全自动数据流水线,生成了2.6万条经过验证的监督微调轨迹,以及3千条高难度的强化学习实例。他们还推出了专门的基准测试VideoRover-Bench,按视频时长和研究难度分层设计,用来衡量模型在不同复杂度下的表现。

实验结果显示,VideoRover-8B-RL在直接回答(不借助工具)的设定下,性能可与专有模型一较高下;而在配备相同工具套件时,它明显超越了更大的开源模型。消融实验和训练动态分析进一步确认,主动视频定位、外部检索以及长程强化学习三者缺一不可,它们各自承担着互补的角色。

这项研究的启示在于:开放世界的视频理解,或许不该指望模型“记住一切”或“看遍一切”,而是让它学会何时该细看、何时该查阅、怎样把两种信息串联成答案。当视频不再只是被观看,而是被“研究”,人工智能对世界的理解,便向前迈出了一小步。

2026年8月25日

在大语言模型的强化学习训练中,一个长期存在的难题是:如何稳定地利用评论家模型来估计每一步的奖励?传统方法如GRPO,为了绕开评论家,需要为每个提示采样多个回答,再通过组内相对比较来计算优势。这虽有效,却意味着巨大的采样成本。另一条路是训练一个评论家,让它从单个回答中直接估算优势值,但这套方法一直以不稳定而闻名。

这项研究并没有直接放弃评论家,而是深入剖析了其不稳定的根源,并在此基础上构建了一套名为BPCO的最佳实践配方。研究团队将DPPO算法、约束在奖励范围内的价值预测、蒙特卡洛价值目标、未归一化的策略优势,以及长度自适应的广义优势估计巧妙地组合在一起。更妙的是,由于评论家只在训练时存在,它能够“看到”策略模型无法接触的秘密信息——例如标准答案或评分细则,从而为学习过程提供更精准的引导。

为了验证每一个设计决策的价值,研究团队进行了精细的对照实验。从15亿参数的模型到300亿参数、激活30亿的混合专家模型,在多个数学推理任务上,BPCO相比强基线评论家方法取得了稳定提升,并在每个提示仅采样一个回答的情况下,达到甚至超过了依赖多采样的组相对优势方法。即使是基于评分的奖励,BPCO同样表现出色。

这项研究的有趣之处在于,它证明了一个精心设计的评论家,完全可以成为组相对优势估计的可靠替代方案。当别人需要成群结队的样本才能摸索出方向时,一个被调教得当的向导已足够独自领路。这或许提醒我们,在追求高性价比的AI训练道路上,深挖已有组件的潜力,有时比不断堆叠资源更具巧思。代码已公开,等待更多研究者来续写这个故事。

2026年8月25日

今年八月三十日,一颗耗资约四十三亿美元的太空之眼将从肯尼迪航天中心启程,搭乘SpaceX猎鹰重型火箭奔赴深空。它的名字叫南希·格蕾丝·罗曼太空望远镜,NASA以这位“哈勃之母”命名,寄托着下一代天文革命的厚望。如果说詹姆斯·韦布望远镜是天文界的“变焦镜头”,能窥见宇宙尽头最细微的光,那么罗曼望远镜就是一台“超广角相机”——它拥有与哈勃旗鼓相当的清晰度,视野却比哈勃大至少一百倍。同样一片天空,哈勃要一寸一寸地看,罗曼却能以快一千倍的速度横扫而过。

它要去看什么?首先是行星。罗曼预计能发现约十万颗凌星行星,还有一千多颗通过微引力透镜捕捉到的系外世界,那些寒冷、遥远、甚至无家可归的流浪行星,都可能被它一一收入眼底。它还要绘制超过十亿个星系的分布图,连起星系之间看不见的暗物质蛛网,同时追踪数万颗超新星爆发的踪迹。

这趟旅程的时间点耐人寻味。近年来,暗能量可能随时间变化的蛛丝马迹,与宇宙膨胀速率测量的冲突相互交织,成了当代宇宙学最大的谜题。罗曼望远镜的广域观测能力,恰好有望为这些争论提供规模空前的数据。它不追求单颗恒星的精致特写,而是要让罕见的天文现象变成海量的统计样本,把一扇窄窗推开成整片天空。

当罗曼望远镜在轨道上睁开眼睛,人类或许会第一次看清暗物质如何编织宇宙的骨架,也或许会在那些数据里找到改写教科书的新线索。每一次望向深空,都是在问同一件事:我们身处的这个宇宙,究竟藏着多少尚未言说的秘密?而罗曼,正准备给出它的回答。

2026年8月25日

曾经估值逼近千亿美元的快时尚巨头Shein,如今终于走向公开市场,却不得不接受一个残酷的现实:它的估值已经缩水到270亿美元,相比2022年巅峰时期的982亿美元,跌去了超过七成。这趟IPO之旅,像是一场从云端坠落的重力加速度。

Shein计划在香港上市,发行2.8亿股,发行价区间定在每股47.60至49.50港元,最高募资约17.7亿美元,预计9月1日开始交易。这个数字与三年前近千亿的估值相比,形成了刺眼的落差。曾经追捧它的投资者,如今要面对一个增速放缓、利润下滑、竞争加剧的“新”Shein。

故事要从几年前的疯狂说起。2022年,Shein凭借极致低价和社交媒体的病毒式传播,估值一度冲到982亿美元,成为全球最值钱的独角兽之一。然而热潮退去,现实接踵而来:增长放缓至仅1.1%,营业利润同比下降26%,美国取消了针对低价值包裹的关税豁免,让Shein赖以生存的“小额免税直邮”模式成本陡增,而拼多多旗下的Temu又成了它最凶猛的对手。三重打击之下,Shein的估值故事再也讲不回从前。

更值得玩味的是,当年以高估值入场的投资者们留了一手。Shein与这些股东签订了反稀释保护条款:如果IPO估值低于特定水平,公司需要补偿差额。如今,这一条款被触发,Shein需要向这些早期投资者支付最高35亿美元,几乎是本次IPO募资额的两倍。换句话说,这次上市的钱,还不够填上估值缩水带来的“赔偿坑”。为了给上市保驾护航,包括博裕资本、老虎环球和腾讯在内的机构承诺认购约3.83亿美元的股份,而Shein表示,募资所得约80%将用于技术和全球品牌建设。

这不仅仅是一次IPO,更是一次现实检验。过去,市场为Shein的“超高速增长”买单,相信它可以用疯狂扩张掩盖一切问题。但当增速神话破灭,公开市场的投资者开始追问:剥离了高增长光环,Shein的本质到底是什么?一家依赖低价、供应链效率和流量红利的电商公司,在面对关税壁垒、同质化竞争和日趋理性的资本市场时,它的真实价值有多大?这或许是所有“神话”公司最终都要面临的一课:潮水退去时,才知道谁在裸泳。而Shein的上市,正是这一课最生动的注脚。

2026年8月25日

一只小小的戒指,正在撬动健康科技领域的一桩大事。以睡眠追踪起家的Oura,据报道正筹备最早于九月登陆资本市场,目标募资高达30亿美元,估值有望突破160亿美元。这意味着一款曾经被视为小众的睡眠追踪设备,即将成为今年最受关注的消费健康IPO之一。

故事的起点并不复杂。Oura目前拥有900名员工,去年融资超过9亿美元,估值从2024年底的52亿美元翻倍至约110亿美元。而如今,新一轮上市传闻将这一数字再度推高。更令人瞩目的是其商业模式的加速运转:付费会员数量在两年内翻了四倍,本季度预计突破500万,且一年后续费率超过80%。这意味着用户不只是买一枚戒指,而是愿意长期为健康数据买单。

今年五月,Oura推出了更纤薄的Ring 5,搭载预测性健康软件,并高调进军女性健康、代谢追踪、AI健康教练以及医疗合作领域。这已远远超出最初“睡眠追踪器”的定位,而是一个完整健康数据平台的雏形。

资本市场对此类设备的热情正持续升温。今年三月,另一家可穿戴健康公司Whoop在加入激素和血液检测功能后,估值达到100亿美元。投资者越来越倾向于将这类设备视为个人健康平台,而非单纯的健身玩具。

Oura的上市计划,不仅是公司自身的里程碑,更预示着整个可穿戴健康行业正在经历定位的转变。从追踪睡眠,到预测疾病,再到连接医疗服务,一枚戒指的边界正被不断拓宽。

健康,正在从一次性的体检报告,变成指尖上持续跳动的数据流。而这场关于身体数据化的想象,或许才刚刚开始。

2026年8月25日

沉寂近两年后,苹果终于为Mac mini换上了新装。这一次,它没有把宝押在传统的性能数字上,而是把全部火力对准了一个意想不到的战场:让AI真正跑在你的桌面上,而不是云端。

新发布的Mac mini搭载了苹果首款2nm工艺的M6芯片,以及更强大的M5 Pro版本。起售价899美元,预购即刻开启,9月22日发货。苹果宣称,M6机型运行AI工作负载的速度最高提升4倍,而高配版本甚至能在本地完整运行更大的AI模型——无需联网,数据不出设备。

这并非一次简单的例行升级。过去两年里,Mac mini悄然成为开发者圈子的“隐藏神器”。它体型小巧,却凭借统一内存架构,让CPU和GPU共享高达64GB的内存池,使得在本地运行大模型成为可能。开发者们用它来跑AI推理、微调模型,避免每次都将任务交给云端,既省时又保护隐私。

苹果显然注意到了这股热潮。在这次发布会上,它罕见地将Mac mini称为“领先的常驻智能计算桌面”。所谓“常驻”,意味着这台小机器可以7×24小时待命,随时执行AI任务,成为个人AI代理的核心枢纽。

另一个耐人寻味的细节是,苹果即将首次在美国休斯顿生产这款Mac mini。在地缘政治与供应链重构的大背景下,这款小盒子不仅承载着AI平民化的野心,也成了苹果制造版图迁移的探路者。

当AI变得无处不在,最强大的算力或许不再藏在云里,而是静静躺在你桌角那个不起眼的方盒子里。Mac mini的新故事,才刚刚开始。

2026年8月25日

在网络安全的世界里,一场悄然发生的转变正在浮现。台湾研究机构TeamT5在一份最新报告中揭示,中国国家关联的黑客组织在将DeepSeek等开源AI模型整合进作战手册之后,攻击次数已经翻了一番多。这个数字背后,隐藏着一种更低的门槛和更隐蔽的威胁。

TeamT5发现,这些黑客组织尤其青睐DeepSeek,原因在于它相对强大,却几乎没有网络防护的“围栏”。相比之下,研究人员尚未在攻击中捕获更昂贵的模型如Kimi K3的身影。TeamT5首席分析师Charles Li直言:“DeepSeek是中国黑客的首选AI,因为它相对强大且网络防护门槛极低。”

报告中的细节令人警惕:这些被追踪的黑客组织利用DeepSeek编写入侵代码,突袭了一家台湾公司的电子邮件系统,甚至通过1000个地址精准绘制出攻击目标的地图。原本需要高级技术人才才能完成的复杂攻击,如今似乎被压缩成了几个简单的指令。

这一现象的意义远远超出了某个案例。早在今年5月,AI安全研究所就曾发出警告:AI的网络技能水平每隔几个月就会翻上一番。而现在,数字显示攻击总量正与AI的能力同步倍增。当舆论的目光聚焦于诸如Mythos这类顶级模型时,真正棘手的或许是那些廉价、可下载、又缺乏防护约束的开源模型——它们正在成为更难解决的安全难题。

低成本智能的普及,正在改变网络攻防的规则。当工具变得唾手可得,真正的防线或许不再只是技术本身,而是对风险的理解与准备。

2026年8月25日

在AI浪潮席卷全球的当下,大多数企业选择直接租用现成的模型API,但全球法律信息巨头汤森路透做出了一个截然不同的决定。这家坐拥Westlaw法律数据库和路透新闻社的行业巨擘,花了整整两年时间,投入四千万美元,用自家数十年积累的独家内容,训练出了一个完全属于自己的人工智能模型。而它背后的秘诀,竟然是中国阿里巴巴开源的Qwen模型——汤森路透的工程师们将这一开源底座重新改造,灌入自家海量法律与新闻数据,最终打磨出了名为Thompson的专属AI。

这个项目的成本结构相当值得玩味。四千万美元的总投入中,包含了人员薪资和算力开销,而最近一次完整的模型训练花费仅为四十五万美元。与那些动辄烧掉数亿美元的硅谷前沿大模型相比,这个数字小得惊人。更令人惊讶的是,在内部测试中,Thompson在特定领域的表现竟然超过了Claude Opus 4.8、Gemini 3.1 Pro和GPT-5.5这些市面上最顶尖的模型。虽然目前测试范围仅限于公司内部,但这一成绩已经足以让整个行业侧目。

汤森路透的首席技术官Joel Hron用了一个相当生动的比喻来解释为什么公司要费这么大劲自研AI。他说,租用别人的AI模型就像租房子,每个月按时交房租,看似省心省力,但到头来你什么资产都没有积累,更别提那些能随时间增值的无形资产。与之相反,自研模型就像买下属于自己的房产,每投入一分钱,都在构建属于公司的核心竞争力。这种从"租房"到"买房"的思维转变,折射出大型内容型企业对AI基础设施的战略焦虑。

值得注意的是,Thompson目前只完成了公司整体内容库不到百分之十的训练覆盖。公司计划向研究人员开放一个权重可公开访问的版本,这既是一种对技术社区的贡献,也是一种战略性的展示。四千万美元对普通企业来说或许是个天文数字,但对汤森路透这样此前长期依赖昂贵商业模型的大型公司而言,这笔钱不过相当于一年的API账单。它不是一个疯狂烧钱的登月计划,更像是一笔精打细算的长线投资。

当越来越多的企业手握海量独家知识库,同时看到开源模型性能日益强大、训练成本不断下降时,他们都会算出和汤森路透一样的数学题。与其永远按调用次数付费租别人家的模型,不如用越来越低的成本训练属于自己的专属智能。这一天可能不会太远,到那时,拥有知识的企业都会认真思考一个问题:既然数据和运算能力都在自己手里,为什么还要把价值的复利交给别人?汤森路透用四千万美元证明了这条路走得通,而这道算术题的答案,正在悄悄改变整个AI行业的游戏规则。

2026年8月25日

当不少人还在为地面AI数据中心的能耗和成本争论不休时,马斯克已经准备把服务器搬到太空轨道上。SpaceX近日宣布,将基于英伟达最新的Vera Rubin NVL72机架系统,打造名为Starmind的太空数据中心,而马斯克本人也罕见地透露了专为轨道环境“减肥”的定制版本细节。

这套系统最令人咋舌的地方在于,每一台NVL72机架都内置72颗芯片协同工作,相当于一台“巨型计算机”。按照英伟达的说法,单颗Vera Rubin芯片的算力最高可以达到此前主力产品H100的25倍。马斯克强调,太空版机架比常规硬件“明显更简单、成本更低、更致密、更轻便”,并针对轨道上的辐射和散热问题做了专门优化。

马斯克从不掩饰对Vera Rubin的偏爱,甚至称其为“最好的AI计算机”。据称,SpaceX计划让自家所有AI业务——从Grok大模型到星舰轨道舰队——全部跑在英伟达芯片上,彻底摆脱对其他云厂商的依赖。

当然,把算力搬上天绝不是一笔便宜的买卖。分析师粗略估算,目前轨道计算的整体成本比地面高出4倍以上。但马斯克对此不以为然,他坚信未来几年内这个数字会反转,太空计算将反超地面成为更具性价比的选择。

这一计划最耐人寻味的地方在于时间节点。就在今年早些时候,OpenAI首席执行官萨姆·奥特曼还公开吐槽太空数据中心“荒谬可笑”。然而,随着地面AI建设遭遇环保抗议、电力短缺和网络瓶颈等一系列负面情绪,轨道解决方案反而成了不少科技巨头暗中押注的方向。SpaceX的高调入场,让这场原本看似科幻的博弈,突然变得触手可及。

太空AI竞赛的脚步声已经越来越近,它究竟是资本泡沫的一次华丽冒险,还是人类算力版图的下一个边疆?当第一组机架在明年底升空时,答案或许才会真正开始揭晓。

2026年8月25日

在三维视觉领域,从稀疏视角或偏离视角渲染新视图,一直是个棘手的难题。无论是高斯泼溅、神经辐射场,还是传统网格与点云,当输入图像稀缺或目标视角偏离过远时,生成的画面总会出现破碎、模糊或结构畸变等伪影。此前的修复方案往往依赖扩散模型,但每一种三维表达都得定制专属架构,代价高昂且难以通用。

如今,一项名为FixAnything的新研究给出了一个出人意料的答案——它没有重新发明轮子,而是直接“借用”了一个现成的视频生成模型,只做极轻量的微调,就统一修复了四种主流三维表达方式的渲染伪影。其核心洞察非常巧妙:即便渲染出的画面充满噪点,这些图像序列依然保留了相机运动的轨迹和粗略的场景结构,于是清理伪影这件事,可以被重新理解为“视频到视频”的翻译任务——模型只需在原有视频生成能力的基础上,识别出哪些像素是“脏”的,并依据隐含的多视角先验把它们修好。

为了保证修复过程不破坏场景的真实结构,FixAnything引入了一个二值掩码,专门标记出干净、可靠的像素。这些像素就像是锚点,牢牢锁住高质量输入(比如训练视角)的信息,模型则在其余区域自由发挥。更重要的是,为了让修复结果不仅视觉好看,还能支撑后续的三维重建,研究者用运动恢复结构恢复出的相机位姿精度作为奖励信号,通过直接偏好优化来训练模型。这一招让FixAnything生成的新视图在三维空间里保持一致性,而不是仅仅在二维像素上“自圆其说”。

实验结果显示,FixAnything在四种截然不同的三维表示上都稳定提升了渲染质量,而且只需轻量微调就能完成。这意味着,一个通用的视频先验模型,足以替代多个针对特定表示精心设计的修复流水线。更妙的是,这个框架足够简洁,未来等到更强的视频生成模型问世,无需改动任何架构设计,即可无缝替换升级。

这一研究的启示或许在于:当某个领域的问题看似复杂多样时,换个视角看看相邻任务的强大模型,可能远比从零定制解决方案更高效。渲染伪影的修复,本质上不过是视频生成的一次“顺水推舟”——而这恰恰是通用先验的威力。

2026年8月25日

在漫长的智能体任务里,奖励信号常常像沙漠中的绿洲一样稀少。一种名为“基于提示的强化学习”的方法,巧妙地从专家轨迹中截取一段前缀,让智能体从离成功更近的位置开始探索,从而缓解稀疏奖励的难题。但这种方法的效果,极度依赖一个关键问题:到底该保留多长的专家轨迹作为提示?这个“引导深度”此前被当作一个固定数值处理——要么所有样本共用同一个值,忽视了任务之间的差异;要么对每个样本单独探测,代价却是要多跑好几轮完整的试错。

研究人员发现,有用的提示深度并非集中在一个孤立的“最优点”上,而是呈现出一个连续的“带”状分布——在这条带的中心附近,提示信息量最高,往两边衰减的趋势近似于高斯曲线。基于这一洞察,他们提出了一个名为Agent-G²的高斯引导框架。它不再为每个任务硬性指定一个深度,而是从任务难度和同类任务的波动程度中,在线估计出一个高斯分布的中心和宽度,每次都从这个分布中采样一个合适的深度。整个过程完全利用策略优化时已经收集到的轨迹数据,不需要额外的探测回合,也不需要训练任何深度预测器。

在ALFWorld和WebShop两个经典智能体环境中,基于Qwen2.5-1.5B和7B-Instruct模型,Agent-G²与最强的提示型、免提示型以及Aux-RL基线相比,在ALFWorld上分别领先2.3、3.9和7.4个百分点,而它的计算成本还不到逐样本探测方法的三分之一。

这项研究的价值,不仅在于给出了一个更高效的算法,更在于它改变了对“提示深度”这一核心变量的理解:它不是需要精确定位的单点,而是一片可以优雅地分布采样的区间。有时候,承认不确定性、用概率去把握它,比执着于寻找那个并不存在的“完美答案”更接近智慧。

2026年8月25日

想象一下,你面对一张360度全景照片,想轻轻点一下,就把画面里的某个物体挪个位置,比如把桌上的花瓶移到窗台。这在普通照片编辑器里或许不难,但全景图却是个大难题——它首尾相连、变形随纬度变化、场景全局连续,传统视角编辑器很难处理,用户也难以精确指定操作目标。Mover360正是为解决这一痛点而生。

这个由研究团队提出的新框架,核心能力是“物体平移”:在现有全景图中重新定位指定物体,同时支持参考图引导的“插入”和“移除”作为辅助任务。它的聪明之处在于把点、框、蒙版三种指定方式统一封装成一个固定提示词和一张紧凑的、与等距柱状投影对齐的指令图。最常用的是“点模式”:你只需单击一下物体,模型就能借助全景上下文和辅助深度信息,推断出合理的大小、支撑面和光照效果,完成移动。

结构上,Mover360是一个预训练扩散Transformer的轻量适配版本,不需要从头训练。为了生成配对训练数据,团队构建了一套基于虚幻引擎5的数据生成管线,支持表面感知的物体放置和随机化光照,产出了大规模配对数据,以及一个包含合成和真实全景图的双域基准数据集,三个任务都有真实标注。

在两类测试域和两种评估协议下,Mover360在重建保真度、语义一致性和分布质量上都超越了用于透视编辑、插入和修复的强基线方法。代码和基准数据集已公开。这项研究让全景图物体编辑第一次变得如此直观——或许未来,你在VR里随手一点,就能重新布置整个世界。这一切都在提醒我们,当工具学会理解空间的连续与变形,创作的边界也随之悄然拓宽。

2026年8月25日

想象一个机器人正在执行复杂的长期任务,比如整理房间或组装物品。它需要记住之前看过的东西,而不是每次重新观察。过去的做法往往在机器人的“眼睛”和“大脑”之间加一个额外的视觉语言模型来管理记忆,这就像给一个熟练的工人配了个只会传话的助理,反而拖慢了效率。有些方案简单地让机器人多看几帧历史画面,但如果这些画面选的时间不对,反而会让性能变差。

现在,研究者提出了一个叫UniMem的新框架,它把“高层记忆”和“低层控制”融合在同一个模型里,不再需要额外的记忆管家。它用一个“事件分类器”来决定什么时候该更新记忆,用一个“关键帧编码器”来存储空间位置信息,还用了“关键帧缓存”技巧,让机器人在行动时不会因为读取记忆而卡顿。

这个系统在五个模拟环境和四个真实硬件任务上都做了测试,专门考察顺序记忆和空间记忆能力。结果显示,UniMem在模拟环境中成功率高达93.4%,远高于固定间隔取帧的68.2%;在真实硬件上,它比传统的分层方法表现更好,成功率80.0%对43.5%,而且推理更快,训练流程也更简单,方便其他研究者直接使用。

让机器人记住真正重要的瞬间,而不是机械地回放所有画面,这或许才是通向更聪明、更高效智能体的关键一步。记忆不是越多越好,而是要看准时机、抓对重点。