AI 资讯早报 · 10-09
🤖 AI 资讯早报 · 10-09
🔥 必读
1. 李飞飞团队发布 OpenWAM:世界动作模型的「公共试验台」,换个底座机器人成功率飙升
- 事实(10-08):斯坦福李飞飞、吴佳俊(Jiajun Wu)、Ehsan Adeli 团队发布开放世界动作建模框架 OpenWAM(arXiv 2610.07922,项目页 openwam.stanford.edu)。它要回答一个领域痛点:世界动作模型(WAM)论文以周为单位涌现,但各家同时换了视频骨干、数据、交互方式与推理流程,谁也说不清究竟是哪个设计带来提升。做法:从阿里开源视频模型 Wan2.2-5B 出发,在约 334 万条机器人 + 人类交互视频(名义约 1.46 万小时、全程不用动作标签)上做「因果化」预训练——每个视频块只能看到当前及之前内容,像直播而非照剧本,正是机器人逐步行动所需;再用共享 Mixture-of-Transformers 架构把 5B 视频专家与 2B 动作专家拼在一起。在此底座上定义四种「谁先起奏」的交互程序(VTA 先想后动 / ATV 先动后想 / Joint 同时 / Decoupled 互不可见)与两种局部动力学程序(IDM/FDM)。
- 数据:LIBERO 四个子集上 VTA 平均成功率 98.6%(略高于已报告的 LingBot-VA 98.5%、π0.5 96.9%);真机两台 Franka FR3 机械臂做烤面包、还原魔方最后一层、按色分拣杯,VTA / Joint 平均 92.1% / 91.9%。消融最能说明底座分量:其他条件不变,用原版 Wan2.2 初始化时 LIBERO-Long 仅 68.4%,换成因果化机器人视频底座后升至 97.8%(+29.4 个百分点)。
- 最关键的组件迁移:团队把逆向动力学模型(IDM,即「动作翻译器」)拆出独立训练:输入当前画面 + 本体状态 + 想象出的未来视频,输出具体动作;为此构建 LIBERO-Long-CF——恢复示范状态后执行被改动过的动作(停止 / 反向 / 加噪 / 改夹爪时机),得到 32000 片段、约 410 万条控制记录,是原始示范的 29.7 倍。结果:冻结 IDM 迁移到 4 个新任务时,示范 + 反事实训练的局部 IDM 成功率 84.0%,而接收完整上下文的 IDM 仅 47.0%、只用示范训练的仅 21.5% ⇒「只看局部 + 见过足够多样的后果」缺一不可。
- ⚠️ 限定:作者明确说明,目标任务上的视频预测器用含动作标签的示范微调过,并非零样本迁移;组件复用主要在仿真中验证,真机「故意做错」成本高得多;FDM 也只覆盖短时程预测。⚠️ 另注:本论文与 09-25 早报推过的另一篇同名 OpenWAM(arXiv 2609.07398,新加坡国立 / 清华 / 北大等七校,作者含邵林、赵行、董豪、张尚航)并非同一篇——同名不同文,本条第 1 次推送。
原文:机器之心 · 李飞飞团队造了个世界动作模型:换个底座,机器人成功率直接飙升
2. 谷歌云推出通用企业智能代理 Gemini:可调内部工具、支持「同事代理」
- 事实(10-08):谷歌云宣布推出面向企业工作的通用智能代理 Gemini——可通过单一界面处理问答、知识工作、内容创作以及代码编写与运行等任务,并能调用企业内部工具和数据,自主完成用户设定的目标。它可直接集成 Gmail、Drive、Docs、Sheets、Slides、Chat 和 Calendar,并支持创建具有独立身份和权限的「同事代理」(colleague agents)。同时推出面向数据分析、数据工程和机器学习的新技能,并首次针对金融服务与法律行业提供专业化版本。
- 看点:Gemini 还支持在谷歌自有模型及 Anthropic 的 Claude 等不同模型间动态选择(多模型路由),并提供权限管理、审计、沙箱及实时支出上限等企业级控制功能。这是大厂把「Agent 从 demo 推向企业生产」的又一步——与 OpenAI 的 ChatGPT Work / Decisions API 路线正面竞争,也把「模型可换」写进产品设计。⚠️ 为厂商发布口径,实际落地效果尚无独立评测。
原文:36氪 · 谷歌云推出Gemini智能代理,可自主执行企业多步骤任务
3. ChatGPT 踢到铁板:PaperBenchX 量出「AI 科学家」的距离,最强模型论文复现率仅 13.98%
- 事实(10-08):UniPat AI 发布 PaperBenchX——国际上第一个多学科端到端论文结果复现基准:从 93 篇研究论文构建 93 个复现任务,横跨电磁、光子、化学、材料、生物、机器人等 12 个研究方向、10 种领域原生科学环境,含 3168 条专家校验的评分项。规则:Agent 拿到一篇真实论文、一个装好对应科学软件的容器环境、一份「要复现哪部分」的任务书,交回一份可执行复现工作流;评分标准、容差、参考答案全部对 Agent 隐藏,交卷后删掉全部输出、断开网络、隔离环境重跑,只认重放产物——相当于给科学仿真搭的一道「Lean」。
- 结果:在 93 个任务里,表现最强的 GPT-6 Astra 完整复现率仅 13.98%。分阶段得分看卡点:建模 62.70% / 执行 61.84% / 验证仅 42.80%——Agent 能完成部分建模、调用求解器、产出结果文件,但很难串成一次完整可信的复现。另两条反直觉发现:交互轮数越多分数不一定越高(长轨迹常是反复试错/故障恢复/在错误设定上继续算);前期决策决定后续价值(Fable 5 把 37.1% 时间用于论文重建与代码实现,前期投入最高,反而用更少交互拿到接近最优分)。
- 意义:承接近期「OpenAI 88 小时解 N-S / 722 篇数学手稿」主线——AI 能解顶级难题,却仍难可靠复现一篇已发表工作。团队已开源 12 个代表性任务,另维护 81 个封闭测试任务以维持区分度。
原文:量子位 · ChatGPT踢到铁板了!能破解千禧数学难题,但论文复现率低至13.98%?
📌 值得看
4. Vidu Q4 Preview:0.09 元/秒起的「视频 DeepSeek 时刻」,生数的世界模型底气
- 事实(10-08):生数科技发布 Vidu Q4 Preview(面向创作者的首个预览版),重点在三项能力:更细腻的人物演绎、更有张力的镜头语言、更具冲击力的复杂视效;支持最多 15 张参考图、3 段参考音频、2K/4K 输出。价格首发 0.09 元/秒起(同预算最高可生成 5 倍内容)。效率上,图生视频速度约为同类模型的 2 倍、5 秒视频最快约 110 秒完成。
- 技术底气:生数把自身定位为通用世界模型公司,五级路线中 Vidu 对应第一级「生成世界」,Vidu S 系列加实时交互、Motus/Motubrain 延伸至物理行动。低价背后是效率优化链:SageAttention(低比特注意力)、SLA(稀疏 + 线性注意力)、TurboDiffusion(注意力加速 + 少步生成 + 量化)等,已在 Vidu S1 实时视频生成中产品化。⚠️ 目前仅为正式版上线前的提前亮相,稳定性、控制力与创作上限待正式版验证。
原文:机器之心 · 视频DeepSeek时刻?Vidu Q4 Preview背后的效率账与世界模型底气
5. 联想 YOGA Pro 15 开启盲约:搭载英伟达 RTX Spark N1X,端侧跑通超千亿参数
- 事实(10-08):联想 YOGA Pro 15 RTX Spark 于 10-08 9:00 开启全网盲约,号称全球首批搭载英伟达 RTX Spark N1X 超级芯片的本地智能体 AIPC。芯片集成最高 20 核 Grace CPU + 6144 核 Blackwell RTX GPU、1 Petaflop FP4、最高 128GB 统一内存 + 2TB 存储;官方称本地可跑超千亿参数大模型,出厂自带 35B 本地模型开箱即用。搭载联想「天禧 AI」智能体,支持本地 / 标准模式切换,主打「断网即用、零 Token 成本、数据留存本地」。
- 看点:⚠️ 与 10-08 晚报 值得看 #4(微软 Surface Laptop Ultra 首发 RTX Spark、2599 美元)同属 RTX Spark 首发阵营,本条为联想侧产品,故降档为「值得看」;两篇为不同厂商产品、非同一事件。
原文:智东西 · 搭载英伟达RTX Spark N1X超级芯片:联想YOGA Pro 15开启盲约,端侧跑通超千亿参数大模型
📄 其他
- 浪子回头!Manus 重启北京办公室大举招聘(招聘官网共 17 个岗位:16 全职 + 1 实习,含 Agent Harness / Agent 评测 / LLM 算法等;⚠️ 融资部分 = 10-08 晚报 值得看 #5,本条仅取「回国组建团队」新进展)
- 英伟达支持的 AI 制药公司 Iambic 寻求美国上市,拟融资至多 1.59 亿美元
- 软银、Grab 与砂拉越石油签署 AI 基础设施框架协定
- 格芯与台积电签署 20 亿美元硅中介层协议,初始期限 5 年
- 老虎环球押注 OpenAI 浮盈或达 50 亿美元