AI 资讯早报 · 09-28
🤖 AI 资讯早报 · 09-28
本期脚本抓到 21 篇新文(机器之心 8 / 新智元 9 / 量子位 3 / 36氪 1);其中 新智元 9 篇经逐条按实体名回 grep 后确认全部已于 09-26 / 09-27 两期推送或已定性剔除(详见第二节);真正的新内容 = 机器之心 7 条 + 量子位 3 条 + 36氪 1 条 ⇒ 本期推送 10 条(必读 3 / 值得看 4 / 其他 3)。
🔥 必读
1️⃣ Plan Mode 才成标配,就有人宣布它「已死」
YC 孵化的 AI 编程公司 Nuanced 创始人兼 CEO Ayman Nadeem 在 HN 发帖《Plan mode is dead》并复盘自家产品为何失败——她是亲手把「计划」做成产品、又亲自推翻这条路的人。核心判断:规划(Planning)≠ 计划(Plan)。 计划模式过去承担两件事:给 Agent 足够精确的指令、帮人理解自己在建什么;随着模型能力提升,第一件事正在迅速过时,第二件事比以往更重要,但计划模式并不适合承担它——尤其在并行运行的 Agent 越来越多之后。失败归因四条:① 把规划和计划混为一谈,早期用户对结构化规格文档兴趣出乎意料地低;② 模型变强本身就是竞争——它们越来越擅长自主探索代码仓库并做出合理判断,模型每可靠地自行做出一个决定,就少有一个决定需要交给人;③ AI 生成的文字读起来很痛苦(节奏与过度结构化让阅读走神),补救方案 Spec Tour 只是又叠了一层复杂度,「如果必须再生成一份更短的摘要才能让完整文档可用,完整文档存在的意义是什么」;④ 把一个本应连续的过程拆成线性瀑布(聊天→消歧→生成规格→审查→修改→批准→实现→审查代码),界面要求用户过早地「结束思考」,而实现一旦开始,回到之前基于聊天的推理就像工作流倒退,「那条瀑布流无法逆行」。她提出新循环:理解 → 行动 → 检查 → 澄清 → 调整 → 再次行动——其中依然包含大量规划,只是规划不必呈现为一份名为「计划」的文档。作者观察到 Codex 里规划与执行的边界正在消失。
原文:机器之心 · Plan Mode 才成标配,就有人宣布它「已死」(编译自 Ayman Nadeem 博客)
2️⃣ EverMind 开源 Raven V0.2.0:Claude Code、Codex 组队干活,Harness 自己进化
RSI(递归自我改进)不应只发生在模型参数层——按互补学习系统理论(海马快速记经历 / 皮层缓慢沉淀能力),真正可以类比大脑的不是 LLM,而是整个 Agent:参数如同皮层(慢速巩固),由记忆、技能、提示、控制代码与决策策略构成的 Harness 才应像海马一样快速适应。EverMind 的 Raven V0.2.0 给出两个设计:① 为 RSI 而设计的 Harness 框架——把可被 AI 改写的部分分四类:Modules(playbook 与子 Harness 组合)、Code(如执行前检查等策略代码)、Prompt(系统提示与上岗手册)、Policy(工具开放与闸门配置),每类可独立替换改写;V0.2.0 已把运行时的 Curator 作为实验性功能开源,跑通「反馈 → 生成代码 → 校验 → 安装」闭环。② The Harness of Harnesses——把自家四个深度优化的子 Agent(Raven-Research / Code / Design / Oncall)与 Claude Code、Codex 等专业 Agent 统一编排,负责成员选择、任务拆解、依赖调度与结果交接;任务以 DAG 组织(无依赖分支并行、前置失败可跳过),EverOS 承接跨会话上下文与经验,支持跨模型跨框架组合,成员可经 ACP / CLI / OpenAI 兼容 API 接入。已有两条 RSI 实测:AI 改自身工作方式(Curator);AI 改 AI 研发——Raven RSI 在 nanochat 预训练实验中完成 7 轮、172 次训练,在相同单次训练预算下使 val_bpb 相对下降 5.8%。Raven 的发布本身也是自用案例:浏览器端物理小游戏、16 页产品介绍、中英文海报与 README 均由它自己产出。
原文:机器之心 · Claude Code、Codex 组队干活,Raven 新版本既做总调度,也让 Harness 持续进化
3️⃣ CoRL 2026|上海交大 LIFT:0 条带力数据预训练,让 VLA 学会力
上海交大卢策吾、汶川团队联合穹彻提出 LIFT(Late Reactive Injection of Force for VLA Post-Training),被 CoRL 2026 高分收录。问题:把书推上书架,视觉几乎不变,模型只能靠力推断任务状态(撞到旁边了吗/推到底了吗);但力与真实硬件强绑定,带力数据采集成本极高、难以规模化,而引入新模态又要面对「是否需重新预训练、会不会遗忘原有知识」。LIFT 的答案:保留预训练知识,仅通过在线后训练教模型感知力,并用力做高频反应式动作生成。实测三任务(vs 纯视觉后训练):叠毛巾 73.3 → 84.2、插书 36.7 → 58.3、汉诺塔圆环放置 26.7 → 56.7;仅需 20–30 条带力在线数据,且全程 0 条带力数据参与预训练。三个机制:① 复制预训练动作专家参数得到「反应式动作专家」,用因果交叉注意力感知最新时段力并高频调整动作,视觉/语言信息提前算好缓存,控制闭环从 1Hz 提到 10Hz;② 平移因果注意力掩码让两个动作专家的上下文 token 数值完全一致(初始化时 a=r),在数值层面保住先验;③ 两阶段训练(RoboPocket 纯视觉 → 在线人工纠正带力),对无力的纯视觉数据用力掩码截断梯度。结论还包括:接触一变动作要立马跟上(动作块内即可调整)、真实失误中才好学会力(在线采集让数据分布随模型更新)、学会力同时保留泛化(桌布/光照/物体变化后无明显下降)。论文指其思路对任何以 MoT 为基础架构的预训练模型理论上都适用,代码已开源。
原文:机器之心 · CoRL 2026|0 条带力数据预训练!上海交大卢策吾、汶川团队让 VLA 学会力 | arXiv 2607.14236 | 项目主页 | 代码
📌 值得看
4️⃣ 从 Computer-Use 到 Robot-Use:NUS Show-Harness 让 VLM 直接「玩转」真实机器人
新加坡国立大学 Show Lab 提出 Show-Harness(arXiv 2609.10522)。出发点不是再训一个更大的机器人策略,而是追问:如果给基础模型一个它能理解、组合并持续校正的物理接口,它已有的智能能否更直接地进入物理世界?对照 Computer-Use:电脑上 Agent 不需要输出底层驱动信号,面对的是 click / type / scroll 这类清晰、可组合、可从观察中验证的动作接口。Show-Harness 作为具身版 Harness,核心就是介于模型与机器人控制之间的语义动作接口:模型侧的动作是「相对当前视角前后/左右/上下移动、绕轴旋转、抓取、释放、结束」这类可读可推理的语义单元;机器人侧由各自的动作解释器转成受安全边界约束的本地控制命令 ⇒ 换具身平台只需换底层解释器,VLM 无需重学一套面向关节与坐标系的动作语言。它不是「一次性输出长计划再盲执行」,而是把多视角图像、本体状态、短期动作历史与任务描述组织成 observe → reason → act 闭环,执行后按新反馈继续修正。团队另建 GUMI:把同一套语义动作做成浏览器 GUI + 键盘快捷键——人类可键盘遥操(不需专用硬件)、Computer-Use agent 可像操作网页一样控机器人、VLM 则直接预测同一套语义动作;每步 (observation, action) 被记录成数据对。数据规模:真机经 GUMI 采集 164 条遥操数据、约 7.8K 决策步(Franka 101 条 / 5.0K 步,AgileX 63 条 / 2.8K 步);仿真 230 条、13.5K 步,覆盖 ManiSkill 与 RoboLab。
原文:机器之心 · 从 Computer-Use 到 Robot-Use:一套接口让 VLM 直接「玩转」真实机器人 | 项目主页
5️⃣ 拆解 DeepSeek-V4-Flash 的 mHC:四条残差流其实只用了两条
一篇针对 DeepSeek-V4-Flash 结构分析(arXiv 2609.05309)。mHC(Manifold-Constrained Hyper-Connections)把标准 Transformer 的单条残差流扩成四条并行流,且读写权重与残差混合矩阵逐 token 动态生成。核心结论:动态路由在实践中大幅退化为近似静态的路由。 ① 读写集中:同一 Attention/FFN 子层内,多数 token 共享同一条「主导流」(一致性读 0.871 / 写 0.905),有效流数量只有 1.998 / 1.775 条 —— 架构给了四条流,一次典型计算只把主要权重放在约两条上;② 深层混合坍缩:第 22–42 层的残差混合矩阵已接近单位矩阵(各流独立传递),浅层仍保留一定跨流混合;③ 表示不再趋同:四条流在第 1 层后即分化,全网络两两平均余弦相似度 0.404(区间 0.235–0.564),此后未再收敛。干预实验(推理时):去掉最弱读写路径 → PPL 最多 +2.7%、六任务平均分最多 -0.38 个百分点;把 22–42 层混合矩阵替换为单位矩阵 → PPL +1.9%、任务平均分基本不变(84.22 → 84.26);浅层直接换单位矩阵会崩(PPL +41.4%),但固定为 C4 校准集上的token 平均矩阵(保留混合结构、去掉逐 token 变化)仅 PPL +0.2%、六任务 -0.25 个百分点。
原文:机器之心 · DeepSeek mHC 多流残差坍塌失效了?
6️⃣ 匿名模型 Space Bunny(玉兔)冲上 OpenRouter / OpenCode 双榜第一,Coding 实测全记录
中秋节期间一个匿名模型 Space Bunny(量子位译作「玉兔」)经历「突然出现 → 热度飙升 → 冲上 OpenRouter 与 OpenCode 双榜调用日榜第一 → 讨论度飙升」。量子位从 OpenRouter 取 API、接入 DeepSeek Harness 后做了 4 个 case 的实测:① Three.js 立方体风格天坛(跑了约 1–2 小时,自行加入未要求的细节:底部控制条含夜/黎明/正午三个时刻与雨/烟天气开关,昼夜自行循环约 3.5 分钟,时辰文字随时间从子时走到亥时)——注意测完作者才发现 DSH「没长眼睛」,故再加一颗星;② 更适合中国宝宝体质的 macOS 闹钟(22 分 46 秒,响铃时霸占整屏,还加了「每月到底响不响」与 7:23 起床);③ 把 DSH 思考像字幕一样打在屏幕上的 mac app(首版不到 5 分钟,给出窗口拖不动/无最小化的问题后,在同时跑多个任务的前提下不到 15 分钟改好);④ 多模态:丢一段特斯拉擎天柱吧台营业视频让它描述。整体评价:首轮常有小 bug,但一轮交互基本能解决;只有一次它声称「全部检查通过」却说明 lint 仍有 33 个错误(指出后即改,Codex 复核无问题)。缓存命中率除一个任务外都在 95% 以上。社区口碑偏正(快、结果 ok、信息量大),主要槽点是思考太多。猜厂商环节众说纷纭(有按声音猜 OpenAI、按名字 “space” 猜 Grok 的)。
原文:量子位 · 又快又能打!匿名模型玉兔模型杀上双榜第一,Coding 实测全记录
7️⃣ 多伦多大学数学家 Daniel Litt:AI 攻下 100+ 难题之后,数学才刚开始
9 月 21 日 OpenAI 公告一款 8 月 28 日才开始训练的内部模型已攻克 100 多道世界级数学难题,数学圈情绪一路下沉。多伦多大学数学家 Daniel Litt 随后发博文《A beginning for mathematics》——几周前他刚做过《The End of Mathematics》的演讲,新文章给出明显更积极的版本。他直接接受激进前提:能在大部分数学任务上稳定超过人类的 AI 可能很快出现;真正要讨论的是数学这门职业该怎么改、学生怎么培养、人类数学家该把精力放哪。核心论证:数学界对「我们的目标是什么」从来没有共识;而「证明定理」并不是重点——给一台计算机或一只猴子 ZFC 公理再让它机械套用推理规则,也能源源不断产生定理,甚至迟早会撞上今天人类正在研究的开放问题。因此机器能生产我们想要的答案,却生产不了人对答案的理解;他判断我们可能站在数学大爆炸的前夜,但数学家不会变得多余、甚至可能更忙。他区分数学本身的价值与今天学术数学的制度形态:真正值得保留的是学习讨论班、走廊里碰出的想法、学生敲老师办公室讨论;期刊、同行评审、arXiv、署名则未必要一成不变。他还警告别把「模型当前还不会提好问题」赶紧变成新的评价标准——制度变得慢、模型升级得快,与其追着模型短板跑,不如直接考虑终局的取舍。教育上:博士论文同时承担「贡献新结果」与「证明作者掌握了这些数学」两个功能,而 AI 让后者失效(学生完全可以交出一篇自己都没读完的论文)⇒ 建议重新定义——成为某个重要而深刻问题上的真正专家,并有能力把理解传达给别人,学位授予更多依赖一次真正严格的答辩;很多传统的评价方式(报告、长讨论、面对面追问)反而重新升值。此外他指出「筛选什么数学值得研究」长期被低估——AI 眼前的「好题」其实都是人类提前挑出来的。
原文:机器之心 · OpenAI 横扫 100 多道世界难题,他却说:数学才刚开始
📄 其他
- 量子 AI 创业来了一支「清华梦之队」:费米宇宙 10 亿估值,用量子改造大模型底层(国内首家 Q4AI 创业,累计融资 1 亿元、投后估值约 10 亿;推出自称全球首个全链路量子增强大模型 FermiQLLM 1.0,基于 Qwen 基座,称推理性能 +15%、强化学习训练成本 -25%、MATH-500/GPQA-Diamond/BBH 综合 +10%~20%。⚠️ 厂商口径,未独立核实)
- 量子计算走上桌面!「小盒子」跑通端到端,数据全程不出门(上海交大团队孵化的酉术量子发布异构计算底座 UnitarySpark + 自然语言驱动的 UnitaryLab 2.5 公测版;核心是「薛定谔化」算法,把非酉微分方程问题转成酉演化;入选国家自然科学基金委「十四五」优秀成果选编)
- 商务部:中秋假期消费市场需求旺盛,具身智能机器人销售额增长 93.1%(全国重点零售和餐饮企业日均销售额比去年农历同期 +6.1%;智能穿戴 +1.2 倍、具身智能机器人 +93.1%、有机食品 +36.3%、户外运动装备 +30.2%;以旧换新两天惠及 190.7 万人次、带动 115.3 亿元)