本期深读 5 篇(抓正文通读后撰写概述),另附全量抓取清单 55 篇。

🔥 必读

1. 谷歌 Dream-RSI:不改编权重,靠「做梦」实现自我进化

谷歌联合 DeepMind、马里兰大学等发布 Dream-RSI:自我进化的对象不是模型权重,而是一段决定「怎么探索」的策略代码。做法是把每次真实搜索存成「发现树」(含快照、产物、评分),评估新策略时在树上回放历史、不再跑代码,论文称之为「做梦」。实测:Lasso 求解器任务主流进化搜索须跑 51200 代,Dream-RSI 仅 317 次调用即追平;圆填充追平 AlphaEvolve V2;GPU 内核优化生成次数降 2.43 倍。底层权重未改,Gemini 3.1 Pro/3.7 Flash 均可套用。人给 AI 指方向反而更差。

原文:新智元 · 震撼,谷歌破解了 RSI?AI 靠「做梦」学会无限进化 | 论文:arXiv:2609.14858

2. Figure Helix 2.5:机器人零样本进 30 个陌生家庭干活

Figure AI 9 月 17 日发布 Helix 2.5,在 30 个从未打交道的湾区民宅做零样本盲测:不采集数据、不做微调,420 次试验成功 237 次,成功率 56%;对照组(同硬件同数据、无 Index 预训练)仅 9%。关键是缩放规律——预训练数据每翻倍,动作预测误差规律性下降,用小规模实验预测最大规模的偏差仅 0.54%。Index 上线即有 26.4 万下载、覆盖 108 国、1600 万条视频,12 个月内拟投超 10 亿美元。全程不遥操。

原文:爱范儿 · Figure 让机器人第一次「空手」进陌生人家

3. Claude Code 大重构:一人指挥一队 Agent

Claude Code Projects 全面重构:核心是 Coordinator 协调器——开发者下达高阶目标(如「把鉴权模块重构为 OAuth 2.0」),协调器自动拆解子任务,调度多个云端 Claude Code 实例各拉独立分支并行开发、自动提 PR;新增共享记忆同步技术规范与架构决策,全程可异步。Anthropic 同批公布:平台常态并发 3 万个 AI Agent、单月决策超 10 亿次,AI 主导的 AL4 级研发占比达 26%(今年 2 月不足 1%),超 90% 流程处于 AL3。

原文:量子位 · 刚刚,Claude Code 大重构!内部 3 万 Agent 管理技术免费开放 | 同源报道:InfoQ · Claude「主导」Anthropic 26% 的 AI 研发、3 万 Agent 同时运行

📌 值得看

4. 宇树 UnifoLM-WLA-1.0:6B 具身大脑拿 7 项开源 SOTA

6B 参数、约 2500 小时真机数据,单模型覆盖 64 项任务(桌面 54+全身 10),支持二指夹爪与多种灵巧手。具身推理底座基于 Qwen3-VL-4B、500 万条样本训练,16 项基准中 7 项领先开源模型;空间理解反超 GPT-6 Astra:Where2Place 82.0 vs 69.0、EmbSpatial 88.9 vs 83.3。模型、代码、数据集将开放。

原文:智东西 · 不只强在硬件!宇树 6B 具身大脑拿下 7 项开源 SOTA,对标 GPT-6 Astra

5. 阿里达摩院 RADAR 登 Science:一个模型看 146 种腹部病

全球首个专家级通用腹部影像 AI,覆盖 18 种解剖结构、146 种病。用视觉-语言对比学习直接从 CT 与诊断报告学习,免逐片标注;核心是「器官级细粒度对齐」。内部 3.9 万例 AUC 0.913、8 家外部医院 2.4 万例 0.895、急诊 2.7 万例 0.904;26 名放射科医生对比中准确率超 23 人,医生+AI 阅片时间减 30% 以上。模型代码框架全开源。

原文:量子位 · AGI 最难一战,竟在医院!中国 AI 登上 Science

📄 其他