🤖 AI 资讯早报 · 10-03

🔥 必读

1. AIBuildAI 开源 PostTrain Agent:让 AI 自己给大模型做后训练,登顶 PostTrainBench

AIBuildAI 团队开源 PostTrain Agent——一个用于自主后训练大语言模型的递归自我改进(RSI)Agent,代码、知识库、技术报告全部开放。它把「把基座模型变成会指令/推理/工具调用的模型」这件事整个交给 AI:输入基座模型、目标能力和算力预算,Agent 自己设计后训练算法、收集整理数据、写代码、跑实验、迭代改进,全程无人介入。在 PostTrainBench(ICML 2026, Rank et al.;单张 H100、10 小时内自主完成后训练,产出 checkpoint 在 Agent 看不到的评测集上打分,覆盖 4 个基座模型、7 类任务)上以 46.6 分排名第一,超过所有前沿模型与 Agent 系统,逼近人类专家(51.1)。机制上有两处关键改动:① 知识系统——一个走 MCP 的远程检索库,含工作流(13 步 / 34 文件)、方法(111 文件)、数据集(215 文件)、框架(108 文件)四个子库,每条声明带 URL 与日期、评测基准文件一律剔除,实验员按需检索、跑完回写观察;② 元搜索——让搜索拓扑本身成为 Agent 的输出(元 Agent 先调研任务、再写出搜索程序),从而摆脱此前「线性搜索」与「整实验树搜索」的限制(前者一遇死路耗尽预算,后者表达不了「生成数据」这类无分数节点与 fan-in 合并)。

2. 影身智能:比 World Labs 早两年押注原生 4D,已在制鞋工厂跑起机器人

切入点是 AMD 9 月 28 日以约 82 亿美元全股票收购 World Labs(李飞飞出任执行副总裁兼首席科学家),及其新发布的空间世界模型 Atlas。文章主角是中国的 影身智能(2024 年成立,创始人兼 CEO 闵伟:清华工学博士、前阿里本地生活机器人团队负责人),它比 Atlas 早两年走原生 4D 世界模型路线。核心主张:现实物理世界是四维的(3D 空间 + 时间),而 LLM 处理文字、视频模型处理二维像素,都是对物理世界的「降维投影」,会丢失空间结构、遮挡、接触与柔性形变;4D 高斯数据用带位置/尺度/方向/透明度/外观的高斯基元描述物体的时空分布,再在此基础上做理解、生成与预测。文章把行业路线归为四类(LLM 向上延伸 / 视频生成 / 隐空间推理 / 原生 4D),并指出前三条的固有局限。工程侧:产品「影身 360」把 4D 数据的采集门槛从行业早期的约 80 台摄像头降到 4–6 台消费级摄像头 + 单块消费级 GPU 实时生成,4D 数据集已达万小时量级;9 月服贸会展示 6 摄像头 4D 直播;已在福建晋江制鞋工厂落地,拿到 2 亿元订单、排产机器人达数千台。⚠️ 订单规模、部署数量均为公司自述,未经独立核实。

3. LegoFlow:华为联合港中文、港科大,让智能体自主跑完代码数据「造题—答题—改卷—训练—评测」全流程

华为、香港中文大学、香港科技大学联合推出 LegoFlow——一个交互式代码数据工程框架,把从仓库/PR 收集、任务验证、轨迹推理到训练评测的漫长流水线全部自动化,每个环节封装为标准插件技能,Claude Code、Codex 等编码智能体可直接调用。架构分五个 block(Root 协调、Curator 造题、Tracer 生成轨迹、Trainer 微调、Evaluator 评测),设计理念是「每个 block 像一位职责清晰的工程师」。数据侧:LegoFlow-SWE 从 1200 万个候选 PR 中筛出 5000 个已验证任务(覆盖 8 种语言、20 个标签,仅占原始池 0.0417%),并放出 2780 条验证成功的高质量轨迹。效果:仅用 1000 条轨迹微调 Qwen3.5-35B-A3B-Base,在 SWE-bench Verified / Pro / Multilingual 上分别达 70.2% / 48.8% / 57.0%;更值得注意的是递归自我改进——在极少人工设定下让智能体跑完整流程、评估并调整策略,两轮迭代后同一基座在 SWE-bench Verified 上从 7.6% 提升至 64.4%。

📌 值得看

4. 淘宝 TaoMate-H3 开源:三步生成「分钟级」音视频连续创作

阿里 TaoLive AIGC 团队发布并开源(GitHub + Hugging Face)TaoMate-H3 音视频联合流式生成模型,基于 MiniMax H3,把三步 LoRA 推理与自回归生成结合:以小片段为单位推进、每片段仅三步去噪,无需等整段视频完成,显著缩短首段产出时间,支持分钟级连续续写与 480p/768p/1080p 横竖屏输出。关键技术包括持续更新的音视频 KV 缓存、全局连续 RoPE 位置编码(跨提示词衔接)、分段音频引导,以及 Self Forcing 自回归训练(缓解训练与推理分布差异)。演示覆盖电商讲解、人物演唱、动漫对白与环境特效等场景。

5. 生物医学基础模型:榜单越来越漂亮,但我们真的知道它学会了什么吗?

德国海森堡大学、纽约大学等团队 2026 年 9 月 4 日在 《Nature Methods》发表「Benchmarking biomedical foundation models」,讨论生物医学基础模型的评估困境:传统「选几个任务、算几个指标、排一个排行榜」对这类具有广泛适应能力的系统已远远不够(「只挑几个任务就像拿地图上几个城市代表整个大陆」)。文章以单细胞基础模型(scFMs)为例,强调评估应覆盖不同技术平台、物种、器官、疾病环境与扰动条件;扰动预测尤其有价值,因为它触及的是基因调控与细胞响应背后的机制而非表型。一个反直觉案例:在预训练的 scGPT 上嵌套随机森林做扰动探测,反而优于直接微调 scGPT。论文建议 benchmark 不只给一个数字,而应加入简单基线、null model 与 upper-bound reference,并用 ablation 检验模型究竟依赖哪些数据与组件;还讨论了 agentic systems 需考虑中间步骤部分得分、可信度与 alignment(是否绕过测试规则)。最后倡议建立跨领域、持续更新的 benchmark 生态,并介绍了新启动的 BEACON(Benchmarking, Evaluation and assessment CONsortium)。