🤖 AI 资讯早报 · 10-02

🔥 必读

1️⃣ 何恺明团队新作:看猫片就能学会 ARC 挑战(量子位 · 原文)

MIT 何恺明团队提出 NAT-ARC,一条纯视觉的 ARC 解题路线——不靠 LLM,改用 ImageNet 上的 MAE 自监督预训练(约 130 万张猫狗花草自然图像)初始化视觉编码器,再把这份「看世界」的能力迁移到抽象彩色格子推理上。流程三步:① ImageNet MAE 预训练 encoder;② 在 ARC 训练集离线训练编解码器;③ 测试时对每道题单独 LoRA 微调(每题仅 2–5 组示范)。为适配 64×64 的格子,丢掉了与原图尺寸绑定的 patch embedding 和位置编码,改用 2D RoPE。

成绩:最大单模型(huge,0.6B 参数)ARC-1 pass@2 达 63.4±0.7%,三策略集成 70.2±0.6%(总参数约 2B);对照专门微调的 The ARChitects 用 8B LLM 拿 71.6%——视觉路线以约 1/4 参数逼近专用 LLM。

最关键的发现是预训练打通了视觉路线的 scaling 瓶颈:无预训练时模型从 large 到 huge 反而掉点,加上预训练后才转为正收益。注意力可视化显示,ImageNet 预训练模型在从未见过的 ARC 格子上已能区分前景/背景、自动聚焦有意义图案——视觉世界与抽象世界在物体分组、图案匹配、区域分割上共享同一套表征。

2️⃣ 美国大厂嫌 OpenAI/Anthropic 太贵,转向中国开源模型(机器之心 · 原文)

据《金融时报》,企业 AI 正进入「模型分流」阶段:最难的任务留给最强前沿模型,大量重复、容错边界清晰的任务流向更便宜的开放权重模型——而当下开放权重市场里最活跃的一批玩家正来自中国(DeepSeek、智谱等)。

成本压力有具体数字:Tinder CTO 透露,按 1 月用量估算全年 AI 支出约 100 万美元,到 7 月已变成 1000 万美元/年(半年涨 10 倍),Tinder 已把部分普通用户请求转给开放权重模型;AT&T 每天处理约 450 亿 token,其中约 40% 的 AI 负载已跑在开放模型上,目标一年内提到 70%,并会用专有数据调优,部分任务效果可与闭源相当甚至更好。调用量上,今年 8 月 Vercel AI Gateway 处理的 token 中 56% 来自开放权重模型(去年 12 月仅 7%)。除成本外,数据主权与安全也是推手:Digital Realty 自建内部聊天系统,敏感数据只进私有基础设施上的模型。结论:OpenAI/Anthropic 的真正对手可能是「一张 Excel 表」——企业开始系统性拆任务、按成本分流。

3️⃣ 三星&上交 RoboICL:冻结 GPT-6 Astra,看一遍示范就会(机器之心 · 原文)

机器人学习通常要「收数据→训策略→部署」,RoboICL 走另一条路:冻结 GPT-6 Astra,不训练任务专用 VLA,只在推理时给模型少量示范 + 持续保留机器人刚执行过什么、环境发生了什么。

在 RoboDojo 30 项双臂操作任务(Open/Memory/Precision/Long-Horizon)上,30-task Overall 50.64,高于更新后最强对比方法 PhysicalRSI 的 39.56;相比官方零样本 GPT-6 Astra 控制器 RoboProbe,四类任务各提高约 20–27 个 progress-score points。无示范的 Open 类仅靠任务描述+在线经验就拿到 54.75 分。机制上,示范上下文(TRAIN)与交互记忆(LIVE)用同一种「观察→动作→执行回执→结果观察」语法,关键是 execution receipt——模型提出的动作不等于真实完成的动作,回执告诉模型实际执行了多少、哪些后缀没执行、是否被控制器中断。长任务记忆用 bounded anchored memory(固定保留最初交互+若干时间轴锚点+最近一次交互,省略处插 <TRAJECTORY_GAP>)。项目页公开 929 条可播放、可逐布局核查的三视角执行记录。

📌 值得看

4️⃣ 汽车之后,安徽开始让车企跨界「造人」(机器之心 · 原文)

安徽 9 月 28 日印发《关于推动机器人产业高质量发展的实施意见》,23 条里「深化车机协同发展」最受关注:鼓励车企把机器人当「第二增长曲线」,并开放研发平台、人才与零部件代加工/试制/检测。背景是安徽 2025 年汽车产量 368.65 万辆、新能源车 179.41 万辆双双全国第一,而人形机器人产量 2025 年仅 700 余台、今年上半年已超 2600 台。两个样本:奇瑞孵化墨甲机器人(称汽车与机器人约 70% 技术可共享,2026 上半年销量超 590 台、覆盖 60+ 国家);零部件企业中鼎股份联合逐际动力等设合资公司,首台全尺寸人形机器人下线、规划 3000 台年产能。作者提醒:车机协同 ≠ 直接拆汽车零件——关节减速器、多维力传感器等仍需重新设计,真正能迁移的是研发、工艺与量产能力。

5️⃣ openJiuwen WorkSwarm:全双工多模态,边聊边办事(机器之心 · 原文)

openJiuwen 是华为 2012 实验室、华为云等联合构建的开源 AI Agent 平台,WorkSwarm 是其办公编码统一工作台,把实时音视频交互与 Core Agent 执行接入同一任务:用户可展示画面、随时插话打断播报,复杂任务交给后台 Core Agent 继续查资料、调工具——搜索在后台跑,对话在前台继续。任务队列支持排序、置顶、打断;音视频连接与后台任务分别管理(关掉音视频,已提交任务仍继续跑)。支持 Qwen Omni / JoyAI(ASR+LLM+TTS 拼接)协议,也可在昇腾 NPU 上基于 vLLM-Omni 部署,提供 Windows/Mac/HarmonyOS 一键安装包。⚠️ 华为生态首发稿,偏厂商口径。

6️⃣ EMNLP 2026:让报告「数字抄对了、意思却说歪」不再发生(机器之心 · 原文)

论文《Provenance Before Prose: Claim-Locked Reporting for Statistical Text Generation》(EMNLP 2026 Main)针对「统计主张失真」:数字没变,但比较方向、适用条件或结论强度被改写(如把 85.9% 写成「略低于」79.5%)。作者指出 FActScore 与 SelfCheckGPT 都有盲区——前者只要数字有证据就给分(方向写反也满分),后者只查采样一致性(每次都犯同样的错也能高分)。方法 Claim-Locked Reporting 先锁定 claim 再生成正文,三步:① 把统计结果整成带证据/数字/方向/最强措辞的「主张账本」,缺证据不进账本;② 风险审计器查是否说过头,策略层只能把措辞往弱压、不能往强推;③ 数字/表格/方向由代码呈现,LLM 只在约束下写衔接段。效果:fMRI 报告跨次生成数值复现率 61.1%→98.5%、临床报告 79.5%→100%;临床试验盲审中基线方向反转率 5.6%–14.3%,该方法为零;DeepSeek 成本实验 token 与耗时中位数最低。