AI 资讯晚报 · 10-09
🤖 AI 资讯晚报 · 10-09
🔥 必读
1️⃣ 西湖机器人 WR1:全球首次人形机器人灵巧手自主叠衣
西湖机器人(西湖大学 AI 与机器人领域首个成果转化项目)发布通用大脑 WR1,用自研「通用大小脑双预训练架构」把认知决策与全身运动控制端到端打通:通用大脑融合世界模型(WM)与 VLA,直接输出含移动位移、躯干姿态、灵巧手操作的完整全身动作序列;通用动作专家 GAE 作为「运动小脑」承接落地,配长短时运动状态回顾 + 实时动作分块衔接 + 前瞻延迟补偿。它针对行业痛点「站定才能干活」——公开演示跑通厨房→客厅→卧室跨空间长程家务链(冰箱取玉米、U 型转身送空气炸锅、下蹲拖筐收纳玩偶、卧室整被),全程无停顿、无场景切换重启;并完成全球首次由人形机器人灵巧手完整折叠衣物的公开公演(此前其机械臂平台叠衣为 36 秒 / 100% 成功率)。⚠️ 均为厂商公开演示口径,尚无第三方评测。
原文:机器之心 · 全球首次!人形机器人用灵巧手自主叠衣,西湖机器人做到了
2️⃣ 清华星动纪元 VPP2 登顶 RoboDojo 世界动作模型全球第一
清华唯一持股的具身公司星动纪元自研世界动作模型 VPP2 登顶 RoboDojo 仿真榜:平均成功率 32.26%、平均得分 39.26,两项均列第一,领先 GPT-6-Astra(22.48% / 28.97)约 9.8 个百分点 / 10.3 分,并在泛化、精细操作、记忆三个维度均第一。真机 ALOHA 双臂 10 类零样本任务平均成功率 58.5%(高于 Physical Intelligence π0.5 的 40%),拿下 9 类最佳。技术路线是不把「视频、动作一锅炖」,而是三阶段解耦(事件级视频继续预训练 → 固定时长视频后训练与蒸馏 → 动作专家训练),让「预测能泛化」与「行动能泛化」同时提升;且未加额外数据、未用 Agent RSI 等增强手段,性能来自预训练基座。⚠️ 主要成绩为仿真榜单 + 厂商自测真机口径。
原文:量子位 · 清华具身模型登顶全球第一!突围GPT-6、英伟达,不靠外挂和额外数据
3️⃣ 陶哲轩转发抵制声明,数学界和 OpenAI 彻底撕破脸
因 OpenAI 一次公开 722 篇数学手稿,人类数学协会(成立于 2026-08,约 809 名会员,多数为研究生)发声明呼吁全体数学家抵制 OpenAI,称「数学家们并没有要求这项工作」。菲尔兹奖得主陶哲轩在个人博客转载(网友误传为其领衔,实际他不在该协会名单内);而该声明本身被 AI 检测工具 Pangram 判为100% 由 AI 生成,引来群嘲。争议焦点:722 篇中仅 162 篇主要结果经计算机验证,OpenAI 次日撤回 3 篇(一处符号错误使核心论证失效、连带两篇)、修订 14 篇,官方 README 承认部分未形式化结果可能有问题;另一侧,OpenAI 开发者社区有人重跑准黎曼与矩阵乘法结果的 Lean 检查并通过。分歧实质是「效率 vs 以人类理解为中心」,以及一家公司是否在重设数学研究的节奏、规则与评价标准。
原文:爱范儿 · 陶哲轩转发抵制声明,数学界和OpenAI彻底撕破脸
📌 值得看
4️⃣ Anthropic 发布 OSS Scanner:免费最强模型给开源项目定期扫漏洞
Anthropic 推出自愿加入型漏洞扫描器 OSS Scanner,用自家最强模型(含 Claude Mythos)免费为开源项目定期安全扫描,输出完全由模型生成、不经人工审核,报告直接发维护者。过去 6 个月扫出超 2.9 万个候选漏洞,人工仅验证约 6000 个,已直接发送近 5000 份未验证报告。抽检 48 个项目的 97 个严重 / 高危漏洞中 85 个(88%) 达到对外报告标准(仅 1 例误报)。PostgreSQL、OpenSSL、wolfSSL 等维护者反馈积极——wolfSSL 74 份报告 72 份有效、5 个成 CVE。争议在于大量未验证报告被批量发出,是「快车道」还是「噪音场」尚待观察。⚠️ 为 Anthropic 自述口径。
原文:智东西 · 一个月扫出近5000漏洞,Anthropic发布OSS Scanner
5️⃣ OpenAI 发布 GPT-6.1 Sol Ultrafast:快 8 倍、贵 6 倍,社区口碑崩
在「连续 28 天发布或重置」第 4 天,OpenAI 推出 GPT-6.1 Sol 的 Ultrafast(极速)模式,速度最高为标准版 8 倍、智能接近 Astra;GPT-6.1 Sol 现按速度三档售卖,Ultrafast 每百万 Token 输入 12 / 输出 60 美元(标准版 6 倍)。但社区几乎一边倒吐槽:Sol 标准版本身极慢(Artificial Analysis 实测 Max 推理仅 54.9 tokens/s,开发者反映低至 20–27),Ultrafast 又未向 Pro 200 套餐开放,被批「变相涨价 / 卖速度补丁」。同期 Codex 上线实时纠偏,允许在模型执行任务过程中介入调整方向。
原文:智东西 · GPT-6.1 Sol极速版快8倍,但依然口碑秒崩?
6️⃣ 字节 Seed 找到 DeepSeek「时强时弱」的原因:KV Cache 相位敏感性
字节 Seed 团队发现,DeepSeek-V4 表现会随信息的输入位置每 4 个 Token 周期性起伏:128K 长上下文「大海捞针」中换个位置,检索准确率最大差 40.2 个百分点(V4-Pro-Base 34.8),后训练后收窄(V4.1-Flash 降至 6.1),但周期性仍在。根源指向 DeepSeek-V4 采用的分块 KV Cache 压缩:同一信息相对压缩窗口边界的位置(论文称 Phase / 相位)不同,检索能力就有系统性差异,波动周期恰等于压缩步长(V4 为 4、V4.1 为 2)。团队从头训练的对照模型复现该现象,全注意力基线则无——说明是分块压缩设计本身引入的周期弱点。
7️⃣ OpenAI 带头「扫货」:今年 195 起 AI 并购,最大一笔 110 亿元
据 Crunchbase,今年截至 9 月 29 日,风投系 AI 公司对 AI 初创的收购已达 195 起、比 2025 全年高出 14%;收购方数量仅增 2%,说明是同一批公司在更频繁出手。OpenAI 三年完成 20 笔 AI 收购(今年 10 笔)最活跃,Anthropic 与法律 AI 公司 Legora 各 5 笔、Harvey 4 笔、Sierra / Cursor 各 3 笔。195 笔中仅 12 笔披露金额,最大一笔为欧洲 AI 基础设施厂商 Nscale 以 16.5 亿美元(约 110 亿元)收购 Anyscale。国内动作较少(公开的如智谱收购中科加禾约 60% 股权)。⚠️ 统计不含大厂发起的收购。
原文:智东西 · OpenAI带头“扫货”:195起AI并购,最大一笔110亿
8️⃣ 扩散智能 DiffuSpace 数亿元融资:全球扩散语言模型最大融资
深圳大模型厂商扩散智能(DiffuSpace)连续完成两轮、总额数亿元人民币融资,创下全球扩散语言模型(dLLM)最大规模融资纪录:经纬创投、顺为资本、君联资本联合领投,中科创星、华为哈勃、地平线等跟投。团队由港大 NLP 实验室联合主管孔令鹏及其博士生龚珊三、叶佳成于 2026 年创立,是全球最早探索 dLLM 的团队之一(2022 年 DiffuSeq 开创条件式文本扩散、2025 年 Dream 7B 首次全面超越同规模自回归模型并在规划能力上比肩 671B 的 DeepSeek-V3、HF 下载超 250 万)。dLLM 采用全局并行扩散生成、天然适配端侧 Agent;资金投向模型训练 / 垂直场景 / 基础设施,10 月将发布并开源新一代更大参数 dLLM。
原文:智东西 · 数亿元!雷军、华为都投了,全球扩散语言模型最大融资诞生
📄 其他
9️⃣ Aether AI CRIS-0:0.2 秒急停、秒级重规划,因果智能走进真实世界
由 UCSD 助理教授、CMU 因果学派学者黄碧薇创立的 Aether AI 亮出官方 Demo:因果原生 Agent 架构 CRIS-0 在机器人关微波炉遇人手插入时 0.2 秒紧急悬停,咖啡机测试面对移位 / 光照突变平均 2 秒完成重规划(10 次扰动 9 次恢复),长程「客厅寻物整理」可把目标拆成原子化可验证因果阶段、误踩隐私物件时收纳进抽屉、遇模糊指令「晨跑后喝的饮料」20 条里 18 次精准操作。⚠️ 为官方 Demo 口径。
原文:量子位 · 0.2秒急停、秒级重规划!因果智能走进真实世界
🔟 被 OpenAI 解雇的三名安全研究员联名公开信曝光内幕
上周被 OpenAI 解雇的三名安全与对齐研究员 Tomek Korbak / Jasmine Wang / Mikita Balesni 发联名公开信,称被解雇是「因为把 AI 安全置于公司短期利益之上」,指内部沟通已让前同事产生寒蝉效应、不敢再公开提安全担忧;三人担心 OpenAI 会借解雇减少与外部审计机构 METR 的合作。OpenAI 回应称内部调查发现的问题超出公开信披露内容,坚持终止雇佣,并非针对其 AI 安全担忧,同时正敲定与第三方安全评估机构的合作。
原文:机器之心 · 被OpenAI解雇后,三名安全研究员联名公开信曝光内幕
1️⃣1️⃣ 谷歌 EmbeddingGemma 2:不到 600MB 的手机端多模态搜索
谷歌开源 EmbeddingGemma 2——首个原生多模态开源嵌入模型:740M 参数(文本 270M + 视觉 170M + 音频 300M 可组合加载),把文字、代码、图像、视频、音频放进同一 768 维空间互搜,8K 上下文(上代 4 倍)、支持 100+ 语言;Pixel 11 Pro 上量化后纯文本约 191MB、完整多模态约 567MB,离线查询约 22 毫秒。图像检索得分 57.3 远超 Jina v5 Omni-Nano(31.6),视频检索 50.7 vs 31.2;可在本地为代码库建索引(MTEB Code 68.76 → 78.68)。
原文:新智元 · 谷歌把AI搜索塞进手机!不到600MB,照片、视频、录音断网照样搜
1️⃣2️⃣ 马斯克让 Grok Bot 接入 Claude:「谁好用,就用谁」
马斯克 10 月 7 日在 X 宣布,Grok Bot 将根据具体任务选用最合适的后端模型,直接点名 Claude Opus 5.5、Midjourney 和 Suno,标准是「哪个最可能带来最好结果就用哪个」。据 9to5Mac 同日报道,Grok Bot 已可使用 Claude Opus 5.5。一边与 Anthropic 争夺用户、一边调用对手模型,逻辑是:即便背后干活的是 Claude,用户交代需求、连接工具、跟进任务的地方仍是 Grok Bot,把对手模型当外援来争取自己的用户。
原文:新智元 · 马斯克让Grok Bot接入Claude!谁好用,就用谁
1️⃣3️⃣ 英伟达 Physis-Lang:用自然语言表示物理世界,增强视频真实感
英伟达联合 MIT、牛津提出 Physis-Lang:把物理原因、规律和结果写进语言描述,再让这套描述贯穿数据筛选、模型训练与视频生成。在权威榜单 Physics-IQ Verified 上,其 Cosmos3-Super(16B 级)与 Cosmos3-Nano(16B)分别以 48.2 / 43.3 分按平均分列第一、第二(Super 比此前最高 42.7 高 5.5 个百分点)。配套构建 PhysCapBench(246 段物理视频 / 3794 条人工核验原子断言),并让 caption 描述准则自进化(F1 78.64 → 87.82)。四项物理评测开源 SOTA、三项总分超 Veo 3.1。