🤖 AI 资讯晚报 · 09-29

本期深读概述(微信推送只发标题清单,概述进博客与归档)。抓取:2026-09-29 19:00 北京时间|窗口 近 30 小时|脚本报新文章 143 篇(36氪 80、InfoQ 18、机器之心 11、新智元 10、极客公园 8、爱范儿 8、少数派 4、量子位 4;智东西首轮 timed out,已手工补拉 20 条)。

🔥 必读

1️⃣ AMD 82 亿美元全股票收购 World Labs,李飞飞出任执行副总裁兼首席科学家

  • 事件:AMD 宣布以全股票交易收购李飞飞创办的空间智能/世界模型公司 World Labs,估值约 82 亿美元(约 550 亿元人民币);李飞飞将以执行副总裁兼首席科学家(EVP & Chief Scientist)身份加入 AMD,直接向 CEO 苏姿丰汇报。苏姿丰早就是 World Labs 的投资者,去年起双方已在 AMD GPU 的模型训练与推理优化上深度合作。
  • 技术底牌:World Labs 2024 年初成立(联创 Ben Mildenhall、Justin Johnson),已发布全模态模型架构 Atlas——像 LLM 预测下一个 token 一样,从二维图像预测下一个视角,表现超过专为该任务训练的 SOTA,并借此解决了计算机视觉长期存在的稀疏重建问题;此前还收购 SceniX 补齐机器人仿真能力。
  • 李飞飞的核心判断:「宇宙不是由文字组成的」,仅靠语言不足以支撑模型发展;要解决科学、机器人与物理世界问题,必须更接近硬件——否则 AI 仍被困在数字世界里。并入 AMD 后可做硬件—软件—模型—数据平台端到端运行,并承诺继续提供开放模型与平台。
  • 意义:世界模型赛道迄今最大一笔交易落地,也再次验证 AI 产业链「资本—算力—模型」的深度绑定(多源报道:机器之心、量子位、爱范儿、InfoQ、智东西)。

2️⃣ Claude Sonnet 5.5 上线:半价逼近 Opus 5.5,智能体编程从 10% 飙至 70.6%

  • 发布:09-29 早间 Anthropic 正式发布 Claude 5.5 家族第二款模型 Sonnet 5.5(赶在 OpenAI 年度开发者大会开幕前一天深夜)。相对 Sonnet 5 速度提升 30% 以上、单任务成本最多降低 30%;标价为 Opus 5.5 的一半(输入 $2/输出 $10/缓存写,缓存读同为 $0.20 每百万 token),定位「高频 Agent 任务的规模化默认模型」。
  • 评测:Terminal-Bench 4.0(智能体编程)得分 70.6%,对比 Sonnet 5 的 10.3%(约 7 倍)——反超 Opus 5.5 的 66.4%;FrontierCode 比同设置 Sonnet 5 高 10 分,而单项任务成本仅约 1/15;模拟真实 Cursor 会话的 CursorBench 距 Opus 5.5 仅约 2 分(Sonnet 5 只有 34.1%);GDPval-AA(覆盖 9 个行业 44 种职业的真实工作任务)1844 分,与 Opus 5.5 的 1846 分几乎持平。第三方 Artificial Analysis 智能指数榜前三全为 Claude 系,Sonnet 5.5 居第二。它还是首个仅靠屏幕截图就通关《宝可梦 红》的 Sonnet 模型。
  • 安全:能力提升后 Anthropic 为其部署了与 Opus 5.5 类似的网络安全防护(高风险网安任务自动回退到 Sonnet 5 并提示用户);首次在发布时即配备防蒸馏的推理提取分类器,并扩展思考保留机制。Haiku 5.5 将在未来几周加入 5.5 家族。

3️⃣ Anthropic IPO 招股书曝光:估值目标超 2 万亿美元,2025 年收入 45.9 亿美元

  • 性质:路透披露的是 Anthropic 今年 6 月以公益公司身份秘密递交的 S-1 草案,并非主动公开版本,数字仍可能随 SEC 审阅调整。上市估值目标超 2 万亿美元,是它 5 月自估 9650 亿美元的两倍以上——这也是 ChatGPT 引爆 AI 浪潮近四年来,第一家把完整账本摊给公众投资人的前沿大模型实验室。
  • 财务:2025 财年收入从 3.86 亿美元增至 45.9 亿美元(+1088%),经营亏损从 29.8 亿扩大到 80.6 亿美元,规模效应已出现但亏损绝对值仍大。420 亿美元净亏损中约 340 亿是一笔会计费用(可转股融资工具估值上升所致)——公司越值钱账面就「亏」得越多。年化收入曲线:2025 年底约 90 亿 → 今年 5 月约 470 亿 → 7 月底超 650 亿美元。
  • 关键风险:去年近 1/4 收入来自两个客户,且许多最大客户未签长期合同;2025 年算力与基础设施支出 73.3 亿美元,占总运营支出 58%(约收入的 1.6 倍),且主要流向同时是其投资方的亚马逊与谷歌——资本在巨头之间循环,进入公开市场后「真实终端需求 vs 资本循环」会被追问。
  • 治理:七位联合创始人通过 Founder LLC 以一股 F 类股掌握 50.1% 总投票权(含选举部分董事),招股书自认这套结构可能作出与股东中短期财务利益冲突的决定,并承诺将个人所持 Anthropic 股权的 80% 用于慈善。另主动放弃图像与视频生成模型,把算力投向研究与安全优先事项——与 OpenAI 关停 Sora 形成鲜明对照。

📌 值得看

4️⃣ 庞加莱猜想证明首次被机器完整验证:Lean 470 万行,其中 270 万行由 AI 写就

  • 谁做的:UCSD 数学教授 Ben Chow(丘成桐弟子,研究 Ricci 流数十年)牵头,一位刚毕业的本科生冲在最前,身后是一群「24 小时连轴转」的 AI。四人小团队用证明助手 Lean 把 Hamilton 与佩雷尔曼的庞加莱猜想证明从头写到尾,约 470 万行代码全部通过 Lean 内核检查,没有一处用 sorry 留待后补。
  • 结构:庞加莱定理真正引用到的约 402 万行 / 14197 个文件,最长引用链串起 353 个文件。佩雷尔曼三篇论文对应的代码约 66 万行,只占六分之一——剩下六分之五全是论文默认「读者早懂」的基础数学(分析学约 109 万行、微分几何约 77 万行)。论文写得越简略、Lean 里要补的越多:第三篇 7 页平均每页对应 1.4 万行;其中只用一句话提到的「曲线缩短流」就写了 7.6 万行。让 Ricci 流短时存在性可计算(DeTurck 技巧背后的 Sobolev 空间、谱理论)要 89 万行;佩雷尔曼的杀手锏典范邻域定理独占 272 万行(占整条依赖链三分之二)。
  • AI 的角色:约 270 万行是最后两周在 ChatGPT、Claude 等 AI 协助下赶出来的;团队此前先花七个月手写约 200 万行基础代码(当时 MathLib 连黎曼几何最基础的工具都不全)。
  • 意义:一个大型证明过去要靠同行花数年逐页审读才能「没毛病」,这次说了算的换成了机器,主力也换成了 AI(新智元)。

5️⃣ Manus 2.0 发布:自研 Cascade 框架 + 云电脑 + 全天候个人助手 Cue

  • 新架构:Manus 2.0 重构底层,新一代自研 Agent Harness 名为 Cascade,保持轻量化、仅在任务需要时引入专业能力。内部测试相较上一代:Token 消耗 −23.2%、任务完成时间 −28.2%、运行成本 −32%。
  • Cloud Computer:为项目提供独立云端运行环境(可当常驻服务器或自动化任务的长期运行空间),Agent 不再依赖用户开机,生命周期被改写;Automations 从「定时任务」升级为事件触发流程(新邮件、广告效果变化、日历事件、Slack 消息、Notion 更新等均可触发),一句话即可建立并运行整条工作流。
  • Studio 与 Cue:桌面端升级为 Manus Studio(文档/表格/PDF/幻灯片/网站/代码/游戏/视频),新增 Video Editor(时间线级编辑 + Alchemy 创意模式)与 Game Dev(可从可玩的模板起步,几次点击配好多人游戏服务器);同时推出个人助手应用 Cue,并支持手机语音远程操控已授权电脑(可实时看着它操作)。

6️⃣ GPT-6 Astra 的「隐藏思维链」被 tool calling 撬出(丹麦奥尔堡大学)

  • 方法:论文《Capable yet Parsimonious》(arXiv 2609.26637) 通过标准 API 的 tool calling 做协议层「越狱」,让多款前沿模型外显出带推理性质的隐藏思维链。在原生 CoT 可见的开源模型上验证:工具提取的 reasoning 准确率与原生推理相当(DeepSeek-V4-Flash 上甚至略高),文本相似度与「模型自身多次生成原生 CoT」的波动范围相当 ⇒ 提取的是真实推理,而非事后合理化。所有实验在 2026-09-09 前完成,已正式告知 OpenAI 与 Anthropic。
  • 对 Astra 的拆解:Astra 的推理树更紧凑(深度相近、宽度与节点数显著更小);完成相同推理操作时更常省略基础计算与代数变形,直接给关键结论,类似熟练的「心算」;其推理活动构成(阅读/分析/规划/实现/探索/验证/监控)与其他前沿模型高度一致,区别只在「写出来多少」——Astra 不是跳过推理,而是把细粒度步骤心算掉了。
  • 反直觉结论:把思维链交给其他模型继续作答时,Sol 与 Opus 的 CoT 基本可被不同能力模型复用,而 Astra 的压缩思维链对强模型几乎无损、对弱模型明显更难读——Astra 在 73/80 道题里已写出正确答案,较弱的接收者仍会答错。论文因此提出:思维链的价值取决于「谁在读」,而不只取决于「谁在写」。安全启示:关闭原生推理不等于推理不会经其他通道外泄(工具调用、可见回复都是替代通道)。

📄 其他