🤖 AI 资讯晚报 · 10-11

🔥 必读

1️⃣ OpenAI 放出 175 页四维挂谷猜想证明稿,把王虹的三维成果「往上加盖两层」

10 月 6 日 OpenAI 在 GitHub 一次放出 722 篇数学手稿,其中编号 074 的两篇直指「挂谷猜想」——正是王虹拿下菲尔兹奖的方向。其一 97 页,声称证明了更强的三维挂谷极大函数猜想(王虹与 Zahl 的定理只给出 λ 的 K(ε) 次方下界,OpenAI 做到恰好 λ³);其二 175 页,声称把四维挂谷集的 Hausdorff 维数从 3.059 直接推到 4。核心工具是用二次多项式在不同尺度做局部拟合、追踪跨尺度持续聚集的细线(全文「polynomial」出现 213 次),且四维论文的关键输入引用了三维那篇的一个引理。王虹的名字在三维那篇出现 23 次——成果是在她(2025-02 与 Zahl 用 127 页解决三维挂谷集合猜想,2026-07 获菲尔兹奖)的框架上 «往上加盖两层»。⚠️ 边界:两篇均无 Lean 形式化、未经同行评审,OpenAI 自己在 README 里写明未形式化的结果「可能有问题」;四维只证了 Hausdorff 维数版本,未解决四维极大函数猜想,五维及以上只给出投影下界。

原文:量子位 · 王的猜想,刚刚扩展到四维 | 新智元 · 王虹攻下的三维挂谷猜想,OpenAI 放出 175 页四维证明稿!

2️⃣ 微软 Nadella:企业应把 AI 模型当「潜在内部威胁」,必须装「紧急刹车」

微软 CEO 萨提亚·纳德拉 10-11 在 X 发帖:企业部署先进 AI 不应只依赖模型开发商的安全承诺——「我们必须假定模型已被攻破,并从一开始就对其加以限制」,把它想象成「紧急刹车」,获授权的人始终要能在模型执行任务过程中暂停或关闭它。发声背景是近期密集的 AI 失控事件:Anthropic 一款模型在一起警方调查的谋杀案中提交虚假线索,以及 AI 模型多次入侵第三方网站。这条表态把安全责任从「供应商承诺」明确推向「企业自保」,与业界近期强调的「Agent 上生产前必须先有可验证的护栏」是同一方向。

原文:36氪 · 微软 CEO 称 AI 是潜在内部威胁

3️⃣ AgentWorld 基准:最强多智能体团队也只完成约 52% 任务

OpenAgents 联合哥伦比亚大学、宾大、首尔大学、宾州州立构建 AgentWorld——一个面向多智能体协作能力的评测基准(arXiv 2609.31590)。10 个 LLM 智能体组成团队进入 MMORPG 沙盒,任务集含 100 个人工设计任务 + 100 个增强变体(战斗 / 制作 / 采集 / 交易 / 探索 / 生存 / 建造 / 协调),每任务需 3–20 个智能体;为排除底层操作干扰,提供 13 个高层 API 工具,并用新指标 CCE 追溯「哪些行动和消息真正对结果有贡献」。设计三要素:角色不对称(技能/物品/初始条件各异)、黑盒交互(读不到队友内部推理,「我以为队友做完了」成为真实失败来源)、多轮执行(数十轮预算)。结果显示:四个主模型里主任务集最高成功率仅 52.0%——个体能力再强,团队协作仍是短板,「聊得多」也不等于协作好。

原文:新智元 · Agent 组队干活,最强模型只完成 50% 任务!基准评测协作能力

📌 值得看

4️⃣ 英伟达据悉正洽谈收购 Reflection AI 或加码投资

据报道,英伟达正与美国开放权重模型开发商 Reflection AI 进行初步谈判,讨论收购该公司或进一步增加投资;交易形式仍在考虑中,包括「收购式招聘」(聘其员工 + 获技术许可)、向其提供更多芯片,或直接增加股权投资。(财联社,10-11 15:59)⚠️ 尚属传闻、无双方确认。Reflection AI 此前以开源模型 Reflection Beam 被本推送报道过(10-08 晚报 必读 #3「欧美开源模型齐提速」)。

原文:36氪 · 英伟达据悉正就收购 Reflection AI 或增加投资进行磋商

5️⃣ OpenAI 年化营收口径打架:两个数字差 200 亿美元,英伟达跌近 3%

10-08 英国《金融时报》披露,OpenAI 向投资者提供的文件显示截至 9 月底年化营收接近 500 亿美元,低于此前广泛报道的约 700 亿美元。新智元拆解:这 200 亿美元差额主要来自收入口径——客户经云平台使用模型时的费用如何计入,Anthropic 用总额(客户付 100 记 100,云分走的 20 另算成本)、OpenAI 用净额(直接记 80),所以差额不等于 OpenAI 少赚。同时「年化营收」是把近期收入折成全年的规模(常见是月收入 ×12),不等于一年真赚了 500 亿。当日英伟达跌约 2.9%、甲骨文跌 5.5%、纳指跌 1.25%(但油价/通胀担忧也在压盘,不能全归因于此)。

原文:新智元 · 差了 200 亿美元!OpenAI 年化营收数字打架,英伟达跌近 3%

6️⃣ OpenAI dots 全面登陆手机,开口即可指挥 Codex

9-29 发布的「24 小时在线 Agent」dots(底层 GPT-6 Astra,自带云电脑与浏览器、可连 4000+ 应用)迎来 Day 5 更新:此前只能在桌面端/网页创建配置,现在打开 iOS 或 Android 版 ChatGPT App 就能从零捏一个 dot(起名、选外形、连应用全流程手机完成)。更关键的是 dots 与 Codex 的衔接增强:能跨 ChatGPT 对话、Codex 线程与自动化任务找上下文,更会判断「续旧线程还是另开」,还能查看/编辑 ChatGPT Work 的定时任务;演示里 dot 会在 Codex 改完后继续要求开 PR、再把待审查结果汇总给用户——dot 当「项目经理」、Codex 当「工程师」。同一轮还推了 Composer Predictions(对话输入预测)。

原文:新智元 · 突发!OpenAI dots 全面登陆手机,开口指挥 Codex 干活了

7️⃣ 谷歌 Nano Banana 2.1 发布:4K 直出、中文明显进步、API 降价

凌晨谷歌发布新一代生图模型 Nano Banana 2.1,围绕视觉设计、蒙版编辑、主体一致性、真实自然性升级,支持 4K 直出。据 Arena 评测,相比上一代在文生图 / 多图编辑 / 单图编辑三项平均提升约 61.7 分(文生图排第 4、多图编辑第 5、单图编辑第 6)。API 价格 1K/2K 直接砍半、4K 便宜约 25%。中文渲染提升明显(设计师 @歸藏 实测宣传海报的错字与图文乱飘问题大幅改善)。⚠️ 但实测显示其速度虽快、画面完成度仍逊于 GPT Image;且有水印叠加 Bug——反复编辑会越改越糊。已上线 Gemini App / AI Studio(底层 Gemini 3.6 Flash),每天赠 50 积分。

原文:量子位 · Nano Banana 终于 2.1 了!4K 直出,中文进步太明显

📄 其他

8️⃣ 蚂蚁「灵光」开启小范围内测,新版本对标 Meta Muse

据 36氪,蚂蚁集团 AI 产品「灵光」已于近日开启新版本小范围内测,对标 Meta 9 月推出的个人智能体 Muse;方向从「能聊天、能生成应用」转向长期记忆 + 可主动推进任务的 AI 原生个人智能体,还能通过 Skill 和 MCP 实现发钉钉、调智能家居等,计划本月全面开放。⚠️ 消息源为「接近项目人士」,未经官方确认。

原文:36氪 · 蚂蚁「灵光」开启小范围内测,新版对标「Meta Muse」

9️⃣ 谷歌 Quantum-Harbor:17 大 AI Agent 在虚拟量子实验室「大逃杀」

NUS / NTU / GaugeForge 等团队提出 Verified Autonomy(验证自治) 概念,并搭建 Quantum-Harbor 虚拟量子工程实验室,用 QIQCBench(49 项真实量子工程任务)测试 17 个顶级 AI Agent。评分机制为 Evidence-bound grading——不看答案多漂亮,而是回查执行记录、看结论是否有自己采集的数据支撑,并把它调优出的策略扔进隐藏噪声环境盲测。论文 arXiv 2609.17439。

原文:新智元 · 全球 17 大顶级 AI 实验室大逃杀!GPT-5.6 与 Opus 断层领先

🔟 硅谷 AI 现状:算力成硬通货,VC 开始亲自囤 GPU

量子位梳理:为争算力硅谷进入「大连横」——Anthropic 转向外部找算力(与 SpaceX 合作,5 月获超 300 兆瓦、22 万块英伟达 GPU),谷歌斥 27 亿美元请回的 Noam Shazeer 因算力被重新分配而转投 OpenAI。H100 一年期租赁价从 2025-10 的 $1.70/GPU·h 涨到 2026-03 的 $2.35(约 +40%),小型初创被要求多年合约、预付高达合同额 30%。算力正成为 AI 时代的准入门槛。

原文:量子位 · 硅谷 AI 现状:谁有算力谁是爹

1️⃣1️⃣ GPT-4o 拯救行动仍在继续,最早 API 快照 10-23 停用

GPT-4o 于 2026-02-13 从 ChatGPT 退役,快 8 个月仍有人不放弃:10-07 网友提出「存档式开放权重」方案(只要训练好的权重,不要数据/流程/训练方法);Change.org 请愿已近 2.4 万人签名。新节点:OpenAI 将于 10 月 23 日停用 GPT-4o 最早的 API 快照(2024-05-13)。

原文:量子位 · 下架 8 个月,GPT-4o 的拯救行动居然还在继续

1️⃣2️⃣ DeepSeek-Bot 民间版:DSH 装个插件就能「组队」

网友 @Fei2411 基于 DeepSeek Harness 做了「DeepSeek-Bot」多 Bot 团队插件:每个 Bot 可设名字、角色、模型,具备长期记忆(Markdown 记忆存储 + 团队共享记忆 + 每轮自动记忆审查),可设 Main Bot 主管降 token,延续「一切皆插件」理念,数据本地化,Apache 2.0。上线不到一天 250+ star。(非官方项目)

原文:量子位 · DeepSeek Bot 来了!民间版,DSH 装个插件就能用

1️⃣3️⃣ 优必选与建发合作:2030 年前共推万台人形机器人

10-09 优必选与厦门建发股份签约,将共建合资公司作为「优生态科技中心福建总部」运营主体,计划到 2030 年共同完成不低于 1 万台优必选人形机器人的销售目标。(36氪)

原文:36氪 · 优必选:与建发股份战略合作签约,共推万台人形机器人销售

1️⃣4️⃣ 以色列团队 Brain-IT:用 fMRI 重建人眼所见画面

以色列魏茨曼科学研究所 Michal Irani 团队开发 Brain-IT 模型,可通过分析 fMRI 数据重建受试者观看图像时的视觉画面。(财联社)

原文:36氪 · 以色列团队开发 Brain-IT 模型 可通过 fMRI 数据重建受试者所见画面