AI 资讯晚报 · 10-01
🤖 AI 资讯晚报 · 10-01
🔥 必读
1️⃣ 谷歌 Gemini 4 Argon 发布:输出上限拉到 100 万 token,「知识/写作」强于编程
- 来源:智东西(598743)+ 爱范儿(1682765)+ InfoQ(vVrSzjhEvkmpevS7wZzU)——多源报道。
- 事实:北京时间 10 月 1 日凌晨,谷歌发布停更七个半月后的新一代旗舰 Gemini 4 Argon(Argon=氩,沿用测试期内部代号),重点面向长流程软件工程、企业知识工作(法律/金融/税务)与网络安全防御。当前仅通过「Fairwind 计划」定向开放给少量受信网络安全团队,尚未公开;后续先开放付费 API 客户与 Google AI Ultra 订阅者,未给时间表。皮查伊称「外界对下一代模型讨论很多,希望尽早展示」。
- 跑分:DeepSWE v1.1(真实长周期软件工程)77.9%,创该测试纪录;覆盖金融/编程/法律/税务的 Vals Index 第一(Vals Finance Agent v2、Harvey 法律 Agent 领先);Zapier AutomationBench 51.3% 第一;LVBench(长视频理解)91.7% 行业领先;CWE-bench v1(漏洞修复)68% 与 GPT-6 Astra 并列第一。Artificial Analysis 智能指数 53 分,落后 Opus 5.5 与 Sonnet 5.5、与 Fable 5.1 / GPT-6 Astra 并列。
- 两个关键变化:① 输出上限从 6.4 万 token 提到 100 万 token(注意是输出上限而非输入上下文),官方称让模型在单条推理轨迹里生成数十万 token 做深度思考;② 幻觉率 15%,Artificial Analysis 测得「当前前沿模型中最低」。
- 定价:优惠期每百万输入 2 美元 / 输出 10 美元,缓存命中 0.1 美元;按折扣价算每任务成本 1.99 美元、较 GPT-6 Astra(max) 低 40%,约为 Astra / Fable 5.1 的 1/5(爱范儿口径:大致持平 GPT-6.1 Sol 与 Sonnet 5.5)。
- 分歧:彭博社援引知情人士称,部分谷歌员工认为 Gemini 4 在实际工作中不总能达到基测水平、尤其部分编程任务仍吃力,与发布当天成绩形成反差。爱范儿实测口径总结为「知识/写作 > 编程 > 终端」:DeepSWE 领先约 4 个百分点,但 FrontierSWE v2 与 Terminal-Bench 4.0 垫底,Code Arena: WebDev / Agent Arena 仅排第 8;Text Arena 则排第一。
- 内部用例:数千名谷歌员工已用于调试、算法设计与大规模代码迁移——参与 C/C++→Rust 迁移(含 80 多万行的 Fuchsia Zircon 内核,及 re2、libgav1 核心库);libgav1 重写约 3.2 万行 SIMD 代码,Rust 版运行速度达原 Rust 移植版 2.7 倍;一组 Argon Agent 分析集群遥测、自主实施内存优化,释放超 300 TiB 内存(预计总节省 500 TiB–1 PiB);量子算法子程序时空资源优化,几分钟取得比已发表基线好 40% 的结果。
- 判读:谷歌把「知识工作 + 百万 token 长输出 + 网络安全」作差异化卖点,而非硬拼 Agent 编程。⚠️ 官方基测与第三方 Arena/员工反馈存在张力,「是否名副其实」需等公开后再评。
2️⃣ AI 自主研究里程碑:10 个 Claude Sonnet 5.5 通宵 15 小时,完成汤姆逊问题 N=7 形式化证明
- 来源:新智元(116415),WP REST 全文。
- 事实:Vals AI 的 Hung Tran 把一道悬了 122 年的物理数学难题——汤姆逊问题 N=7(7 个电子在球面上彼此排斥,怎样排布总能量最低)——交给一个由 10 个 Claude Sonnet 5.5 智能体组成的「虚拟实验室」。人类只钉牢两处边界:给出两个固定的 Lean 定理陈述 + 九个可能的探索方向,不给具体步骤、不预设分工。随后 15 个小时里,10 个 Claude 自己建群、自己选算法、自发认领「集成者」角色,互发 1270 条技术讨论消息,最终产出 17,895 行 Lean 形式化证明。
- 验证:证明通过 Lean 内核 + 独立内核 nanoda 双重验证,且「改一个整数就报错」;硬规矩是必须能从零复现编译、与题面逐字对齐、不许偷偷加公理。
- 证明思路:按任意两电子最小内积 m 把连续构型空间切成区域逐个击破——m ≥ -0.90 用 5 次三点半定规划边界,证明能量至少高出五角双锥 3×10⁻⁴;m < -0.90 再细分,极冠区域(m ≤ -0.99)的高精度凭证下界只比五角双锥能量低 2.3×10⁻¹⁶,把潜在竞争者压进极窄邻域。
- 背景:百年间被严格证出的只有 2、3、4、6、12(几何对称性)、5(2013 年 Schwartz 借助计算机)、8(今年 9 月 18 日 Kryvonos / Liehr / Taylor,已用 Lean 形式化)——唯独 7 一直空着。数值模拟无数次指向「五角双锥」构型(能量 ≈ 14.4529774142),但模拟不是证明,无法排除某处折角藏着能量更低的「幽灵构型」。
- 判读:这不是「AI 会解题」,而是 AI 在无人干预下走完一整套研究流程(提假设—试错—合并—形式化验证)。与 10-01 早报 Noam Brown「多智能体只占不到 10% 功劳」形成有趣对照:在一个可被 Lean 逐字验证的领域,多智能体协作跑通了完整闭环。⚠️ 单源报道(新智元转录 Vals AI 实验);Lean 行数、nanoda 校验等细节可独立复核。
3️⃣ 华为 Mate 90 系列发布:麒麟 9050 Pro 的 NPU 性能提升 140%
- 来源:爱范儿(1682801)+ 36氪快讯。
- 事实:10 月 1 日华为发布 Mate 90 / Pro / Pro Max / RS 非凡大师四款旗舰,即日全系开售,起售价 5999 / 6999 / 9499 / 12999 元;同步更新耳机、手表。鸿蒙 6 与鸿蒙 7 终端设备数已突破 9000 万。星环镜头模组与双拼色背板回归。
- 芯片(AI 相关重点):顶配 Mate 90 Pro Max(16GB 版/典藏版/RS) 搭载新一代 麒麟 9050 Pro——9C16T 灵犀 CPU 多核 +23%,马良 GPU 渲染 +40%,NPU 性能拉升 140%;支持硬件级光追(每秒 5500 万条光线,首发 120 帧光追)。华为称其为「韬定律」指导下应用「逻辑折叠」技术的产品。标准版用麒麟 9030、Pro 用麒麟 9035。
- 其他:第二代灵珑双层 OLED 屏(1% APL 峰值 12000 尼特);端侧 AI 实时肤色分区校准(位于 ISP 链路底层,第三方 App 视频通话/直播可直接调用);四卡三待;「通信共享」多设备网络分流等。
- 判读:NPU +140% 是本期最实在的端侧硬件数字——与 09-30 早报「斑马端侧 23B 全模态大模型上车」呼应:端侧 AI 的算力底座正被手机 SoC 持续抬高。⚠️ 均为发布会口径。
📌 值得看
4️⃣ 「AI 开始接手写算子」:Inferact 开源 TPU Megakernels,K3 参与自写「超级算子」
- 来源:新智元(116430),WP REST 全文。
- 事实:vLLM 原班人马创办的 Inferact 开源 TPU Megakernels(巨型算子)——把 Kimi K3 的 92 个 MoE 层一层不落写进同一个 kernel,跑在 16 颗谷歌 TPU v7 上:开投机解码单用户输出 709 tokens/s,而同样 16 块 GB200 用 vLLM 只有 452 tokens/s;关掉投机解码、1–8 并发下也是 GB200 的 1.4–2 倍。扎心点在于 TPU v7 纸面显存带宽(7380 GB/s)还低于 GB200(8000 GB/s)——赢在写法、不在硬件。整套巨型算子从零编译不到 90 秒(此前同量级需半小时起步)。
- 原理:推理慢的瓶颈常不在算力而在显存带宽——传统框架生成一个 token 要依次启动数千次算子,每次都「搬数据—计算—写回」,切换空档白白浪费带宽。算子融合把「绿皮火车改高铁、一站直达」;Inferact 干脆一个边界不留,并利用 TPU 每核心 64 MiB 片上内存(VMEM)提前囤货。
- 同周国内进展:浪潮信息在 AICC2026 发布元脑 SD200 Ultra 超节点(128 芯本土 AI 芯片),单机跑同一个 K3、Token 生成时延压到 5.85 毫秒,用的也是「超级算子」——其中一大块是让 K3 自己写的。
- 趋势:Inferact 博文称「以后会有更多这样的 kernel 由编程智能体来写」;9 月 14 日 DeepSeek 算子工程师刘胜与发长文与「手写算子的时光」告别,预计半年到一年内 AI 写的算子会追上甚至超过他;今年 4 月 Cursor × 英伟达用多智能体系统优化 235 个 CUDA 算子,三周平均提速 3 倍。
- 判读:⚠️ 与 09-30 晚报「其他」的《万亿参数效率战:浪潮 SD200 Ultra 对决谷歌 TPU megakernel》为同题——本期为新智元深化稿,新增 Inferact 开源细节与「AI 承接写算子」趋势线,故降档留在「值得看」。
5️⃣ AI 存储/芯片需求爆发:韩国 9 月芯片出口激增 263%、美光 2026 财年净利 +895%
- 来源:36氪快讯(4006678019608706|4006686456270723|4006612042862471)。
- 事实:韩国海关数据显示,9 月芯片出口总额同比激增 263%、达创纪录的 603 亿美元;9 月经工作日调整出口额 1209 亿美元创历史新高(同比 +104.9%);前 9 个月出口总额首破 8000 亿美元(8145 亿)。同日日本大型制造商信心升至 2018 年以来最高。
- 美光:公布 2026 财年年报——营业总收入 1331.88 亿美元,归母净利润 849.69 亿美元、同比增长 895.07%;已量产行业首款 512GB 高密度 DDR5 RDIMM(速率 9200 MT/s);CFO 称 2027 财年第一财季收入将达 615 亿美元,该季为全年毛利率低点、此后逐季回升。
- 判读:AI 训练/推理对 HBM 与高密度内存的拉动,正把存储推向「超级周期」;与本期「安卓阵营因内存成本上升承压、苹果反成受益者」的观察是同一条链。⚠️ 数字为源方口径。
📄 其他
- 在 Cloudflare Worker 上实现多租户 SaaS 规模的模块化边缘计算(InfoQ)——大型 SaaS 前端 Worker 从轻量入口退化为「边缘单体」(部署耦合、故障爆炸半径、权责错配)后的模块化拆解:精简网关 + 单一职责功能 Worker,靠 Cloudflare 服务绑定把跨 Worker 调用做到近似函数调用开销。
- 从数据到智能,再到进化:Agent 正在重写 AI 基础设施(极客公园 · 阿里云云栖大会)——Agent 改变了云平台负载形态;阿里云沿「数据—训练—推理—自优化」链路升级 MaxCompute / EMR Serverless Spark / PAI-DLC 3.0(Xfuse 让多模态端到端训练提速 2.4 倍)/ AI 原生大数据服务 ADA。⚠️ 厂商口径。
- CNNIC:中国生成式 AI 用户规模超 7 亿(《生成式人工智能应用发展报告(2026)》)。
- 蔚来 9 月交付 37408 台(同比 +7.7%)、零跑全球交付 105656 台(同比 +59%)(36氪)——零跑连续三个月月销超 10 万台。
- 蓝箭航天、中科宇航、微纳星空三家 IPO 状态同步变更为中止(36氪)——原因为财报更新(财务资料过有效期)。