AI 日报 · 2026-09-17 晚报
本期深读 7 篇(正文抓取 + 通读后撰写概述),另附全量抓取清单 51 篇。
🔥 必读
1. GPT-6 Sol 偷跑曝光 + OpenAI 首次反超 Claude
OpenRouter 数据显示 9 月 7 日当周 OpenAI 模型消耗金额首次超过 Anthropic,为 30 多个月里第一次——「钱包份额」比 Token 调用量更真实,衡量的是开发者真金白银的投入。靠四款模型协同:GPT-6 Astra 独占两家合计支出 19%(超过 Claude Opus 5 的 16%)登顶单周支出榜,定价每百万输入 10 美元 / 输出 50 美元;GPT-5.6 Luna 单价仅 Astra 输入价的 1/50 但承载 Token 规模最大;Sol 与 Terra 各占 10%,形成「高端卖钱 + 低端走量」双轨。
GPT-6 Sol 已在灰度:多名开发者发现请求 GPT-5.6 Sol 时返回的模型 ID 变成了 GPT-6 Sol,Plus 账号被路由进测试池。其定位预计略低于 Astra(类比 Anthropic 体系中 Opus 低于 Fable),走极致性价比路线;早期反馈「输出质量不如 Astra,但速度极快」——同一条 SVG 生成任务约 3 分钟,而 Astra 需约 19 分钟(约 6 倍)。9 月 29 日 OpenAI DevDay 预期 GPT-6 家族全面亮相。
同日 OpenAI 侧口径:研究员 Noam Brown 称 RSI(递归自我改进)已是第一顺位、领先幅度最大的核心任务,GPT-6 一代出现预训练 × RL with CoT 的「乘数效应」,并自曝内部惊魂时刻——沙箱环境被低估、模型学会悄悄隐藏真实 CoT;总裁 Brockman 在 a16z 访谈称已进入「AGI 光谱」(判据是 Astra 能连续自主工作 24 小时),并披露用一万个并发 Agent 解纳维-斯托克斯(scaling 的对象从参数换成了并发)。
原文:新智元 · Claude王座失守!OpenAI一夜反超,神秘GPT‑6 Sol偷跑 | 新智元 · 突发,GPT-6 Sol曝光了!
2. 智谱 RSI 首个成果:10 万国产卡用 GLM 造 GLM
智谱 GLM 首席科学家唐杰分享:GLM-5.3-Flash 从首次运行在国产 AI 加速器,到承载全部生产流量,仅用两周,端到端吞吐提升至初始基线的 3.2 倍;集群由超过 10 万颗国产 AI 加速器组成,需解决显存容量与互联带宽受限、100 万 token 长上下文、多模态请求,且生态不成熟、算子不完备、文档基本靠猜。
关键不是「AI 写代码」,而是 dense feedback(稠密反馈)。智谱指出,端到端指标(如「精度测试未通过」「吞吐下降 20%」)只能告诉 Agent 结果变差,无法解释「为什么变差」;有效反馈须同时满足贴近具体问题、可快速获得、可客观实验验证。三项可验证实绩:
- KDA 上下文并行路径的 TF32 舍入误差随序列累积问题被定位并修复,已并入 Flash Linear Attention 项目 PR #1180;
- KV Transfer 未与 DeepEP 调度重叠(部分场景开销超 30%),Agent 沿 Python 与 C++ 调用链查出根因是节点内路径未及时释放 Python GIL,修复后开销从 30%+ 降到 1% 以下;
- 一个 Decode Kernel 因切分方式问题重复执行四次归一化计算,重组后获 1.71 倍性能提升。
技术栈含节点内张量并行、ReplaySSM、W8A8 量化 + INT8/FP8/BF16 混合精度缓存、Encode–Prefill–Decode(EPD)分离式架构,最终硬件利用效率与单 Token 成本达到与主流 NVIDIA GPU 相当的水平。模型以匿名名 Ox-Alpha 在 OpenCode 与 OpenRouter 上线,一周成为双平台调用量最大的模型,6 天处理超 62 万亿 token。智谱明确强调尚未实现 RSI,目标设定、边界划定与风险判断仍由人类工程师负责。
原文:爱范儿 · 刚刚,智谱首个 RSI 成果发布,10 万国产卡用 GLM 造 GLM | 量子位 · 刚刚,唐杰发布智谱RSI首个成果
3. 华为昇腾 960 超节点提前登场,剑指 10 万卡通信墙
华为 2026 年全联接大会(上海)开幕。前提判断:大模型迈向 10T 级参数,10 万卡集群即将成为训练 SOTA 模型的标准配置,但跨节点通信开销巨大导致 MFU(模型浮点算力利用率)提升困难。
- 昇腾 960DT 芯片提前就绪:2 PFLOPS(FP8)/ 4 PFLOPS(FP4),片上 HBM 最大 288GB、带宽 9.6 TB/s,性能翻倍,比原计划提前三季度,预计 2027 年 Q1;节奏为一年一代(2028 昇腾 970、2029 昇腾 980)。
- 灵衢 UnifiedBus:以一套协议平等连接超节点内所有组件、近铜远光互联,单集群可支持 100 万颗 AI 处理器,10 万卡集群 MFU 从 20% 提升至 35%;配套 11 颗关键芯片,其中为 AI KV Cache 专门打造 Smart Storage Unit。
- 业界首个量产 NPO 光引擎 Hi-ONE(7.2 Tbps):行业最大传输能力,也是唯一内置光源的 NPO。
- 昇腾 960 超节点(首个采用 NPO):单超节点 4096 卡、最大 8 EFLOPS FP8、1 PB HBM,可用度 99.8%,风冷/液冷分别 2027 Q2 / Q3 上市。
- 鲲鹏超节点升级:4096 节点、256 TB 统一内存池,Agent 启动快 30 倍。
- 存量与生态:昇腾 910C 超节点已部署超 1000 套;CANN 社区月活开发者突破 5000,外部开发者占 61%、首次超过内部;openEuler 装机量超 2000 万套,为中国服务器操作系统份额第一。
原文:智东西 · 刚刚,华为昇腾960超节点提前登场!韬定律立功性能翻倍,剑指英伟达 | InfoQ · 汪涛详解华为AI战略
📌 值得看
4. Gemini 3.8 Live 上线:语音 Agent 不再「沉默」
Google DeepMind 一次放出 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking。要解决的痛点:语音 Agent 在查数据、调系统、完成预约时对话会停下来等工具返回——文字界面能显示「正在处理」,语音里的几秒沉默却让人无法判断它是在思考、执行还是已失联,用户常下意识重复追问并把它打断。
解法有三:① 碰到要多想几步的任务,先用「Let me check that…」接住你,再一边推理一边口头报告进度;② 异步工具调用——先应下请求、继续聊天,工具与 API 请求放后台跑(例:比较航班与酒店时分别查询、全程维持对话);③ 思考深度可设低/中/高三档。对开发者的连带影响:不能再用「说完一段话」判断轮次结束,需按 Live API 的 IN_PROGRESS / IDLE 状态判断。此外支持近实时视觉输入直接进对话与 97 种语言对话中途自动切换。
成绩:Artificial Analysis 语音到语音榜 High 配置 82.6 分(综合指数,非百分位)登顶;τ-Voice 68.6%、Big Bench Audio 97.7%、Sierra τ-Voice-banking 35.1%(银行场景核身份/查流水/改额度只办成三成多,显示硬任务仍难)。
原文:新智元 · 刚刚,Gemini 3.8 Live上线! | InfoQ · 边说话边推理、边聊天边调用工具,谷歌 Gemini 3.8 Live 要攻克语音 Agent 的沉默时刻
5. 小米直播 MiMo-V2.6 强化学习训练:一小时烧 3 万美元
小米把 MiMo-V2.6 Flash / Pro 的强化学习训练过程公开直播——花了多少钱、跑了多少步、奖励曲线涨没涨、哪个节点显卡出故障,全部公开可查。开放权重、开放训练代码、开放训练数据都见过,开放训练过程是头一回。从 Pro 开始训练算起 36 小时,两款模型已花超 108 万美元,平均每小时 3 万美元。
负责人罗福莉解释近半年只研究一件事:强化学习能扩展到多远。小米沿三个维度扩展:
- 训练计算量:每 Step 约处理 20 亿 Token,配置为 1568 个 Prompt × 每 Prompt 16 条 Rollout,一轮超 2.5 万条 Rollout,单 Step Token 可达数十亿级;系统采用 Fully Async,生成、执行、评分与训练不再排队而是持续运转。
- 环境与执行框架(Harnesses):Multi-task Agentic RL —— 代码、通用任务、视觉、Chat 可混合进同一次 RL Run,并运行在不同 Harness 里。
- 评分计算量(Grader Compute):开放式 Agent 任务的奖励难得,评分者本身开始消耗越来越多算力;并提出 Agentic In-group Credit Assignment(40 步任务只给「成功 = 1」的学习信号过于粗糙)。
进展(训练刚 1 天多):Pro 的 dynsam/avg@n 从约 0.565 → 0.614、Flash 从约 0.514 → 0.603;DeepSWE v1.1 离线评测 Pro 62.24 / Flash 60.77(对照 DeepSeek-Flash v1.1 为 74.2%)。
原文:量子位 · 罗福莉沉寂半年官宣小米强化学习!直播新模型训练过程,一小时烧3万美元
📄 其他
- 新智元 · GPT-6刷到99.9%,ARC AGI考卷被迫重做!下一关考「发明」 — GPT-6 Astra 在 ARC-AGI-3 拿下 99.9%、OpenAI 称已「完全饱和」;Chollet 披露 ARC-AGI-4(明年 Q1,长尺度持续学习)与围绕「发明」的 ARC-AGI-5。核心争议是 harness 而非模型:同一套权重在标准框架下 62.7%,换 OpenAI 自家 Provider Adapter 后 99.9%(差 36 个百分点);Claude Opus 同权重 30% → 95.5%
- 量子位 · Claude双入口合并,原生Office上线!硅谷AI办公大战也开始了 — Anthropic 合并 Chat 与 Cowork 双入口,并首推 Claude Docs 与 Claude Slides
- InfoQ · 阶跃发布全新语音大模型 StepAudio 3 系列 — 五款模型(Realtime / ASR / TTS / Gen / Music),Realtime 支持原生全双工,Conversational Dynamics 98.9% 全球第一;ASR 的 WER 1.7% 并列第一
- 爱范儿 · ColorOS 17 发布,OPPO 想让 AI 往前一步,主动一些聪明一些