🤖 AI 资讯晚报 · 09-28

本期脚本抓到 117 篇新文(36氪 80 / 机器之心 10 / 新智元 9 / 极客公园 4 / 爱范儿 5 / 少数派 5 / InfoQ 3 / 智东西 1 / 量子位 0);其中 36氪 约 60 条为纯股市/公告类、按画像降权剔除。⚠️ 另发现 36氪 覆盖缺口 09-28 07:00→15:58(约 9 小时)并已回捞——华为 openPangu-2.0 全流程开源、MiniMax M3.1-Flash-Preview、Sharpa 三款机器人新品、SAFA 前沿 AI 标准局 四条均出自该缺口。最终推送 15 条(必读 3 / 值得看 4 / 其他 8)。

🔥 必读

1️⃣ 代季峰团队 Naive AI 开源首个模型:让 AI 研发 AI(Naive-N0.5-Flash)

代季峰(Faster R-CNN 作者之一)的创业公司 Naive AI 开源首款模型 Naive-N0.5-Flash:总参数 309B、激活 15.5B,原生支持 百万 token 上下文,定位面向编程与 AI 研发。路线选择上它不从零预训练,而是以开源基模为起点做架构改造、增量预训练与后训练——团队判断「新实验室的竞争点已从『能不能从头训出基模』转向『能不能更快更好地把基模改造成自己要的样子』」。

更值得关注的是研发出自 AI:公司自 2026 年 2 月成立起就把写代码、跑实验、监控流程、分析结果交给模型,人类只负责提出目标、设定约束与评价标准、做关键决策。技术报告称 AI 已参与注意力架构探索与训练/推理/部署系统优化。

核心评测:PaperBench 63.2 分(高于报告中的 Claude Opus 4.7、GPT-5.5 与 MiniMax M3);MLE-bench-30 73.7%;PostTrainBench 37.5。两个配套案例更直观——推理运行时 NaiveRT 上,研究员与 AI 6 天推进 151 轮实验,把一轮完整投机解码从 12.3 毫秒压到 3.4 毫秒;世界模型任务里模型累计 400 小时、15 轮主要实验产出 AutoWM,已跻身 WorldArena 第一梯队。

背景坐标:Anthropic 十天前披露内部 AI 研发已有 26% 由 Claude「主导」(2 月时不到 1%);OpenAI 称「自动化研究实习生」目标达成,研究团队 1 个人类工作日 ≈ 3.1 个智能体工作日。「让 AI 研发 AI」半个多月内从理论话题变成了头部实验室争相公开的量化指标。

原文:机器之心 · 用AI造的!刚刚,代季峰团队首个模型开源

2️⃣ 华为全流程开源 openPangu-2.0:预训练、SFT 与后训练 RL 代码一并放出

华为把 openPangu-2.0 的预训练代码、SFT 代码与后训练 RL 代码正式开源上线,模型相关组件已陆续上线开源平台。开源的不是权重而是训练全流程——从预训练到后训练强化学习的完整链路,等于把「怎么训一个盘古」的方法论交给社区。这与 09-26 平头哥 T-Head SAIL 软件栈开源、09-27 阿里 OpenCodeReview 开源同属「国产厂商把工程侧能力开源」的连续动作。

(本条为 36氪 快讯口径,官方仓库地址、模型规格、开源协议与许可范围均未见披露;本条系本期 36氪 覆盖缺口回捞所得,细节待官方文档确认。)

原文:36氪 · 华为:openPangu-2.0预训练、SFT代码和后训练RL代码正式开源

3️⃣ 北大清华阿里提出 SparkDiffusion:单卡视频生成提速 265 倍,18 秒出片

问题:把稀疏注意力压到极致(90% → 97%,算力降到 3%)时出现反常现象——训练损失持续下降,生成视频却急剧恶化(人物破碎、背景扭曲、时序混乱);延长训练、加大数据集、扩大补偿分支容量都修不好。团队把这种失效模式命名为「高稀疏陷阱(High-Sparsity Trap)」。

诊断:Oracle 干预实验显示,用稠密教师的预测替换稀疏学生在不同采样区间的预测时——只修正最高噪声的 5 步即可移除大部分终点误差,修正最低噪声的 5 步收效甚微 ⇒ 高噪声阶段的结构误差会被后续步骤放大,最终导致终端质量崩溃。

方法(三阶段统一框架):① RoLA 稀疏注意力——块稀疏分支保留高能量 query-key 交互,带旋转位置信息的低秩线性分支补回被丢弃的全局上下文;② CrossDistill 轨迹级混合少步蒸馏——高噪声 1 步 PCM 一致性(跟随教师粗结构与运动轨迹、保留种子多样性)+低噪声 2 步 DMD 分布匹配(直接修正终点可见误差),得到 3 步、无 CFG 的学生模型;③ FP8 量化 + 融合算子把理论收益转成真实延迟。核心洞察是「终端对齐监督」:不只监督当前步预测是否准确,还要约束「这一步最终会生成什么」。

数据:RTX 5090 上 97% 稀疏率 265× 加速(90% 稀疏率时为 201×);H100 同配置 220×、绝对延迟降至 8 秒;90% 稀疏率下全面超越 FastWan 与 TurboDiffusion。权重、稀疏微调+蒸馏训练代码、RTX 5090/H100 推理脚本全部开源,跨模型支持 Wan2.1/Wan2.2、T2V/I2V、480P/720P。

原文:机器之心 · 18秒出片、视频生成提速265倍!北大清华阿里提出SparkDiffusion | 项目主页 | 代码 AlibabaResearch/SparkDiffusion

📌 值得看

4️⃣ 英伟达发布 AI 智能体安全平台:毫秒级隔离异常智能体

英伟达推出「开放智能体安全平台」,含两款开源工具:OpenShell 在英伟达 Vera CPU 上运行,实时限制 AI 智能体的访问权限;Nvidia Sentry 运行于 BlueField 数据处理单元(DPU),监控智能体行为,发现异常时将其隔离,最快可在数毫秒内完成。英伟达称该系统有望帮助 AI 行业更安全地测试先进 AI 系统——把智能体安全从应用层下沉到芯片/DPU 层。

原文:36氪 · 英伟达推出AI智能体安全平台,可实时隔离异常智能体

5️⃣ OpenAI 与 Anthropic 差点签下「互黑协议」;三巨头拟自建「前沿 AI 标准局」SAFA

The Information 爆料:今年初 OpenAI 与 Anthropic 差点坐到一张桌子上,签下一份互相攻击对方模型的协议——双方互相开放 API,你来黑我的模型、我去黑你的模型。尺度相当大:测的是正在对外服务的商业模型(未发布的不算),互相挖漏洞过程中谁也不准截留对方的数据,两边律师连「测什么、怎么测」都写进了合同。报道还称两家谈判范围已扩到两个新方向:模型训练前立什么规矩、发布前又立什么规矩。

同日另一路进展:谷歌、OpenAI、Anthropic 正推进在不受政府监管的情况下自建 AI 安全标准机构,初步命名为「前沿 AI 标准局」(Standards Authority for Frontier AI,SAFA),希望 2026 年底或 2027 年初正式启动;工作组已向 Sriram Krishnan(前特朗普政府高级 AI 政策顾问)抛出 CEO 邀约。

分歧与未定:真正的卡点是反垄断——Amodei 自己就担心几家巨头坐一起定标准会踩红线;行业另一派认为「核电站互查反应堆、网安公司互测产品」几十年了也没人管。去年夏天两家也搞过一次「互查」,但那次只是各测各的、测完各发各的博客。

原文:新智元 · 真怕了!OpenAI和Anthropic差点签下「互黑协议」 | 36氪 · 谷歌、OpenAI与Anthropic的AI安全组织正逐渐成型

6️⃣ 10 个 Opus 5.5 智能体 15 小时「吵」出新最短路径算法 C-HD,289 个 Lean 文件通过机器验证

Vals AI 把 10 个 Claude Opus 5.5 实例放进沙盒,让它们可以在虚拟留言板上交流、互相找茬甚至「吵架」,任务是设计一种比 Dijkstra 更快的最短路径算法,并用 Lean 形式化语言证明它。15 小时后留言板留下 733 条讨论记录,它们交出一套名为 C-HD 的新算法,外加 289 个文件的 Lean 形式化证明,直接扔给 Lean Kernel 做机器验证并一次性通过。任务约束很硬:必须在带非负实数权重的有向图上找精确最短路径、必须实现理论复杂度的实质提升、必须与 2025/2026 年人类最前沿论文(如把复杂度压到 O(m log^{2/3} n) 的成果)对比、必须记录所有失败尝试、宣布成功前必须完成两次独立的「AI 同行评审」。

机制:C-HD 不再像 Dijkstra 那样只盯单个最近点,而是标出一批「枢轴点」,引进基于启发式分解的策略——沿出边做有界局部搜索、把未探索叶子节点也计入搜索限制、用搜索树与枢轴组织递归工作,并设计「局部不变量」约束每次更新;在特定稀疏图区间内取得渐近复杂度上界的超越。

⚠️ 注意:成绩来自 Vals AI 自设沙盒与自报口径,复杂度上界的具体公式在原文中以图片呈现,尚待独立复核。

原文:新智元 · 震撼,Opus 5.5首次颠覆Dijkstra算法最短路径!

7️⃣ 阿里云 Agent Sandbox:每分钟可创建 10 万个沙箱,单 Region 百万级在线,TCO 最高降 70%

阿里云 Agent Sandbox 面向两类负载:训练与评测(Agentic RL、模型 RSI 自我进化需要大量并行、可反复重置复用状态的环境)与生产应用(Agent Serving / Agent Use 的开箱即用执行环境)。它提供两种接入方式——Developer API 兼容 E2B(开发者快速创建/操作沙箱、便于迁移已有 Agent 应用,可做代码执行、文件读写与工具调用)、Kubernetes API(企业平台团队结合现有集群、权限与运维流程统一治理大规模沙箱)。

数据:支持每分钟创建 10 万个沙箱、单个 Region 百万级 Sandbox 在线;三档算力 QoS——经济型 0.060 元/vCPU·小时、通用型 0.078、性能型 0.120(专属资源池,极速版支持),均按秒计费、深度休眠期间仅收磁盘费;结合按需供给、休眠唤醒与弹性能力,典型场景整体 TCO 最高可降 70%。MiniMax 的云端助手 MaxClaw / MaxHermes 已用 Agent Sandbox 作安全执行环境。

原文:机器之心 · 给Agent一台可控的「云上计算机」:揭秘阿里云Agent Sandbox

📄 其他

  • GPT-6 Astra 自己打开专业软件干活:一张蒸汽机车图纸在 Blender 里还原出 3295 个可编辑独立零件,一句话生成带花园的住宅并自己发现法线错误、重渲修复,还能在 KiCad 里摆元件走线排出可送厂 PCB —— 新智元
  • MiniMax 上线 M3.1-Flash-Preview 并开启公测:原生多模态 + 百万上下文,可完成 Bug 修复与完整功能开发 —— 36氪
  • 荣耀 Magic9 系列发布:联合阿里打造 397B 行业智能体大模型、MagicOS 11 落地 Agent Harness,与中国移动首发 169 元/月起 Token 套餐 —— 智东西
  • OpenAI 神秘「o」代码曝光:传 DevDay 发布 24 小时在线常驻助手,网页代码出现「小写 o 是产品名」「-o 邮箱后缀」与多智能体协同看板等线索,截至发稿未官宣 —— 新智元 | 极客公园
  • Sharpa 在 IROS 匹兹堡现场发布三款自研机器人新品:一体式触觉灵巧操作机器人 D01、灵巧手 W02、外骨骼触感数据手套 AE01 —— 36氪
  • 特朗普以白宫私人晚宴款待 Anthropic CEO 阿莫代伊(两人首次单独会面),并称并不担忧 AI 失控;中美约定 11 月底前举行下一次人工智能对话 —— 36氪 | 36氪
  • IDC×浪潮信息《2026 年中国人工智能计算力发展评估报告》:全球活跃企业 Agent 将从 2026 年 7940 万个增至 2030 年 22.16 亿个(CAGR 129.8%),同期 Token 消耗 CAGR 达 4822.6% —— 机器之心
  • 港大戴勃团队 SceneMosaic:一张图生成一屋子可仿真的多样布局,相比 SceneSmith 提速 24 倍、生成一个变体场景仅需 0.03 小时 —— 机器之心

本期完整抓取清单(117 篇)与去重/回捞说明见知识库归档 raw/blog/2026-09-28/ai-news-digest-晚报.md。