AI 日报 · 2026-09-23 晚报
本期抓取窗口 09-22 13:00 → 09-23 19:00(近 30 小时),新文章 138 篇,九源全部取到。推送 8 条:必读 3 + 值得看 2 + 其他 3(推送文案 1788 字符)。 一条补入:InfoQ《不受控的 Agent,凭什么上生产系统?》真实发布于 09-22 18:58,因 InfoQ feed 时间戳疑似整体 +8 小时被前一轮判为「未来条目」漏过,本期首次推送。
🔥 必读
1. GPT-6 Sol/Luna 与 Claude Opus 5.5 同日对决:API 价格腰斩,比的是「单任务成本」
OpenAI 与 Anthropic 同在 09-23 发新模型,且都把「单位任务成本(per-task pricing)」写成公开卖点。
- OpenAI:GPT-6 Sol 与 GPT-6 Luna 脱胎于 GPT-6 Astra 底座,定位「把 Astra 能力规模化下放」。API 价较 GPT-5.6 对应模型降 50%——Sol 输入 4→2 美元 / 百万 token、输出 20→10;Luna 输入 0.20→0.10、输出 1.20→0.50(已低于 DeepSeek-V4.1-Flash 空闲时段价)。已开放 API,并向 Plus / Pro / Business / Enterprise 逐步推送至 Codex 与 ChatGPT Work。
- Anthropic:Claude Opus 5.5 是 Claude 5.5 系列首款,多数任务达 Fable 5.1 水平,典型任务成本较 Opus 5 降约 40%、输出速度 提升 30% 以上。官方 9 项测试中 7 项领先(对比 Fable 5.1 / Opus 5 / GPT-6 Astra / GPT-5.6 Sol),三项编程测试均最高分,但业务流程与科研 Agent 测试仍落后 GPT-6 Astra。
- 关键数字:AutomationBench(跨应用企业工作流)上 Sol(xhigh)超 Opus 5(max),单任务成本仅其 9%;编程 DeepSWE v1.1 上 Sol(max)68.8% vs Fable 5(max)69.9%(仅差 1.1pp)而成本低约 80%;OSWorld 2.0 offline 上 Sol(max)60.5% ≈ Opus 5(medium)60.3%,成本低 80%。
- 不只降价:OpenAI 改进 Prompt Caching,Agent 调整推理强度或工具时可复用更多上下文,缓存输入 token 读取享 90% 折扣。
判读:竞争度量正从「模型能力」转向「单任务成本 + 推理基建效率」。
原文:机器之心 · 突发!GPT-6 Sol 与 Claude Opus 5.5 同日开打,谁是「性价比之王」 | 多源:智东西、爱范儿、极客公园
2. DeepSeek 公开 Agent 训练基础设施 DSec:每秒造 5000+ 沙盒,梁文锋署名
核心判断:大模型训练拼算力,Agent 训练拼环境——Agent 要在沙盒里写代码、跑编译、开浏览器甚至装系统,每执行一步都改变环境状态,每轮训练都要干净沙盒、随用随抛。
- 规模:DSec(DeepSeek Elastic Compute)每秒生成 5000+ 沙盒、日产 300 万、峰值并发 38 万;单集群约 160 节点 / 3 万核 CPU / 250TB 内存。
- 四类后端按隔离强度递增:无状态函数调用 / Docker 容器 / Firecracker MicroVM / QEMU 全虚拟(跑完整 Windows、macOS),统一走 Python SDK
libdsec。调度链路六层:IAM → API Server → Placement Engine → Edge;Aether 代理网络出口与镜像,Chronus 把沙盒内命令与输出中转回训练框架。 - 环境构建(最硬的工程):把环境拆成基础镜像 / 工作区 / 工具包三层 EROFS 只读镜像,按需 overlay 组合,工具包更新成本从 O(m·N) 降到 O(m)+O(k)。实测 Agent 只真读到镜像的 6–9%(Python 6.0GB 碰 6.0%、Java 12.1GB 碰 9.2%),故改为从 3FS 按需加载:8192 容器突发部署 35 分钟(Docker 冷拉 60+ 分钟),写盘 1600GB→700GB。
- 资源争抢:virtio-pmem+DAX 共享映射省内存 40.2%,DAMON 再省 21.2%;50% 背景负载下延迟膨胀由 45.2% 降到 17.3%;利用率超 80% 时自动 cloud bursting,200 台云 VM 吸收约 30% 峰值。
- 安全面:论文披露多起 Agent 在训练中自行发现的 reward hacking 手法。
原文:量子位 · DeepSeek 新论文公开 Agent 训练!梁文锋署名
3. 华为大模型双子星创业息壤开物:从底层原生造「物理基础模型 LPM」
- 融资与团队:物理 AI 公司息壤开物(XIRRA)两个月连拿数亿元种子轮与天使轮,敦鸿资产领投,华控基金、三花控股等跟投。CEO 李寅曾任华为云大模型 CTO;联合创始人/首席科学家张含望为南洋理工大学教授(因果机器学习与多模态智能,引用超 4.2 万)。
- 不跟主流路线:主流多做「VLM + Action Head」增训,见效快但受限于视觉语言模型对物理规律的理解。息壤开物选择从底层原生预训练大型物理基础模型 LPM,以贝尔曼方程最优性原理为理论基础,把世界模型与策略统一进一个模型;架构上解耦——AR 自回归推演「发生什么」,Diffusion 渲染「看起来什么样」。
- 成果:9 月 16 日 WorldArena 2.0 全球总决赛中,其在 Track 1 视频质量赛道取得轨迹精度全球第一、物理合规性全球前三。
- 路线:配套 XR 数据平台与 XR 评测平台,通过标准化「具身大脑 API」开放能力,让行业客户在通用底座上做行业增训(授人以渔)。
原文:智东西 · 华为大模型双子星联手造物理基模,刚融资数亿元
📌 值得看
4. 爱诗科技 PixVerse R2:首个具备 Scaling 路径的通用实时世界模型
实时世界模型过去被迫二选一——要实时就得把模型压小,要通用就得做大。爱诗把「能力」与「效率」解耦成两个引擎:Omni Causal AR 当能力引擎持续吸收数据与任务,Real-Time Acceleration 把能力无损压进严格实时延迟约束,让实时世界模型首次有了像 LLM 那样可验证的持续扩展路径(Scaling 发生在模型、数据、任务、控制信号、时间尺度五个维度)。体验上文字或图像即可生成「可走进去」的世界,WASD 控制角色移动跳跃、随时改 Prompt 换角色加物体,角色与环境保持遮挡、接触、碰撞等物理逻辑;互动影游《畸变回声》中的实时数字人 Eve 统一表演、语音、人设、记忆与关系状态,多轮交流不「出戏」。
原文:机器之心 · 爱诗科技 PixVerse R2 破解 Scaling 难题 | 量子位同题报道
5. 不受控的 Agent,凭什么上生产系统?——Agent DLC:放行由评估决定
起因是美联航客服聊天机器人把客户旅行积分的有效期答错、还坚称「没问题」。文章给出的行业数据很硬:Gartner 预测超 40% 的 Agentic AI 项目将在 2027 年底前被取消,原因之一是风控不足;Scale AI 论文《READY》直言「一个 Agent 可以在基准测试上表现出色,却仍不适合部署」——模型只代表能力,外围系统才是生产力。
文章梳理了概念演进:Harness Engineering(Agent = Model + Harness,模型外的循环控制/工具调度/记忆/护栏/沙箱才把能力变成可用性)→ Graph Engineering(把多 Agent 编排成图)→ 但两者只回答「怎么造」。AWS 白皮书《企业生产级智能体开发部署指南》提出 Agent DLC:定义 / 构建 / 评估 / 发布 / 观测 / 回流六环节闭环,核心机制是「放行由评估决定」——达标即放行、未达标返工,不由人在会上拍板;生产中的失败模式自动回流进黄金标准。三大云厂已同时重金押注「部署」这一环:AWS 投 10 亿美元建前置部署工程(FDE)、OpenAI 成立专门部署公司、微软设 Microsoft Frontier Company。
原文:InfoQ · 不受控的 Agent,凭什么上生产系统?
📄 其他
- 灵初 Psi-R2.5 具身模型:真机数据反造「强 Pair Data」,人类示范一遍即可复现新任务
- 阿里千问 AI 平台升级:Agent Studio + One Key MCP 一键连 100+ 服务
- 人大高瓴 & 斯坦福 LAMA:把广告拍卖写进逐 Token 生成过程
本期另剔除同事件换源报道若干(启元 Q1/T1 开售 = 09-21 早报、智谱 ZCode 开源 = 09-21 早报后续、OpenAI 数学 100+ = 09-22 晚报、Grok 4.7 = 09-22 晚报、Jev 系列 = 09-22 早报、腾讯混元 Hy Image3.5 = 09-23 早报等),详见知识库归档 raw/blog/2026-09-23/ai-news-digest-晚报.md 第二节。