AI 日报 · 2026-09-24 早报
本期抓取窗口 09-23 01:00 → 09-24 07:00,新文章 15 篇;另按「已抓取但未推送」规则补入 2 条 09-23 晚报抓取、未进推荐位的内容。推送 8 条:必读 3 + 值得看 2 + 其他 3。 ⚠️ 本期 36氪、新智元两个源抓取超时;已手工回捞:新智元 feed 确认最新 8 条均已被 09-23 晚报抓取并留档;36氪
fetch_36kr(max_pages=8)覆盖 09-23 16:46 → 09-24 07:04 共 60 条,缺口内 AI 相关仅 6 条且均为低权重,无漏推。
🔥 必读
1. OpenAI 内部模型开始「自己训自己」,同日发布 RSI 全球安全倡议
据 The Information 爆料,OpenAI 内部模型已接管实验性模型的训练全流程——其中最昂贵、最复杂的「为 GPU 编写并逐行优化 kernel」已大部分由 AI 接手。工程师只需给出一个「想要实现的优化类型」示例,AI 就能连续跑数周落实优化;员工的多智能体还会互相协作排查问题,无需惊动人类。报道称原需数年的宏大实验被压缩到约一周,且这种自动化水平「直到最近几个月」才成为可能。
同日,OpenAI 发布一份全球安全倡议,罕见地把 RSI(递归自我改进)单列一节,明确写下「全自主 RSI 今天并未发生,在能安全做到之前不应推进」。报告警告:随着 AI 在开发下一代 AI 中承担越来越多任务,AI 进步的步伐可能急剧加速;若不采取适当谨慎,RSI 可能导致人类失去对 AI 发展的实际控制、无法对自己已看不懂的研究过程提供监督。
三项具体呼吁:
- 借助 CAISI 与澳、加、英、法、日等国已建的 AI 安全研究所网络,制定只针对前沿模型的全球技术标准——如何评估一个模型的 RSI 能力、自主研发时风险多大。
- 建立通用测量与事件报告协议:量化企业内部究竟有多少研发工作由 AI 自动完成;设强制性的人类监督触发机制(明确规定何种自动化研发流程必须立即人工审查);建仿航空业/核工业的事故分级与上报门槛。
- 主张美国应领导这一进程,理由是其处于技术最前沿、占据全球网络枢纽。
另据 The Information,OpenAI 与 Anthropic 正在敲定互测对方商用模型的协议——Anthropic 创始团队当年正因 AI 安全理念分歧而出走,此番握手颇具象征意义。
原文:新智元 · OpenAI 内部曝光:AI 开始自己造 AI,奥特曼急发全球暂停令
2. 成立 3 个月的 Simate:AutoResearch 登顶机器人榜 RoboDojo,主打「物理 RSI」
今年以来 RSI 已从硅谷前沿话题演变为全球共识:Anthropic 公布截至 8 月其内部已有 26% 的 AI 研发工作由 Claude 主导、超 90% 研发流程进入「AI 深度协作」。但数字世界的 RSI 不等于物理世界的 RSI——机器人面对连续、动态、受物理规律严苛制约的真实世界,一次失败的抓取或错误的规划,就意味重新采集数据、动辄数天的重训与重部署。
成立仅 3 个月的 Simate(Silicon Mate,硅基伙伴)给出了第一个工程注脚:其 AutoResearch 自动研究系统在机器人智能评测榜单 RoboDojo 取得第一名——该榜综合考察长程规划、空间泛化、记忆与亚毫米级接触精度——并以真机展示记忆、高精度操作、复杂长程执行与泛化能力。创始人张颖曾任头部自动驾驶公司核心技术负责人,推动一段式端到端智驾方案达到国内领先水平。
方法叫「人机共驾的弱 RSI」,分权边界明确:
- 人类研究员仍掌握方向——提出研究假设、设定目标、划定边界条件与安全物理约束;
- AutoResearch 在统一体系内自主推进方案改进、生成代码修改、下发分布式实验、调用评测工具并完成多轮迭代,循环为「提出假设 — 规划实验 — 执行验证 — 分析迭代」;
- 低风险、易验证的实验由 Agent 持续推进;高风险或需资深判断的节点主动交回研究者裁决,研究员可随时介入调整约束。
配套上,Simate 在搭一套 AI-native 的研究基础设施(模型框架、研究记忆与协作系统、数据与实验底座),让模型修改、云端实验、结果反馈与人的判断持续衔接。判读:这是 RSI 从数字世界延伸到物理世界的第一份工程注脚,落地形式是把「做研究」这一行为本身标准化、代码化——与本期另外两条(程序图 PG、DeepSeek DSec)同属「把研究/训练过程基础设施化」的线索。
原文:机器之心 · 超越 GPT-6 Astra 登顶 RoboDojo,成立 3 个月的 Simate 让机器人学会「设计下一个自己」
3. HappyWorld-Bench:给世界模型一张统一考卷,能力分 W1–W6 六级
世界模型今天面临的尴尬是:大家已经很会「生成一个看起来像世界的东西」,但假的真不了——夹爪抬起了,托盘却没有离开桌面;把黑车改成红车,旁边的楼跟着变色。作者形容行业像一所没有统考的学校:Google DeepMind 的 Genie 3(像导演,生成可探索视频世界)、World Labs 的 Marble(像建筑师,重建三维空间)、具身智能公司(像机器人教练)三类选手参加三种比赛、用三套规则,各自拿成绩宣布领先。
云栖大会发布的 HappyWorld-Bench 想把试卷统一起来。它不争论「什么技术路线才算世界模型」,改问「一个模型至少要会做什么,才说明它真的掌握了一部分世界规律」,据此分三级基础能力——表征(记住世界里有什么)、预测(知道动作会带来什么后果)、交互(事情发生后更新状态),并划出 W1–W6 六级:
| 级别 | 考什么 |
|---|---|
| W1 看得见 | 语义不错、空间不乱、短时间保持连贯 |
| W2 推得动 | 智能体采取动作,物体与环境给出合理反应 |
| W3 记得住 | 被遮挡、换视角后仍在;走过的房间与已发生事件留在世界状态中 |
| W4 改得了 | 用户主动改天气/车色/行为规则,生效但不影响无关内容 |
| W5 扩得开 | 世界可扩展,多智能体共存、通信、合作与资源争抢 |
| W6 通用 | 生成、仿真、交互、规划放进同一系统,跨环境跨任务跨模态 |
一句话:看得见,推得动,记得住,改得了,扩得开,最后才谈得上通用世界。但本次公布的 1692 个评测案例主要覆盖 W1–W5,W6 已写进框架却未被充分测量——「托盘还是不一定能抬起来」。
最有价值的是判据设计:每个案例要经过构造输入、匹配能力等级、人工复核、编写判据四步;关键是判据不能只写「机器人成功抬起托盘」,而要说明画面的哪个区域、哪个时间点应该出现什么结果——例如「托盘离开桌面后,底部应该出现间隙」。同理,改车色要同时检查道路、背景建筑、其他车辆有没有被误改,「顺手重建半条街」不算成功。整套基准设 29 个评测维度,且不强行压成一个总分:一部分来自 HappyWorld-Arena 的匿名两两比较与 Elo 排名(回答「人更喜欢哪个」),另一部分来自针对具体能力的自动化指标(回答「模型究竟在哪一步出错」)——偏好分与能力分刻意分开,因为好看和可靠不是一回事。
三赛道结果各有领先者、没有全能第一:视频赛道 HappyOyster 2.0 preview 整体领先,Genie 3 紧随并在运动约束、镜像对应、开放交互上突出;重建赛道像「偏科生大赛」——GPT-6-Astra 擅长编辑与扩展、Marble 基础场景构建更稳、HYWorld-2.0 在物理连通性领先(导航网格覆盖率 82.7% vs Marble 53.6%);具身赛道 MiniMax-H3 领先(单步操作、连续动作、成对反事实较好),但其 W4 成对反事实任务得分仅 88.62。项目地址:LivingFutureLab/HappyWorldBench。
原文:InfoQ · 人人都在造世界模型,HappyWorld-Bench 试着给出一张统一考卷
📌 值得看
4. 阿里 Qwen Intelligence:手机 Agent 的「三层底座」,荣耀 Magic9 首批搭载
网信部公告新增荣耀 YOYO Claw 等 3 款手机端侧生成式 AI 服务备案;此前一天在 2026 云栖大会现场,荣耀宣布即将发布的 Magic9 系列将成为首批搭载阿里 Qwen Intelligence(QI)的正式机型,荣耀 Robot Phone 同步支持。此前苹果智能国行版备案时曾传引入千问,如今荣耀与千问的合作「靴子落地」。
QI 是阿里最新发布的面向手机智能的全栈解决方案,分三层——先进模型(千问针对手机场景优化)、全栈平台(模块化的模型底座/Harness/端云协同/安全/自定义 Skill)、真实方案(任务规划、跨应用执行、影像创作)。首发三套 Agent:
- Mobile Planner(大脑):理解需求、规划任务、拆解步骤、编排工具并动态调整,如「安排周一去上海出差」拆成订机票/订酒店/设日历,航班取消随即给改签方案;依赖「模型 × Harness 协同演进」与双层记忆(工作记忆逐任务演化 + 长期记忆沉淀用户画像)。
- Mobile-Use(执行):「API 优先 + GUI 兜底」混合模式——有接口走 MCP/API、DeepLink、CLI,无接口则视觉理解 + GUI 操作覆盖长尾。
- Mobile Creative(影像):口语描述即可完成编排,靠轻量模型蒸馏 + RL 把生成从 100 步压到 8 步、首图 3 秒、较竞品平均提速 2 倍。
安全设三层管控:违法或高风险请求直接拒绝;涉及资金、数据删除等关键决策交还用户确认;涉及发表评论等平台规则要求的动作也交还用户。评测层面,QI 团队开放四套评测集(复杂任务规划 / 跨应用执行 / 真实手机任务 / 风险场景安全行动),覆盖 200+ 常用手机工具、1000+ 真实场景。
圆桌上,vivo AI 副总裁张飞直言:「Agent 手机还没到,不是技术做不到,而是手机形态和生态服务原本为移动互联网而生,并未为 Agent 准备。」
原文:智东西 · 不造手机,阿里凭什么做 AI 手机「Agent 底座」?
5. 4 亿副耳机等一次 AI 改造:供应链老炮集体接入一家不到两年的创业公司
四家音频供应链「老炮」——烽火宏声(ODM,AI 耳机样机已到 DVT 阶段,主打会议转写与 AI 翻译,目标年底量产出货、已有两个品牌客户下订单)、奇智创新(IDH,样机跑通「电脑放英文 TED → 耳机收音 → App 实时滚动中文翻译」的同传链路)、科奈信(ODM,工程测试板进入软硬件联调)、迈斯高(耳机 ODM,正调试新一代 AI 耳机)——四条独立推进的线,最后汇到同一家技术方:成立不到两年的 Hojo 恒聚愿景(创始人赵恒艺原小鹏汽车语音业务负责人、苏丹原腾讯 AI Lab 语音技术中心负责人)。
文章真正的价值在主线:大模型打乱了硬件分工。以前客户带清晰图纸与规格来,工厂稳定做出来即可;现在客户手里只有一个想法——「想做一款 AI 产品」。于是 ODM/IDH 必须前移到产品定义,一起讨论场景、判断功能取舍,再一路推到芯片选型与工程实现。科奈信描述了具体「超纲考题」:一颗芯片的算力能不能跑通所需音频通路?撑不住时是缩功能、调方案还是换平台?临时加需求,软硬件怎么重新匹配?奇智创新把这概括为「一朵云、两个端」——云端、手机及 App、耳机必须一起工作,任何一环掉链子,用户看到的都是同一个结果:不好用。
由此硬件 ↔ 模型之间出现了新中介层:Hojo 搭一套面向智能硬件的 AI Stack(模型、系统、记忆、App 同一体系),并自研 ASR、TTS、全双工语音等底层模型——理由是自研才能同时调准确率、响应速度、部署方式与成本。现实约束也很具体:烽火宏声 2024 年投入约 10 个月做 AI 小音箱、成功出货,事后才看清能力边界——外观/结构/电路/声学是熟悉的,一旦涉及界面设计、体验按反馈持续调整,以及卖出后的软件升级与维护,都超出经验与资源射程。联调教训同样真实:科奈信接入 Hojo 软件后连不上,表面像软件 Bug,沿链路排查后问题出在固件。
判读:主流叙事是「大厂自上而下定义下一代 AI 硬件」,本文给出的是另一面——传统硬件供应链自下而上找 AI 落点,并催生出新的中介角色。
📄 其他
- InfoQ · 从「单目感知」到「多视角立体对齐」:PrismAlign 重新定义文档结构化提取的精度上限:华为团队被 EMNLP Industry Track 2026 收录的工作。核心判断是单视角 VLM 在复杂版式、低质扫描、跨语言混排下会稳定幻觉(凭空补出源图中不存在的单元格、把多级表头压平、把模糊墨点脑补成货币符号);解法借鉴双目立体视觉——多个 VLM 对同一版面差异化观测,再用贝叶斯决策层做一致性对齐,仅在多视角于单元格粒度达成高置信共识时才落盘,其余位置标保守低置信而非放任单模型自圆其说。作者把「字段错误率逐量级收敛(10⁻¹→10⁻²→10⁻ⁿ)」类比为「大模型数据管线的有效位宽」,与 ADC 之于模拟信号同构。
- InfoQ · 2026 年的云栖,阿里给 AI 行业递了一把新尺子:阿里 ATH 事业群 MaaS 业务线总裁文征提出新衡量公式——智能价值密度 = 单任务价值 × Token 生产效率 × Token 单位能力,并给出面向 Agent 负载(而非 ChatBot 一问一答)的工程数字:FlashBoot 把模型弹性启动从 1200 秒压到 70 秒、UniScheduler 把集群调度决策从 20 秒压到 0.4 秒、首 Token 延迟 -38%、峰值吞吐翻倍、Vineyard 分布式全局 KV 缓存最高节省 95% Prompt 缓存成本、99.9% SLA 与 3600 秒超时上限。
- 新智元 · ChatGPT 版 Grok Bot 代码曝光!OpenAI 也要为你造不下班的 AI 同事:据 The Information 爆料,OpenAI 正开发更直接对标 Grok Bot 的功能,爆料博主 Tibor Blaho 从 ChatGPT 客户端代码中翻出
aeonId与accountUserId并列(安卓连续两个版本反复出现,旁边有memberAeonIds字段)以及「保护 aeon 式行为——能力状态在每个采样步骤重新捕获」的测试说明。竞争的另外三家:Grok Bot(8 月 11 日发布,同用户名下 Bot 共享一台云端持久电脑、多 Bot 群聊分工)、Claude Tag(6 月 23 日,以成员身份入驻 Slack)、Meta Muse(9 月 22 日登顶美区 App Store 免费榜)。⚠️ 属代码字段 + 媒体爆料,无官方表态。