AI 资讯早报 · 10-08
🤖 AI 资讯早报 · 10-08
🔥 必读
1️⃣ OpenAI「疯狂 28 天」Day 2 四连更:Auto-review 全面免费、API 分档五改三、Meetings 进 ChatGPT、Decisions API 公测
Tibo 承诺「连续 28 天、每天一项明确更新」,第一天让 GPT-6 Astra / GPT-6.1 Sol 订阅下默认速度提升约 50%;第二天一口气放出四项跨 Codex / ChatGPT / API 的更新。① Auto-review 全面免费(即权限菜单的「Approve for me」,不再消耗套餐额度):主 Agent 执行时由第二个 Agent 专盯高风险、偏离原始意图的操作,缓解长任务里频繁手动批准的负担——但它不等同绝对安全,只是让长任务权限管理更接近可用工作流。② API 付费分档由五档压成三档(Build 5 美元 / Launch 100 美元 / Grow 500 美元),进最高档门槛从 1000 美元减半、达标自动升级,缓解扩容时的 Rate Limit 摩擦,而非直接降价。③ Meetings 插件进入 ChatGPT(macOS 桌面端 Pro/Business 公测),会议记录与待办自动存入 ChatGPT Space,让「工作发生」到「AI 拿到上下文」的距离更短。④ Decisions API 进入 public beta(DevDay 首发,由 GPT-6 Luna 驱动),提供 Predicates / Choices / Scores 三类输出,专做「判断下一步做什么」而非生成长文本,官方称速度最高约为 Responses API 调 GPT-6 Luna 的 10 倍(150ms vs 1.6s,⚠️ 系 OpenAI 自测口径)。
原文:机器之心 · 刚刚,OpenAI四连更!API最高档付费砍半,Auto-review全面免费
2️⃣ 谷歌发布 Nano Banana 2.1:设计感、蒙版编辑与多人一致性全面升级,底模换成 Gemini 3.6 Flash
Google DeepMind 于 10-07 凌晨发布 Nano Banana 2.1,底模换成 Gemini 3.6 Flash,定位仍是「Flash 级速度成本 + 向专业图像生成与编辑靠近」。重点提升三项:① 设计/信息图——Infographic Design 得分 1048(前代 961、Pro 912),整体偏好 1050(990/935),能把排版、字体、色块组织到同一画面而非只画好单个主体;② 蒙版局部编辑(Mask/Ink-Based Editing 1049,前代 965/927;General Editing 938→1026),可圈选物体改环境而保持主体位置不变,逼近传统编辑软件的确定性;③ 主体一致性——单角色 981→1028、多角色 978→1106(整个编辑评测表中差距最明显的一项),并强调消除「AI 味」的照片与材质自然度。开发者侧支持 1K/2K/4K 输出、最多 14 张参考图、1:4~8:1 极宽幅平铺,已上架 Gemini App / AI Studio / Gemini API / 搜索 AI Mode / Ads / Flow / Stitch。评测为人类侧对侧 Elo(⚠️ 均为谷歌自测口径)。
原文:机器之心 · 刚刚,Nano Banana 2.1发布!这一次杀向专业设计师
3️⃣ 2026 诺贝尔化学奖:95 岁 Kagan「迟到 25 年」,与硤合宪三破解「生命为何只用一只手」
瑞典皇家科学院 10-07 将 2026 诺贝尔化学奖授予法国 Henri B. Kagan(1930 年生,95 岁)与日本 硤合宪三(Kenso Soai),表彰他们在不对称有机合成中发现非线性效应与自催化现象。自巴斯德发现分子手性以来,「生命为何只用单一手性(同手性)」百年悬而未决,1953 年 Frank 提出实现它所需的三条理论条件。Kagan 在 1986 年(JACS 三篇)发现:金属催化剂会形成「左-左 / 右-右 / 左-右」三种组合,若异手性组合恰好低活性,等于把杂质锁起来,产物的手性纯度可超过催化剂本身的纯度——非线性效应由此成为独立研究方向;他 2001 年与诺奖擦肩(沃尔夫奖同年授予、诺奖却无他),法国学界称「被偷走的诺贝尔化学奖」,时隔 25 年终获认可。硤合宪三 1995 年在《自然》做出首个不对称自催化反应(Soai 反应),2003 年更进一步:从完全不带手性的原料出发,靠随机涨落放大,加料三次即从 0.00005% 领先冲到 >99.5%(且每次实验赢的可能是另一只手)——人类首次在生命之外造出接近纯粹的单手性。Frank 的三条件到此全部打通。
原文:机器之心 · 刚刚,诺贝尔化学奖揭晓!95岁的他等了25年
📌 值得看
4️⃣ USENIX Security 2026:上海创智学院×复旦给智能体装上「轨迹安全规则审计员」MATE
上海创智学院与复旦大学提出 MATE——首个面向移动/GUI 智能体执行轨迹的「规则感知」安全审计模型(已发表于 USENIX Security 2026)。它把「任务指令 + 执行轨迹 + 自然语言安全规则」一起交给专门训练的轻量模型(0.5B/1.5B/3B 三档),输出违规判定、风险类别与基于轨迹证据的解释。关键设计是安全规则以可编辑文本存在、不写死在参数里,换场景 / 改政策 / 调整权限边界无需重训,同一条轨迹在不同规则下可得不同结论。它直击现有两类方案的痛点:静态规则难覆盖长轨迹的上下文语义,通用大模型 Judge 成本与延迟高、且把完整轨迹外发有隐私风险。训练语料由 158 个中英文 App 的功能/工作流/安全策略知识驱动合成,超过 14 万条规则条件化轨迹,并引入轨迹—规则错配等增强策略。配套 MATEBench 基准、GitHub 与 HuggingFace MATE-3B 开源。
原文:机器之心 · USENIX Security 2026|上海创智学院×复旦大学给智能体装上轨迹「安全规则审计员」
5️⃣ NeurIPS 2026:SAGE 用「结构信号」纠偏长推理,AC 实例 Lean 验证通过率近 8 倍
弗吉尼亚理工、威斯康星大学麦迪逊分校与达特茅斯团队提出 SAGE(结构可采纳性引导探索),追问「长推理为何总在中途走偏」。它用符号闭包分析(SCA)把长推理的两类偏差摆到同一张结构地图上:探索偏差(局部可行前缀占比随深度连乘急剧缩小,终点奖励有限时难采到有用轨迹)与累积偏差(仅终点给奖励,早期决策缺纠偏,微小偏离沿长链放大)。SAGE 据此设计两个训练期结构势函数——代数稀疏化(比较候选操作对应子空间能解释多少残差)与双曲结构引导(把状态与目标映射到双曲空间,逐步反馈远近),只软重排训练采样、推理期零额外开销。12 个基准、7 个模型家族中总体优于 SFT/GRPO/EMPO/GRPO-PRM;Andrews–Curtis(AC)长程符号任务上,Qwen3 的 Lean 验证通过率接近基础模型的 8 倍。⚠️ 结构信号是训练期构造、非正确性证明,理论保证不能原样搬到自然语言任务。
原文:机器之心 · NeurIPS 2026|长推理为何总在中途走偏?SAGE用结构信号纠偏
6️⃣ 视频世界模型的「量化闪烁」:QuantWM 免训练 2-bit KV Cache 压缩,最高 6.2 倍
哈工大(深圳)iLearn-Lab 与新加坡国立大学 LV-Lab 发现:把视频世界模型的 KV Cache 量化到 2-bit 后,即使 VBench 分数几乎不变,画面仍出现明显闪烁、模糊(现有 QVG 方法的评测指标未捕捉到这种退化,例如 HY-World 1.5 上 BF16 与 QVG 的时序闪烁分为 95.62% vs 95.85%)。根因:分别量化 Key 与 Value 时,量化 Key 比量化 Value 更伤画质——Key 的量化误差虽更小,却会改变注意力分数的相对排序,让模型检索到另一帧 / 另一个时空位置,扰动对历史场景的利用。团队据此提出免训练的 QuantWM:量化敏感性感知聚类(QSAC) 选择量化后注意力扰动最小的聚类中心,主子空间注意力补偿(PSAC) 用低秩形式补回关键方向误差(仅用 8 个主方向即可覆盖约 71% 的 Query 能量)。在 Matrix-Game-2、LingBot-World-v2、HY-World 1.5 等 5 个模型上,KV Cache 最高压缩 6.20 倍,最高分历史 token 选择偏移从 53.88% 降到 10.19%。
原文:机器之心 · 量化后画面闪烁?时序稳定的视频世界模型2-bit KV Cache压缩方案诞生
📄 其他
- OpenAI 突破纳维–斯托克斯方程之后,物理学中发生了什么变化(Nature 评论:Karniadakis 估算奇点出现时旋涡核心宽约 70 纳米、已近空气分子平均自由程,属连续介质理论在极端尺度下的数学破裂;⚠️ 该 N-S 结果此前已由 09-22、10-01 期推送,本期仅留档)