🤖 AI 资讯早报 · 10-07

🔥 必读

1️⃣ 4B 模型下棋比肩大师、还会讲棋,陈丹琦团队怎么做到的?

普林斯顿陈丹琦团队发布 QUEEN(arXiv 2610.03695),总参数约 4B,棋力接近一位典型特级大师(Lichess 口径 2697,而特级大师快棋等级分中位数约 2730),同时能用自然语言讲清自己为何这样走。架构思路是「沉默的大师 + 会说话的解说员」:棋力核心用 Lc0 家族的 BT5 网络(约 240M、15 层,不做搜索即近超人),语言端用通用模型 SmolLM3-3B,两者之间借鉴 Flamingo 的门控交叉注意力插入 16 个桥接模块(约 470M,逐层对接 Leela 浅层与深层表征、门控零初始化再逐步打开)。先用四阶段问答课程教语言端读懂棋盘(静态→动态→多步推演,四类问题准确率 96.07%–99.97%),再用迭代搜索蒸馏自我进化(「语言版贝尔曼更新」:每局面写三个候选,各走一步重新分析,由 Qwen3.8-27B 合并成完整解释,仅当结论更优才留作训练数据)。七轮后分数从 1782 一路升到 2697(+915)。对照:Gemini-3.1-Pro 2201、GPT-5.6-Sol 2071、同为 4B 的前作 C1-4B 32 盘全负。论证质量:战术题首步不失误率 91.6%(比第二名 Gemini 高 9 个百分点)、实战局面 97.1%;短板是概念连贯性仅 2.76(低于 Sol 的 3.61)。模型已在 HuggingFace、代码已在 GitHub 开源。

原文:机器之心 · 4B模型下棋比肩大师、还会讲棋,陈丹琦团队怎么做到的?

2️⃣ 黎曼猜想临界线零点比例下界达 67.35%:清华团队开源模型 VeriLoop E2 叩开可验证智能之门

清华大学深圳国际研究生院(刘厚德教授、周超男董事长联合指导)发布开源模型 VeriLoop E2,以 Qwen 3.8-27B 后训练,面向代码、数学、物理等有外部可验证约束的复杂推理任务。核心机制是循证收敛递归(VGR):把「生成候选」与「获得持久化提交资格」分离——候选必须先外显为可检查制品,再由独立 Verifier 判断它是否对一组固定受保护义务构成严格进展,从而把状态转换(严格进展/无进展/回归/完成)外化为可学习监督信号;训练数据池含 1,841,831 条 records。9 项 Benchmark:SWE-bench Pro 76.2%、Terminal-Bench 2.1 88.8%、AIME 2026 98.3%、GPQA Diamond 93.94%、Apex 2025 89.6% 等。数学 Demo 选了黎曼 ζ 函数临界线零点比例下界 κ:从 67.25% 推进到 67.350003708785593%,据称已完成局部不等式验证、困难区域穷尽检查(327/327 个困难 well、190,375,830 个 branch-and-bound 节点)与精确有理数组装;过程亮点是反例驱动——两个更高候选(67.3503%、67.3501%)因反例暴露种子族覆盖不全(遗漏约 2.915 的大间隔结构)而被主动放弃。同步发布 GGUF 量化版(Q6_K 为质量/效率甜点、IQ1_M 为最小占用)。⚠️ 重要限定:67.35% 目前只是有限维计算机辅助证书候选,riemannzeta.fun 公开账本截至 2026-09-17 的正式 kernel-verified 纪录仍是 67.2500703679%,与上游 Zeta23 的形式化桥接、及 Lean/nanoda 内核端到端重放尚未完成。

原文:机器之心 · 黎曼猜想临界线零点比例下界达67.35%:清华团队开源模型VeriLoop E2叩开可验证智能之门

3️⃣ RSI 火了,但自进化也会过拟合:Google 等提出 RRSI,给自进化施加正则化

Google 等发布 RRSI(Regularized Recursive Self-Improvement of Agent Harnesses,arXiv 2609.24972)。论文指出:当前 Agent 的 Harness 自进化(反复修改 prompt/控制流/工具/记忆/子智能体)本质上是在同一批 evolve tasks 上持续做 adaptive search,会带来三类耦合问题——benchmark-specific fitting、evaluation noise chasing、complexity accumulation,最终出现「evolve score 持续上涨,但离开演进集后收益迅速缩水」的反直觉现象。RRSI 的关键选择是不限制「能改什么」,只正则化「怎么搜」:Proposal 端限制单轮可同时塞入的纠缠改动数量(前期广探索、后期收紧以便归因)、保留完整 Evolution History 作证据、长期停滞时把算力转向少探索的组件;Selection 端更严——benchmark-specific 改动提前筛掉、落在噪声范围内的涨分不写永久状态、新增 context/token 必须用足够性能增益证明价值、长期无贡献机制直接 prune。最反直觉的 ablation:去掉正则化的 Unregularized Evolution 把 evolve score 推到 92.8(高于 RRSI 的 90.5),但三个从未参与演进的 OOD Benchmark 上 RRSI 达 43.6 vs 40.3,且每 Trial 仅耗 2.42M policy tokens(对比 3.80M)——更高的 evolve 分对应更差的迁移与更高的推理成本。在 Coding、Agentic Workspace、Engineering Design 三类环境共 8 个 Benchmark 验证。

原文:机器之心 · RSI火了,但自进化也会过拟合:Google等提出RRSI,给自进化施加正则化

📌 值得看

4️⃣ Token 账单扛不住了,Meta、微软开始猛砍 Claude 使用

The Information 报道,在 Anthropic 冲刺 IPO 的关键节点,Meta 与微软同时收紧 Claude。Meta 用 Claude Code 开发自家 Muse 后,内部 Claude Code 活跃用户从 6 万降到 3 万(−50%),转向自家 Muse Code(已超 6000 名员工用户)与内部 MetaCode(超 3 万人);Meta 最近一个 28 天周期在 Claude Code 上花费就超 1.05 亿美元。微软将内部 Claude 支出削减超 33%,把单人每月 token 预算从 10 万美元砍到 1 万美元,并要求尽量走 GitHub Copilot(其自动模式多数情况优先路由到 OpenAI 模型,且微软与 OpenAI 的商业关系可进一步压低成本)。Anthropic 对投资者称:ARR 自今年 1 月以来增长约 7 倍(从约 90 亿到 650 亿美元),超 100 家企业客户年支出 >1000 万美元;并回应「两客户贡献 25% 营收」是 2025 年旧数据(当时全年营收仅 46 亿美元),放到今天 11 亿美元不到当前年化规模 2%。

原文:机器之心 · Token账单扛不住了,Meta、微软开始猛砍Claude使用

5️⃣ 刚刚,诺贝尔物理学奖给到中微子天文学,IceCube 之父 Francis Halzen 独享

2026 年诺贝尔物理学奖授予比利时粒子物理学家 Francis Halzen(本届唯一得主),表彰他对 IceCube 中微子天文台的决定性贡献及「发现源自天体物理过程的高能中微子」。其核心洞见是把南极冰盖直接变成探测介质:冰下 1.5 千米、由 86 根探测串、5000 多个光学模块组成立方千米级探测器(世界首个吉吨级中微子探测器),通过切伦科夫辐射反推中微子来向。为什么中微子适合看宇宙:它不带电、不被磁场偏折、几乎不被吸收,可从致密天体核心笔直飞来并指向诞生地;高能中微子与宇宙线同源(π 介子衰变),找到其来源≈找到宇宙线加速器。工程难度三重——规模(通量极低需立方千米介质)、背景(大气 μ 子多出约百万倍)、介质(须透明、黑暗、稳定);从 AMANDA 原型到 IceCube 全阵列物理运行走了约 25 年。

原文:机器之心 · 刚刚,诺贝尔物理学奖给到中微子天文学,IceCube之父Francis Halzen独享

6️⃣ 给 ChatGPT 打水印的人,是「统计学诺奖」得主苏炜杰

OpenAI 正式启用文本水印:全球 API 客户可自行开启(默认关闭),未来几周欧盟区符合条件的 ChatGPT 与 Codex 输出将覆盖水印(全部付费档),检测器仅向通过审核的研究者与专业机构开放。直接推手是欧盟《人工智能法》第 50 条(2026-08-02 起适用)+ 6 月《AI 生成内容透明度行为准则》。配套技术报告 《textGrain: Entropy-Calibrated Watermarking for Language Model Text》 的通讯作者是今年考普斯会长奖(COPSS,统计学界「诺奖」)得主、Wharton 教授苏炜杰(2012 年来首位华人得主)。核心问题:传统「无偏」水印(如 Aaronson 的 Gumbel-max)在固定密钥下总是选同一个词,令同提示反复生成一字不差、牺牲采样多样性。textGrain 把任何无偏水印看成生成词与密钥随机数的「耦合」,证明耦合偏离独立程度的 KL 散度 = 互信息 = 固定密钥后平均丢失的抽样熵,据此引入可解释的「熵预算 β」(0–1,规定最多拿出多大比例选词自由交给密钥),再用带 KL 正则的最优传输(OT)在预算内挑最优耦合,并分块使 OT 在十几万词表上可解。

原文:机器之心 · 给ChatGPT打水印的人,是「统计学诺奖」得主苏炜杰

7️⃣ GLM-5.3 上架 Amazon,智谱打开海外收入分成通道

AWS 旗下大模型服务平台 Amazon Bedrock 官宣接入智谱 GLM-5.3,AWS 将基于模型调用量与智谱进行收入分成。除 AWS 外,智谱近期与多家海外云厂商落地收入分成模式,作为一条具规模潜力的商业路径;国内亦已与阿里云百炼等头部云厂商签署类似分成协议,华为云已上架 GLM-5.3 并就合作达成意向,形成贯通国内外的分成体系。

原文:36氪 · GLM-5.3上架Amazon 智谱打开海外收入分成通道

📄 其他