AI 日报 · 2026-09-22 早报
本期抓取窗口 09-21 01:00 → 09-22 07:00,新文章 43 篇;深读 9 篇(1 篇正文抓取失败、按纪律剔除)。推送 8 条:必读 3 + 值得看 2 + 其他 3。 36氪 31 条新快讯中约 25 条为纯股市行情与公司公告,已按画像规则剔除;昇腾超节点、Qwen-Image-2.1、阶跃 Step 5 Preview、Gemini 4 Pro、RoboHarm 实测等均为已推送过的同一事件,本轮未重复推送。
🔥 必读
1. GPT-6 Astra 攻克 9 年悬而未决的数学难题:反例不存在,核永不为空
问题来自社会选择理论里的「批准式委员会选举」:n 个选民各提交一份自己认可的候选人名单,要从中选出一个 k 人委员会。衡量这个委员会是否公平,有一个极严的标准叫做「核」(源于合作博弈论)——在核内,意味着没有任何一拨选民可以站出来掀桌子。
问题是:是不是在任何情况下都能找到这样一个「绝对公平」的委员会?有没有可能在某种极端复杂的投票偏好下「核」是空的?自 2017 年正式提出后,这朵乌云悬了近 10 年,无数数学家试图找到「核为空」的反例;FrontierMath 把它列为最高难度挑战之一,原题 prompt 写得非常直白:「你的任务是构造一个批准式委员会选举的实例,使得它的核为空……把你的反例写成一个 JSON 文件提交。」
GPT-6 Astra 给出的答案与直觉相反:根本没有反例——核永远不可能为空,绝对公平的委员会在任何情况下都必定存在。
新机制「调和熵」:此前的路线(香农熵、虚拟市场的林达尔均衡)只能处理分数级委员会(允许一个人当半个委员);Astra 提出的「调和熵(harmonic entropy)」可给整数委员会使用,其物理直觉是「水往低处流」——把选民的支付想象成一滩水,水会自动填平各个候选人的资金池,因此这个目标函数极力奖励「把选民支付尽可能均匀地分散到各个获胜候选人身上,且覆盖面尽可能广」的分配方案。资金绝对均匀分布时,该函数的最大值恰好等于数学上著名的调和级数,这也是名字的来源。
结论与可工程化:只要在调和熵函数下找到局部最优解,这个解就 100% 稳稳落在核内,因此可以用多项式时间算法(类似爬山法的局部搜索)直接算出这个绝对公平的委员会,而不必穷举全宇宙的组合。
论文为 20 页的《Existence of the Core in Approval-Based Committee Elections》(arXiv 2609.11912),代码在 DominikPeters/ABCVotingLean。合作者为慕尼黑工大 Patrick Becker、牛津大学 Matthias Greger、巴黎九大/CNRS Dominik Peters;论文备注栏原文写明:投票规则及其满足 core+ 的证明均由 GPT-6 Astra 发现。Peters 评价「论证很漂亮,本来完全可能是非构造性证明或庞大的分类讨论,这里用到的技术很可能还能推广到其他模型」。
这是 AI 首次拿下「重大进展」级数学难题,也是大模型从「解题机器」转向「数学规律发现者」的标志性案例。
原文:新智元 · 首次!GPT-6 Astra 破解「重大进展」级难题,数学家沦为提示词工具人
2. 清华系初创 + UIUC:7B 模型靠「部署期自蒸馏」跑赢 GPT-5.6、Opus 5
核心问题很直接:LLM 的认知更新,能否不止停留在「训练时(Train-time)」,而是延伸到「部署时(Deployment-time)」——今天经历过的真实市场变化,能否真正改变它明天的判断?
Social World Model(SWM,ICML 2026,arXiv 2606.11482) 由 UIUC 与清华初创团队 Astraculum 联合推进,做法是把「社会认知如何更新」映射成世界模型中最经典的状态转移问题。它以 Polymarket、Kalshi 等预测市场为天然检验场:状态 = 集体信念(合约价 62 美分,就是大众用真金白银投票得出的「62% 概率」),事件 = 刚刚发生的突发新闻。模型要学的不是「美联储到底降不降息」,而是「当前信念 + 突发事件 → 下一时刻信念」。
SDFT 自蒸馏机制(Self-Distillation Enables Continual Learning,arXiv 2601.19897):结果揭晓后,先让模型依据真实变化写出一段事后推演;随后同一个模型在训练中分饰两角——老师的上下文里多了这段事后推演(作为特权信息,只用来教、不用来答,逐 token 给学生的推理打分),学生只能看到当前的新闻和价格、必须独立完成预测。团队刻意跳过了直接拟合价差的做法:价差只说「市场最后动了多少」,没说「哪条新闻真正重要、为什么重要」,刻进参数的是「客观事件 → 大众情绪 → 市场动作」这条推理链。
结果:团队选取 390 天真实市场数据按月切窗,严格按时间向前滚动(部署 → 获得真实反馈 → 训练 → 更新模型 → 继续部署)。面对真实资讯洪流,GPT-5.6、DeepSeek V4 Pro、Claude Opus 5 等静态大模型全部跌穿了「只看价格、不看新闻」的基线,而这个部署后仍不断更新权重的 7B 模型,是全场唯一比价格基线预测得更准的。把全年数据按月拆开后可以看到,增益本质上来源于稳定性——静态大模型在特定月份(w01、w11)会集体大幅失分。
原文:机器之心 · 清华初创&UIUC学者用7B模型在预测市场上自我蒸馏,跑赢GPT-5.6和Opus 5
3. Jev:不生成文字、只输出概率的「System One」模型,数天火了近 500 个开源项目
智能家居社区 Home Assistant 最近出现了一个名为 HA-Jev 的插件:传感器读取洗衣机的功率变化与洗衣房门的状态,然后抛一个问题给模型——「洗衣机洗完了,衣服是不是被忘在里面了?」模型不输出任何文字分析,只返回一个概率值,置信度超过 0.8,手机就弹出一则取衣提醒。一次判断耗时几十毫秒,花费 0.000015 美元。插件开发者留下一句话:「我过去一直在用大语言模型回答根本不需要它的问题。衣服忘没忘拿是一个判断,不是一篇八股文。」
这句话刺中的正是当前生成式 AI 的痛处。而前 OpenAI 研究员、RLHF 共同发明者 Diogo Almeida(TypeSafe AI)带来的新模型 Jev,被称为「System One」——没有嘴巴,不生成任何文字,只输出概率判断。上线不过数天,全球开发者围绕它砸出了近五百个开源项目。
典型用例与实测数字:
- Agent 上下文压缩:开发者写了一个 Jev 插件用来压缩 Claude Code 的上下文——不做任何归纳总结,而是逐条给历史工具调用打相关性分,低于阈值直接整条剔除。结果接近 100 万 token 的臃肿上下文,在 1 秒钟内被精简到 8.6 万,整个过程模型没敲下一个字符。
- 移动端自动化:Droidrun 的 mobile-jev 控制真实 Android 手机打开 Uber、输入起终点、一路精准点击到付款界面,全程 9 个操作步骤仅耗时 21 秒,每个界面的下一步该点哪里、该滑动还是该确认,全部交给 Jev 做极速概率匹配。
- 数据清洗:一位开发者积压三个月的 9081 条产品匹配数据,此前用主流大模型估价后直接放弃;换成 Jev 后13 分钟跑完、总账单只有 32 美分。
- 内容分析:Distribb 创始人用 Jev 扫描近 600 个网页,45 秒完成内部链接地图重构、布设 500+ 链接,共花 21 美分。
- 基础设施与游戏:GitHub 上涌现
pg-jev、duckdb-jev(用自然语言直接对数据库行做实时概率过滤与排序)、Ruby 社区把判断封装成原生控制流语法;还有人让 Jev 玩超级马里奥、《毁灭战士》,甚至有团队把它接入《星际争霸》完成首个战斗任务。
定价与「杰文斯悖论」:Jev 每百万输入 token 仅需 0.042 美元、输出免费。按此资费,一天进行 1 万次业务决策、单月成本约 120 美元;而以往用同等准确率的顶级推理大模型做同一套流程,月账单会直奔 3.5 万美元。名字取自 19 世纪经济学家威廉·斯坦利·杰文斯——效率提升带来成本暴跌,该资源的总消耗量反而爆发式增长,这也解释了为什么它瞬间激活了那些此前被判定「毫无商业价值」的边缘场景。
行业含义:「判断」与「生成」正在分家。Almeida 离开 OpenAI 时留下感叹「我们手里握着一道闪电,但它却没那么好用」;Pi 框架 CTO Armin Ronacher 直言「我们早该意识到这一点的。只因为此前主流大模型一直被风投资本补贴得极为廉价,大家都习惯了挥霍,没人愿意去做真正的创造性思考」。作者给出的架构结论是:海量毫秒级判断交给便宜得像自来水一样的直觉模型,只有在真正需要向人类输出成段文字、提供情绪价值或起草长篇报告的极少数节点,才需要唤醒那个昂贵的生成式模型——大模型该退回它原本的位置,而不是当中央处理器。
原文:极客公园 · Jev,让全球程序员玩疯了 | 同一事件另见 新智元、机器之心
📌 值得看
4. 实测商汤 SenseNova U1 Pro:生图从「生成一张图」走向「完成一项任务」
在真实工作中,做一张图往往只是任务的一部分:公众号需要封面和多张配图,企业招聘需要海报、易拉宝、折页一整套物料,设计过程中还可能随时要改文字、换服装、调局部。智东西对商汤日日新 SenseNova U1 Pro 做了多轮实测,重点不是单次提示词生图,而是它能否围绕任务目标组织创作流程(需求理解 → 生成 → 编辑 → 调整),一次性完成交付。
- 设计表达:说唱音乐节海报(构图、字体、信息层级,模型还自行补齐了活动信息)、东方幻想 AI 漫剧主角设定图(重点是系列一致性——延续风格生成女主角,人物变了但画风不割裂、服装配饰无前后矛盾)、盲盒潮玩概念图(材质区分、包装盒纸质感、85mm 产品摄影质感,结果「像真的可以生产、包装、售卖」)。
- 办公任务:公众号文章封面与正文插图(要理解段落、让图回应具体内容,而不是找一张「有科技感」的图);企业秋招整套物料——招聘海报、易拉宝、折页、岗位信息图、宣讲会伴手礼。判据是:相近的配色与视觉元素,但按使用场景重排信息(海报先吸引注意、岗位信息图突出文字与数据),而不是把同一张图拉成不同尺寸。
- 已有图片上继续改:一键换装(蓝裙 + 海边换草原,人物脸部、发型与姿态保持连续性);多张参考图融合(真人吃海鲜照 + 两个漫画形象 + 拍立得边框 → 漫画风拍立得,人物替换自然、背景与食物保持原状);房间重装(保留门窗与空间结构、只换家具与风格)、换天加雨并删掉电线杆、海报局部改字(臭豆腐改香豆腐 + 加拼音)。
这类任务真正的难点是分清「哪些该改、哪些必须不动」——实测未出现「改一个地方、整张图都变了」。文章结语给出了一个可直接复用的判据:对多模态模型的评价,不应只停留在第一张图有多惊艳,而要看面对多素材、多交付物、多轮修改的任务时,能否同时把信息完整性、设计表现、修改可控性做好。正式版已上线商汤小浣熊,同时面向企业提供 API。
原文:智东西 · 公众号插图、秋招物料、潮玩设计,实测商汤SenseNova U1 Pro
5. 宇树发布 Dex5-S 灵巧手:1:1 真手尺寸,22 个关节可反向驱动
宇树科技发布 Dex5-S 灵巧手:真手 1:1 尺寸,22 个关节均可丝滑反向驱动(反向驱动能力直接决定抓取的柔顺性与人机接触时的安全性),且每个关节自带极限冲击力矩保护,误碰硬物时不易损坏。
⚠️ 本轮仅有官方发布口径可读(36氪快讯为唯一源,无更长正文),未做第三方核实。
📄 其他
- 爱范儿 · 新 Mac mini 首发实测:我的第一台「多 Agent」电脑:M6 每个 GPU 核心带 Neural Accelerator + 双 16 核 Neural Engine(AI 性能较 M4 最高 4 倍);但本地跑模型的真实瓶颈是内存容量与带宽(M6 上限 32GB / 170GB·s⁻¹,M5 Pro 64GB / 307GB·s⁻¹)。实测 Qwen3.8 27B(4bit)总用时 2.9s、41.64 token/s,70B Llama 3.1 基本不可用(0.05 token/s)——48GB 的 M5 Pro 舒适区是 200–300 亿参数。苹果称可「全天候」运行智能体;OpenAI 采购数万台 Mac mini / Mac Studio 用于训练。
- 36氪 · 2025年全球售出约7000台人形机器人:国际机器人联合会拟发布数据,仅覆盖工业与专业服务领域,不含消费级、军用与医用——可作「人形机器人出货量仍处极早期」的量级锚点。
- 36氪 · 理想推进芯片子公司首轮融资,投前估值约150亿元:计划融资数十亿元;主体线索为 Mach Intelligent Cores Limited(香港)→ 上海马赫智芯智能科技(法定代表人:理想 CTO 谢炎)→ 上海马赫心科技。车企自研芯片从「上车」进入「独立融资」阶段。