本期抓取窗口 09-21 13:00 → 09-22 19:00,新文章 136 篇;其中 36氪 80 篇里约 60 篇为纯股市行情与公司公告,已按画像规则剔除,实际进入候选讨论约 15 篇。深读 7 篇(全部成功),推送 8 条:必读 3 + 值得看 3 + 其他 2。 Gemini 连黑三家公司(09-20 已推)、GPT-6 Astra 真机伤人(09-21 已推)、GPT-6 Astra 控制机器人 / 做数学(09-22 早报已推)、Jev 解禁(09-22 早报已推)、Opus 5.5 线报等均为已推送过的同一事件,本轮未重复推送。

🔥 必读

1. 阿里云栖大会:吴泳铭称「机器思考总量将达人类 1000 倍以上」,Qwen 迈向 5–10T 参数

吴泳铭在 2026 杭州云栖大会首次系统阐述「机器智能」时代,给出两个判断:

  • 判断一:未来机器供给的思考总量将是人类的 1000 倍以上。他类比工业革命把「动力」变成规模化商品——今天机器动力已承担 99.9% 的物理工作,而今天机器思考总量还不到人类的 3%,机器将承担 99.9% 的思考工作,因此至少还有几万倍增长空间。供给端:培养一名顶级专家需数十年与天赋运气,而 AI 到位后「每个细分领域都可以组织上百万个 Agent」——以新生儿早衰症为例,全球有记录患者仅几百人,从医药商业逻辑看几乎没有公司愿意投入十几年为几百人研发新药,这类方向将第一次获得大规模智力供给。需求端:人类消费物理商品受人口限制,而「AI 造一艘飞船去火星」这类超长任务可拆成上千万个子任务、由上百万 Agent 持续工作,「每一个超级个体都可以拥有上万倍的智力杠杆」。
  • 判断二:机器智能时代的代表性产品还没有出现。他把今天的 AI Coding 比作 1882 年爱迪生珍珠街电站点亮的那 400 盏电灯——「最早爱迪生卖灯泡就送电,就像今天 Agent 送 Token 一样」;而空调要等到 1902 年、第一台计算机要到 1946 年,比珍珠街那 400 盏灯晚了 60 多年。

三大基石与最新进展:

基石 进展
AI 模型 Qwen 团队在递归式自我改进(RSI)上取得进展;Qwen3.8-Max 在人类完全「零参与」下自主搭建训练流程、构造训练数据、设计实验并定位缺陷,持续迭代超 1 个月、完成 33 轮有效迭代,Artificial Analysis 得分从 40 提升到 45(+12.5%),与 Claude、GPT 最强模型同处第一阵营。推理侧:在从未见过的平头哥新 GPU 上自主适配下代架构 Qwen3.8-Flash 的推理框架,单实例吞吐 +96%。芯模协同:仅凭一份真实的总线模块规范自主完成前端/验证/后端全链路迭代,运行超 60 小时、调用 EDA 工具上万次,实现面积 -42%、标准单元 -29%、功耗 -59.5% 的物理实现优化。
AI 芯片 平头哥发布「最强国产 AI 芯片」真武 V900,算力提升至真武 M890 的 3 倍,单一集群可扩展至 50 万卡
AI 云 客户 AI 需求强劲、中长期需求远超供给;目标是 2032 年阿里云运营的全球数据中心规模超过 20GW

参数与架构路线:Qwen LLM 项目负责人刘大一恒表示 Scaling 是迈向 ASI 的关键路径,基于新一代架构的 Qwen4 已投入训练,Qwen4.5、Qwen5 计划把总参数量扩展到 5 万亿–10 万亿。架构侧提前开源下一代架构(Qwen3.8-Flash),靠注意力机制与模型内信息传递创新,在实现前沿性能的同时训练成本骤降近 90%,缓存命中输入低至 0.1 元/百万 Token

多模态与终端:图像模型 Qwen-Image-3.1(面向电商/创意/设计,把原本数小时的视觉设计压到秒级交付)、音乐模型 Happy Shrimp 1.1、世界模型 HappyOyster 2.0 Preview、语音家族 Qwen-Audio-3.1(ASR/TTS/Realtime 三线,称国内第一、超越 Gemini 3.1 TTS)、同传模型 Qwen3.8-LiveTranslate(时延压到 <2.5 秒,人类同传平均 >4 秒)、AI 手机全栈方案 Qwen Intelligence;视频侧 Wan3.0 拿下 Artificial Analysis 文生视频与视频编辑双榜第一下一代视频模型将于 11 月发布。开源侧:Qwen3.8-27B 成为 Hugging Face 历史上最受欢迎(Most Likes)的大模型,阿里累计开源 460+ 个 Qwen 模型、下载量超 30 亿次、衍生模型超 30 万个。

原文:量子位 · 阿里吴泳铭最新演讲:未来机器思考的总量将达到人类的 1000 倍以上 | 补充:Qwen4.5 后将扩展至 5–10T 参数全模态模型新进展

2. 小米开源 MiMo-V2.6 系列:AA 智能指数 46.32,超过 Kimi K3 居开源第一

小米大模型团队 9 月 22 日发布并开源新一代 Xiaomi MiMo-V2.6 系列(MiMo-V2.6-Pro 与 MiMo-V2.6-Flash,均为原生全模态),并同步开源用于新模型训练的 RL 环境、训练框架与技术报告,还将逐步开放 MiMo-V2.6-Pro-UltraSpeed(同等智力水平输出速度提升 20 倍,定价为 Pro 的 10 倍)。

  • 成绩:MiMo-V2.6-Pro 在 Artificial Analysis 智能指数拿下 46.32 分,超过 Kimi K3 与 Qwen3.8-Max,成为该榜迄今得分最高的开源模型(与同日发布的 Grok 4.7 相当);Code Arena WebDev 首测 1628 分(上代 MiMo-V2.5-Pro 为 1475),全球前十、开源权重模型第三
  • 罗福莉的说法:押注大规模 RL 扩展,完成了开源模型迄今最大规模的单次 RL 训练,并将其视为探索 RSI(递归自我改进)、通往 AGI 的一步,直言其「创新和工程难度已经超过 DeepSeek R1」。
  • 训练账本:9 月 17 日凌晨起全网「直播」训练看板,两轮训练平均每小时烧掉约 3.08 万美元。技术报告显示 6 天内 Flash 与 Pro 各完成 30 步,累计覆盖约 75 万条轨迹,训练成本分别约 85 万美元和 262 万美元,任务平均通过率提升 25% 与 12%;DeepSWE v1.1 上 Flash 48.8→65.68、Pro 58.4→72.57(各 +17 / +14 分),多数 Agent Benchmark 接近 Claude Opus 5 与 GPT-5.6 Sol。
  • 训练系统:全异步架构,单次更新 1568 个样本,最高支持 100 万 Token 上下文,每个 RL step 消耗约 35–37 亿 Token;任务从编程扩到通用 Agent、视觉与 Cyber 场景并混合多种 Harness;长程任务用组内评分机制重新分配奖励信号(既区分「完成任务」与「高质量完成」,也引导模型减少路径与 Token);为防漂移冻结 MoE Router,并针对 Reward hacking 设「奖励设计 → 对抗评估 → 验证器交叉校验」多层防护。
  • 能力覆盖面:3D 游戏开发(拆解任务、多 Agent 搭建场景并按渲染结果视觉检查迭代)、Blender 生成 3D 资产(可动画/3D 打印)、Computer Use 进具身仿真(多视角相机输入 → 控制 Franka Panda 机械臂完成抓取/颜色匹配/精确放置)、前端界面与演示文稿、产品宣传片全流程、音乐与首次探索作曲。
  • 价格:维持 V2.5 定价——Pro 输入(缓存命中)0.025 元/百万 Token、未命中 3 元、输出 6 元;Flash 为 0.02 / 1 / 2 元。网友对比称同等智力水平下 Grok 4.7 价格约为 MiMo-V2.6-Pro 的 29 倍
  • ⚠️ 质疑:有开发者认为 Flash 未达预期,在 OpenCode 中会不断循环执行命令和读取文件;智东西实测也发现多模态与编程水平尚可,但存在长时间思考、反复查找目录文件的问题

原文:智东西 · 直播「烧钱」后,罗福莉终于放出新模型,实测 MiMo-V2.6 系列

3. Meta Muse 上线 13 天被 Amazon 拉闸:AI Agent 撞上「广告驱动」的商业模式

9 月 21 日起,用 Meta Muse 在 Amazon 上购物的用户会看到弹窗:「未经授权的 AI Agent 继续访问,将违反 Amazon 使用条款」。距 Muse 上线仅 13 天。

  • Muse 是什么:Meta 9 月 8 日发布,定位「全球第一款为所有人打造的个人 AI Agent」——能开浏览器、登录邮箱、填表、订机票、直接下单。Sensor Tower 显示 13 天累计下载超 250 万次,9 月 18 日登顶美国 App Store 免费榜首,把 ChatGPT、Gemini、Claude 压在身后。
  • Amazon 的理由:Meta 从未提前告知 Muse 会访问 Amazon 商店;Agent 浏览时不表明 AI 身份;且似乎会捕获并存储用户登录凭证。Amazon 把 Muse 类比外卖平台与 OTA——「代替用户从其他商家购买商品时,都应当公开透明并尊重服务提供商是否参与的决定」。
  • 真正的痛点:Amazon 去年广告收入超 680 亿美元,其链条前提是「人在浏览」——输入关键词、滑过赞助商品、被推荐算法引导、点击购买。而 Agent 不浏览:不滚页面、不看赞助位、不被种草,只找货并结账。在 Agent 发起的交易里,广告失去了存在意义。
  • 法律武器已失效:2025 年 11 月 Amazon 起诉 Perplexity(Comet 浏览器 AI Agent 冒充普通用户登录代购),2026 年 3 月拿到初步禁令;但 8 月第九巡回上诉法院撤销禁令,理由是「是用户在访问 Amazon 系统,不是 Perplexity」,而《计算机欺诈和滥用法》本质是反黑客法。9 月 10 日法院又驳回重审请求,但留下口子——基于合同与服务条款的主张仍可推进。于是 Amazon 转向更古老的手段:7 月起从确认邮件删除具体商品名(让 Agent 更难解析购买记录)、robots.txt 屏蔽 47 个 AI 爬虫,等 Muse 上门只需一行弹窗。
  • 同一周的反例:Shopify CEO 宣布与 Muse 合作,支持 Agent 直接在 Shopify 商家店铺完成结账——早在 Muse 上线当天就把 Meta 加入「Agentic Storefronts」AI 渠道(默认对合格商家开放)。技术底座是 Shopify 与 Google 2026 年 1 月共同发布的 UCP(Universal Commerce Protocol),把 Agent 视为新的分销渠道而非入侵者,商家保留客户关系、定价权与交易数据。Amazon 堵门、Shopify 开门,差别不在开明与否,而在商业模式:前者靠广告驱动的流量变现,后者靠为商家提供基础设施收佣金。
  • 中国镜像:豆包手机二代(努比亚 NaviX Ultra,9 月 16 日开售,5999 元起)已从 GUI 模拟点击转向 MCP/A2A 协议驱动,并发布 SAEP 屏幕自动化操作声明协议、给 App 30 天公示期;但真机测试显示微信、美团、淘宝等主流应用仍无法自动化,能流畅调用的基本只有字节系自家应用。初代豆包手机曾在上线 48 小时内被微信、支付宝、美团、淘宝集体风控拦截。

原文:极客公园 · Meta 个人 AI 助手刚火 13 天,Amazon 就拉闸了

📌 值得看

4. OpenAI 成立独立数学顾问团 AGMAI:100+「已攻克」开放问题待审

OpenAI 宣布与独立顾问组「数学与人工智能顾问组」(AGMAI,由普林斯顿高等研究院托管)合作,眼下任务是就 OpenAI 内部模型产生的大量数学结果的评估、审查和发布方式提出建议。

  • 背景:OpenAI 称从 8 月 28 日开始训练一款新内部模型,除已公布的纳维–斯托克斯方程千禧年大奖难题解答外,已解决横跨数学多个领域的 100 多道长期开放问题,速度令内部数学家意外。9 月 8 日公开了 NS 问题的论文与 Lean 形式化证明,并明确无意申请千禧年大奖
  • 重要限定:「解决 100 多道开放问题」目前只是 OpenAI 对内部研究结果的陈述,成果尚未全部公开、也未完成数学共同体的独立审查;顾问组自己的措辞同样是这些结果由 OpenAI「报告称」产生。
  • 数学界的反弹:9 月 11 日多位菲尔兹奖得主参与发布公开信《人工智能在数学领域的严重错位》,批评 AI 公司把开放问题当作能力基准,担忧「又解决了多少道题」压过概念理解,也担忧原本用于训练年轻研究者判断力的问题被批量转化为模型测试集。OpenAI 直接回应了这封信。
  • 顾问组构成与权限:首批 9 位数学家——François Charles、Camillo De Lellis、Timothy Gowers、Martin Hairer、Nikhil Srivastava、Ulrike Tillmann、Ravi Vakil、Edward Witten、Melanie Matchett Wood,来自 ENS、IAS、剑桥、EPFL、伯克利、牛津、斯坦福、哈佛。成员不接受 AI 公司报酬、建议公开发布、服务对象不限于 OpenAI;但没有任何 AI 公司的决策权,也不参与决定 OpenAI 内部数学能力的发展速度。换言之,数学家获得的是发言、评议与公开批评的空间,没有成果发布的否决权

原文:机器之心 · 刚刚,OpenAI 成立独立数学顾问团!100+「已攻克」开放问题待审

5. SpaceXAI 发布 Grok 4.7:换更大基座主打长任务,价格不变但跑分被吐槽

Grok 4.7 换用比 4.6 更大的基础模型,延长 RL 周期、加难任务组合(更多样本需数小时完成),重点强化长时间任务、自我检查与长上下文管理;发布页定位「面向编程与知识工作的最强模型,速度达到可比模型的两倍,价格只有一半」,并被训练为原生理解 Grok Bot 运行框架。

  • 成绩(官方口径):CursorBench 4.0(考察长时编码)46.3%(4.6 为 40.4%,+5.9pt);DeepSWE v1.1 高推理强度 71.0%;Terminal-Bench 4.0 从 20.3% 升至 38.0%;AA Briefcase v1.1 1657 分(1546);GDPval Elo 1605→1695,接近 Fable 5.1 的 1735、高于 GPT-6 Astra 的 1542;EEBench 53.0→64.0%,Harvey Legal Agent 15.8→19.6%,HealthBench Professional 48.5→56.7%。跨模型比较仍受推理强度、工具配置与测试环境影响。
  • 安全:SpaceXAI 称这是其测试过的模型中拒答与抗越狱最强的一款,生物安全评测以 62.4% 登顶 LatchBio;HackerBench v0.3 仅放行 3.3% 高风险双重用途提示,同时很少误拦正常安全研究;并向少数网络安全合作伙伴开放邀请制红队能力。
  • 价格:标准版维持每百万输入 2 美元 / 输出 6 美元,与 4.6 一致;已上线 Cursor 与 Grok Build。
  • 反应:网友并不买账,「这种模型居然也敢发布,简直差到不该发布」——核心卖点被读作「不是全面碾压,而是用远低于部分旗舰的 API 成本换来接近、并在个别专业任务上领先的性能」。

原文:机器之心 · 刚刚,SpaceXAI 最强 Grok 4.7 发布!价格杀疯,跑分令人失望

6. 小鹏机器人生产线正式启用,已签供应链定点协议,年底规模量产

小鹏集团首届机器人供应链合作伙伴大会举行,来自机器人关节模组、执行器、精密结构件等核心零部件的供应链企业集中出席。小鹏机器人已与供应链企业完成定点协议签署,正在推进产线排产;近期机器人生产线正式启用,完成了从研发试制到产线制造的关键跨越。按计划,小鹏机器人将于今年底进入规模量产阶段,并率先在小鹏门店、园区等商业场景落地。

原文:36氪 · 小鹏机器人已与供应链企业完成定点协议签署,生产线正式启用

📄 其他


本期一并留档(未进推送):腾讯混元 Hy Image3.5 preview(设计师盲测胜率 +30%,2K 出图 0.15 元/张)、华为云码道鸿蒙编码大模型(千行代码错误率 -80%、一次编译通过率 +78%)、openJiuwen 开源智能体资产平台(技能/连接器/插件/专家/专家团五类资产)、清华与斯坦福在 LLM 内定位「奖励子系统」(value neuron 剪 1% 使 MATH500 从 75.2% 跌至 20.3%)、摩根大通称超大规模云 AI 支出明年或达 1 万亿美元、英国议会邀 Meta/谷歌/OpenAI/Anthropic 参加 10 月 13 日 AI 安全听证、欧盟推出数据中心 A–G 环境评级(2027 年 8 月生效)、原高瓴合伙人严文韬加入 DeepSeek 任 CFO、全球首台全天候浮空器「云哨 M1000-CNS」在四川自贡首发。