AI 资讯晚报 · 10-08
🤖 AI 资讯晚报 · 10-08
🔥 必读
1. OpenAI 面向全球所有用户开放 GPT-6:Intelligent UI 上线,思考与回答交错生成
- 事实(10-08):OpenAI 宣布向全球所有 ChatGPT 用户(含免费 / 付费)推出 GPT-6,取代此前的 GPT-5.6 Sol 与 GPT-5.6 Luna。本次最核心的新能力是 Intelligent UI(智能界面)——模型可针对不同问题自主决定文字、图片、图表、按钮、表单等元素的组合,直接生成可交互的回答界面。技术上 OpenAI 搭了一套原生、支持流式生成的组件库,并配套一个界面编译器:模型边输出、编译器边逐步渲染界面,用户不必等整段回答生成完。
- 交互范式变化:GPT-6 支持「思考与回答交错进行」——刻意训练模型考虑用户等待时间,先给出阶段性结论再逐步补充,而非等推理全部结束才出结果。OpenAI 自测:GPT-6 Extra High 的开始作答时间已与 GPT-5.6 Medium 相当,但整体得分高于 GPT-5.6 Extra High;需要联网搜索时 GPT-6 Instant 平均开始作答时间提前 44%。⚠️ 均为 OpenAI 内部评测口径。
- 覆盖节奏:今天起先在 Chat 页面向 Plus / Pro / Business / Enterprise 逐步开放,明天扩展到 Free 与 Go 用户;付费档由 GPT-6 Sol 驱动、免费档由 GPT-6 Luna 驱动;ChatGPT Work 与 Codex 所用模型不变。OpenAI 称 ChatGPT 周活已超 12 亿。
- 判读:「软件主动适应人」的路线首次产品化落地——从固定 UI 转向按任务动态生成界面;对 Agent / 交互式工具链有直接参照价值。
原文:机器之心 · 刚刚,GPT-6全面开放!免费用户也能用了 | 量子位 | 爱范儿早报
2. Anthropic 发布 Claude Haiku 5.5:价格暴降 90%,OSWorld 2.1 达 72.4% 超 GPT-6 Luna
- 事实(10-07):Anthropic 发布号称迄今最快、最强、最便宜的小模型 Claude Haiku 5.5。价格是最狠的一刀:提示 ≤10 万 token 的请求,输入 / 输出单价较上代直降 90%(每百万输入最低 0.1 美元),超 10 万 token 仍降 50%,官方预计同类任务平均成本下降约 75%。性能:OSWorld 2.1 离线子集成功率 72.4%(上代 Haiku 4.5 仅 15.7%、GPT-6 Luna 48.9%);GDPval-AA v2.1 1620 vs Luna 1437;Terminal-Bench 4.0 39.2% vs 16.4%。
- ⚠️ 关键限定(报喜稿最爱藏的部分):最高分需付最大推理强度。Haiku 5.5 首次引入可调
effort参数;VentureBeat 指出切到默认的中等强度后,Terminal-Bench 从 39.2% 掉到约 20%;Artificial Analysis 也测得最大强度智能指数 43、中等强度仅 34,单任务成本 0.21 vs 0.05 美元。此外 Haiku 5.5 换了新 Tokenizer,同一段文本 token 数可能多约 30% ⇒ 单价降 90% ≠ 账单降 90%。长上下文门槛:Haiku >10 万 token 加价,而 GPT-6 Luna 到 >27.2 万才加价,故 10 万–27.2 万区间 Luna 单位价更优。 - 背景:Anthropic 15 天内补齐 Claude 5.5 全家桶(Opus 9/22、Sonnet 9/28、Haiku 10/7);定位是「高频、范围明确」的活儿与复杂 Agent 工作流里的 Subagent(文档摘要、分类、数据库查询、上下文压缩),复杂 Agent 编程仍归 Sonnet / Opus。
原文:机器之心 · 价格暴降90%,多项测试超GPT-6 Luna!Anthropic最便宜模型来了 | 智东西 | 量子位
3. 欧美开源模型齐提速:Mistral Large 4(1 万亿参数、月底开源)与 Reflection Beam 同步交卷
- 事实(10-05/10-06):西方开放模型阵营一周内连发两款旗舰,且都以中国模型(GLM / Kimi / DeepSeek / Qwen)为对标。① 法国 Mistral 发布 Mistral Large 4(代号 le Chonk):总参数 1 万亿 MoE、每 token 仅激活 490 亿,在自家机房用 3800 块 Grace Blackwell 从零训练,权重月底全部开源;Artificial Analysis 智能指数拿 38 分追平 GPT-6 Luna,为欧美开源第一(第二名 Thinking Machines Inkling 仅 25 分);法律 Agent 得分近 GPT-6 Astra 的 3 倍、Cybench 安全题解出 93%、SciCode-Verified 91.8%(超 Claude Opus 5 的 91.3%),一道修漏洞的网安考题拿 82%(Claude Opus 5.5 / GPT-6 Astra 直接拒答)。② 被称「美版 DeepSeek」的 Reflection(创始人来自 DeepMind RLHF 团队)发布首款开放权重模型 Beam:MoE 总参 5010 亿 / 激活 230 亿,23.8 万亿 token 预训 + 1.05 万张 GB300 强化 4 周、超 1 亿次 rollout;官方承认绝对能力仍落后 Kimi K3 约一代,卖点转向「单位推理算力换多少智能」。
- 大背景:Hugging Face 数据显示过去一年中国模型占平台下载量约 41%;Vercel AI Gateway 的生产流量中,开放权重模型 token 占比已从去年底不足 10% 升到今年 8 月的 56%——开放模型正从研究工具变成主流生产基础设施。
原文:新智元 · 1万亿参数「肥猫」单挑GPT-6和Claude!多项测试赢了 | InfoQ · 海外开源模型重新提速
📌 值得看
4. 微软 Windows AI 大会:Surface Laptop Ultra 首发英伟达 RTX Spark,2599 美元本地跑 1200 亿参数
- 事实(10-07):微软在旧金山办 Windows AI 与 Surface 活动(纳德拉 + 黄仁勋同台)。Surface Laptop Ultra 首发英伟达 RTX Spark N1X 超级芯片(最高 20 核 Grace CPU + 6144 核 Blackwell GPU、600GB/s、1 petaflop FP4、最高 128GB 统一内存),可在本地运行超 1200 亿参数的 AI 模型;2599 美元起(10/16 供货),顶配 5899.99 美元。微软自测对比 16 英寸 MacBook Pro(M5 Pro):首 token 快 2.1 倍、AI 图像生成 4.3 倍、视频生成 6.2 倍(⚠️ 自测口径)。
- Windows 侧为「智能体时代」重构:混合智能(本地上下文 / 操作 / 模型)、任务栏搜索接入 Copilot、OS 级 MXC 执行容器保障 Agent 安全、本地模型 MAI-Code-1.1-Flash(缩小近 80%、成本降至 1/4)、Windows ML 支持 llama.cpp;另发 Surface RTX Spark Dev Box(5999 美元)与 DGX Station for Windows(GB300、748GB 一致性内存、20 petaflops FP4,本地跑万亿参数模型)。
原文:智东西 · 首款RTX Spark电脑,开卖!可跑1200亿参数大模型 | 爱范儿 · Windows 迎来 AI 时代最大更新 | 爱范儿 · 黄仁勋发布史上最强 Surface
5. Manus 母公司蝴蝶效应完成超 5 亿美元融资:国内 Agent 创企最大单笔
- 事实(10-08):Manus 母公司蝴蝶效应宣布完成超 5 亿美元(约 33.52 亿元)新一轮融资,由博裕投资、IDG 资本领投,老股东腾讯、红杉中国、真格基金继续加持——这是国内 Agent 原生创企获得的最大单笔融资。此前彭博社曾报道其拟以 40 亿美元估值(较上一轮 20 亿翻倍)融资。9 月 29 日刚发 Manus 2.0 与多 Agent 群聊应用 Cue;自研 Agent 框架 Cascade 使 token 消耗 -23.2%、任务完成时间 -28.2%、运行成本 -32%(官方口径)。⚠️ 融资后既要与内置 Agent 的海外巨头正面竞争,也要证明高估值的长期商业价值。
原文:智东西 · 超33亿元!Manus拿下国内Agent创企最大单笔融资,腾讯投了
6. 突发:Claude 据称拿下概率论「圣杯」——渗流连续相变猜想被 AI 形式化证明(⚠️ 单一来源,待核实)
- 事实(10-08):新智元报道,Anthropic 工程师 Justin Leder 在 GitHub 提交了一个代码仓库——其中是一份由(尚未公开的)超前代 Claude 生成、并经过 Lean 形式化验证的完整证明,声称攻克了渗流理论中困扰近 70 年的「连续相变猜想」(临界点处无限大连通概率是否 = 0;3–10 维是长期无人逾越的「叹息之墙」)。2022 菲尔兹奖得主 Hugo Duminil-Copin 8 月 30 日刚在博客预言该猜想「倒于 AI 推土机」只是时间问题;数学家 Benedikt Jahnel、Gil Kalai 等已给出评价。
- ⚠️ 边界:目前仅新智元单一来源,未见 Anthropic 官方博客、论文或同行评审确认;此类「AI 证明重要数学猜想」的说法此前多次出现自述与传闻,引用时须视为待核实,不宜当作已确立事实。
原文:新智元 · 突发!Claude拿下概率论「圣杯」,AI跨过菲尔兹奖终点线
7. OpenAI 撤回 3 篇 722 数学手稿:一个正负号写错,形式化率 42%
- 事实(10-08):一天前刚一次公开 722 篇 AI 数学手稿的 OpenAI,发布首份更新日志:撤回 3 篇(均与霍奇猜想相关),起因是第一篇在一处关键论证里把几何操作的符号记成 +1(按其约定应为 -1),导致本应归零的计数变成非零、所依赖的经典定理前提不成立,另两篇借用该构造被连带撤回;手稿总数 722 → 719。另修订 14 篇、13 篇更新引用。新增 6 项 Lean 形式化,OpenAI 称已有 300 篇主结果完成形式化(42%)——此前被报道的「约六成」是按成果族统计(一族有一篇带形式化即计入),42% 是按单篇主结果统计,更反映逐行检查过的比例。
- ⚠️ 关键细节:被撤回 / 实质修订的内容几乎都落在没有 Lean 形式化的部分;OpenAI 强调撤回的是证明、不代表命题本身为错,原稿保留可查。从落款到公开相隔近三周、公开后一两天内即被撤回。
原文:机器之心 · 刚刚,OpenAI撤回了三篇AI数学论文,竟是因为符号写错了
📄 其他
- Einsia AI 发布世界模型物理「终极大考」:40 任务 9 类现象,最高仅 57.76 分
- NeurIPS 2026:Defense-as-Skill 让 Agent 安全守卫变成可进化的 Skill(9 轮迭代 ASR 0.300→0.078)
- 首篇自回归视频生成 Memory 综述出炉(港科大 / 复旦 / CMU / NYU / NTU 等,110 页)
- Vercel Labs 发布 scriptc:TypeScript 编译为原生二进制,启动快 12 倍但运行慢 7.5 倍
- 两名工程师、两个月、4 万行 Rust:Perplexity 自研 CobbleDB 替换 DynamoDB,读取延迟降至 1/5
- 谷歌用 Gemini 与差分模糊测试把 C 库 giflib 改写为 Rust,提前修复零日堆写入漏洞
- Anthropic 技术负责人:AI 几年内或超越所有人类,2028 年 AI 资本开支或达 4 万亿美元
- 大模型原生智能体手机 STEPX Neo 将于 10 月 13 日在上海发布