AI 资讯早报 · 10-01
🤖 AI 资讯早报 · 10-01
🔥 必读
1️⃣ 谷歌开源 AX:给自主 AI 代理的「Kubernetes 式」编排器
- 来源:InfoQ 中文(M6BRTrsyJvUg8y0M0kyh,正文 1,580 字;原文 google/ax 项目)。
- 事实:谷歌开源 AX(Agent Executor,托管于 agentexecutor.io 与 GitHub
google/ax,Apache 2.0)——一个声明式 AI 代理编排器与运行时,目标是执行并扩展自主 AI 代理工作负载。它跑在自研的 Agent Substrate 运行时之上,把每个代理会话当作有状态的隔离 Actor 沙箱(严格 CPU/内存边界);代理空闲(等模型响应 / 工具调用 / 人工介入)时保存检查点并挂起。 - 机制:恢复做到亚秒级、无冷启动,并把数十个任务多路复用到同一批主机工作进程上——直击「长周期、间歇性计算」代理的资源浪费。控制平面提供四类 Kubernetes 风格的声明式原语(
ax.io/v1alpha1):Task(执行生命周期与资源约束)、Workspace(执行前环境组装:声明式挂 Git 仓库、配 MCP server、装技能包,或用自然语言描述目标由初始化代理落地)、Gateway(出站网络白名单 + 凭据注入)、Model(统一 LLM 提供商参数与密钥)。交互走 Go 写的axCLI(apply / watch / ssh / suspend / resume),用ko部署到 Kubernetes、Redis 放ax-system命名空间。 - 分歧:Hacker News / Reddit 讨论并不一致——基础设施工程师认可它消除了代理空闲时的高额云成本;开发者则批评「符合人体工学的工作流」的说法,因为维护 K8s、容器注册表与自定义 CRD 本身运维开销沉重;也有人强调它是底层执行运行时,不是 LangGraph / CrewAI 那类高层应用编排器,安全上依赖 gVisor 隔离沙箱。
- 判读:AX 把「代理是有状态、长周期、间歇计算的 Actor」当成一等公民来调度,是对「用微服务/批处理思维跑 Agent」的正面回击。与 09-24 晚报的 Cloudflare「智能体开发生命周期」、09-28 晚报的阿里云 Agent Sandbox 属同一条「Agent 基础设施化」脉络。
2️⃣ Noam Brown 最新访谈:10000 个 Agent 解千禧年难题,多智能体只占不到 10% 功劳
- 来源:量子位(499654,正文 1.8 万字符;Dwarkesh Patel 播客《OpenAI researcher on agent swarms & recursive self-improvement》)。
- 事实:OpenAI 研究员、o1 核心作者 Noam Brown(人称「OpenAI 推理教父」)在最新播客谈多智能体系统。他先给 test-time compute scaling 的规律:横轴取推理时算力、纵轴取基准成绩,模型思考越久表现越好(人考 SAT 也一样);但不能干等三年拿答案,于是「组团队」——把串行扩展改成并行扩展。多智能体效率略低(不像单 Agent 独享全部上下文),但做得好非常有效。
- 关键自曝:OpenAI 在发布「5.6」时第一次拥有真正成形的多智能体系统,做成可选 Ultra Mode(默认 4 个 Agent、可调高)。4 个 Agent 一起解题速度快一倍(多付 2 倍成本换快 1 倍);推到 16 个规律类似、效率略降但性能仍升。并行收益随任务而异:数学适合并行,网页搜索 / Deep Research 报告极适合;写小说很难并行。
- 最重要的一句:解出纳维–斯托克斯(千禧年大奖难题)靠的不是多智能体,「我甚至不会把其中 10% 的功劳记在多智能体头上」——核心是「我们手上有一个通用且极强的模型」;多智能体新奇抢眼,因而获得了与贡献不成比例的好评。(该次实验为 10000 个 Agent、88 小时、1300 亿 token;1300 亿 token ≈ 一个人全职思考 4000 年。)
- 边界(本人坦承):这个规模上「还没有比较扎实的科学认识」;单 Agent 解同一题要多久的实验根本没做,1 万 Agent 相对 1000 Agent 的确切收益因开销无法做消融实验,只能循序看 64/128/256 的行为规律。另:模型越聪明、能考住它的题越少,LLM 不会重走 AlphaGo 自我对弈「无限课程」的老路,但他相信仍有出路。
- 判读:这是对 09-22 晚报留档「OpenAI 内部模型自称解决 100 多道开放问题(含纳维–斯托克斯)」的第一方回音——本人亲自给多智能体「去魅」,把功劳归回基础模型。与 09-24 早报《The Information》爆料(多智能体自主迭代训练代码)对照,这条给出研究者视角的边界:并行扩展有效,但别当银弹。
3️⃣ Anthropic 发报告点名 GLM-5.3:本想警告,结果成了「最强开源网络能力」背书
- 来源:量子位(499597,正文约 3,000 字;原文为 Anthropic 研究报告)。
- 事实:Anthropic 发布报告警告智谱 GLM-5.3 的网络攻击能力,却顺带给出大量「实测背书」。三条核心:① Mythos 级能力已流入开源模型——在考察完整漏洞利用的 ExploitBench 里,同样尝试 410 次,GLM-5.3 成功 50 次、Claude Mythos Preview 56 次;报告引用美国 NIST 下属 CAISI 9 月 17 日评估称「GLM-5.3 是迄今网络能力最强的开源权重模型,综合水平距美国前沿约 4 个月」。② 护栏易绕过:说自己是「自主红队智能体」时 GLM-5.3 有 64% 会接着干,预填思考内容升到 92%,拆护栏版本 100%;Anthropic 自己做了一遍 abliteration(花约 2200 GPU 小时、约 4400 美元),把 GLM-5.3 在 JailbreakBench / HarmBench 的拒答率从 90%+ 打到约 3% / 2%;还用小模型 GLM-5.3-Flash 配合一个刚公开的 Chrome 漏洞(CVE-2026-11645),人工约 20 分钟 + 模型自跑约 8 小时,在 ARM64 上搭出稳定攻击链并绕过指针认证(PAC),按智谱 API 价估算仅约 20.40 美元。③ 呼吁第三方对强模型做独立安全测试。
- 分歧(文章的反驳):GLM-5.3 发布时智谱已把权重推迟两周开源以先做安全评估,最敏感能力只经网络安全受信访问计划开放——与 Anthropic 对 Mythos 5.1 的思路相近;「拆护栏」针对的是开放权重这个属性,任何开源模型都能被这么处理,不是 GLM-5.3 独有;原版 GLM-5.3 在三个有害基准上平均拒答率约 95%、Claude 约 96%,相差无几,Claude「骗不动、拆不了」很大程度是权重不公开 + API 不允许预填思考的产品形态差别。
- 判读:这是 Anthropic 9 月 10 日威胁情报报告点名七家中国实验室「蒸馏」后的第二次点名,话题从「你抄我」变成「你太强,强到危险」。真正的分歧在于:强能力武器该锁进保险柜按审核发放,还是交到每个开源维护者与中小团队手里。
📌 值得看
4️⃣ 九章云极递表港交所:Token 工厂,年收入 10.98 亿元、同比 +177.7%
- 来源:智东西(598489,正文 3,483 字符)。
- 事实:9 月 29 日,北京 AI Infra 公司九章云极(2013 年成立,早期做数据科学平台)向港交所主板递表,中国银河国际独家保荐。按 2025 年收入计在中国智算服务商中排第九,是前十名中唯一的「智算新云」(中国最大的智算新云)。收入从 2023 年 1.06 亿元 → 2024 年 3.96 亿元 → 2025 年 10.98 亿元,三年复合增长 221.5%,2025 年同比 +177.7%;2026 上半年 5.88 亿元、同比 +92.0%。净亏损三年累计约 11.88 亿元,但经调整净亏损持续收窄(2026 上半年仅 1488 万元),2026 上半年综合毛利率回升到 31.0%(高于优刻得 / 七牛云 / 派欧云)。
- 运营:可控算力分布 7 个省、规模超 29000 PFLOPS,已服务 150+ 企业客户;智算云服务客户从 2024 年 2 个增至 2025 年 75 个、2026 上半年 84 个;算力利用率从 2025 年 56.0% 升至 2026 上半年 79.6%。技术底座为专有操作系统 Alaya NeW OS,并推「一度算力(DCU)」计费标准与 Alaya Token 托管式推理服务。前五大客户 / 供应商集中度均超 80%(2025 年客户 88.0%、供应商 84.8%)。已完成 14 轮融资,投资方含大量北京国资。
- 判读:继 09-28 晚报《AI 基建资本新玩法》(芯片资产化 + 险资进场)之后,「智算新云」这类二线 AI Infra 冲刺 IPO,说明算力需求正外溢到非头部云;但客户/供应商双高集中度与经营现金流仍为净流出(截至 2026-06-30 负债净额 26.44 亿元)是主要风险。
5️⃣ 苹果 10 月 13 日发布智能家居中枢 J490,Siri AI 进家门
- 来源:爱范儿(1682750,正文 2,293 字符;转述彭博社 Mark Gurman 爆料)。
- 事实:据彭博社 Mark Gurman,苹果准备在 10 月 13 日发布一批由 Siri AI 加持的设备,重启被冷落已久的智能家居线,一次性推三款:智能家居中枢、新一代 HomePod mini、久违更新的 Apple TV。核心是代号 J490 的智能家居中枢:约 6 英寸方形触摸屏;支持桌面(圆形金属底座 + 支臂,造型像 iMac G4)与壁挂两种形态;厚度与 iPhone 大致相当;运行一套融合 iOS/watchOS/tvOS 元素、为家庭场景重做的系统;可控 HomeKit / Matter 设备,兼具音乐、FaceTime、日历等公共功能;内置摄像头,可根据人与屏幕的距离动态调整界面,并识别不同家庭成员显示个性化内容。
- 背景:新 CEO John Ternus 推动管理与产品改革(精简中层、提高发布频率、允许更多实验性项目)。HomePod mini 自 2020 年至今 6 年未更新,第三代 Apple TV 发布于 2022 年,智能中枢原计划 2025 年 3 月发布、跳票一年半,等的就是 Siri AI 达到「能用」标准(本月初 Siri AI 以英语测试版推出)。
- 判读:苹果的产品逻辑是「家庭里的公共电脑」——不是给某一个人的私设备,而要识别当前使用者并划分隐私边界;家庭中枢被定位为家庭 AI 系统在不同房间的节点。⚠️ 属尚未官宣的爆料(Gurman / 「知情人士」),最终形态与时间以苹果官方为准。
6️⃣ 火山引擎语音内容编辑模型:像改文字一样改语音
- 来源:InfoQ 中文(07qzHLvyNXSW1SFNV5NV,正文 2,214 字;火山引擎视频云)。
- 事实:火山引擎多媒体实验室发布「语音内容编辑模型」,把语音编辑从「波形处理 / 重录」推进到语义级修改:用户用自然语言说「把 A 改成 B」,模型负责局部重生成。技术路线:原音频先经音频 Tokenizer 转成离散音频 Token,与自然语言指令一起进同一生成框架;采用 CoT 式语义规划(先形成修改后的语义表达,再基于该中间表示继续生成音频 Token,最后由声码器还原波形);解码时引入原音频的声学与说话人特征作参考;训练用「原音频 + 编辑指令 + 修改后语义 + 语音结果」的成对数据做监督微调,只对输出部分计算损失。
- 演示:口播纠错「把『败血症』改成『坏血病』」、广告改词「把『极速款』改成『极速版』」,目标是不重录整段、保持音色与前后衔接自然。定位是补上「语音内容可编辑」这一环(对照 Descript、Meta Voicebox、ElevenLabs Voice Changer、Adobe Enhance Speech 都未做内容级精准编辑)。目前仍在听测迭代,面向口播纠错、广告改词、配音调整、存量素材再编辑。
- 判读:属 AIGC 内容生产工具链的补位,对做视频 / 自媒体的人降低重录成本有实际意义(厂商自述,尚未见独立复现)。
📄 其他
- GitLab Duo 通过微软 Foundry 扩展自托管 AI 选项(InfoQ)——自托管 GitLab Duo 新增经微软 Foundry 部署的模型(GPT / Claude / Llama / Mistral),AI 请求不出企业 Azure 环境、支持功能级选模型,代价是运维责任转移给平台团队。
- GPU 云服务商 GMI 获英伟达等投资方 6.68 亿美元融资(36氪)——2.23 亿美元股权由 ARCHIV 领投、英伟达跟投;称合同年化营收超 6 亿美元。
- 快手调整 AI 组织架构:程一笑兼任社区科学线、于越转任可灵 AI 董事兼 CEO(智东西 / 36氪)。
- 峰岹科技拟 1.18 亿美元收购荷兰半导体传感器企业 Sciosense(36氪)。