AI 资讯早报 · 10-04
🤖 AI 资讯早报 · 10-04
引言:本期为国庆假期薄日,九源中仅机器之心有真实新增(6 篇),智东西 1 篇为已两次剔除的同事件续报。经同事件去重后共 6 条,全部为机器之心单一源。
🔥 必读
1️⃣ Karpathy 用 40 年前航空写作规范 ASD-STE100 治大模型「废话」 Karpathy 分享一组让大模型输出更易读的技巧,底料是上世纪 70 年代欧洲航空业的受控英语规范 ASD-STE100(最新 Issue 9:53 条写作规则、约 900 个批准词、约 1200 个建议避免词)。规则朴素——程序性指令 ≤20 词、一句只安排一个操作、尽量用主动语态、同一概念从头到尾只用一个名字。大模型常为「语言丰富」轮换同义词,反而造成阅读障碍;STE 反其道而行。Karpathy 发现把这套规范交给 LLM 后输出明显更清晰,但日常常只要求「做到 80% 的 ASD-STE100」以免僵硬。他进一步主张「能画图就别写字」:让模型生成 diagram、直接输出可交互 HTML(如用滑块实时演示学习率对梯度下降的影响),乃至生成完全定制的 3Blue1Brown 风格讲解视频(接 ElevenLabs 旁白)。核心判断:模型越强、越多具体工作由模型自主完成,人的工作向上移到监督/检查/理解,而 AI 可反过来帮人做这部分——为某个很具体的问题临时生成「庞大、定制、用完即弃的软件产物」(large, custom, discardable software artifacts)。社区已有开源 Skill(asd-ste100-skill,分 Strict 与 STE-flavored 两模式)。分歧:有人实测「好像也没什么区别」,共识是内容越复杂(长篇技术解释、多步骤操作、Agent 间指令)效果越明显。 原文:机器之心 · Karpathy 的新玩法!40 年前的航空规范,救了爱说废话的 AI
2️⃣ StartLux-Decision 开源:38 项基准 31 项超 Jev,中国决策模型登顶 上海明星创企 StartLux(原点星辉,成立不到 5 个月)于 9 月 30 日发布完全开源的决策模型 StartLux-Decision,一次推出 0.8B/2B/4B/9B/27B 五档并附本地部署量化版。在 Decision Index 0.2.1 的 38 项基准中,27B 版有 31 项高于 Jev 1.13,综合得分 63.88 对 57.91(领先公开榜首近 6 分);与 Jev 的国际象棋对弈 36 局赢下 35 局(均不借助搜索、直接选步)。团队说明该成绩为自测(基于公开榜单 09-28 快照与上海 AI Lab Intern-Decision 评测集,两套独立口径)。文章解释了「决策模型」的定位:Agent 里大量步骤其实是短小的确定性选择(Yes/No、多选、评级、选工具),生成式模型要先产出自然语言再解析,而决策模型直接对开发者提供的候选做选择/判断;单卡 H200 上 4B 版一次回答三个问题平均 26ms,0.8B/2B 分别为 12.2/15.5ms(用 CUDA Graph、快速线性注意力算子、多问题合并前向)。这也是 StartLux「本地智能分层」的一环:27B 承接复杂推理与对话,Decision 填充调用最频繁的高频判断层。 原文:机器之心 · Jev 被请下王座,StartLux 中国开源决策模型冲上第一
3️⃣ CoRL 2026 LeaP:可学习源先验,让机器人动作生成从「起点」就更稳 东南大学魏秀参团队论文被机器人学习国际会议 CoRL 2026 接收。研究追问一个被默认的问题:生成式机器人策略的「动作生成起点」应是一个确定值还是一个分布?团队提出可学习源先验 LeaP,把固定的标准高斯源分布替换为本体感知条件下的对角高斯分布,用两层 MLP 先验头(仅 0.21M 参数)联合预测均值与对数方差,为动作生成提供随机器人状态变化的随机初始化,生成器再结合视觉与本体感知细化。RoboTwin 15 项双臂操作任务上平均成功率 81.6%,较同编码器/生成器的标准高斯基线(NoPrior)提升 25.5 个百分点,并领先确定性起点的 VITA、A2A 分别 6.5/7.8pp;真实 Franka Research 3 三项任务达 80.0%(NoPrior 46.7%)。消融最见洞见:仅用预测均值 78.0%,叠加固定标准差 1 的高斯噪声反降至 62.7%,联合学习状态自适应方差才达 85.3%——「有随机性不够,方差必须随状态变化」;先验只用本体感知(加视觉反而降到 59.3%–70.3%),与「先验定起点、生成器补细节」的分工一致。代码已开源。 论文:arXiv 2606.17408 | 仓库:SEU-VIPGroup/LeaP
📌 值得看
4️⃣ Meta 开源 Muse Gadgets:ESP32/树莓派,人人都能造 AI 外设 Meta 为个人 AI Agent「Muse」推出开源项目 Muse Gadgets,下放硬件能力:开发者可用 ESP32 开发板跑 Muse 固件,或用 Linux SDK 在树莓派 5 等边缘设备运行客户端;官方给了彩色墨水屏看板、HDMI 显示棒、触控掌上挂件等 DIY 形态,流程为在 gadgets.muse.ai 领 API Token、导入 GitHub 代码库交给 Claude Code/Cursor 等生成驱动、刷入固件。同时发布官方设备 Muse Home Link(USB-C 供电,让 Muse 接入家庭网络控制电视/音响等智能家居),首批试产 5000 台、对符合条件的订阅用户免费。Alexandr Wang 称目的是释放开发者创造力。已有网友动手:把电子墨水阅读器改成 MagSafe 随身屏、用约 50 美元的 SenseCAP Watcher 连个人酒窖(拍酒标识别酒庄年份)。文章点出 Agent 时代的硬件路径变化:从「公司造硬件→用户购买→开发应用」转向「公司提供模型与 Agent 能力→开发者创造各种形态的设备」。 原文:机器之心 · 刚刚,Meta 开源 Muse Gadgets,让全球开发者自己「造 AI 外设」
5️⃣ 万分之一稀疏监督:只保留 1 个 token 的梯度,推理能力反而更强 亚马逊与杜克大学论文(arXiv 2609.04565)挑战「后训练需要密集 token 级信号」这一默认假设。以 On-Policy Distillation 为场景,研究团队对每条 rollout 仅随机保留 1 个 token 处的梯度(4000 token 的 rollout 即 0.025% 监督),学生模型推理能力仍显著提升;若保留「教师-学生分歧最大」的 1–2 个 token,可匹配甚至超过全信号训练,且学生超过教师本身。跨任务(数学/代码)、跨模型(Qwen3/Llama)、跨范式(OPD/PPO-RLVR)一致成立。消融给出关键规律:性能与监督密度并非单调——随监督变稀先降后升,极端稀疏时反超全信号,再稀则学习信号不足;万分之一监督只更新约 10% 的网络参数即取得大幅提升。有趣的是,最强调优学生的输出分布与教师的差异反而可能变大,暗示并非单纯模仿。机制仍是开放问题,作者类比人类学习:已有先验时,少量关键纠正信号即可改变后续策略。 原文:机器之心 · 万分之一——大模型后训练中的极端稀疏监督
6️⃣ DepthART:Depth Anything 砍到 6M 参数,深度估计跑进 Jetson 论文被 ACM Multimedia 2026 接收,研究单目深度基础模型进入 6M 级后哪些能力易失、训练该怎么改。两个核心设计:① 抗偏置数据采样 BRDS——从约 4400 万张多源图按特征空间密度降采样,得约 170 万张更均衡数据,再用 Depth Anything V2-L 伪深度把相对深度先验蒸馏进 TinyViM+DPT 小模型;② 相机条件化微调 CamFT——冻结蒸馏好的编码器,加轻量相机适配模块引入相机内参,并以多查询尺度估计头恢复真实尺度(先保护几何、再学尺度)。DepthART-S 仅 6.0M 参数,在 NYUD v2 零样本相对深度评估达 δ1=0.964;strict FP32 下 RTX A6000/224² 约 347 FPS,TensorRT FP16 model-only 延迟 0.918ms,提供 PyTorch/ONNX/TensorRT/Jetson Orin NX 部署路径。2026 年 9 月又增 MobileNetV4 版本(slim-SPF 版约 6.05M 参数、3.78 GMAC,NYUD δ1 仅从 0.953 降到 0.952),且只用标准 ONNX 算子、降低 BPU/NPU 移植门槛。 原文:机器之心 · 把 Depth Anything 砍到 6M,深度估计终于能跑进 Jetson