AI 资讯早报 · 09-27
🤖 AI 资讯早报 · 09-27
本期脚本抓到 4 篇新文(机器之心 3 / 量子位 1);另按「隔 1 期补入」规则纳入 5 条(09-26 晚报窗口内抓取但未推送、或登记为「留档(推荐位已满)」的空间取舍条目)⇒ 本期共推送 9 条(必读 3 / 值得看 3 / 其他 3)。 ⚠️ 本期为薄日,且 36氪 gateway 二次滞后(
oldest=09-24 17:22、newest冻结在09-26 18:35,三次重试不变)⇒ 36氪 侧 09-26 18:35 → 09-27 07:00 约 12.5 小时为上游盲区,其余 8 源全部正常返回、无超时。
🔥 必读
1️⃣ 港科大 LexAgentHallu:最好的法律智能体也有 89% 执行轨迹出现幻觉
香港科技大学团队提出 LexAgentHallu(论文),首个把法律智能体的幻觉从「最终答案」扩展到完整执行轨迹并定位到具体步骤的评测基准。出发点是:法律模型已从单轮问答走向智能体(规划任务、调检索工具、读材料、依据中间结果继续行动),而一个错误的法源、算错的程序期限、误读的工具返回,会被后面越流畅的推理越遮越深。基准建立双层分类体系:第一层针对法律内容(法源 / 法律原则 / 程序规则 / 事实适用),第二层针对智能体执行过程(规划与推理 / 记忆 / 工具调用与观察结果理解),合计 7 个中层类别、27 个细粒度子类;收录 3414 个实例,覆盖 17 个法律类别、6 类任务,由有法律训练背景的标注者核对答案、法源与推理轨迹并做专家复核。
结果:评测 18 种闭源/开源智能体配置——即使表现最好的配置,仍有 89% 的执行轨迹至少出现一次幻觉,所有系统在法律内容层面的幻觉频率都不低于 87.5%。论文另设 RAWR(Right-Answer-Wrong-Reason) 指标,只观察最终答案正确的样本:平均仍有 68% 的轨迹含至少一种法律内容幻觉、37% 含至少一种过程幻觉 ⇒ 答案对,不代表推理链干净。任务差异明显:判决分析的法律内容幻觉频率 1.00、案例分析 0.95;过程性幻觉判决分析 0.83、判决预测 0.71——较短输出并不必然安全。27 个子类并非随机散点:程序期限错误 ↔ 救济路径错误提升度 2.82,程序步骤 ↔ 程序后果 2.59,最强的跨组信号是法源层级错误 ↔ 法律立场混淆,提升度 7.07 ⇒ 高风险错误可当早期信号,一旦命中即应触发二次检索、规则校验或人工复核。编排方式也影响错误分布:ReAct 式行动—观察循环整体与法律内容幻觉上更优,法律专用工作流更能压低过程性错误,先规划再执行没有稳定领先 ⇒ 部署时不能把模型、工具、流程拆开评估。
原文:机器之心 · 答对了,理由却错了:港科大提出 LexAgentHallu,追踪智能体的「隐性幻觉」 | arXiv 2609.09754
2️⃣ 索辰科技 × 美梦空间首发「物理感知」世界模型 Physical-WAM 与物理漂移评测基准 RoboTwin-Phys
9 月 26 日第五届全球数字贸易博览会上,杭州美梦空间(Memo)——由北京大学信息技术高等研究院高文院士领衔的 AVS 先进视觉系统研究中心孵化,2026 年 8 月获物理 AI 企业索辰科技(688507.SH)独家种子轮战略投资——发布两项成果。背景:北大与 BeingBeyond 联合发布的 BeTTER 基准(ECCV 2026)显示最先进 VLA 在标准静态测试中尚可,一旦引入空间布局偏移或时序外推,成功率断崖式下跌;斯坦福另一项研究锁定 VLA 存在「精度失效」与「力失效」两个相互独立的失效模式——模型知道「看到杯子就该抓」,却不知道「杯壁有多薄、摩擦力够不够」。
Physical-WAM(自称业内首个具备物理感知能力的 WAM 基模)的核心设计是在感知输入与动作输出之间插入一层「物理 Token」表征,由三模块构成「感知→预测→生成→修正」链条:PhysLens(物理翻译器,从多模态感知中提取摩擦、重量、重心、接触状态等不可直接观测的物理信息,输出统一物理 Token 表征)、PhysDream(物理预言家,结合当前物理表征与环境状态推演未来物理状态,预测打滑、脱手等风险并给出不确定性)、PhysAct(物理条件化动作生成,环境发生物理漂移时自动调整执行策略)。直观例:抓握纸杯时识别其低刚度特性 → 预测注水后负载增加可能致杯壁形变或滑脱 → 据此调整抓握力度与接触位置并持续修正。RoboTwin-Phys(自称业内首个以物理因素扰动为核心的机器人操作基准)在 RoboTwin 基础上新增 13 类真实世界常见物理扰动因素,覆盖物体属性 / 接触属性 / 阻尼 / 任务环境 / 相机配置五大维度,支持单因素到多因素组合扰动;三层递进逻辑 = 物理属性推断准不准 → 扰动下任务还成不成 → 性能差距上界在哪;工程价值有三:提供物理真值(物理值、接触力日志、物体运动学数据、失败时间线)、固定种子配对评估(不同模型面对相同扰动实例)、逐层区分「物理状态识别错了」与「识别对了但动作策略没跟上」。发布即开源(代码、数据集、排行榜全开放)。⚠️ 本条为企业发布稿,成绩与「业内首个」等表述未经独立核实。
原文:量子位 · 索辰科技加码世界模型,与战略投资企业美梦空间联合发布具身模型与物理测评标准
3️⃣ 顶刊 TMLR 主编约谈 10 篇 AI 代写投稿:无一通过,唯一全答对者仍因重大错误被拒
机器学习期刊 TMLR(Transactions on Machine Learning Research)联合主编、CMU 教授 Nihar B. Shah 在 2026 年 8 月 14–28 日轮值期内做了一次小规模试验(9 月 16 日官方博文《向作者询问他们自己的论文》):从原本要被直接拒稿(desk rejection)的投稿中非正式抽取 10 篇,通过 OpenReview 约作者「聊聊」。结果:1 篇撤稿、1 位作者称没空、8 篇约上但 1 人到点没出现 ⇒ 最终面谈 7 篇,作者身份含本科生、硕士、博士、高校教师与独立研究者,多为单作者论文。提问分两类:基础问题(问题设定是什么、这个符号代表什么、摘要结论在正文哪一部分得到支撑)与细节问题(技术表达式、理论结果、实验设计选择)。
7 场会谈里只有 1 篇作者答上了全部问题;3 篇能讲清高层思路但一被追问技术细节就卡住;最差的 3 篇连基础问题都答不上,且全是单作者论文。唯一全部答对的那篇也没过关——Shah 审读发现其一项主要结论存在重大错误,作者随后承认,TMLR 作直接拒稿(允许修正或收窄结论后重投);其余 9 篇直接拒稿且不开放重投。两个插曲颇有黑色幽默:① 两篇会上答不出基础问题的作者,会后发来书面答复,交给 AI 文本检测工具 Pangram 后均被判为「100% AI」;② 另一位作者在介绍自己的分析方法时,无意间完整描述了一套 p-hacking 流程。Shah 本人不排斥 AI(坦言自己为读完 8 篇论文也用 LLM 辅助),他关心的是作者能否为署着自己名字的内容负责。背景数据:TMLR 投稿量一年内增至原来的 3 倍、单作者投稿暴增至 13 倍,编辑部见过有人一天投 5 篇;desk rejection 比例从 2023 年约 6% 升至如今约 53%。
应对三招:① 7 月 1 日起按作者设年度投稿配额(「调和式」规则——只投单作者论文者每年最多 2 篇,全 9 人合著者最多 9 篇,活跃审稿人与执行编辑额度翻倍,刻意防挂名凑额度);② 7 月引入 AI 审稿(每篇附一份 CSPaper AI 审稿意见,只评估「结论是否有准确、清晰、令人信服的证据支撑」,不给录用建议,最终决定仍由执行编辑作出);③ 8 月 28 日把「写得清楚」写进录用标准,直言「几乎完全由 AI 生成、缺少人的参与」的论文很可能达不到该标准。同一问题的更大面:NeurIPS 2026 立场论文赛道 971 篇投稿中 273 篇(28.2%)被 Pangram 判为 AI 分数 100%;arXiv 计算机科学板块负责人 5 月已宣布,对存在「作者未检查大模型输出的确凿证据」(幻觉参考文献、遗留在正文里的聊天机器人对话)的投稿,所有作者将被禁投。
原文:机器之心 · AI 代写论文露馅?顶刊主编一问,作者啥都答不上来 | TMLR 官方博文
📌 值得看
4️⃣ 北大 / 清华 / 微软亚研 Nature MI:人脑信号不只能「对上」语言模型,还能反过来引导它推理
北京大学、清华大学与微软亚洲研究院的研究者在 Nature Machine Intelligence 发表研究(论文|arXiv 2606.11893|代码),把「语言模型与大脑的表征对齐」从相关性分析推进到功能性神经引导。方法:用公开的任务态 fMRI 数据(参与者完成三段论推理与传递关系推理,问题主要由伪词、虚构名称与受控属性关系构成以减少语义干扰),让来自 Qwen、Llama、Mistral、Phi、Gemma 等系列的 10 个开源模型(1.5B–72B)处理同一批刺激并提取内部激活。结果:整体推理任务下,模型表征平均可解释推理相关脑区约 76% 的可解释方差,且区域特异性明显(演绎推理脑区与多重需求网络显著高于核心语言网络);但按两类推理分别分析时,神经可预测性明显降至约 27% ⇒ 模型与人脑只在部分层面共享结构。进一步提出两种神经引导用法:NARI(推断阶段在模型中间层注意力输出上施加受约束的引导方向,不更新参数)与 NARF(微调把该方向内化进参数)。NARI 对「模型答错、人类答对」的原始错误问题实现了 100% 的纠错覆盖,且聚合出的通用方向能迁移到新问题、并可一定程度扩展至思维链推理;NARF 微调后模型在不同前提数量与排列顺序下均获稳定提升,正确与错误逻辑问题在中间层的分离更清晰,增益还能迁移到命题推理 ⇒ 学到的不是具体问题的表征,而是有一定跨任务泛化能力的推理结构。
原文:机器之心 · Nature Machine Intelligence|不只是「像大脑」,人脑信号还能直接引导语言模型进行鲁棒推理
5️⃣ NASA 给月亮造了个 AI:用 LRO 17 年数据训出可复用月球基础模型,200 万张瓦片开源
NASA 在与 IBM 研究院及多家学术机构的持续合作中推出 NASA-IBM 月球基础模型,是其 AI4S 战略的一部分,也是首批专为月球科学开发的开源 AI 模型之一(模型与数据集)。它并不把所有月球图片丢进一个视觉模型,而采用多模态、多分辨率设计:训练数据约含 11 种数据模态,同时覆盖约 1 米与 100 米两种尺度,全部来自月球勘测轨道飞行器(LRO)过去 17 年收集的数据(体量比所有其他 NASA 行星任务加起来还大,几乎是整个月球的高分辨率无缝拼接图)。模型在该数据集的约 200 万张图像瓦片上训练——含超过 100 万张 1 米分辨率高分辨率相机图像与近 964,000 张 100 米分辨率多光谱图像——经 ViT-B 编码器—解码器架构预训练,学习从不同数据中补全缺失信息,参数甚至包括照明角度、太阳参考坐标、地理范围等观测几何信息。预训练后被用于几项现阶段较难的任务:寻找月球极区可能存在的冰(永久阴影区可把冰困住数十亿年)、寻找年轻火山结构(「不规则月海斑」)、以及经典的陨石坑识别。表现上,相比其他强基线模型做到持平甚至更优,在陨石坑测绘与不规则海面区域分割上结果可比,在估算极地冰层稳定性方面优势明显。团队同时发布了机器学习预训练数据集与基准测试集,并把模型集成进开源工具包 TerraTorch、配一篇论文以保证可重复。
原文:机器之心 · NASA 给月亮造了个 AI:用月面数据训练可复用基础模型 | NASA 官方
6️⃣ 阿里开源 AI 代码评审工具 OpenCodeReview:确定性流水线 + LLM 智能体,内部已用两年
阿里巴巴开源 OpenCodeReview(Apache 2.0,Go 编写)——一款 AI 驱动的代码评审 CLI 工具,采用「确定性流水线 + LLM 智能体」分阶段架构:把文件选择、打包、规则匹配与「根据 diff 验证评审意见」这类本可确定性处理的工作交回确定性组件,只把动态代码分析交给 AI,以降低 AI 的故障面。内置空指针异常、线程安全、XSS、SQL 注入等检测;兼容 OpenAI 与 Anthropic 的模型,可评审 Git diff、分支或整个文件,支持本地运行,也可与 GitHub、GitLab、Gerrit、VS Code、MCP 以及 Claude Code、Codex、Cursor 等集成。官方称已在阿里内部被数万开发者使用两年;在覆盖 10 种语言、200 个 PR 的内部基准中,其精确率与 F1 高于 Claude Code,而 token 用量约为后者的九分之一。⚠️ 争议点必须一并看:Shopify 高级工程师 Tom Rochette 评测后写道,该架构针对的正是真实智能体故障(大型变更集覆盖不全、行号漂移、提示词不稳定),且公开基准、透明披露召回率劣势比同类工具更有说服力;但他同时提醒目前唯一一次独立基准测试结果很糟糕——在 10 个 Martian-benchmark PR 上精确率约 12%,维护者认为系工具调用异常所致、问题已修复但修复后尚未经独立验证;HCLTech 的 Daniel Vaughan 更指出最优配置下召回率仅 20%(专家标记的问题有 80% 检不出),确定性任务分发在保障精确率的同时也限制了对跨文件、架构层面问题的挖掘。Vaughan 的总结是:其贡献不在用更强的模型,而在于更好的 harness 框架——在文件调度中注入确定性、限制工具访问、用独立反思器过滤,以极小 token 成本实现 2.17 倍审查质量提升。
原文:InfoQ · 阿里巴巴开源 AI 辅助代码评审工具 OpenCodeReview
📄 其他
- 计算机科学学术界死了吗?AI 博士生该何去何从(UT Austin 博士生曹晋的公开反思 + 多研究者讨论;观点稿,无新增可核实事实)
- 微软将企业级 AI 整合至单一应用,与 Anthropic 展开竞争
- Anthropic 据悉正洽谈一项规模达 1 吉瓦的数据中心容量交易
本期共 9 条(必读 3 / 值得看 3 / 其他 3)。09-26 晚报窗口抓取但未推送的 5 条按「隔 1 期」规则补入。⚠️ 36氪 gateway 本期 newest 冻结在 09-26 18:35(三次重试不变)⇒ 09-26 18:35 → 09-27 07:00 约 12.5 小时为该源上游盲区,其余 8 源正常、无漏推。