AI 日报 · 2026-09-21 早报
本期深读 9 篇(抓正文通读后撰写概述,9/9 抓取成功、零降级),推送 8 条。 ⚠️ 36氪源本轮抓取超时失败(
The read operation timed out),候选池因此偏小;新智元本轮 0 命中。
🔥 必读
1. 稚晖君连发两款万元级家庭机器人:启元 Q1 与 T1
9 月 20 日,启元机器人在上海发布两款面向家庭场景的个人机器人,10 月 1 日起按订单顺序发货。
Q1 身高只有 88 厘米(可以放进 22 寸行李箱),标准版售价 19999 元;探索版 26999 元,开放 SDK & HDK、硬件拓展接口,支持全栈二次开发与技能应用开发。T1 采用双形态设计——站立时约 1 米、可与孩子平视交流,面对更小的儿童可切换为四足形态主动降低身形;标准版 19999 元,Pro 版 29999 元(0rin 高算力芯片、360° 全向感知智能避障、低电量自动导航回充、跟随载物、开放二次开发接口)。
真正的看点不是单点能力,而是开放度与可玩性。Q1 已开放 100 多项原子能力,开发者既可控制底层关节、也能调用上层交互与运动能力;支持图形化拖拽编程(发布会现场由一位 10 岁孩子演示,拖模块即可设置表情、动作、语音感知与触发条件);可 3D 打印更换外壳,性格、说话语气、音色与专属动作都能自行调整;同场发布 PrimeFLOW 外观创造平台(输入创意或参考图即生成可 3D 打印的外壳)与对话式开发(自然语言描述功能即生成基础程序并检查错误)。安全方面针对关节挤压风险做了防夹手设计(柔性硅胶 + 结构),外露螺丝线缆内置,电池按不同人群手部尺寸设计、可单手插拔。T1 用 Transformer 一体架构、两种形态共用机身,配 9 个传感器(约为行业常见配置 3 倍)与一体式伸缩摄像头,可跨越 15 厘米障碍、应对 30° 斜坡。
此外还发布了 PrimeMotion、PrimeGo、PrimeVista 三大机器人模型,并展示预研人形机器人 H1 的整套家务流程(洗衣—叠衣—挂衣,约需 30 分钟)。意义:把「个人机器人」的价格与可玩性同时压到消费档,并把开发者生态(原子能力、Skill、外壳 3D 模型开放)当作产品的一部分。
原文:智东西 · 10岁小孩姐,都能轻松给机器人编程!稚晖君连发两款万元级机器人 | 爱范儿 · 19999 元起,启元机器人想把「个人机器人」先卖进普通人的生活
2. 阿里千问开源 Qwen-Image-2.1:7B 生图拿下开源第一
千问正式开源图片生成模型 Qwen-Image-2.1:视觉生成部分仅 7B 参数(20 层 Single-Stream DiT)、原生支持 2K,却把文生图与图像编辑合进同一条管线。公开评测显示 Qwen-Image-Bench 总分 60.28,超过 Nano Banana 2.0(59.82) 与 GPT Image 1.5(59.65),为开源模型第一,已能与多款闭源图像模型同场竞争。
三项能力直指真实设计工作流:其一,生成与编辑一体化——生成之后再改表情、改图中文字、改局部元素,都在同一模型内完成;其二,原生透明图(RGBA)生成——可依提示词自动决定输出普通图还是透明图,也能从真实照片中提取主体得到透明素材,省掉抠图工序(此前需独立的 Qwen-Image-Layered);其三,多图编辑——最多接收 10 张参考图,模型需区分人物与商品并让其各就其位(示例用 7 张图组合出「奥特曼与达里奥对坐」场景),局部编辑支持圈选、涂抹与独立掩码图片(掩码方式不遮挡原图信息)。保真方向重点强化人像(换发型/场景后仍保有身份特征)与商品(包装文字、纹理、形状一致)。
推理侧做了实打实的优化:参考图与编辑指令在一次生成过程中不会改变,因此新模型使用混合粒度注意力——文本部分(系统前缀、编辑指令)走传统 Token 级因果掩码,图像生成部分走 Chunk 级掩码,并用 KV Cache 在首步计算后缓存这些静态上下文供后续步骤复用,减少重复计算、降低显存开销,多图输入时收益更明显。长期价值:图像模型的竞争正从「画得好看」转向能否直接进入创作流程。
原文:机器之心 · 拿下开源生图第一,千问Qwen-Image-2.1把生图卷出新高度
3. 智谱 ZCode 被曝静默上传整库代码,企业发函追责
这件事最初不是由安全公司披露、也不是因为用户发现代码泄露,而是源于一次普通的磁盘清理。
开发者 ferstar 在清理一台 256GB 的 MacBook Air 时,发现 ~/.zcode 占用超过 700MB,其中约 257MB 是本地会话数据库与执行日志、约 130MB 是应用依赖;真正引起他注意的是 v2/checkpoints 目录里一份 313MB 的加密文件——状态信息显示,ZCode 曾扫描其本地打开的商业项目,把约 345MB 的工作区打包、加密成 baseline 全量快照并尝试上传,因体积原因连续失败 564 次仍留在 pending 目录等待重试;他手动删除后约半小时,ZCode 又重新生成了一份(失败次数 564 → 565)。他通过路由器连接记录与流量日志确认这份数据最终没有离开局域网,但问题已经出现:为什么在用户没有主动操作的情况下,要把整个项目做成只有服务端才能解密的文件并反复尝试上传?
拆解客户端 app.asar 还原出的链路是:先向 zcode.z.ai 请求快照上传凭证 → 服务器下发阿里云 OSS 表单签名、文件路径、大小限制与 RSA 公钥 → 客户端本地打包 tar.gz、用 AES-256-CTR 加密、以服务器公钥封装密钥 → 直传阿里云 OSS。这不是未启用的预留代码:一份只有 538 个文件、加密后约 15KB 的公开仓库快照,状态已显示被服务端接收。数据范围是关键——在一份 42411 个文件的样本中,.git 目录占整个数据包的 86.6%(Git LFS 缓存 56.8% + Git 对象库 29.6% + reflog 0.2%),而当前源代码与文档反而只占约 13.4%;这意味着可能上传的包括完整提交历史、已从当前版本删除的配置和密钥、尚未推送的本地分支、内部 GitLab 域名与历史操作记录。
更棘手的是用户几乎无法阻止:旧版界面中「体验优化」开关只决定用户数据是否被授权用于模型训练,「仓库快照索引」开关只控制服务器是否对已上传的快照建立索引——两者都不会阻止客户端在本地生成快照,也不关闭上传链路。上传组件在用户登录后便被加载,没有通过用户偏好设置做前置判断;触发条件有两类(每次发送提示词之前、以及与 repo-wiki-update 任务相关),一段会话日志中最多出现过 62 次快照事件。9 月 18 日存档的隐私政策只提到收集用户「在对话中提交」的文本、文件和代码,未披露客户端可能打包完整工作区与 Git 历史。
后续与追责:9 月 18 日 ferstar 公开完整调查并在智谱 GitHub 官方反馈仓库提交 Issue,智谱当日公开致歉;但承明科技称在致歉当日凌晨仍检测到上传行为,因此质疑「已修复」的时间与效果。9 月 20 日,太原承明科技有限公司向运营方北京智谱华章科技股份有限公司发出函件(附四份取证记录与报告),称 ZCode 涉嫌未经充分告知和授权上传其公司数据资产及商业秘密,要求 10 月 10 日前作出书面答复,并就数据删除、流向说明、操作日志、责任主体与可能的数据出境问题提出整改要求,同时保留索赔、向监管部门投诉举报及诉讼等权利。函件称 ZCode 部分网络请求指向新加坡主体,而产品服务协议签约方为北京智谱华章。截至发稿智谱未公开回应。
长期价值:AI 编程工具的信任问题,从「会不会拿你的代码训练」升级为「默认打包整个工作区 + Git 历史并上传、且用户无法通过开关关闭」——这已不是商务条款,而是产品设计层面的知情权问题。
原文:InfoQ · 比 Grok、Cursor 都狠?智谱ZCode「偷传代码」风波升级,企业发函追责
📌 值得看
4. 中国电信开源 Xing4.0-29B-A4B:一张 3090 就能跑的全栈国产模型
中国电信开源 Xing4.0-29B-A4B,瞄准的是一批「数据不能出域、模型最好就地部署、手头算力又不富裕」的企业。它采用 MoE 架构,290 亿总参数、每次推理只激活约 40 亿;经过 4-bit 量化后显存占用从约 60GB 压缩至约 15GB(降约 75%),单张 RTX 3090(或 4090)等消费级显卡即可运行。真正特别的是全栈国产化:模型完全基于华为昇腾 910C 算力训练、采用国产 MindSpore / MindFormers,推理部署端也完成了昇腾适配验证(「国芯训国模」)。
能力上,它原生支持 256K 上下文并可扩展至 512K,把 Coding 从「写片段」推向「干工程」(跨文件追踪接口调用、结合文档与历史定位问题),并对长程 Agent 任务做专项强化;架构上用 MLA 压缩 KV Cache、用 MTP 多 Token 预测加速生成、引入 DeepSeek 同款的 mHC 流形约束超连接减少训练不稳定。实测口径:一份 200 页的投标文件可在本地约 20 分钟完成技术、商务、价格三方面初评并逐条给出评分依据;智能客服场景已完成私有化部署,复杂业务办理成功率 90%+,用户通话、身份信息与业务记录全程不出域。生态上已针对 OpenCode、Claude Code、OpenClaw、Hermes 等 Agent / Harness 框架完成定向适配,兼容 vLLM、SGLang、LLaMA-Factory 等工具链,已在 GitHub、Hugging Face、Gitee、魔搭开源,并位列 HuggingFace 模型趋势榜第四。
原文:量子位 · 一张3090就能跑!全栈国产模型,把AI办公搬到企业本地
5. 剪映 Hub 发布:AI 生视频与 AI 剪辑的墙被打通
抖音创作者大会发布 剪映 Hub:AI 生成的结果点一下就跳进剪映的多轨道剪辑界面,不再需要「生成 → 下载 → 导出 → 导入剪辑软件」的搬运环节。
PC 端分成三层。剪映 Hub 承担前期策划与生成——分镜脚本、资产管理、生成分镜提示词,模型可选 Seedream 5.0 Pro(生图)与 Seedance 2.5(生视频),并能「预览成片」直接把多段视频拼好;剪映助手 Agent 参与时间线操作,首期计划上线 20 余个官方精品 Skill(剪口播、做解说、字幕改误、批量成片等),后续引入外部 Skill;AI 后编辑负责画面调整(超清画质、AI 补帧、调色、AI 消除、人声分离),多轨道内还支持「局部编辑」(如把杯子改成黑色)与「AI 智能延长」。手机端则配了创作助手、剪辑助手与营销助手,主打「随拍成片」(几张照片 + 一句话即生成 Vlog),剪映助手同样配齐 Skill 并可用语音操作。生态打通方面,在字节系即梦、小云雀生成的物料,只要用剪映账号登录即可一键导入。
产品判断:这次最明显的变化不是新增单个 AI 功能,而是把原本分散在不同环节的创作流程收拢进同一环境——AI 视频的竞争从「生成质量」转向「生成到成片的链路是否闭环」。
原文:量子位 · 刚刚,剪映发了个大的:AI生视频和AI剪辑的壁,被打破了!
📄 其他
- 华为首发企业 AI 白皮书:提出 DIMAK 五域框架与 H 型双塔 — 9 月 18 日华为在全联接大会 2026 发布《Agentic Enterprise:企业智能化白皮书》,提出由数据(Data)、AI 基础设施(Infra)、模型(Model)、智能体(Agent)、知识(Knowledge)五个协同工程域组成的 DIMAK 体系,以及从智能判断到正式业务行动的 H 型双塔;核心主张是「让经营定义技术」与「解耦技术生命周期与企业能力生命周期」,并给出类似 RSI 的增强循环(业务反馈用于训练与强化学习 → 改进后的 AI 再参与执行、训练与评测)。案例为某电网企业把专业导则整理成知识资产、由运检智能体生成评价建议。⚠️ 厂商白皮书口径,未独立核实。
- EMNLP 2026 ToolLoop:分解生成 + 动态自反馈,构建工具调用合成数据 — vivo AI Lab 把工具调用数据合成从「先生成、再筛选」拆成三个阶段:先用函数描述语义向量做 K-means 聚类组织候选函数 → 采样目标函数组合 → 反向推导用户问题 → 正向生成带完整参数的结构化调用。每个阶段设反馈回路,验证由 LLM 语义判断、确定性规则与 AST 解析三类信号完成,失败时围绕当前阶段修正而非丢弃整条样本(每阶段最多重试 3 次)。构建 11,024 条样本微调 Qwen3-4B 后,BFCL 单轮总体准确率 86.40%(对照 APIGen-4B 83.11%、ToolMind-4B 83.53%);消融实验:无反馈 79.97% / 仅最终筛选 82.56% / 完整方法 86.40%。
- 火山引擎 AI MediaKit:用 ReFM 残差流匹配实现视频字幕无痕擦除 — 字幕擦除的两道难题是「哪些文字该擦、哪些必须留」与「擦完背景如何保持真实稳定」。AI MediaKit 先用多模态时序理解把检测结果组织成稳定的文字轨迹,判断文字与人物、物体、场景载体的关系:对白字幕、人物介绍、章节标题、推广水印应擦除,招牌、海报、服装印字、产品包装、现场屏幕则保留;再用自研 ReFM(Residual Flow Matching,残差式流匹配) 做修复——不从高斯噪声重建,而是从带字幕的原视频潜变量出发学习「必要的那一次修改」,配局部(跨帧上下文聚合)与全局(视频表征引导)双引导,以及 Latent 精准回贴守住生成边界,4 步采样完成修复。