每日 AI 新闻简报 · 报刊式排版
今日 AI 速览
新闻窗口:截至 17:30 美西时间 · 2026 年 9 月 22 日 星期二 · 本期约 6 分钟 · 在线阅读
头条
SpaceXAI 正式发布 Grok 4.7:底模与强化学习规模大幅扩展,编码与数学基准刷新业界纪录
SpaceXAI 正式推出旗舰级前沿推理模型 Grok 4.7。该模型基于 2.1 万亿参数的稀疏混合专家架构构建,原生支持 500k 词元超长上下文窗口。研发团队大幅拉长了后训练强化学习周期,在专业编程、电子工程和法律基准测试中展现出极强竞争力:CursorBench 4.0 自动化编程测试取得 46.3%(xHigh 档位)登顶榜首,软件工程真实基准 DeepSWE v1.1 达成 71.0%,法律基准 Harvey Legal 取得 19.6%,电子工程 EEBench 得分 64.0%。API 定价采取每百万输入词元 2 美元、每百万输出词元 6 美元的策略。该模型同步上线企业级开发控制台,并对长程任务执行提供自动化检查点兜底机制。
点评:对于重度依赖大模型处理长工程代码和法律专业文书的团队,Grok 4.7 的推理深度足够惊艳,但高推理深度带来的时延和长连接超时风险必须在架构层做好降级兜底。
小米开源 MiMo-V2.6 全模态大模型家族:开源模型跑分首次登顶,支持全模态 3D 物理世界生成
小米正式开源全新一代 MiMo-V2.6 全模态大模型家族。该系列包含旗舰级 MiMo-V2.6-Pro(总参数 1.02 万亿,激活参数 420 亿)、轻量级 MiMo-V2.6-Flash(总参数 3090 亿,激活参数 150 亿)以及输出吞吐提升 20 倍的 UltraSpeed 版本,原生支持 100 万词元上下文。在权威综合基准 AA 智能指数中,MiMo-V2.6-Pro 获得 46.32 分,成为当前全球开源大模型评测第一。更引人注目的是,小米团队公开了耗资 347 万美元的全套大规模强化学习实验记录与损失函数曲线,并在 Hugging Face 上完整开源权重。该模型拓展了全新跨模态能力 Vibe World,可直接端到端生成带物理碰撞约束的 Blender 3D 场景与机械臂交互轨迹。
点评:把千万级参数量压进低激活成本的稀疏架构,并直接开放权重与全套训练实验记录,想在本地或私有云跑全模态物理仿真的工程师今天就可以拉镜像部署了。
亚马逊全面拦截 Meta Muse AI Agent:禁止未授权智能体代客下单,引发智能体商业准入争端
电商巨头亚马逊部署全新自动化防护策略,全面拦截来自 Meta 新一代个人智能体 Muse 的访问与自主结账行为。尝试借助 Muse 智能体在亚马逊完成自动比价与自主代客下单的用户均收到阻断警告,提示未授权自动化智能体违反平台服务条款。这是继社交和搜索平台筑起数据围墙后,头部电商平台针对自主智能体商业行为采取的最严厉封禁行动。行业分析指出,阻断的核心分歧在于商业模式冲击:自主代购智能体直接绕过了亚马逊高利润的赞助商品广告推荐位与站内搜索推荐流,同时在支付凭据托管和退换货责任归属上面临巨大的法律不确定性。
点评:所有指望靠自动化智能体帮用户“全网比价、自动下单”的创业项目,最先撞上的不是大模型推理瓶颈,而是中心化电商巨头基于商业利益筑起的反爬反代购高墙。
研究动态
OpenAI 携手普林斯顿高等研究院成立数学与 AI 独立顾问组:多位菲尔兹奖得主加盟
OpenAI 联合普林斯顿高等研究院(IAS)宣布成立数学与人工智能独立顾问组(Advisory Group on Mathematics and AI)。该顾问组由菲尔兹奖得主蒂莫西·高尔斯(Timothy Gowers)、爱德华·威滕(Edward Witten)、马丁·海勒(Martin Hairer)以及顶尖数学家梅兰妮·伍德(Melanie Wood)、卡米洛·德莱利斯(Camillo De Lellis)等顶级学者组成。成立顾问组的直接动因在于 OpenAI 内部前沿推理模型已在实验室内自主攻破 100 余个未解决的纯数学猜想与引理,包括多项与纳维斯托克斯方程适定性相关的推论。该顾问组享有完全独立的学术审查与公开发声权限,旨在建立跨学科同行评议机制,监督机器生成数学证明的严格性与安全性。
点评:当 AI 开始触碰基础数学未经证实的猜想时,把学术信誉交给独立的顶级数学家把关,远比厂商单方面宣称突破更能守住科学共同体的信任底线。
前沿论文聚焦:排版 Agent 自演进程序化记忆与全参与稀疏架构 IntBMoE
本期两篇高分论文展示了智能体记忆机制与混合专家模型架构的新突破。清华与智谱团队发表的《Designer-RSI》(arXiv:2609.22086)提出了一种自演化程序化记忆框架,让平面设计智能体能够直接从真实用户流量中沉淀几何排版与图层变换规则,使多步海报生成的格式对齐成功率大幅提升。另一篇来自上海交大与开源社区的《IntBMoE》(arXiv:2609.21346)提出块级条件路由算法,解决了传统 MoE 架构中未激活专家参数闲置的效率损耗,在参数利用率提升 34% 的前提下实现了全专家参与的高效推理。
工具与产品
智谱 AI 全面开源 ZCode 客户端与 Agent 架构,第三方审计通过并上线“数据零留存”策略
智谱 AI 宣布将旗下 AI 编程助手 ZCode 的全套客户端代码、插件体系及底层 Agent CLI 整体向社区开源。此举是对前期关于特定插件可能将本地代码库维基索引静默上传至对象存储争议的正式解决闭环。中国信通院与绿盟科技完成的联合安全审计确认,相关涉事测试对象存储桶已物理清空并吊销全部访问密钥,客户端通信链路完全透明。同时,智谱大模型开放平台正式上线企业级“数据内容不留存”策略(Zero Data Retention),明确承诺不对企业用户通过 API 和客户端发送的代码与提示词进行持久化缓存或模型二次训练。
社区热议
Linear 深度复盘:AI 编程吞吐激增 10 倍引发 CI 瓶颈,推行推测执行与差分调度架构破局
项目管理协作平台 Linear 发布了一份详尽的工程架构深度复盘。随着团队内部全面普及自主编程智能体,每日生成的 Pull Request 代码合并请求数量激增超过 10 倍,导致原有的持续集成(CI)流水线严重过载,代码审查与自动化测试成为整个软件工程交付流程的最大瓶颈。为此,Linear 重新设计了测试基础设施,引入“推测性分支调度”与“影响面差分测试选择”机制,结合轻量级模型快速预判用例冲突,在测试资源零增加的情况下将平均代码合入等待时间缩短了 78%。该实践引发了全网软件工程团队对 AI 编程时代新型研发基础设施的广泛探讨。
Builder 观点
“AI 智能体正在 iOS 模拟器中全天候运行临时的 Vercel 预览环境,用来进行近乎穷尽式的视觉与行为自动化回归测试。软件工程的测试范式正在经历根本性重塑,从人工编写的死板单元测试,彻底转向智能体在隔离真实环境中的自主探索与验证。”
“各大科技巨头之间的个人智能体之争(Meta Muse vs ChatGPT vs Grok Bot vs Google Spark)正在从单机单兵作战,不可逆转地滑向‘多人协作与多智能体博弈’。未来的胜负手不再是哪家模型单点智商略高一点,而是智能体运行容器的跨平台便携性与环境协议通用性。”
GitHub 趋势
从 xAI Grok 4.7 的超长推理与后训练演进,到小米 MiMo-V2.6 登顶开源榜并开放全套训练损失函数,前沿大模型的竞争正从纯粹的预训练参数堆叠,快速过渡到强化学习深度与全模态物理生成的系统工程比拼。与此同时,亚马逊对 Meta Muse 的全面封锁,再度提醒我们:当智能体开始真正替人掏钱消费时,平台利益壁垒将成为技术落地过程中必须直面的最大商业现实。