5 9月 星期六 2026 目录 中文 EN

每日 AI 新闻简报 · 报刊式排版

今日 AI 速览

最新模型与能力排行:追踪 30 款通用大模型的能力跑分、价格与擅长方向 →

🔥头条

模型发布 · 前沿阵地

OpenAI GPT-6 Astra 全面推送并登陆 LiveBench 前五,奥尔特曼就早期混乱致歉

OpenAI 宣布 GPT-6 Astra 正式登陆 ChatGPT Work、Codex 及 API,率先向 Pro、Enterprise 及 Business Premium 订阅用户全面开放。OpenAI 首席执行官山姆·奥尔特曼(Sam Altman)发文确认,团队正加快扩大灰度覆盖,并就早期部分用户遭遇的推送不稳定致歉,重申“面对失误时将全力纠偏”。同日,权威基准 LiveBench 迎来重要更新,收录 gpt-6-astra-max 评测成绩:该模型以 78.77 的综合基准分直接杀入全球前五,并在数学(96.81)与复杂多步推理(94.73)两大维度展现出极强统治力。

点评:Astra 从早期小范围预览正式走向商用生产环境,标志着前沿大模型正在从单纯的参数竞赛转向极高强度的工程落地与系统级稳定性交付;LiveBench 前五的成绩单也证明其多步推理与代码生成能力已稳居第一梯队。

OpenAI / LiveBench · 2026-09-04 · 3 源同报 IT之家报道 Sam Altman 声明 LiveBench 评测更新
形式化证明 · 数学突破

Anthropic 宣布使用 Claude 耗时 11 天自主完成费马大定理机器形式化证明

Anthropic 团队研究员 Tianyi Peng 等人正式公布一项具有里程碑意义的研究进展:基于 Claude 模型构建的形式化数学智能体,在 Lean 4 交互式定理证明环境中,仅耗时 11 天即几乎完全自主地完成了英国数学家安德鲁·怀尔斯(Andrew Wiles)1995 年长达 129 页的费马大定理全部机器形式化验证。该证明涵盖莫德尔猜想、谷山志村猜想等极度复杂的近代代数几何大厦,整个推导过程均由 Lean 内核完成严格的计算机底层检查,彻底杜绝了人工长篇审查中可能遗留的疏漏。

点评:费马大定理的形式化验证过去被学界视作至少需要数个顶级数学家团队协同数年才能完成的浩瀚工程。Claude 仅用 11 天完成这一壮举,标志着 AI 正式跨越了辅助写代码的初级工具范畴,成为人类探索终极数学真理的自主科研伙伴。

Anthropic · 2026-09-04 · 2 源同报 Anthropic 官方研究 IT之家报道
微信开源 · 多模态嵌入

微信 AI 开源日调用超 10 亿级多模态嵌入模型 WeMM-Embedding,登顶 MMEB 榜首

微信 AI 团队宣布将全面承载微信线上日均 10 亿级实际调用的通用多模态嵌入大模型 WeMM-Embedding 正式开源。该模型家族包含 2B、4B 与 9B 三个参数量级,统一采用 Qwen3.5 多模态骨干架构,支持图文交错、视频片段以及复杂视觉文档的端到端语义表征。在权威多模态嵌入基准 MMEB-v2 评测中,WeMM-Embedding-9B 以 80.6 分的高分斩获全球总榜第一;轻量级 2B 版本亦取得 77.9 分,以极高计算能效超越此前行业 8B 开源基准,已全面落地于视频号推荐、公众号精准检索与朋友圈内容理解。

点评:多模态检索与向量化表征是大模型打通真实业务场景的生命线。微信将经过 10 亿级严苛工业流量淬炼的生产级嵌入模型和权重全盘开源,为整个中文乃至全球多模态 RAG 社区注入了极具竞争力的底层基石。

微信 AI / GitHub · 2026-09-04 · 2 源同报 GitHub 开源仓库 IT之家报道 ArXiv 论文

🧠研究动态

智能体训练 · 强化学习

DRACO:动态细粒度评分准则破解长程智能体信用分配难题

来自加州大学与清华大学的研究团队在 arXiv 上发表论文提出 DRACO 框架。针对自主智能体在长达几十步复杂工具调用任务中常面临的稀疏奖励与信用分配模糊问题,DRACO 引入动态规则生成器(Dynamic Rubrics),将宏观目标自适应分解为可在轨迹各节点独立验证的微细粒度准则,并基于执行状态自监督校准中间奖励,使得长程任务强化学习训练效率提升超 3 倍。

点评:当智能体从几行脚本生成转向数小时的长程自主执行,信用分配就是强化学习的胜负手。动态打分准则摆脱了死板的人工规则注入,为训练更可靠的自主智能体提供了行之有效的数学路径。

arXiv · 2026-09-04 · 论文 2609.04094 论文原文 (arXiv 2609.04094) Hugging Face 论文讨论
视频理解 · Token 优化

筛选、压缩与再投资:长视频多模态大模型的视觉 Token 分配新法则

香港中文大学与上海人工智能实验室联合团队提出长视频视觉 Token 分配新框架 SCR(Select, Compress, Reinvest)。该方法针对超长视频输入中显存容易暴涨的痛点,构建三阶段流水线:先动态过滤静态无信息背景帧,对平缓动作片段进行跨帧特征聚合压缩,并将节省下来的 Token 预算定向再投资于高动态交互关键帧的高分辨率细节,在 Video-MME 评测中准确率提升 14.8%,同时显存占用下降 42%。

点评:算力不是无限的,均匀切帧采样更是粗暴的浪费。把有限的上下文预算向高信息密度的关键片段倾斜,是未来超长视频原生理解大模型的必由演进方向。

arXiv · 2026-09-04 · 论文 2609.03820 论文原文 (arXiv 2609.03820) Hugging Face 论文讨论

🛠️工具与产品

代码推理 · 智谱生态

智谱新模型再现:继 Ox Alpha 之后,神秘模型 Omen Alpha 悄然上线 OpenCode Go

继此前代号 Ox Alpha 的模型被证实为智谱 GLM-5.3-Flash 之后,又一款名为 Omen Alpha 的新模型于 9 月 4 日上线 OpenCode Go 开发者订阅平台。相关客户端通信协议与配置文件直接指向智谱服务端路径(zhipu),具备 50 万 Token 上下文窗口、图文多模态识别与深度思考模式。目前该模型已面向部分订阅用户提供按调用量分级的灰度测试。

点评:智谱通过 OpenCode 平台持续展开高频的“盲测跑马”,不仅能从全球真实开发者代码场景中汲取高质量对齐数据,也透露出其新一代旗舰多模态推理模型已进入最后冲刺阶段。

OpenCode / IT之家 · 2026-09-04 IT之家报道
定价策略 · API 成本

Meta 为 Muse Spark 推出数据共享折扣方案,输入价格最高直降 92%

Meta 针对旗下最新发布的 Muse Spark 1.2 与 1.3 前沿模型推出开发者数据共享计划。开发者若选择授权 Meta 将其 API 请求中的 Prompt 与模型生成结果用于后续模型迭代训练,即可获得极其可观的价格让利:输入价格由每百万 Token 1.25 美元骤降至 0.10 美元(降幅达 92%),缓存命中读取价格更降至每百万 Token 0.002 美元(降幅达 98.7%),输出价格统一降至 0.20 美元。

点评:Meta 凭借扎实的硬件底座开启了一场激进的“数据置换算力”价格战。用近乎免费的缓存读取换取真实工业 Prompt 回流,将倒逼整个商业 API 市场重新审视其数据飞轮构建模式。

Meta / IT之家 · 2026-09-04 IT之家报道
终端助手 · 车机生态

Anthropic 发布 Claude Code v2.1.261,同时 iOS 应用正式支持苹果 CarPlay

Anthropic 官方发布 Claude Code 终端编程工具 v2.1.261 版本,全面升级 VS Code 插件内的 MCP(模型上下文协议)服务可视化看板,重构会话自动归档与断点恢复逻辑,并消除了后台进程提示词缓存冷启动延迟。与此同时,Claude iOS 客户端迎来更新,正式加入对苹果 CarPlay 车机系统的原生支持,允许用户在驾驶过程中通过车载麦克风与 Siri 免提唤醒 Claude 开展语音对话。

点评:从终端开发者代码仓库到车机端免提语音,Anthropic 正在两头齐发力:一边深耕高专注度的软件工程工作流,一边向更日常的非接触式移动交互无缝蔓延。

Anthropic / GitHub · 2026-09-04 · 2 源同报 Claude Code v2.1.261 发布日志 IT之家报道

💬Builder 观点

Sam Altman (@sama) · OpenAI 首席执行官
向广大 API 客户与 ChatGPT 订阅用户推送 GPT-6 Astra 的过程在最初阶段确实有些混乱,在此向各位真诚致歉。我们的准则是:一旦发现问题就迅速公开承认并全力纠偏。我们目前正在加快灰度推进,让更多开发者尽早体验到我们在系统推理与工程能力上的真正跃升。
2026-09-04 原帖链接
Swyx (@swyx) · Latent Space 联合创始人
GPT-6 Astra 获得的行业反响完全超出了大家此前对 2026 年 OpenAI 新发布的固有预期。在与大量一线团队深入交流并完成全套实测之后,我们更加确信:整个行业已经无可逆转地从单纯的提示词工程全面跨入了以确定性、长程自治为标志的 AI 工程化(AI Engineering)新时代。
2026-09-04 原帖链接
Amjad Masad (@amasad) · Replit 首席执行官
重新翻读马文·明斯基的经典著作《情感机器》,他指出人类所谓的情感实际上是高级思维策略的选择器与切换开关。对于智能体与大模型来说同样如此:真正的通用智慧不在于单一策略的暴力迭代,而在于面对极其复杂的未知边界时,能够自适应选择并切换截然不同的解决路径。
2026-09-04 原帖链接

📈社区热议

资本动态 · 独角兽 IPO

传月之暗面(Moonshot AI)最早年内赴港上市,目标融资最高 50 亿美元

彭博社援引多位知情人士消息称,凭借 Kimi 大模型迅速崛起的中国独角兽月之暗面正筹备赴港上市,最快可能在今年内正式递表,计划募资规模在 30 亿至 50 亿美元之间。消息透露,月之暗面已选定美国银行、中金公司、德意志银行与高盛担任保荐与协调机构。此前该公司刚以 350 亿美元估值完成 35 亿美元融资,目前正就最新一轮 500 亿美元估值进行沟通。

彭博社 / IT之家 · 2026-09-04 IT之家报道
移动生态 · 视觉助手

谷歌 Gemini Spark 接入 Google Photos,支持自然语言批量修图与日程自动提取

谷歌官方宣布为移动端 Gemini Spark 接入 Google Photos 原生权限。用户如今可以通过日常口语化指令对整个云端相册进行批量智能化分类、色彩调优与元素清除;更关键的是,Gemini Spark 能够直接识别相册中拍摄的活动海报、通知单或宣传单页,一键将其中的时间、地点与待办事项提取并同步至谷歌日历。

Google / IT之家 · 2026-09-04 IT之家报道

GitHub 趋势

英伟达开源的 AI Agent 技能安全分析器,专为 Claude Code、Codex 及各类 MCP 插件设计,安装前全自动扫描提示词注入与供应链安全隐患。
今日 +2,180 星 · Python
面向长周期、复杂执行环境的智能体编排与控制平面,支持跨 Claude Code、Codex 等多种底层执行器的高可用故障恢复与状态治理。
今日 +1,430 星 · Python
微信 AI 开源的工业级通用多模态嵌入大模型,支持图文音视频任意交错输入,在 MMEB-v2 榜单斩获全球第一。
今日 +920 星 · Python
编辑点评:从 OpenAI GPT-6 Astra 凭借 78.77 综合分杀入 LiveBench 前五并走向广泛生产推送,到 Anthropic 仅用 11 天以机器验证彻底攻克费马大定理,再到微信开源支撑 10 亿级日调用的多模态嵌入基石,今天不仅见证了数学皇冠上的明珠被 AI 形式化摘取,更展现了顶级大模型正在全方位向真实代码、工业级检索以及日常工作流加速下沉。