9 9月 星期三 2026 目录 中文 EN

每日 AI 新闻简报 · 报刊式排版

今日 AI 速览

最新模型与能力排行:追踪 30 款通用大模型的能力跑分、价格与擅长方向 →

🔥头条

千禧难题突破 · 学术争议与形式化验证

OpenAI 称用 1 万个 AI 智能体在 88 小时内攻破千禧年大奖难题,学术界掀起数学证明与伦理争议

9 月 8 日,OpenAI 宣布其内部高级研究模型调用 10,000 个推理智能体协同推导,历经 88 小时运算,声称给出了困扰数学界近一个世纪的千禧年大奖难题,即纳维-斯托克斯方程存在性与光滑性的完整数学证明,并同步开源了机器可读的 Lean 形式化代码。然而该项成果旋即在数学界引发剧烈震动。纽约大学数学家 Tristan Buckmaster 发布公开声明,指责 OpenAI 绕过学术界正常的同行评审机制抢发成果;菲尔兹奖得主陶哲轩(Terence Tao)在肯定 AI 推动复杂数学证明巨大潜力的同时,也对其未经验证的大规模声称表达了审慎担忧。

点评:无论这项证明最终能否经受住顶级数学家数月的严谨推敲,AI 从“辅助刷题”迈向“集体攻坚千禧难题”的拐点已经到来,形式化代码正在成为机器与人类共同验证前沿科学的新通用语言。

OpenAI / TechCrunch · 2026-09-08 · 3 源同报 OpenAI 官方成果公告 NYU 数学家公开声明 TechCrunch 报道原文
生图模型换代 · 精准排版与草图引导

OpenAI 正式发布 ChatGPT Images 2.5:图像生成延迟砍半,新增草图生图与精准文字排版

9 月 9 日,OpenAI 正式面向 ChatGPT 付费订阅用户推出新一代图像生成模型 ChatGPT Images 2.5。相比上一代,新模型将图像生成等待时间缩短了最多 50%,并首次支持直接上传手绘草图作为结构参考,精准转化为工业设计稿或插画。此外,新模型彻底解决了 AI 画图中文字符错乱与拼写漂移的顽疾,在画面中直接排版复杂英文字母与中文招牌时表现出极高的准确率与清晰度。

点评:纯文字提示词抽卡的生图时代正在过去,草图引导加上可控排版让 AI 生图真正具备了融入工业级生产设计的实用价值。

OpenAI / IT之家 · 2026-09-08 · 2 源同报 OpenAI 官方发布公告 IT之家 测评与发布报道
个人超级智能 · 权限治理与长任务智能体

Meta 推出首款个人智能体 Muse,直面扎克伯格“个人超级智能”愿景

9 月 9 日,Meta 正式发布旗下首款面向消费者的独立个人智能体产品 Muse。作为扎克伯格推动“个人超级智能”的核心载体,Muse 能够在获得用户明确授权后,自主跨应用执行包括撰写并发送邮件、线上比价与出售二手车、预订跨国旅行等复杂多步骤长链条任务。据路透社报道,Meta 内部测试中曾对智能体直接调用用户高度敏感的个人隐私凭证表达了安全风险担忧,目前该功能率先在美国市场开启免费与订阅版公测。

点评:当 AI 助手从屏幕里的对话框变成能直接替你花钱操作账户的数字跑腿,权限隔离与安全审计的设立比任何炫酷功能都更为关乎生死。

Meta / 路透社 / IT之家 · 2026-09-08 · 2 源同报 IT之家 跟踪报道

🧠研究动态

生命科学 · 人类全基因组表征

谷歌 DeepMind 发布 AlphaGenome Atlas:人类基因组全功能高分辨率表征图谱

谷歌 DeepMind 团队宣布推出人类全基因组功能图谱 AlphaGenome Atlas。该项目利用深度神经网络建模预测 DNA 序列变异如何影响分子生物学层面的基因表达与转录调控,系统性覆盖了数千种人体细胞类型与特异性组织。该图谱为科学家识别遗传罕见病的致病基因突变、理解非编码区功能以及加速靶向药物靶点筛选提供了前所未有的数字化基石。

点评:从破解蛋白质折叠到测绘全基因组调控密码,AI 正在将生命科学从漫长的经验摸索彻底推向可计算与可预测的崭新范式。

Google DeepMind · 2026-09-08 DeepMind 官方发布博文
扩散架构 · 极速大语言模型

Inception Labs 发布扩散架构语言模型 Mercury 2.5,生成速度突破每秒 1,100 Token

前沿 AI 初创公司 Inception Labs 正式发布新一代大语言模型 Mercury 2.5。与依赖逐字自回归生成的传统架构不同,该模型基于离散扩散机制构建,在保持与主流旗舰级优化模型相当理解能力的同时,实现了高达每秒 1,107 个 Token 的惊人输出速度,整体综合推理能力较前代提升 40%,为实时代码补全与超低延迟对话系统开辟了全新路径。

Inception Labs · 2026-09-08 Inception 官方技术报告

🛠️工具与产品

模型 API 资费 · 高并发生产降本

DeepSeek 宣布明日起下调 Flash 系列模型 API 价格,输出降至每百万 Token 4 元

DeepSeek 开放平台官方宣布,将于北京时间 2026 年 9 月 10 日中午 12 时起全面执行新的 Flash 系列 API 资费标准。在空闲时段,输入端缓存命中单价降至每百万 Token 0.02 元,未命中降至 1.00 元;模型输出单价降至 4.00 元,降幅达 11% 至 60%。此前 DeepSeek 刚刚开启 V4.1 Flash 中间版本的内测,此次官方降价进一步巩固了其在高并发生产场景中的极致性价比优势。

DeepSeek / IT之家 · 2026-09-08 · 2 源同报 DeepSeek 官方资费公告 IT之家 降价报道原文
专业影视剪辑 · 智能体工作流原生集成

达芬奇 DaVinci Resolve 21.1 发布,视频剪辑时间线深度整合 Claude Code 与 Codex

专业音视频制作软件巨头 Blackmagic Design 正式推出 DaVinci Resolve 21.1 版本,行业首次在剪辑时间线与 Fusion 节点特效面板中原生集成了 Claude Code 与 ChatGPT Codex 等编程智能体。剪辑师与调色师现在可以通过自然语言对话,自动批量生成 Python 与 Lua 自动化脚本、重排多机位轨道素材并快速构建复合特效宏命令。

Blackmagic / IT之家 · 2026-09-08 IT之家 版本发布报道
主权开源模型 · 欧洲超级资本储备

Mistral AI 完成 30 亿欧元巨额 D 轮融资,加速打造欧洲前沿开源模型

欧洲 AI 独角兽 Mistral AI 宣布完成 30 亿欧元巨额 D 轮股权融资,投后估值突破 210 亿欧元,创下欧洲科技企业历史上规模最大的单笔融资纪录。本轮融资由三星电子领投,Scaleup Europe Fund 与 PSG Equity 联合领投。所筹资金将全部用于扩展自建算力超算中心,并持续推进全开放权重的世界级前沿大模型研发。

Mistral AI · 2026-09-08 Mistral 官方公告

📈社区热议

工程质量反思 · 形式化验证与对抗测试

Dan Luu 深度复盘:编程智能体究竟在多大程度上真正运用了测试与验证技术?

资深软件工程师 Dan Luu 发表长篇技术分析《How well do agents use test/verification techniques?》,深入探讨当前代码生成智能体的工程可靠性缺陷。文章指出,尽管当前智能体在编写玩具级单元测试上表现良好,但在处理复杂系统的并发死锁、长尾边界条件与真实生产回归验证时,大多数系统仍停留在表面测试通过即交卷的浅层阶段,呼吁开发团队将形式化对抗验证纳入智能体闭环。

点评:自动化生成代码只转移了打字工作,若把确认对错的责任交给缺乏对抗验证的系统,最终只会在软件库中悄然堆积更隐蔽的技术债务。

Dan Luu / Hacker News · 2026-09-08 Dan Luu 原文博客
端侧极限推理 · SSD 流式读取

ArgonautLabs 开源 DeltaFin:单台 MacBook Pro 借助 4 块固态硬盘流式运行 2.8 万亿参数 Kimi K3

开发者团队 ArgonautLabs 开源了本地大模型流式推理引擎 DeltaFin,成功在单台配置 128GB 内存的 M5 Max 芯片 MacBook Pro 上运行了月之暗面开源的 2.8 万亿参数巨型混合专家模型 Kimi K3。系统将 1.45 TB 的权重分片并利用高速外部固态硬盘阵列动态换入换出,在 512 Token 生成测试中实现了每秒 1.0 个 Token 的稳定解码输出。

GitHub / ArgonautLabs · 2026-09-08 DeltaFin GitHub 仓库

GitHub 趋势

开发提效 · 高信噪比交互规则

ayghri/i-have-adhd:专为编程智能体打造的高信噪比精简交互规则插件

专为 Cursor、Claude Code 等开发智能体设计的开源 Skill 插件。通过重构交互 prompt 策略,强制智能体在面对复杂任务时杜绝客套套话与冗长铺垫,直奔代码变更与核心结论,今日在 GitHub Trending Python 榜单斩获超 600 颗 Star。

GitHub Trending · 2026-09-08 ayghri/i-have-adhd 仓库
量化交易 · 多智能体群体博弈

TauricResearch/TradingAgents:基于多智能体协同的大模型全自动量化交易分析框架

TauricResearch 开源的金融量化交易多智能体分析框架,将宏观经济研判、即时新闻情绪跟踪、财报结构化解析与风险控制等任务分配给专属智能体分工协作,通过群体辩论制定投资策略,今日收获超 500 颗 Star。

GitHub Trending · 2026-09-08 TradingAgents 仓库
编辑点评:从 OpenAI 调动万名推理智能体声称破解纳维-斯托克斯千禧难题引爆学术同行评审争议,到 ChatGPT Images 2.5 砍半延迟并融合草图与精准文字排版,再到 Meta 推出首款直面消费者的个人自主智能体 Muse,今天的 AI 行业同时在基础科学边界、创意多模态生产力以及自主 Agent 落地维度展现出惊人的演进速度。但正如 Dan Luu 对智能体形式化测试缺失的深刻反思,当 AI 越来越深入参与核心科研推演与高风险账户决策,仅凭表面的自动化演示绝不能代替严谨的数学求证与对抗验证。让机器证明透明可信,让自主代理权责明晰,仍是整个行业迈向通用超级智能前不可绕过的真正试金石。