每日 AI 新闻简报 · 报刊式排版
今日 AI 速览
新闻窗口:截至 17:30 美西时间 · 2026 年 10 月 7 日 星期三 · 本期约 5 分钟 · 在线阅读
头条
Mistral AI 发布首款万亿参数原生多模态旗舰 Mistral Large 4,月底正式开放模型权重
法国人工智能独角兽 Mistral AI 正式推出其最新旗舰模型 Mistral Large 4(内部代号为 le Chonk)的公开预览版。该模型是原生多模态架构,总参数量达 1 万亿,每次计算激活 490 亿参数,基于 3,800 块英伟达 Grace Blackwell 芯片在其自建欧洲算力中心从零完成训练。官方表示该模型在企业网络安全、法律和复杂金融任务中超越了欧美所有现有的开放权重模型,即日起在 Mistral Studio 提供 API 预览,完整的开源权重将在 10 月底正式开放免费下载。
点评:欧洲在算力与模型自立上迈出最关键一步,1 万亿参数的 MoE 架构把开源大模型的企业级上限拉到了全新量级。
OpenAI 公布数学推理重大进展:攻破数百个未决前沿难题,形式化证明改变科研范式
OpenAI 正式发布题为《分享人工智能在数学领域的进展》的最新前沿研究报告。研究团队使用配备强化推理能力的先进模型,攻克了涵盖 372 个成果家族的数百个此前悬而未决的数学难题,单项成果消耗的算力约等于 ChatGPT Pro 深度思考三小时。团队不仅给出了自然语言推导,还将所有关键成果转化为严格的形式化证明代码,展示了从假设提出、路径搜索到机器严密验证的完整科研闭环。
点评:当 AI 开始独立解决人类数学家未解的定理,学术研究从“人写机器验”彻底倒向“机器发现人复核”。
研究动态
QLabs 提出全新预训练方法 Dust:不依赖反向传播,将大模型训练还原为搜索
人工智能研究机构 QLabs 正式公开最新基础理论研究 Dust。该方法彻底放弃了沿用数十年的反向传播与可微梯度计算机制,转而在 Transformer 激活值空间进行零阶扰动搜索,通过对大量虚拟候选单元的并行前向评估来更新网络权重。实验证明,该方法能有效利用大规模算力探索传统梯度优化容易陷入的局部最优陷阱,为无法求导的离散架构和专用硬件训练提供了全新理论路径。
点评:算力爆炸时代终于有人向反向传播这一延续数十年的基石动刀,把训练还原为纯粹的搜索。
工具与产品
谷歌推出全模态端侧模型 EmbeddingGemma 2:7.4 亿参数量化后仅需 191MB 内存
谷歌正式发布第二代轻量级嵌入模型 EmbeddingGemma 2,基于 Gemma 4 架构开发并采用 Apache 2.0 商业开源许可。新模型将嵌入能力从纯文本拓展至代码、图片、视频与音频,能将所有模态映射到同一个 768 维向量空间。模型采用模块化设计,纯文本部分仅 2.7 亿参数,量化后在手机上运行时内存占用低至 191MB;同时支持 8K 上下文和动态截断,大幅降低了本地端侧知识库与检索增强生成的存储门槛。
Anthropic 升级网络核验计划:向安全防守团队开放无约束顶配 Claude 权限
人工智能安全机构 Anthropic 宣布大幅升级其网络核验计划(Cyber Verification Program,简称 CVP),并将此前联合多家科技巨头运行的玻璃翼计划正式并入其中。新项目分为防御、红队攻防和关键基础设施专项三个层级,通过资质审核的安全团队可使用降低安全拦截规则的顶配 Claude Opus 5.5、Sonnet 5.5 和 Mythos 5.1 模型。官方透露,该计划今年已帮助全球关键软件生态排查出超过 13.4 万个漏洞,其中高危与严重漏洞占比超四分之一。
社区热议
开源硬件项目 openTPU 获热议:首个由 AI 自身协同设计的专用神经网络加速器
开源开发者 FeSens 在 GitHub 与 Hacker News 公布了名为 openTPU 的全新开源项目,迅速引发技术社区广泛讨论。该项目完整包含芯片逻辑、指令集架构、模拟器、编译器和性能分析工具,全套核心代码均由前沿大语言模型协同编写与验证。测试显示,该自研专用芯片已成功在标准的赛灵思 FPGA 板卡上运行千问与 LFM 系列开源大模型,证明了当前 AI 已经具备闭环开发并实机验证自身推理硬件的工程能力。
此前漏报
亚马逊云科技在 Amazon Bedrock 全面上线智谱 GLM-5.3,开创“海外调用分成”商业闭环
亚马逊云科技(AWS)官方宣布,智谱旗下的旗舰开源混合专家大模型 GLM-5.3 正式向 Amazon Bedrock 的企业用户全面开放。该模型拥有 7,530 亿总参数,针对智能体长程规划、代码生成与自动化网络渗透测试进行了专项强化,支持 100 万 Token 超长上下文与灵活的提示词缓存。此次合作是国产前沿基座模型首次以纯调用量分成的商业模式接入全球主流头部云平台,为大模型出海和全球化商业变现探索出了清晰的闭环路径。
从万亿参数开源模型开启红队公测,到学术界首次抛弃反向传播探索纯搜索训练,再到 AI 开始独立攻克未解数学难题,大模型正在从“模仿人类已有知识”大踏步迈向“探索人类未知边界”:谁能在前沿能力、端侧部署与真实安全防御中率先建立正循环,谁就能锁定下一代智能系统的核心定义权。