今日 AI 速览
头条
Kimi K3 需求触及算力上限:暂停新订阅,并拆分通用与编程会员
月之暗面称,Kimi K3 上线后 48 小时内的需求已接近现有 GPU 容量上限,因此暂停接收新的 C 端订阅,把算力优先留给已有会员,现有订阅权益不受影响。公司计划扩容后分批恢复名额,并把会员拆成服务网页、App 与 Work 的 Kimi Membership,以及面向编程工作流的 Kimi Code Membership。公告没有给出扩容规模和重开时间。
点评:暂停拉新说明产品热度已经转化为真实推理压力,但能否成为长期优势,取决于扩容速度、峰值稳定性和拆分套餐后的单位算力经济性。
Qwen3.8-Max-Preview 上线:2.4T 参数,完整开放权重仍待后续
通义团队宣布 Qwen3.8 正在发布并将很快开放权重,参数规模为 2.4T;预览版已先在阿里云 Token Plan、Qoder 与 QoderWork 提供试用。团队把它描述为仅次于 Claude Fable 5 的前沿模型,但本期窗口内尚未公布完整权重、技术报告、许可证、推理成本和可复现实验,因此厂商排名主张暂不能视为独立结论。
点评:开发者可以先用真实任务建立基线,但生产选型应等权重、许可证和第三方长任务评测齐全后再决定,避免把预览期宣传当成可迁移能力。
AI 给出错误建议后,受试者更少回答「不知道」,准确率反而从 27% 降至 9%
一项新近受到关注的预印本实验,让参与者回答模型经常答错的电影视觉细节问题,并刻意采用在这些题目上不可靠的 Step 3.5 Flash。没有 AI 建议时,受试者有 44% 的回答是「不知道」,准确率为 27%;看到 AI 建议后,「不知道」降到 3%,准确率降到 9%,自信度却从 30% 升到 76%。这是针对单一模型和特定困难问题的控制实验,不能直接外推到所有 AI 辅助任务。
点评:高风险流程不应只测答案命中率,还要记录模型是否诱导人越过不确定性阈值,并为「拒答」保留明确、低摩擦的出口。
工具与产品
Claude Code v2.1.215 停止自行运行 verify 与 code-review 技能
新版不再由 Claude 自主触发 /verify 和 /code-review,用户需要在希望执行验证或代码审查时显式调用相应命令。改动范围很小,却把会增加耗时、成本或读取范围的检查重新交回用户决定;依赖自动审查的现有流程升级后应检查钩子和提示词,避免误以为验证仍会自动发生。
润科具能发布轮足「半人马」机器人,面向高危巡检与应急处置
润科具能在世界人工智能大会发布轮足复合机器人:上半身可搭载双臂、灵巧手与传感器,下半身用四轮足兼顾平地速度和崎岖地形通过性。厂商称其平均负载 100 至 120 千克、极限静态负载 210 千克,并用激光雷达、双目视觉和深度相机完成环境感知、路径规划与目标锁定。所谓「全球首款」和负载数据均来自厂商,仍需独立场景测试。
深空矩阵提出「星环计划」:先以约 210 颗卫星验证遥感、通信与算力协同
深空矩阵公布面向太空 AI 算力的星座方案,第一阶段拟在 450 公里轨道部署约 210 颗卫星,验证通信、遥感和计算协同,并声称后续扩容可提高全球覆盖与区域重访频率。方案还描绘了从验证星座扩展到数千乃至数万颗卫星的路径,但本期公告没有披露发射时间、资金、芯片规格、星间网络和在轨能耗数据,目前应视为产业路线图而不是已落地基础设施。
开源项目
ai-agent-book:把 Agent 原理、上下文工程、评估与多 Agent 实验整成一本开源书
李博杰开源的《深入理解 AI Agent:设计原理与工程实践》提供中英文本体、编译 PDF 和按十章组织的配套代码,主线公式是「Agent = LLM + 上下文 + 工具」。内容覆盖记忆、MCP、Coding Agent、评估、后训练、自我进化、多模态和协作;仓库也明确标注哪些示例可独立运行,哪些只是复现指南或设计文档,读者不应把所有目录都当成开箱即用项目。
code-review-graph:用本地代码图为审查 Agent 缩小读取范围
项目用 Tree-sitter 把函数、类、导入、调用、继承和测试覆盖关系写入本地 SQLite 图,再通过 MCP 返回变更影响半径与最小相关文件集。作者在 6 个开源仓库、13 个提交的自建评测中报告,相对整库上下文的每题 token 中位缩减约 82 倍,也坦承整库基线是上界,小仓库、单文件变更和一次性查询未必适合建图。基准可复现,但仍应与团队现有 grep、LSP 和 Agent 搜索基线对照。
Builder 观点
Thibault Sottiaux(OpenAI Codex 与 ChatGPT 团队):他用语音把一项批量任务交给 ChatGPT Work,要求从大量 X 私信中筛出相关申请、整理链接与文本,并在表格中补充分类判断。这个示例的重点不是单次回答,而是把检索、清洗、判断和表格交付串成可委派工作。
X 原帖 →Guillermo Rauch(Vercel CEO):他称内部未公开网络安全评测显示 Kimi K3 具备较强能力,Sol 更进一步但成本显著更高,Fable 因拒答未完成测试。这只是 Vercel 的内部「隐身评测」摘要,没有题集和完整结果,适合作为能力信号,不足以替代公开基准。
X 原帖 →Zara Zhang(创业者与投资人):每个人都应建立一小组与日常工作和生活真正相关的「个人评测集」。行业榜单提供横向信号,但持续用自己的任务触碰模型边界,更能判断一次升级是否真的有用。
X 原帖 →社区热议
Claude Code 已内置 Rust 重写版 Bun,数百万设备上的迁移几乎无人察觉
Simon Willison 检查本机 Claude Code 二进制,找到 Bun 1.4.0 标识与 563 个 Rust 源文件路径,印证 Claude Code 自 v2.1.181 起使用尚未正式发布的 Rust 版 Bun;Bun 随后也以 canary 形式公开。作者转述的结果是 Linux 启动速度约快 10%,其余体验基本不变。HN 的 500 余条评论把话题扩展到运行时重写、静态二进制分发与兼容性,真正值得关注的是大规模底层替换能否保持无感。
今天最清晰的信号是,前沿能力的竞争正在同时碰到三种边界:Kimi 的 GPU 容量、Qwen 预览版尚未补齐的开放证据,以及人在错误 AI 建议面前快速消失的「不知道」。工具和基础设施也在做同一件事,把高成本验证、代码上下文与算力位置拆得更细。下一阶段的差异不只是谁更强,而是谁能把容量、证据和人的判断一起做成稳定系统。