今日 AI 速览
头条
OpenAI 让 GPT-5.6 Sol 最快每秒输出 750 个 token
OpenAI 公布 Ultrafast 模式,让 GPT-5.6 Sol 在 API 里最高以标准处理的 14 倍速度运行。官方给出的上限是每秒输出 750 个 token,也就是模型生成文字时使用的小块内容。
这项服务由 Cerebras 提供算力,目前只向少数客户开放预览。OpenAI 把事故排查、实时客服和金融研究列为适合场景,但没有宣布全面开放日期。
点评:做实时客服或故障处理的团队可以申请测试,但先测首字延迟、稳定性和总价,不能只看最高速度。
Google 发布 Gemini 3.7 Flash,继续主攻速度与低成本任务
Google 已在 Gemini API 官方目录上线稳定版 Gemini 3.7 Flash。开发者可以在 Google AI Studio 试用,也能通过同名 API 模型调用。
官方页面显示,这个模型支持文字、图片等输入,也支持工具调用和结构化输出。LiveBench 同日加入 High 思考配置;AIdaily 仍按四项能力各占 25% 计算,不把价格和速度混进能力分。
点评:正在使用 3.6 Flash 的团队,应拿自己的分类、抽取和客服样本做同场测试,再决定是否切换。
研究与论文
Mechanist 让 AI 自己设计实验,寻找模型为什么会这样回答
Mechanist 是一个研究型智能体。它把约 1.3 万篇模型可解释性论文、4300 万篇跨学科论文和 32 种分析方法放在一起,让 AI 提出机制假设、运行实验,再检查结果。
作者称,它发现了安全特征会通过看似安全的训练数据跨模态传递,并研究模型如何表示事实与信念。论文还没有经过长期独立验证,自动发现的机制仍需要研究人员复核。
点评:做模型安全和生命科学模型的团队值得关注,但应把它当成实验助手,不是自动给出真相的机器。
研究者让短命智能体接力 120 小时,继续维护同一个软件项目
Genesis 不要求一个智能体记住全部历史。它让软件仓库和已通过检查的版本长期保留,再让一批批短时智能体提出修改,只有被接受的结果才能进入下一版。
论文称,使用 DeepSeek V4 Flash 的一次运行持续超过 120 小时,花约 44 美元模型费用,写出约 25 万行 Rust C 编译器代码,并通过完整 c-testsuite 和大部分 LLVM、Csmith 测试。这些是作者报告的实验结果,仍需别人复现。
工具与产品
Claude Code 默认让子智能体继承上下文,还能跨会话点名发消息
Claude Code v2.1.232 默认开启子智能体分叉,让新子任务继承完整对话和提示缓存。用户还可以在提示里用 @ 点名另一条 Claude 会话,直接发送消息。
这个版本同时修复多项权限问题,包括 PowerShell 变量覆盖、Windows 符号链接、嵌套 Git 仓库信任和 Linux 沙箱绕过。团队升级后要重测会话通信、插件与权限边界。
Mistral OCR 4.1 能标出段落位置,还会给结构块打可信度分数
Mistral 发布 OCR 4.1 公开预览。OCR 就是把图片或扫描文档里的内容读成可处理文字;新版本能返回段落级位置框,并为结构块提供可信度分数。
它适合做文档抽取和版面恢复,但公开预览代表接口和效果还可能变化。处理合同、票据或医疗材料时,低可信度区域仍应交给人复核。
Google Sheets canvas 能把表格数据直接变成互动看板
Google 推出 Sheets canvas。用户用一句话描述需要的页面,它就能把电子表格里的数据做成互动看板、学习追踪器、座位图等可视化工具。
这减少了手工排版和写公式的时间,但看板结论仍取决于原表格是否准确。分享给别人前,要检查筛选条件、单位和缺失数据。
Builder 观点
Google Labs 与 Gemini 负责人 Josh Woodward 说,Gemini 正接入 OpenTable、Ticketmaster、Wix、Zocdoc 等服务。目标是让模型不仅回答问题,还能在订票、预约和建站等真实流程里继续完成下一步。
查看 X 帖子 →Box CEO Aaron Levie 认为 DeepSeek 与 Grok 的能力和价格变化会扩大企业智能体需求。模型越便宜,公司越愿意自动化更多流程,真正稀缺的会变成选择模型、连接业务系统和控制风险的应用层。
查看 X 帖子 →播客精华
微软 CTO Kevin Scott:智能体需要像网页一样开放的协议
Kevin Scott 认为,真正有用的智能体不能困在一家公司里。它们需要共同协议来发现工具、交换信息和申请权限,他把 MCP 比作网页传输用的 HTTP,把 NLWeb 比作描述网页内容的 HTML。
他也强调,开放不等于放弃安全。智能体应该只申请完成任务所需的权限,并清楚记录身份和访问范围;微软希望内部系统也逐步使用这些标准协议。
GitHub 趋势
needle:把 14MB 基础模型放进小型设备
cactus-compute/needle 面向手机、穿戴设备、智能家居和机器人。它希望在本地运行模型,减少联网依赖;真实速度、耗电和任务效果仍要在目标硬件上测试。
ppt-master:把资料做成仍可编辑的 PowerPoint
hugohe3/ppt-master 会生成原生形状、图表、表格、转场和动画,不是把每页压成一张图片。正式汇报前仍要核对数据来源、模板兼容性和文字。
hermes-agent:让个人智能体随着使用继续积累能力
NousResearch/hermes-agent 把自己定位成会随用户成长的智能体。项目更新活跃,但接入个人文件和工具前,要先检查权限、记忆保存方式和模型调用成本。
今天最清楚的变化是,速度、模型和智能体外壳一起向前跑。OpenAI 追求实时输出,Google 与 Mistral 更新模型,DeepSeek 和 Claude Code 扩大多智能体工作方式。越是想让 AI 连续做事,团队越要把版本、权限、低可信度结果和人工复核写进流程。