14 8月 星期五 2026 目录 中文 EN
Daily AI Digest

今日 AI 速览

模型速查 · 每日核对 今天该用哪个模型?查看 30 款通用模型的能力、价格、上线日期与擅长方向 打开最新榜单 →

头条


OpenAI · API 预览 · 2 源同报

OpenAI 让 GPT-5.6 Sol 最快每秒输出 750 个 token

OpenAI 公布 Ultrafast 模式,让 GPT-5.6 Sol 在 API 里最高以标准处理的 14 倍速度运行。官方给出的上限是每秒输出 750 个 token,也就是模型生成文字时使用的小块内容。

这项服务由 Cerebras 提供算力,目前只向少数客户开放预览。OpenAI 把事故排查、实时客服和金融研究列为适合场景,但没有宣布全面开放日期。

点评:做实时客服或故障处理的团队可以申请测试,但先测首字延迟、稳定性和总价,不能只看最高速度。

OpenAI · 08.13 · 2 源同报
Google · 新模型 · 3 源同报

Google 发布 Gemini 3.7 Flash,继续主攻速度与低成本任务

Google 已在 Gemini API 官方目录上线稳定版 Gemini 3.7 Flash。开发者可以在 Google AI Studio 试用,也能通过同名 API 模型调用。

官方页面显示,这个模型支持文字、图片等输入,也支持工具调用和结构化输出。LiveBench 同日加入 High 思考配置;AIdaily 仍按四项能力各占 25% 计算,不把价格和速度混进能力分。

点评:正在使用 3.6 Flash 的团队,应拿自己的分类、抽取和客服样本做同场测试,再决定是否切换。

Google AI · 08.13 · HN 120 分 · 3 源同报
DeepSeek · 开源智能体 · 3 源同报

DeepSeek 开源 Harness,让智能体功能都能换成插件

DeepSeek 发布开源智能体外壳 DeepSeek Harness,简称 dsh。它把界面、工具和其他功能都做成插件,安装 Node.js 后可以用一条 npx 命令启动本地网页界面。

项目使用 MIT 许可证,目前只是开发者预览。官方明确提醒,后续会有破坏兼容性的改动,所以现在更适合试验和做插件,不适合直接当成稳定生产系统。

点评:智能体开发者可以先做一个小插件验证架构,但要锁定版本并隔离测试环境,别把预览版直接接上关键数据。

DeepSeek · 08.13 · HN 128 分 · 3 源同报

研究与论文


模型可解释性 · 自动研究

Mechanist 让 AI 自己设计实验,寻找模型为什么会这样回答

Mechanist 是一个研究型智能体。它把约 1.3 万篇模型可解释性论文、4300 万篇跨学科论文和 32 种分析方法放在一起,让 AI 提出机制假设、运行实验,再检查结果。

作者称,它发现了安全特征会通过看似安全的训练数据跨模态传递,并研究模型如何表示事实与信念。论文还没有经过长期独立验证,自动发现的机制仍需要研究人员复核。

点评:做模型安全和生命科学模型的团队值得关注,但应把它当成实验助手,不是自动给出真相的机器。

Hugging Face Daily Papers · 75 赞 · 08.12
长期编程 · 多智能体

研究者让短命智能体接力 120 小时,继续维护同一个软件项目

Genesis 不要求一个智能体记住全部历史。它让软件仓库和已通过检查的版本长期保留,再让一批批短时智能体提出修改,只有被接受的结果才能进入下一版。

论文称,使用 DeepSeek V4 Flash 的一次运行持续超过 120 小时,花约 44 美元模型费用,写出约 25 万行 Rust C 编译器代码,并通过完整 c-testsuite 和大部分 LLVM、Csmith 测试。这些是作者报告的实验结果,仍需别人复现。

Hugging Face Daily Papers · 4 赞 · 08.12

工具与产品


Claude Code · 多智能体与安全

Claude Code 默认让子智能体继承上下文,还能跨会话点名发消息

Claude Code v2.1.232 默认开启子智能体分叉,让新子任务继承完整对话和提示缓存。用户还可以在提示里用 @ 点名另一条 Claude 会话,直接发送消息。

这个版本同时修复多项权限问题,包括 PowerShell 变量覆盖、Windows 符号链接、嵌套 Git 仓库信任和 Linux 沙箱绕过。团队升级后要重测会话通信、插件与权限边界。

Anthropic · 08.14 北京时间
Mistral · 文档识别 · 2 源同报

Mistral OCR 4.1 能标出段落位置,还会给结构块打可信度分数

Mistral 发布 OCR 4.1 公开预览。OCR 就是把图片或扫描文档里的内容读成可处理文字;新版本能返回段落级位置框,并为结构块提供可信度分数。

它适合做文档抽取和版面恢复,但公开预览代表接口和效果还可能变化。处理合同、票据或医疗材料时,低可信度区域仍应交给人复核。

Mistral · 08.13 · HN 104 分 · 2 源同报
Google Sheets · 自动做看板

Google Sheets canvas 能把表格数据直接变成互动看板

Google 推出 Sheets canvas。用户用一句话描述需要的页面,它就能把电子表格里的数据做成互动看板、学习追踪器、座位图等可视化工具。

这减少了手工排版和写公式的时间,但看板结论仍取决于原表格是否准确。分享给别人前,要检查筛选条件、单位和缺失数据。

Google Workspace · 08.13

Builder 观点


Google Labs 与 Gemini 负责人 Josh Woodward 说,Gemini 正接入 OpenTable、Ticketmaster、Wix、Zocdoc 等服务。目标是让模型不仅回答问题,还能在订票、预约和建站等真实流程里继续完成下一步。

查看 X 帖子 →

Box CEO Aaron Levie 认为 DeepSeek 与 Grok 的能力和价格变化会扩大企业智能体需求。模型越便宜,公司越愿意自动化更多流程,真正稀缺的会变成选择模型、连接业务系统和控制风险的应用层。

查看 X 帖子 →

播客精华


AI & I · Kevin Scott · 开放智能体网络

微软 CTO Kevin Scott:智能体需要像网页一样开放的协议

Kevin Scott 认为,真正有用的智能体不能困在一家公司里。它们需要共同协议来发现工具、交换信息和申请权限,他把 MCP 比作网页传输用的 HTTP,把 NLWeb 比作描述网页内容的 HTML。

他也强调,开放不等于放弃安全。智能体应该只申请完成任务所需的权限,并清楚记录身份和访问范围;微软希望内部系统也逐步使用这些标准协议。

AI & I by Every · 原始发布日期 08.13 北京时间

GitHub 趋势


GitHub Trending · 今日 769 星

needle:把 14MB 基础模型放进小型设备

cactus-compute/needle 面向手机、穿戴设备、智能家居和机器人。它希望在本地运行模型,减少联网依赖;真实速度、耗电和任务效果仍要在目标硬件上测试。

Python · 抓取时 4,947 星
GitHub Trending · 今日 1,064 星

ppt-master:把资料做成仍可编辑的 PowerPoint

hugohe3/ppt-master 会生成原生形状、图表、表格、转场和动画,不是把每页压成一张图片。正式汇报前仍要核对数据来源、模板兼容性和文字。

Python · 抓取时 46,508 星
GitHub Trending · 今日 593 星

hermes-agent:让个人智能体随着使用继续积累能力

NousResearch/hermes-agent 把自己定位成会随用户成长的智能体。项目更新活跃,但接入个人文件和工具前,要先检查权限、记忆保存方式和模型调用成本。

Python · 抓取时 230,134 星
编辑点评

今天最清楚的变化是,速度、模型和智能体外壳一起向前跑。OpenAI 追求实时输出,Google 与 Mistral 更新模型,DeepSeek 和 Claude Code 扩大多智能体工作方式。越是想让 AI 连续做事,团队越要把版本、权限、低可信度结果和人工复核写进流程。