13 8月 星期四 2026 目录 中文 EN
Daily AI Digest

今日 AI 速览

模型速查 · 每日核对 今天该用哪个模型?查看 30 款通用模型的能力、价格、上线日期与擅长方向 打开最新榜单 →

头条


xAI · 新模型

xAI 发布 Grok 4.6,主攻长流程工作与图文任务

xAI 已在官方模型目录开放 Grok 4.6 API。它能读取文字和图片,最多接收 50 万个输入 token,也就是一次处理很长的资料;标准价格是每百万输入 token 2 美元、输出 token 6 美元。

官方目录显示,它支持工具调用、结构化输出和四档思考强度。它已经上线,但还没有进入本期 LiveBench 统一评测,所以 AIdaily 模型页只把它列入官方目录,不给它能力分。

点评:准备把 Grok 4.6 接进生产流程的团队,先用自己的长任务和图片输入做回归测试,不要拿厂商发布或别家的榜单代替真实验收。

DeepSeek · API 更新 · 3 源同报

DeepSeek 把 V4 Pro API 更新到 0813 版,调用名称不变

DeepSeek 官方价格页已经把 deepseek-v4-pro 的模型版本写成 DeepSeek-V4-Pro-0813。开发者仍使用原来的模型名和接口地址,不需要改代码里的型号名称。

这版支持普通与思考模式、工具调用、Responses API 和 Anthropic API。上下文长度是 100 万 token,最多输出 38.4 万 token;官方页面列出的标准价格是每百万未命中缓存输入 token 0.435 美元、输出 token 0.87 美元。

点评:正在使用 deepseek-v4-pro 的团队要把这次无改名升级当成生产变更,立即重跑关键评测,并检查输出、工具调用和成本有没有漂移。

DeepSeek 官方文档 · 08.13 · 3 源同报
OpenAI · 企业使用研究

OpenAI 称企业正让 AI 直接做事,但重度使用公司与普通公司差距扩大

OpenAI 发布两份企业使用研究。它把每月人均 AI 输出量排在前 10% 的客户称为“前沿公司”;截至 6 月,这些公司的每名活跃用户平均输出量是普通公司的 8.3 倍,而 1 月时是 2.6 倍。

研究还称,Codex 占企业客户 Codex 与 ChatGPT 合计输出 token 的 64%。自 2 月以来,企业 Codex 每周活跃用户在法务增长 108 倍,在销售和招聘各增长 41 倍,在营销增长 26 倍;这些是 OpenAI 客户的使用变化,不代表所有公司都得到同样效果。

点评:企业负责人不该只买账号,还要把数据权限、人工复核和成功流程写成团队共同做法,否则使用量越高,错误也可能放大得越快。

OpenAI · 08.12

研究与论文


长文档 · 视觉智能体

InSight-doc 先看低清全页,再放大关键区域读长文档

InSight-doc 把图片清晰度当作可以按需使用的计算资源。它先用低分辨率浏览长文档,再主动放大需要证据的区域,不依赖额外的检索器。

论文称,8B 模型在多项文档问答测试上比基线高 4.3 到 16.4 个准确率百分点。处理长文档时,它把幻觉减少超过 40%,推理时间缩短 41% 到 68%;这些结果仍需独立复现。

Hugging Face Daily Papers · 5 赞 · 08.11
个人智能体 · 人的自主权

ComBodied Agents 主张智能体先理解人的状态,再决定要不要行动

这篇观点论文提出,软件智能体会改变屏幕里的状态,机器人会改变现实世界,但两者常常没有先弄清人为什么这样做。作者用老人漏服药为例:继续提醒或把药送来,都没有回答老人是忘了、身体不舒服,还是主动拒绝。

论文建议让智能体持续记录并允许用户纠正自己的状态,再在同意、安全、可撤回和不确定性约束下选择帮助方式。这是设计框架,不是已经证明有效的产品。

点评:做健康、陪伴或家庭智能体的团队,应该先设计“询问、纠正和撤回”按钮,再讨论系统能替用户做多少事。

Hugging Face Daily Papers · 165 赞 · 08.11

Builder 观点


Claude Code 负责人 Boris Cherny 说,模型写出的错误正从少写一位数字之类的小错,转向系统设计、界面易用性和遗漏大背景等问题。他建议用对抗式代码审查主动找边界情况,因为模型变强不等于所有类型的编程都已经解决。

查看 X 帖子 →

产品顾问 Peter Yang 在帮父母上手 ChatGPT 桌面版时发现,Chat、Work 与 Codex 的分工,加上网页、桌面和手机之间的不一致,让新用户很难理解。他认为 OpenAI 需要做一次统一和清理,而不是继续叠加入口。

查看 X 帖子 →

Box CEO Aaron Levie 认为 AI 项目仍需要大量驻场工程工作。原因是模型会变化、业务流程以前没有自动化、客户也不知道最终体验应该长什么样,所以团队必须持续做定制、评测、流程调整和版本跟进。

查看 X 帖子 →

社区讨论


网站安全 · 机器人冒充

攻击者冒充 ClaudeBot 等 AI 机器人,批量寻找密钥和配置文件

Known Agents 说,它在 5000 多个网站的流量中发现一场广泛扫描活动。请求声称自己是知名 AI 机器人,但没有通过官方 IP 或签名验证,并集中访问 Claude、Codex、OpenClaw、AWS 和 Firebase 等工具常用的凭据与配置路径。

页面没有公布攻击者身份,也没有给出被盗数据规模。它提醒站长,User-Agent 里写着 ClaudeBot 或 GPTBot 不能证明请求真的来自对应公司。

点评:网站运维人员应立即确认敏感文件不会被公开服务器读取,并用官方 IP 或消息签名验证机器人身份,不能只按名称放行。

Known Agents · HN 114 分 · 08.12

GitHub 趋势


GitHub Trending · 抓取时 4,077 星

needle:把 14MB 小模型放进手机、穿戴设备和机器人

cactus-compute/needle 是面向端侧设备的 14MB 基础模型项目,目标是在手机、穿戴设备、智能家居和机器人上直接运行。端侧模型能减少网络依赖,但真实速度、能耗和任务效果仍要在目标硬件上测试。

Python · 4,077 星 · 今日 346 星
GitHub Trending · 抓取时 8,702 星

omnigent:用同一层调度 Claude Code、Codex、Cursor 与自定义智能体

omnigent-ai/omnigent 是一个开源智能体框架和调度外壳,允许团队在同一套任务流程里切换多种编码智能体。统一入口方便比较,但权限、上下文格式和工具行为并不会自动相同,接入前仍需逐个做回归测试。

Python · 8,702 星 · 今日 160 星
GitHub Trending · 抓取时 45,447 星

ppt-master:把文档或主题变成可继续编辑的 PowerPoint

hugohe3/ppt-master 让 AI 生成原生 PowerPoint 形状、图表、表格、转场和动画,而不是只导出一张张图片。要用于正式汇报,团队仍需核对数据来源、版式兼容性和每页文字是否准确。

Python · 45,447 星 · 今日 364 星
编辑点评

今天的共同主题是,AI 正从“会回答”转向“能连续做事”,而验证工作也随之变重。新模型会静默替换旧版本,企业使用量会迅速拉开,机器人名称还能被攻击者冒充。真正可靠的 AI 流程,需要版本评测、权限验证、人工复核和清楚的产品入口一起跟上。