今日 AI 速览
头条
xAI 发布 Grok 4.6,主攻长流程工作与图文任务
xAI 已在官方模型目录开放 Grok 4.6 API。它能读取文字和图片,最多接收 50 万个输入 token,也就是一次处理很长的资料;标准价格是每百万输入 token 2 美元、输出 token 6 美元。
官方目录显示,它支持工具调用、结构化输出和四档思考强度。它已经上线,但还没有进入本期 LiveBench 统一评测,所以 AIdaily 模型页只把它列入官方目录,不给它能力分。
点评:准备把 Grok 4.6 接进生产流程的团队,先用自己的长任务和图片输入做回归测试,不要拿厂商发布或别家的榜单代替真实验收。
DeepSeek 把 V4 Pro API 更新到 0813 版,调用名称不变
DeepSeek 官方价格页已经把 deepseek-v4-pro 的模型版本写成 DeepSeek-V4-Pro-0813。开发者仍使用原来的模型名和接口地址,不需要改代码里的型号名称。
这版支持普通与思考模式、工具调用、Responses API 和 Anthropic API。上下文长度是 100 万 token,最多输出 38.4 万 token;官方页面列出的标准价格是每百万未命中缓存输入 token 0.435 美元、输出 token 0.87 美元。
点评:正在使用 deepseek-v4-pro 的团队要把这次无改名升级当成生产变更,立即重跑关键评测,并检查输出、工具调用和成本有没有漂移。
OpenAI 称企业正让 AI 直接做事,但重度使用公司与普通公司差距扩大
OpenAI 发布两份企业使用研究。它把每月人均 AI 输出量排在前 10% 的客户称为“前沿公司”;截至 6 月,这些公司的每名活跃用户平均输出量是普通公司的 8.3 倍,而 1 月时是 2.6 倍。
研究还称,Codex 占企业客户 Codex 与 ChatGPT 合计输出 token 的 64%。自 2 月以来,企业 Codex 每周活跃用户在法务增长 108 倍,在销售和招聘各增长 41 倍,在营销增长 26 倍;这些是 OpenAI 客户的使用变化,不代表所有公司都得到同样效果。
点评:企业负责人不该只买账号,还要把数据权限、人工复核和成功流程写成团队共同做法,否则使用量越高,错误也可能放大得越快。
研究与论文
InSight-doc 先看低清全页,再放大关键区域读长文档
InSight-doc 把图片清晰度当作可以按需使用的计算资源。它先用低分辨率浏览长文档,再主动放大需要证据的区域,不依赖额外的检索器。
论文称,8B 模型在多项文档问答测试上比基线高 4.3 到 16.4 个准确率百分点。处理长文档时,它把幻觉减少超过 40%,推理时间缩短 41% 到 68%;这些结果仍需独立复现。
ComBodied Agents 主张智能体先理解人的状态,再决定要不要行动
这篇观点论文提出,软件智能体会改变屏幕里的状态,机器人会改变现实世界,但两者常常没有先弄清人为什么这样做。作者用老人漏服药为例:继续提醒或把药送来,都没有回答老人是忘了、身体不舒服,还是主动拒绝。
论文建议让智能体持续记录并允许用户纠正自己的状态,再在同意、安全、可撤回和不确定性约束下选择帮助方式。这是设计框架,不是已经证明有效的产品。
点评:做健康、陪伴或家庭智能体的团队,应该先设计“询问、纠正和撤回”按钮,再讨论系统能替用户做多少事。
Builder 观点
Claude Code 负责人 Boris Cherny 说,模型写出的错误正从少写一位数字之类的小错,转向系统设计、界面易用性和遗漏大背景等问题。他建议用对抗式代码审查主动找边界情况,因为模型变强不等于所有类型的编程都已经解决。
查看 X 帖子 →产品顾问 Peter Yang 在帮父母上手 ChatGPT 桌面版时发现,Chat、Work 与 Codex 的分工,加上网页、桌面和手机之间的不一致,让新用户很难理解。他认为 OpenAI 需要做一次统一和清理,而不是继续叠加入口。
查看 X 帖子 →Box CEO Aaron Levie 认为 AI 项目仍需要大量驻场工程工作。原因是模型会变化、业务流程以前没有自动化、客户也不知道最终体验应该长什么样,所以团队必须持续做定制、评测、流程调整和版本跟进。
查看 X 帖子 →社区讨论
攻击者冒充 ClaudeBot 等 AI 机器人,批量寻找密钥和配置文件
Known Agents 说,它在 5000 多个网站的流量中发现一场广泛扫描活动。请求声称自己是知名 AI 机器人,但没有通过官方 IP 或签名验证,并集中访问 Claude、Codex、OpenClaw、AWS 和 Firebase 等工具常用的凭据与配置路径。
页面没有公布攻击者身份,也没有给出被盗数据规模。它提醒站长,User-Agent 里写着 ClaudeBot 或 GPTBot 不能证明请求真的来自对应公司。
点评:网站运维人员应立即确认敏感文件不会被公开服务器读取,并用官方 IP 或消息签名验证机器人身份,不能只按名称放行。
GitHub 趋势
needle:把 14MB 小模型放进手机、穿戴设备和机器人
cactus-compute/needle 是面向端侧设备的 14MB 基础模型项目,目标是在手机、穿戴设备、智能家居和机器人上直接运行。端侧模型能减少网络依赖,但真实速度、能耗和任务效果仍要在目标硬件上测试。
omnigent:用同一层调度 Claude Code、Codex、Cursor 与自定义智能体
omnigent-ai/omnigent 是一个开源智能体框架和调度外壳,允许团队在同一套任务流程里切换多种编码智能体。统一入口方便比较,但权限、上下文格式和工具行为并不会自动相同,接入前仍需逐个做回归测试。
ppt-master:把文档或主题变成可继续编辑的 PowerPoint
hugohe3/ppt-master 让 AI 生成原生 PowerPoint 形状、图表、表格、转场和动画,而不是只导出一张张图片。要用于正式汇报,团队仍需核对数据来源、版式兼容性和每页文字是否准确。
今天的共同主题是,AI 正从“会回答”转向“能连续做事”,而验证工作也随之变重。新模型会静默替换旧版本,企业使用量会迅速拉开,机器人名称还能被攻击者冒充。真正可靠的 AI 流程,需要版本评测、权限验证、人工复核和清楚的产品入口一起跟上。