12 8月 星期三 2026 目录 中文 EN
Daily AI Digest

今日 AI 速览

模型速查 · 每日核对 今天该用哪个模型?查看 30 款通用模型的能力、价格、上线日期与擅长方向 打开最新榜单 →

头条


OpenAI · 商业模式

OpenAI 开始在 ChatGPT 测试广告,并承诺广告不改答案

OpenAI 的官方 RSS 显示,公司开始在 ChatGPT 测试广告,希望用广告收入继续支持免费访问。公司承诺清楚标出广告,不让广告商影响 ChatGPT 的答案,并提供隐私保护和用户控制。

官方摘要没有说明首批测试面向哪些国家、账户或广告位,也没有公布推荐和退出机制的细节。这些空白会直接影响用户能否分清回答、推荐与付费展示。

点评:经常用 ChatGPT 查商品或服务的人,应该先看清付费标签再点链接。OpenAI 下一步需要公开投放范围、排序规则和退出方式,才能让“答案不受广告影响”变成可检查的承诺。

OpenAI 官方 RSS · 08.11
Anthropic · 内容来源 · 3 源同报

Claude 将给文字加隐藏水印,也给图片文件附上来源签名

Anthropic 说,8 月 2 日以后在欧盟推出的新 Claude 模型会从上线第一天开始标记内容,而且这些标记会在 Claude 提供服务的地区使用。支持的模型会把看不见的水印写进文字;生成 SVG、PNG 或 JPG 等文件时,还会按 C2PA 开放标准附上数字签名,用来说明文件经过 Claude 处理,并帮助发现篡改。

这不是“AI 内容鉴定器”。Anthropic 明确提醒,有标记只说明内容可能经过 Claude,没检测到标记也不能证明内容来自人类;重写、翻译、混合或很短的文字都可能让标记消失。旧模型仍在逐步加入,第三方检测工具的技术说明也尚未发布。

点评:编辑、教师和平台审核人员可以把标记当作一条线索,不能把它当作定罪证据。真正稳妥的做法仍是检查来源、修改记录和内容本身。

Google · 医疗研究

Google 让 AMIE 通过视频看病人,但它还不能进入真实诊室

Google Research 和 Google DeepMind 展示了研究系统 AMIE 的实时视频问诊能力。它基于 Gemini 与 Project Astra,能同时听声音、看画面,引导病人做简单的远程身体检查,再结合过程给出诊断思路。

研究采用模拟问诊:演员扮演病人,参与者还包括一组全科医生。临床评审在病史询问、诊断准确性、处理建议和沟通质量等方面给出积极评价,病人演员也更喜欢视频体验而不是文字聊天。Google 强调 AMIE 仍是研究系统,真实部署前还需要更多研究。

点评:医院和医疗产品团队现在只能把这项结果当作模拟环境证据。进入真实诊室前,真实病人试验、隐私保护、误诊责任和医生接手规则都必须先补齐。

Google Research · 08.11

研究与论文


小模型 · 图形推理

BDH-CQ 用 1.5 亿参数做循环思考,把 ARC 任务成本压到不到 1 美分

BDH-CQ 会把示例不断写进循环记忆,再在看不见的内部空间里多轮计算,不要求先把每一步写成文字。论文称,一个 1.5 亿参数版本在公开 ARC-AGI-1 评测中,两次尝试内答对 29.5% 的任务,每题估算成本为 0.0007 美元。

作者认为这个点刷新了该评测的成本与准确率平衡。结果仍来自单篇论文和一个特定基准,不能直接说明模型能处理日常工作;代码、训练细节和独立复现会决定它是否真有普遍价值。

Hugging Face Daily Papers · 219 赞 · 08.10
API 安全 · 推理记录

研究者称加密推理记录能跨账户复用,还能被较弱模型解开

一篇新论文称,多家模型服务把加密后的内部推理交给客户端保存,再在后续请求中传回。研究者发现,这些加密块可以在同一家服务的不同会话、用户和模型之间互换;把强模型的加密块交给防护较弱的模型后,后者可能把内容原样输出。

团队从公开代码仓库抓取并解码了 315,320 个推理块,称其中包含 367 条可识别个人的信息和 182 份凭据。论文还报告了模型蒸馏、安全拒答泄漏和隐藏提示注入风险,并称已按负责披露流程通知厂商。所有数字和攻击效果仍等待独立复核。

点评:保存智能体日志的团队应立即把加密推理块按敏感数据管理,不要因为“看不懂”就公开上传。API 厂商也该把这些块绑定到账户、模型和会话,而不是只靠加密外观。

Hugging Face Daily Papers · 18 赞 · HN 270 分 · 08.10
智能体评测 · 审计

A²E 记录智能体每一步,帮助团队比较模型与外壳的组合

A²E 是一个端到端的智能体评测引擎。它用统一协议接入任务和不同智能体外壳,再自动记录工具调用、执行过程与错误,最后从正确率、效率、规划、工具使用和错误恢复等角度评分。

作者的实验发现,同一个模型换外壳后表现会明显变化,也没有一个“模型加外壳”的组合在所有任务上都最好。这个工具适合帮助团队建立自己的评测流水线,但论文结果不能替代真实仓库、权限和业务数据上的测试。

Hugging Face Daily Papers · 6 赞 · 08.10

工具与产品


Apple Silicon · 视频与音频生成

h3.c 让 MiniMax H3 在 Mac 上原生生成视频和声音

h3.c 是一个用 C 与 Metal 编写的 MiniMax H3 推理项目,已经支持文字生成视频和声音、首尾帧控制,以及按顺序加入图片、视频和音频参考。它提供命令行和交互模式,目标是在 Apple Silicon 上直接运行,不依赖通用 Python 推理栈。

项目仍在逐步优化,而且需要较大的统一内存。作者称,SSD 流式加载可以把模型核心部分记录到的显存占用从约 36.5 GiB 降到约 2 GiB,但会明显变慢;这个数字不包括系统、媒体缓冲和其他模块。使用者应在自己的 Mac、分辨率和质量设置上复测。

GitHub · HN 399 分 · 08.11

Builder 观点


Vercel CEO Guillermo Rauch 认为智能体沙箱必须同时隔离计算和网络。他引用 Kimi 对容器故障的记录,以及 OpenAI 评测模型通过软件仓库代理连上公网的事件,强调只把进程关进容器还不够,出站网络也要设白名单和日志。

查看 X 帖子 →

FirstMark 投资人 Matt Turck 用一句话总结从大数据到智能体时代的老问题:产品界面在变,但底层数据仍决定结果。对正在做智能体的团队,这意味着先修数据定义、权限和更新流程,再期待模型自动补齐脏数据。

查看 X 帖子 →

社区讨论


BBC · 工作方式

AI 公司说工具能省时间,员工却称冲刺期每周工作可超过 90 小时

BBC 采访的现任和前任科技员工称,OpenAI、Anthropic 和 Meta 的部分 AI 项目长期加班。有受访者说,冲刺期一周会超过 90 小时;BBC 同时注明,高薪科技岗位原本就可能加班,受访说法也不代表每名员工。

报道还引用一项跟踪数百名科技员工八个月的 UC Berkeley 研究。研究发现,AI 使用者工作更快、承担更多任务,也把工作拉进一天中的更多时段;检查 AI 输出本身又增加了工作。节省下来的时间不一定变成休息,也可能被新任务填满。

BBC · HN 119 分 · 08.11

此前漏报


此前漏报 · 原始发布日期 2026-08-05

腾讯把 Hy3 推向海外,并接入 WorkBuddy、Miora 与 TokenHub

腾讯在 8 月 5 日宣布 Hy3 面向全球开发者、用户和企业开放。用户可以通过 WorkBuddy、设计工作台 Miora 和腾讯云 TokenHub 使用,也可以通过 API 接进开发环境与第三方工具;开源版本采用 Apache 2.0 许可证。

腾讯称,Hy3 在发布后一周内的 API 调用量达到上一代模型的 68 倍以上。公司还披露,内部办公测试中 WorkBuddy 接入 Hy3 后任务成功率超过 90%,平均完成时间比上一代 Hy 模型缩短 34%。这些数字来自腾讯自己的产品和内部测试,外部部署仍需单独验证。

腾讯 · 08.05 · 七日回查补录

GitHub 趋势


GitHub Trending · 抓取时 167,989 星

anthropics/skills:公开给智能体按需加载的技能目录

Anthropic 的公开仓库收集了 Agent Skills,也就是让兼容智能体按任务加载的说明、脚本和资源。仓库本身只是分发入口,真正的权限与风险藏在每个技能目录里;安装前仍应逐个检查指令、可执行脚本和外部服务。

Python · 167,989 星
GitHub Trending · 抓取时 34,588 星

DeepTutor:把资料、练习与长期记忆放进个人辅导流程

HKUDS/DeepTutor 面向长期个性化学习,尝试把资料检索、解题、进度和记忆接成一套辅导流程。教育团队试用时应先检查知识来源、答案核验和学生数据保存方式,不能用仓库热度代替教学效果。

Python · 34,588 星
GitHub Trending · 抓取时 2,467 星

quant-mind:为量化研究整理可追溯的知识提取与检索

LLMQuant/quant-mind 是面向量化金融的智能体知识提取与检索框架。它试图把研究资料变成可查询的结构,方便智能体继续分析。金融数据有授权、时效和合规要求,接入前应核查数据来源、更新时间与每条结论的引用。

Python · 2,467 星
编辑点评

今天的主线不是“AI 又会了一项新技能”,而是这些技能开始留下可检查的痕迹。广告要标明谁付了钱,生成内容要带来源线索,医疗系统要把模拟结果和真实诊室分开,智能体日志也不能因为加密就随便公开。能力越强,来源、权限和人工接手的位置越要写清楚。