今日 AI 速览
头条
Google 调整 DeepMind 领导层:Demis Hassabis 转任董事长,Jeff Dean 离开 Google
Google 宣布,Demis Hassabis 将不再担任 Google DeepMind CEO,转任 Google DeepMind 董事长和 Alphabet 首席科学家,同时继续领导药物研发公司 Isomorphic Labs。Koray Kavukcuoglu 将以 Google DeepMind 高级副总裁和 Google 首席 AI 架构师的身份负责团队。
在 Google 工作 27 年的 Jeff Dean 也将离开。他会与 Sanjay Ghemawat 成立一家独立的公益公司,用机器学习推动科学与工程研究。这次调整把模型团队的日常管理交给 Koray,也让 Hassabis 把更多时间放在长期研究方向上。
点评:依赖 Gemini 或 DeepMind 技术的团队不该只看人事标题猜产品路线。接下来更值得追踪的是模型发布节奏、研究资源分配和 Google 各产品团队之间的协作是否真的改变。
Meta 推出 Muse Code:多个后台智能体一起处理大型代码任务
Muse Code 是一款在终端里运行的测试版编程智能体,由新模型 Muse Spark 1.2 驱动。主智能体工作时,多个专用后台智能体会持续收集资料、检查代码和提供帮助,而不是每遇到一个任务才临时启动。
它内置 /plan、/grill 和 /goal 等技能,分别用于制定需确认的计划、找出计划漏洞和持续完成目标。Muse Spark 1.2 加强了代码生成、复杂调试和理解整个代码库的能力,现已同时进入 Muse Code 与 Meta Model API。
点评:并行后台智能体能减少主线程反复查资料,但也会放大成本、权限和错误传播。试用时先在小仓库记录每个后台任务做了什么,再决定是否给它更大的代码范围。
Anthropic 开始组建芯片团队,想让 Claude 的模型与硬件一起设计
TechCrunch 报道,Anthropic 已确认正在组建自己的 AI 芯片设计团队。公司计划同时设计模型和硬件,让 Claude 运行得更快、更省资源;招聘信息也出现了“定制芯片团队”的工程岗位。
这不等于 Anthropic 已经完成芯片或确定量产时间。自研芯片需要设计、制造、软件适配和大规模部署,报道目前只能证明团队建设已经开始。
点评:这条消息对云计算和芯片供应商比普通 Claude 用户更紧迫。采购团队现在该关注的是 Anthropic 会选择哪些制造与云端伙伴,而不是提前把未发布芯片写进容量计划。
研究精选
给智能体积累技能,不一定让它真正学会复用经验
ContinualSkillBench 用五个领域、每个领域 100 个逐步变难的任务,测试智能体能否把早先经验整理成以后还能用的技能。按顺序做任务通常会提高成绩,但明确维护技能库与只保留前文和反馈的效果平均相近。
论文认为,当前不少提升来自模型适应先前上下文,而不是形成了稳定、可迁移的技能。明确技能仍会帮助需要重复步骤或精确格式的任务;能力较弱的模型则更容易堆出大量零散、只适用于单个任务的技能。
点评:做智能体记忆或技能市场的团队,不能用“技能数量增加”证明系统在学习。评测必须把旧经验拿到新任务上复用,并与单纯延长上下文做对照。
长上下文模型可能因小数精度太低,看不见远处的文字
研究者发现,ALiBi 这种位置编码会让距离偏置随文字间隔线性变大。当数值小到浮点格式无法表示时,大量注意力权重会直接变成零,让部分注意力头对远处 Token 失去感知。
这个问题会明显损害从长文本中找回指定信息的能力,却可能只轻微影响常见基准,因此容易被普通测试漏掉。研究在 1.48 亿参数模型上比较四种训练修复方法,按对数缩放距离的结果最稳定,并在现有 ALiBi 模型中也观察到该现象。
工具与产品
安全公司称 Atlassian Rovo 会听从隐藏指令,把公司资料传到外部
PromptArmor 称,攻击者可把隐藏指令放进 Rovo 会读取的内容里,让它把 Jira 工单、Confluence 文档和连接器可见的数据发到外部服务器。攻击不需要用户再次确认,即使管理员关闭网页搜索,Rovo 仍保留打开搜索结果网址的工具,因此研究者称外泄路径依然存在。
PromptArmor 表示已在 5 月 23 日向 Atlassian 报告问题,两个月后仍未收到修复说明。以上结论来自发现漏洞的安全公司,页面发布时 Atlassian 尚未公开回应。
点评:使用 Rovo 的管理员应先按最坏情况处理:缩小连接器和文档权限,限制可访问网址,并查看异常外联记录。关闭“网页搜索”不能替代真正删除联网工具。
Builder 观点
Box CEO Aaron Levie 观察到,企业采用 AI 的方式远比早期云计算更分散。十位 IT 负责人可能给出五种编程智能体方案;有的统一使用 ChatGPT 或 Claude,有的允许多选,还有团队自建模型调度层。数据访问同样从“智能体继承用户身份”到“给智能体独立身份”不等,因此市场格局还远未定型。
查看 X 帖子 →Meta AI 的 Madhu Guru 建议团队先用能力最强的前沿模型验证产品体验,暂时忽略成本;等流程被用户证明有价值后,再用开放权重模型、小模型、路由和微调降低价格与延迟。他认为,太早从最便宜的模型开始,会让团队在还没找到正确体验前就被能力上限困住。
查看 X 帖子 →Zara Zhang 认为,新技术传播首先是社会过程,不是效率计算。人们更容易因为身边相似的人用了新工具并得到好结果,或担心自己被群体落下而采用它。因此推广 AI 时,真实同伴案例往往比“效率提升十倍”的口号更有说服力。
查看 X 帖子 →播客精华
Chai Discovery 想把找药从碰运气变成可反复验证的工程
Chai Discovery 联合创始人 Josh Meier 与 Matt McPartlon 解释,他们希望让模型按目标性质直接设计分子,而不只是从数百万个候选中筛选一个。实验室不会因此消失,反而可能因为每次测试更有价值而做更多验证。
团队采用“苦涩的教训”路线,重点扩大数据、模型和算力,同时尽量简化模型结构。节目也强调,药物设计有可测量的结合能力、制造难度和实验结果,进步必须经过真实实验验证,不能只看模型分数。
社区热议
GitHub 趋势
Strix:让多个 AI 智能体在隔离环境里测试应用漏洞
usestrix/strix 会让多个智能体执行侦察、攻击与验证,并要求用可复现的概念验证来确认问题,而不是只给静态扫描警告。它能在 Docker 沙箱运行,支持命令行和 CI/CD,需自行提供 OpenAI、Anthropic 或 Google 等模型的 API Key。攻击性测试只能用于明确授权的目标。
video-use:让编程智能体根据文字稿和少量画面剪视频
browser-use/video-use 把逐词时间戳、说话人和声音事件压成一份文字稿,只在判断剪辑点时生成带波形和画面的时间线图,避免把每一帧都交给模型。它可删除口头停顿、加字幕与调色,并在交付前检查每个剪切边界;安装需要 ffmpeg,转录默认使用 ElevenLabs API。
今天的共同线索是,AI 正从单个模型变成一整套组织和系统。Google 重排研究领导层,Meta 给编程智能体加后台团队,Anthropic 开始碰芯片,企业软件又暴露权限风险。真正的竞争已经不只是谁的模型分数高,而是谁能把人、硬件、权限和验证一起管好。