今日 AI 速览
头条
OpenAI 不能排除 Astra 达到最高网络风险级别,暂停未达新标准的内部活动
OpenAI 称,过去几天对即将推出的 Astra 所做内部评测显示,其智能体编程和网络安全能力明显推进。结合专家判断,公司目前无法排除 Astra 已达到 Preparedness Framework 中的 Critical 网络能力门槛。此前 GPT-5.6 Sol 被评为 High,而不是 Critical。
这个最高门槛指模型可能在无人干预下,为多种经过加固的关键系统找到并开发各严重级别的可用零日漏洞,或只凭高层目标完成针对加固目标的新型端到端攻击。OpenAI 已暂停不符合强化控制要求的 Astra 内部活动,并增加隔离测试、网络与工具限制、权重保护、沙箱、全程风险监控和外部测试。公司强调 Astra 尚未发布,也没有参与此前的 Hugging Face 入侵。
点评:这是少见的模型发布前高风险信号,但“无法排除”不等于已经确认达到门槛。真正的检验将是外部测试能否复现能力,以及这些控制在第三方部署时是否仍然成立。
蚂蚁开源 Ling-3.0-flash:124B 总参数,每个 Token 激活 5.1B
蚂蚁集团 inclusionAI 开放了 Ling-3.0-flash 权重与模型卡,许可证为 MIT。模型采用 124B 总参数、5.1B 激活参数的稀疏 MoE,并以 5 比 1 交替堆叠 Kimi Delta Attention 与 MLA,目标是在长上下文效率和计算成本之间取得平衡。
官方模型卡给出的结果包括 SWE-bench Pro 56.6、SWE-bench Multilingual 72.4 和 AIME 2026 93.2,但这些榜单结果由发布方提交,尚未独立核验。项目还提供基础版及多种量化版本,适合团队按显存、吞吐与精度需求自行部署和复测。
点评:5.1B 激活参数让这款 124B MoE 更值得关注的是部署效率,而不是纸面总参数。正式采用前,应在自己的代码库和中文长任务上复现准确率、显存占用与持续吞吐。
Databricks 把 AI 编码成本拆成四个杠杆,路由与上下文压缩各省三到五成
Databricks 汇总自身以及 Stripe、Coinbase、Uber 和 Ramp 等早期大规模使用者的做法,把成本控制分成四类:持续切换到价格效率更高的模型、按请求或任务动态路由、给开发者实时用量与分级门槛,以及减少上下文和缓存开销。文章强调,内部工作负载评测比公共榜单更适合决定模型菜单。
Databricks 称,其 Smart Router 在大致维持最昂贵候选模型质量的同时,平均任务成本降低超过 30%;调整智能体外壳和缓存设置后,生成 Token 与相关成本又减少近 50%,且没有观察到开发者质量下降。数字来自公司内部和非正式访谈,方向性强于可复现基准。
点评:简单按人封顶可能误伤最会用 AI 的高产开发者。更稳妥的次序是先统一观测,再以内部任务评测路由,最后对异常支出增加摩擦和降级,而不是直接断供。
研究精选
Activity Frames 不用模型做摘要,把屏幕活动压成可回放的确定性记忆
Activity Frames 用零模型管线把本地屏幕活动切成带应用、站点、时间、输入量和原始证据指针的片段,输出可缓存、可审计且同样输入会得到完全相同字节。作者在一名专业人士 51 个活跃日、128,756 帧的数据上,把一天记录压缩成小 86 倍的提示块,处理耗时 68 毫秒。
读取该提示块的智能体在日程问题上达到 98.4% 准确率,而对同一记录做 LLM 摘要后为 66% 至 80%。论文还展示命中已编译例程时可零模型 Token 回放,但全部结果来自单一用户,隐私、跨人泛化和真实任务收益仍待验证。
点评:适合关心本地个人智能体、可审计记忆和推理成本的团队。先把可重复的人类操作编译成确定状态,再把模型留给例外,可能比无限扩大记忆摘要更可控。
DataSpace 用 7,439 个异构文件测试数据智能体,最佳准确率仍只有 66.34%
DataSpace 包含 410 个跨语言任务和 15.01 GB 的 7,439 个材料,覆盖 CSV、JSON、SQLite、Markdown、PDF 与视频。智能体只拿到问题和本地工作区,必须返回完整表格;确定性评测器会处理列顺序、类型、精度和行顺序差异。
在六个前沿多模态模型和五种常用智能体外壳上,最佳准确率为 66.34%。固定底层模型后,不同外壳仍拉开 15.36 个百分点,跨模态证据与连接操作会持续降低成绩。结果来自作者评测,但说明数据任务的可靠性不只由模型名称决定。
工具与产品
Claude Code 2.1.224 增加自托管运行器,并修补沙箱目录拒读绕过
Team 与 Enterprise 计划现在可用 claude self-hosted-runner,把自有机器或容器接成 Claude Code 网页、移动端与桌面会话的执行环境。新版还支持从 HTTPS 压缩包安装插件并用 SHA-256 固定内容,以及让不同机器上的会话通过 ListAgents 和 SendMessage 互发消息。
安全修复包括 Linux 与 macOS 上带尾斜杠的 denyRead 条目可被静默绕过、超长项目路径映射到另一项目会话目录等问题。经用户同意的反馈分享现在还可能上传最后一次请求的系统提示、工具定义和模型参数,官方称会继续脱敏,并在内容过大时优先丢弃这些字段。
Builder 观点
Box CEO Aaron Levie 认为,真正使用智能体更像在流程里管理员工,而不是向聊天机器人提问。任务提示应接近规格说明,明确范围和完成标准;更大的收益来自重做数据接入、跨部门协作和人工复核步骤,而不是把智能体塞进原有问答入口。
查看 X 帖子 →产品顾问 Peter Yang 判断,消费级 AI 的关键门槛不是谁拥有最强模型,而是普通用户是否信任它连接邮件、日历和其他应用,以及是否理解它已经能做什么。对 ChatGPT 与 Gemini 来说,产品引导、权限解释和可靠完成任务的体验,可能比模型榜单更决定留存。
查看 X 帖子 →Vercel CEO Guillermo Rauch 主张开发工具应同时开源并可普遍扩展,因为 AI 编程智能体会成为最重要的一类开发工具。他看好统一插件标准,让同一扩展能进入 CLI、IDE、云端智能体和个人助手,而不是为每个外壳重复集成。
查看 X 帖子 →播客精华
Basis 联合创始人 Mitch Troyanovsky:结果全对,也不能证明智能体过程可靠
Basis 让智能体连续数小时甚至数天处理会计与报税任务。Troyanovsky 认为,长任务的难点是模型没有真正的短期和长期记忆,又缺少像代码运行那样便宜的反馈。团队因此把人类专业流程翻成少量行为规格,例如研究税务问题必须回到一手法规,完成演示文稿前先渲染检查。
行为规格不是把每一步写死,而是给另一个评审智能体判断轨迹是否遵守关键过程。Troyanovsky 把上下文视为运行时训练数据,强调提示与工具说明会直接影响性能,甚至比代码组织更值得精心维护;但他也承认,随着模型进步,这些外壳工作最终会被模型吸收。
此前漏报
Kitesurf 把浏览器放进 Workers 的 V8 隔离环境,先为智能体舍弃部分视觉负担
Cloudflare 的 Kitesurf 是面向智能体重写的浏览器,可通过现有 CDP、Playwright 与 Puppeteer 客户端使用。它把网络访问集中交给 SandboxOutbound Worker,其余组件不能直接联网,并让渲染器保持无状态,以便卡住时快速销毁和重启。
Cloudflare 称,Kitesurf 已通过约 21.5 万项 Web Platform Tests,在常见 Browser Run 快捷任务中,内存和 CPU 使用量约为 Chromium 的三分之一到七分之一。它仍不适合 WebGL、真实 TLS 指纹或需要长时间持久状态的认证会话,目前在 Browser Run 内限量免费测试。
GitHub 趋势
code-review-graph:先算改动影响半径,再给编程智能体最小相关上下文
tirth8205/code-review-graph 用 Tree-sitter 把函数、类、导入、调用、继承和测试关系存入本地 SQLite 图,再通过 MCP 或 CLI 返回改动的调用者、依赖和相关测试。项目给出的六仓库全量语料对比中,每个问题的 Token 缩减中位数约 65 倍;作者也明确提醒,这个基线高于真实智能体会采用的 grep 读取方式。
google/skills:把 Google Cloud、Gemini API 与基础设施流程整理成 Agent Skills
google/skills 是 Google 产品与技术的 Agent Skills 仓库,覆盖 Cloud 身份、架构、Agent Platform、Gemini API、GKE、数据库、可观测性、安全和广告等工作流。它支持按需安装具体技能,也提供面向 Claude Code、Codex 与 Antigravity CLI 的插件入口;仓库仍标注为积极开发中。
今天几条新闻围绕同一件事:智能体正在从回答问题转向进入真实系统。Astra 迫使安全控制提前升级,Ling 把部署效率放到参数规模之前,Databricks 用路由和观测管住成本,Basis 则把专业流程写成可审查的行为。能力越强,边界、证据和运行状态越不能留到事后补。