今日 AI 速览
头条
Anthropic 的季度收入超过 OpenAI,但 OpenAI 正在美国企业客户中追赶
Ramp 对 7 万多家美国企业的付款数据表明,7 月约 44% 的样本企业向 Anthropic 付费,OpenAI 接近 40%。5 月两者曾是 41% 对 39%,Anthropic 仍领先,但 OpenAI 在第三季度截至目前增长更快。样本中付费使用 AI 的企业比例也从 3 月超过 50%,升到 7 月接近 56%。
另一组由《华尔街日报》依据投资者材料披露的数据给出收入侧对比:Anthropic 第二季度收入约 116 亿美元,OpenAI 约 67 亿美元。OpenAI 环比增长 18%,经营亏损扩大至 123 亿美元;Anthropic 同期收入增速更快,并报告小幅调整后经营利润。
两组数字不能混成同一个市场份额。Ramp 只覆盖使用其卡和付款产品的美国企业,样本偏科技行业,也没有公开实际花费金额;两家公司仍为私营企业,季度收入和调整后利润也不是经公开申报审计的同一套财务报表。
点评:Anthropic 现在把企业采用转成收入的效率更强,OpenAI 则显示出重新拿回企业增量的势头。真正值得继续追踪的是客户是否长期留下,以及增长能否覆盖推理和训练成本。
OpenAI 新设 AI Futures,专门讨论强 AI 将怎样重塑权力、经济与个人自由
OpenAI 推出 AI Futures 博客,准备持续讨论变革性 AI 对权力分配、治理、经济结构和个人自由的影响。它不是模型或产品发布,而是把“能力提升之后社会如何做选择”单独变成一个长期公开议题。
这类讨论的价值不在于预测一个确定未来,而在于提前暴露制度设计中的冲突:谁控制算力和模型、生产率收益怎样分配、个人还有多少选择权,以及公共机构如何在安全和创新之间建立可检验的规则。
点评:实验室讨论社会影响时,最重要的不是愿景词汇,而是能否把假设、利益冲突和可反驳的政策方案公开出来。
Apple Music 将在年底前强制标注 AI 生成音乐
Apple Music 正要求音乐供应方为 AI 生成内容增加标记,并计划在年底前强制执行。标签用于告诉平台和听众作品是否由生成式系统制作,减少 AI 音乐混入人工创作目录后无法辨认的情况。
公开报道目前没有给出完整的判定阈值、混合创作规则和误标申诉流程。平台若只要求上传者自报,仍会留下漏标空间;若采用自动检测,又必须解释检测误差和证据保存方式。
点评:“有标签”只是第一步。创作者、发行商和听众真正需要的是统一字段、可审计来源和可申诉的执行规则。
研究动态
美团用 64 维 LLM 语义向量改造本地生活搜索,长尾结果最先受益
美团搜索团队公布三期生产实践:先让轻量模型把搜索词、商家和商品压成语义向量,再把相似度注入排序模型,解决“宠物 SPA”和“萌宠护理套餐”这类字面不同但意思相近的问题。第一期只用 64 维向量,长尾 NDCG@5 增加 2.21 个百分点,长尾首位坏结果减少 2.96 个百分点。
第二期把训练改成 Query、商家、商品三元表征,并使用同一次请求里“曝光但未点击”的难负样本。消融实验中,加入 Triplet Loss 后商品下单 AUC 增加 11.02 个百分点,远高于点击 AUC 的 4.85 个百分点。三期方案均已完成全量上线。
点评:这份实践最有用的不是“大模型做搜索”这个结论,而是它说明了小向量、好样本和贴近业务的难负例,往往比一味放大模型更能带来真实收益。
工具与产品
Claude Code 2.1.238 释放旧子 Agent 结果,修复长会话内存持续增长
Claude Code 2.1.238 会在子 Agent 工具结果离开近期显示窗口后释放内存,修复长交互会话无限增长的问题。版本还增加 readline 键位风格、自托管 runner 延迟关机和动态代理授权,并改善 Remote Control 的断线重连、消息送达和跨会话错误反馈。
插件市场的 headersHelper 可以临时生成短期 HTTP 请求头,但安装或更新前会展示命令并询问确认;项目级 helper 还要求目录已通过信任对话,并在不继承凭据环境变量的情况下运行。
Ramp 推出 Router,让企业按成本、难度和基准在多家模型间分流
Ramp Router 通过一个 API 接入 OpenAI、Anthropic、DeepSeek、Moonshot、MiniMax、NVIDIA、xAI 和 Z.ai,并可按弹性价格层、最多三个自选基准或问题难度选择模型。控制台展示 Token、成本、延迟和失败回退。
服务目前只在美国开放,2026 年内免平台费,但推理费用仍由用户承担。默认会保存输入、输出和工具调用一年,用户可以退出;Ramp 表示会先移除可识别个人的信息再用于改进产品。
点评:模型路由器的价值是把成本和可靠性变成可观察的策略,但默认一年留存对敏感业务并不轻,接入前要先改数据策略。
社区热议
“别直接粘贴 AI”登上 HN:别人问的是你的判断,不是通用答案
dontpastetheai.com 用讽刺方式提醒:对方既然也能调用聊天机器人,仍然来问你,多半是想听你的背景、品味和判断。作者并不反对用 AI 起草,但建议读完后自己压缩、改写,或只引用真正有用的一段并解释原因。
这条观点获得近千分,也引发大量争论。它把“是否使用 AI”换成更实际的问题:信息接收者能否看出你做过筛选、承担判断,并尊重了对方的阅读时间。
125M 参数钢琴续写模型在 iPhone 15 上每秒生成约 108 个音符
开发者 Simon Edwardsson 用 14 轮实验训练了一个 1.25 亿参数 Transformer,让 MIDI 钢琴演奏能在设备端实时续写。最明显的提升来自重新设计 MIDI 事件表示、严格清洗训练数据和加入 DPO 后训练,而不是扩大模型。
免费应用 RollTab 面向连接 MIDI 键盘的 iPhone 和 iPad。这个项目说明,单一任务若把输入表示和数据质量做对,小模型也能提供延迟足够低的互动体验。
Builder 观点
Meta AI 高级总监 Madhu Guru 建议在评测 v1 完成后立刻建立失败模式分类:从最近 500 至 1000 条生产轨迹里找失败,不能只写“答案不好”,而要区分检索错文档、选错段落、未依据上下文、该拒答却编造、问题含糊却不追问等。命名足够具体,才能为每一类失败建立测试并形成改进闭环。
在 X 查看原帖 →Vercel CEO Guillermo Rauch 认为 AI 会推动基础设施原生优化。他以 6.3 MB、启动约 10 微秒的 Zig 编译工具 fx 为例,强调 Agent 完成任务前的启动和依赖成本本身也应该被持续压缩。
在 X 查看原帖 →Box CEO Aaron Levie 认为 AI 时代专家仍占优势。模型让任何人更快入门,但判断该让 Agent 做什么、何时纠偏、怎样验证输出和什么才算好,仍依赖领域技能;AI 反而可能放大专家与普通使用者之间的杠杆差距。
在 X 查看原帖 →此前漏报
腾讯开源 UI-Mate,让 GUI Agent 通过一次示范适应新的桌面任务
腾讯 HY Frontier 在 Hugging Face 发布 UI-Mate 9B、27B 和演示引导版 27B。模型读取实时截图与自然语言任务,输出鼠标、键盘、滚动和等待等结构化动作;演示引导版本允许用户先展示一次流程,再让 Agent 迁移到相似任务。
官方模型卡报告 UI-Mate-27B 在 OSWorld-Verified 得分 77.0、WindowsAgentArena 得分 66.2,权重采用 Apache-2.0。仓库建议配合官方提示、解析器和交互 harness 使用,不能把它当普通视觉聊天模型。
点评:示范学习能降低写长提示的成本,但桌面 Agent 仍直接触碰文件和应用权限,应在隔离账号、可回滚环境和任务级授权下测试。
GitHub 趋势
OpenViking 为 Agent 统一记忆、知识 RAG 与技能上下文
OpenViking 是火山引擎维护的 Agent 上下文数据库。窗口内提交新增 viking://~ 用户根目录别名,并改进对象存储缺失处理和 release candidate 节点兼容;项目核验时有 31,025 stars。
Microsoft Agent Framework 增加 Foundry 与 Azure Blob 会话持久化
Microsoft Agent Framework 支持 Python 和 .NET 的单 Agent、多 Agent 与工作流编排。窗口内提交为托管 Agent 增加 Foundry 状态持久化和 Azure Blob 会话存储,并迁移到 2026-07-28 的 MCP 长任务扩展;核验时有 13,009 stars。
今天最重要的信号不是谁在某一张榜单上暂时领先,而是谁能把模型能力稳定地变成企业采用、可控成本和可复验结果。Anthropic 与 OpenAI 的数据说明客户仍会迁移,美团和社区项目则提醒我们,表示方式、评测分类和小模型工程同样能决定真实效果。