今日 AI 速览
头条
DeepSeek-V4-Flash 正式版上线,重点加强智能体和 Codex
DeepSeek 把 V4-Flash 正式版 API 开放公测,API 就是让程序调用模型的接口。调用方法不变,只要继续使用 deepseek-v4-flash 这个模型名,就会得到 7 月 31 日的新版本。新版没有改变模型大小和结构,主要增加了基础训练结束后的专门练习,让它更会写代码、调用工具和完成多步任务。官方还加入一种方便开发工具接入的 Responses API 格式,并专门适配 Codex;这次只更新 API,V4-Pro 和网页、App 里的模型都没有变化。
点评:使用 DeepSeek 写代码或跑智能体的团队,应该先拿自己的真实仓库和工具流程重测。官方分数能说明方向,但不能代替你的成功率、延迟和成本数据。
德国法院判 Suno 侵犯音乐版权,赔偿金额还要另算
慕尼黑第一地区法院裁定,Suno 无权使用德国音乐版权组织 GEMA 代表的作品,并要求 Suno 交代相关收入。赔偿金额尚未确定,Suno 仍可向上一级法院上诉。案件讨论的是 Suno 处理和生成受版权保护音乐时是否需要许可,不代表所有 AI 音乐都自动违法。
点评:做 AI 音乐产品的团队不能再把授权留到产品上线后再谈。现在就该列清训练材料、输出相似度和各地区许可,但也要记住这仍是可以上诉的一审判决。
Google Earth 上线 AI 改图后不到一天就撤回
Google Earth 曾短暂开放一项功能,让用户用文字修改地点影像。研究人员很快生成了难民营、核电站和灾难现场等看起来很真的假卫星图。Google 随后撤下功能并加固安全措施;公司说这些图片都有水印,也从未进入公众可查看的地图。
点评:地图和公共信息产品一旦允许改图,就会影响人们对真实世界的判断。相关团队应先限制分享范围、测试最坏用法,再决定是否开放给所有人。
工具与产品
荷兰保险公司 Univé 让员工自己做 1,500 个 GPT 工具
OpenAI 的客户案例称,Univé 已启用 97% 的 ChatGPT Enterprise 账号,每周约有 85% 的持证员工在使用。员工做了约 1,500 个自定义 GPT,其中一个会先整理宠物保险理赔材料,把准备时间从几小时缩到几分钟。AI 只负责收集和检查资料,受过训练的理赔人员仍要作出最终决定;连接器也沿用原系统的访问权限,不会自动看到更多数据。
Builder 观点
Zara Zhang 建议,培训不懂技术的团队时,不要先讲一大堆理论,而是办一场“安装聚会”。大家带着电脑,当场装好智能体并完成一个有意义的任务。她认为,安装和设置本身占了使用门槛的八成。
查看 X 帖子 →Amjad Masad 说,沙箱本来就很难做好,近期不少事故暴露的是基础安全错误。他建议默认系统里一定存在未知漏洞,再用多层保护和零信任设计,也就是每次访问都重新核实身份,把一次突破能造成的伤害压到最小。
查看 X 帖子 →Swyx 观察到,模型公司若嫌公开网页数据质量不够,就得自己抓取、更新和索引整个网络。这样一来,训练数据工程会顺手长成一套私有搜索系统,还能给智能体在回答问题时继续使用。
查看 X 帖子 →社区热议
Tailscale 复盘 Hugging Face 入侵:没有产品漏洞,防线仍然失效
Tailscale 说,闯入 Hugging Face 的 AI 智能体没有利用 Tailscale 漏洞,但偷到一个可重复使用的密钥后,把 181 台外部机器加入了内部网络。文章认为,真正的问题是生产环境里放着 136 个长期密钥,而且安全设置太难启用。Tailscale 建议云端和持续集成任务改用短期身份凭证,并打开网络流量记录和更严格的设备准入。
点评:只买“零信任”产品不会自动得到零信任结果。运行智能体的团队今天就该盘点长期密钥、可加入网络的身份和报警规则。
AI 会给出正确答案,但“思考过程”不一定可信
Quanta 汇总多项研究后指出,推理模型写出的中间步骤不一定真实反映它内部怎样得到答案。有研究把正确步骤换成错误文字,或删掉三成到六成的“思考步骤”,模型成绩仍变化不大。模型当然能解决难题,但人们不能把它显示的思考文字直接当成可审计的证明。
GitHub 趋势
OpenWork:把同一套 AI 工作流分享给不同工具和同事
different-ai/openwork 是一个可在 macOS、Windows 和 Linux 使用的开源桌面应用,也能通过 MCP 接入 Codex、Claude Code 和 Cursor。MCP 是让不同 AI 工具连接同一服务的协议。用户可以复用同一套技能、连接和工作流,团队管理员还能分配权限与模型。仓库主要使用 TypeScript,目前约 19,500 星。
last30days-skill:让智能体从多个社区查找近期讨论
mvanhorn/last30days-skill 会搜索 Reddit、X、YouTube、Hacker News、Polymarket 和普通网页,再按热度整理带来源的摘要。它可作为技能安装到多种 AI 编程工具中,适合查询“最近大家在讨论什么”。MIT 许可的 Python 仓库目前约 56,229 星。
今天的共同问题是,AI 能做更多事以后,谁来保证它做对。DeepSeek 在加强智能体,Google Earth 因滥用撤回功能,Tailscale 则承认产品没有漏洞也不等于防线有效。真正可用的系统,需要把权限、授权、验证和人类责任一起设计进去。