今日 AI 速览
头条
Seedance 2.5 一次生成 30 秒音视频,还能续写成数分钟成片
字节跳动 Seed 团队发布 Seedance 2.5,把一次生成的带声音视频从 15 秒延长到 30 秒,并支持连续多轮续写。一次任务最多可输入 30 张图片、10 段视频和 10 段音频作为参考,编辑时还能按时间点修改画面或声音。模型已在即梦 AI 和豆包专业版逐步上线,BytePlus ModelArk 的 API 还未开放。
点评:广告和短片团队终于能少做一次切段、拼接与补声音,但“可续写数分钟”仍是官方展示。采用前应拿角色一致性、口型、字幕和商用授权做完整测试。
欧盟 AI 透明规则今天生效,聊天机器人和深度伪造须明确披露
欧盟《人工智能法》第 50 条从 8 月 2 日开始适用。AI 服务提供者要让用户知道自己正在与 AI 互动,并为 AI 生成或改动的内容加入机器可识别标记。使用方公开深度伪造、未经人工审阅的公共事务文章、情绪识别或生物特征分类结果时,也要向公众说明。企业违规最高可罚 1,500 万欧元,或全球年营业额的 3%;部分已在今天前投放的生成式系统,其机器标记义务可延至 12 月。
点评:面向欧洲用户的产品不能只补一句免责声明。产品、内容和法务团队应同时核对交互提示、内容标记、公开标签与日志证据,并确认自己是否适用过渡期。
OpenAI 称下一代 Astra 解出 10 个长期未决数学问题
OpenAI 公布十项数学和理论计算机科学结果,涵盖高维球堆积、群论、量子复杂度、格密码和组合数学。公司称,这些论证由内部下一代模型 Astra 生成,按 Sol API 价格计算,寻找解法所用 Token 约值 2,000 美元。人类随后协助整理成论文,模型再为每个论证生成 Lean 形式化证书。论文、证书和推理记录已经公开,但这些重要结论仍需要数学界逐项审查。
点评:真正的进展不只是模型写出答案,而是同时交付可供同行审阅的论文与机器可检查证书。现阶段最重要的指标是独立验证结果,而不是问题数量。
工具与产品
Builder 观点
Aaron Levie 认为,包在模型外面的任务拆分、工具调用和模型路由系统,会成为仅次于模型能力的关键变量。任务从数百万 Token 增长到数千万甚至上亿 Token 后,怎样拆工作、何时调用哪个模型,会直接影响准确率和成本。
查看 X 帖子 →Swyx 仍在使用 /loop 和 /goal。他认为,当使用者既想随时调整方向,又希望智能体自主运行,或者目标本身需要循环产生新的循环时,这两个命令仍然有用,不应因为早期模型表现不稳就过早放弃。
查看 X 帖子 →Peter Steinberger 观察到,5.5 模型在工作途中收到新指令时不再容易混乱,因此使用者可以继续补充任务,不必先把所有要求排进队列。这个变化会让长时间运行的智能体更接近可持续协作,而不是一次性提交作业。
查看 X 帖子 →社区热议
Cursor 确认自助套餐不再显示逐请求美元成本
Cursor 工作人员在官方论坛确认,自助购买的个人和 Teams 套餐现在改为按 Token 展示用量,Usage 页面、导出 CSV 和读取历史记录的接口都不再返回逐请求美元成本。真正另付费的按需用量仍会出现在总账单中;Teams 管理员可以查看每位成员的按需总额,但无法再按模型拆分美元成本。企业套餐和受支持的管理员接口仍保留部分费用字段。
点评:依赖逐请求成本做模型选择的团队会失去重要反馈。迁移前应确认套餐能提供哪些账单字段,并把自己的 Token、模型、任务结果和最终费用保存在同一份记录里。
美国议员调查 DoorDash 使用中国 Kimi 模型
IT之家援引 CNBC 报道称,美国众议院国土安全委员会和美中战略竞争特别委员会的主席要求 DoorDash 说明怎样使用中国月之暗面公司的 Kimi 模型。DoorDash 联合创始人 Andy Fang 此前说,公司会让高端模型处理最难任务,再把较低层工作交给 Kimi K2.6,以降低成本。DoorDash 回应称愿意说明公司怎样安全使用美国前沿模型和开放权重模型。调查是信息收集,不代表已经认定公司违规。
GitHub 趋势
speech-to-speech:在本地搭一套可替换组件的语音智能体
huggingface/speech-to-speech 把语音活动检测、语音转文字、语言模型和文字转语音串成低延迟管线,并提供与 OpenAI Realtime 兼容的 WebSocket 接口。每一层都能替换,语言模型既可连接服务商,也能指向本机的 vLLM 或 llama.cpp。Python 项目支持 Apple Silicon、CPU 与 CUDA,目前约 10,201 星。
cangjie-skill:把长内容变成可调用、可测试的 Agent Skills
kangarooking/cangjie-skill 面向书籍、长视频、播客和课程,不只生成摘要,而是先提取方法论,再检查原文证据、适用边界和可迁移性,最后输出多个带触发条件与测试用例的 Skills。仓库已收录书籍、投资问答、写作方法和视频课程等示例,采用 AGPL-3.0 许可,目前约 5,900 星。
今天的三条主线都在提醒我们,能力提升只是开始。视频模型要接受真实制作流程检验,数学结果要接受同行复核,面向公众的 AI 还要留下可识别、可追溯的标记。把生成速度变成可靠成果,靠的是验证与责任链。