今日 AI 速览
头条
OpenAI 披露首款自研推理芯片 Jalapeño:算力与能效超越英伟达 Blackwell 架构芯片
OpenAI 在 Hot Chips 2026 芯片大会上首次公开了与博通(Broadcom)联合研发的自研 AI 推理芯片 Jalapeño 的实测数据。该芯片专为大语言模型推理定制,历时 16 个月完成流片,全面负责支撑 ChatGPT、Codex 与 API 服务。
实测数据显示,在运行 1200 亿与 6700 亿参数大模型时,Jalapeño 每千瓦电力产生的推理吞吐量与单 Token 延迟均优于现有的 GB200 和 GB300 系统。OpenAI 正在通过垂直自研芯片压低大模型服务成本,减少对外部单一算力供应链的依赖。
点评:所有追求极致推理性价比的团队,都该重新审视自研定制芯片对算力格局的长期冲击。
字节跳动发布“豆包工作”:飞书、扣子与编程工具大整合,桌面智能体接管复杂办公
字节跳动正式推出面向生产力场景的全新品牌与桌面产品“豆包工作”(Doubao Work)。公司整合了飞书、扣子(Coze)与编程工具 TRAE 的产品团队,统一打造能够自主拆解任务、调用工具与跨软件推进流程的“数字员工”。
该产品深度融合飞书的工作上下文,支持直接读取文档、日程与即时沟通信息,并能调用浏览器和电脑本地软件执行长程任务,甚至支持在关机状态下由云电脑持续运行。原飞书企业版入口已全面升级,现有用户权益保持平移。
点评:办公协同从“人在聊天框里叫 AI”变成“AI 在桌面上替人干活”,企业应用正加速进入智能体整合期。
苹果发布全新 M6 与 M5 Ultra 芯片:首尝 2nm 工艺与四芯粒架构,端侧大模型算力大跃升
苹果正式发布新一代 Apple Silicon 芯片 M6 与 M5 Ultra。M6 采用台积电 2 纳米先进制程,配备 12 核 CPU 与双 16 核神经网络引擎,日常 AI 运算性能提升最高达 4 倍,首发搭载于新款 Mac mini。
面向专业工作站的 M5 Ultra 则采用新一代 UltraFusion 互连技术,由 4 颗芯片整合而成,拥有 36 核 CPU 与 80 核 GPU,最高支持 512GB 统一内存与每秒 1.2TB 内存带宽,让个人工作站能够直接在本地离线运行超大规模大语言模型。
点评:当个人工作站能直接塞下数百 GB 本地模型,端侧私有部署和高隐私推理的门槛已被彻底打穿。
研究动态
SWE Refactor Bench:跨仓库大重构测试,前沿模型通过率仅 5.4%
研究团队推出了涵盖 20 个完整代码仓库迁移任务的评测集 SWE Refactor Bench,专门测试 AI 智能体能否自主完成复杂技术架构升级。评测设计了迁移审计、功能测试与多智能体验证三道关卡,防止模型靠原样复制代码蒙混过关。
在对 8 款前沿模型的 520 次测试中,仅有 28 次完整通过三道关卡,整体通过率仅为 5.4%。表现最佳的 Claude Opus 5 得分为 47.0 分;在工具链重写任务中智能体平均得分 31.4 分,而在编程语言重写任务中仅得 5.6 分。
点评:代码能力不能只看单点单元测试修复,跨代码库的长流程技术重构才是检验智能体架构的真试金石。
工具与产品
阿里云 Token Plan 接入千问 App 与 PC 端:统一 API 密钥打通端云工作流
阿里云宣布其大模型订阅方案 Token Plan 正式接入千问 App 与桌面端。用户在千问“工作助理”中绑定统一 API 密钥后,即可直接消耗订阅额度调用 Qwen3.8 等主力模型。
该接入支持在端侧执行网页操作、文档生成与自动化办公等复杂任务,无需分别在云端控制台与消费端重复充值,降低了开发者与企业团队的跨端管理成本。
OpenAI 为 ChatGPT Plus 恢复 Codex 与 Work 5 小时使用限额
OpenAI 宣布面向 ChatGPT Plus 订阅用户恢复 ChatGPT Work 与 Codex 的 5 小时周期使用限额,放宽了此前因高负载采取的临时缩水限制。
该调整允许订阅用户在持续编程与办公协作会话中获得更连贯的使用频次,配合即将举办的 DevDay 2026 大会进一步稳定开发者的日常依赖。
Builder 观点
OpenAI 开发者大会产品负责人 Thibault Sottiaux 表示,即将举办的 OpenAI DevDay 2026 将成为公司历史上规模最大、发布内容最重磅的一届开发者大会。
在 X 查看原帖 →Box CEO Aaron Levie 强调,在 AI 智能体即将承担百倍工作量的时代,企业内部沉淀核心事实与工作流的单一事实数据系统(System of Record)比以往任何时候都更加关键。
在 X 查看原帖 →Vercel CEO Guillermo Rauch 谈到软件演进时指出,随着技术进化,优秀的系统应当朝着更快、更便宜、能力更强且体积更轻巧的方向发展,而不是陷入臃肿和缓慢。
在 X 查看原帖 →社区热议
斯坦福大学最新研究:人工智能对职场入门级岗位造成最直接冲击
斯坦福大学研究团队发布的最新劳动力调查显示,生成式 AI 工具的普及正在对初级工程师、数据分析师与文案助理等入门级岗位的招聘需求产生最明显的替代效应。
研究指出,企业更倾向于依靠资深员工搭配 AI 工具完成原先由初级团队承担的基础交付,这对高校毕业生的传统求职路径与技能积累模式提出了新的挑战。
Headlong:面向持久化智能体的轻量级运行框架引发技术讨论
开源项目 Headlong 提出了一套用于持久化运行自主智能体(Persistent Agents)的微型环境框架,重点解决长生命周期任务中的中断恢复、状态检查点与安全隔离问题。
Hacker News 社区讨论认为,随着智能体从单轮交互走向持续数天的复杂业务流程,轻量级、确定性的状态恢复层正在成为智能体基础设施的关键组件。
GitHub 趋势
TradingAgents:多智能体金融交易决策与回测框架
基于多智能体协作架构的量化交易与金融研究决策框架,支持策略回测与多模型协同推理。本期 1,024 stars 快照,采用 Apache-2.0 许可证。
claude-plugins-official:Claude 官方插件与扩展工具包
Anthropic 官方维护的 Claude 插件与扩展工具库集合,为桌面与终端智能体提供标准化的工具调用接口。本期 1,280 stars 快照,采用 MIT 许可证。
今天的主线是:全栈垂直整合正在重塑 AI 竞争的底层规则。从芯片底座与硬件架构(OpenAI Jalapeño 与苹果 M6/M5 Ultra)、到企业私有数据与行业引擎(汤森路透),再到桌面上直接接管任务的智能体协同(豆包工作),单一模型能力的差距正在被系统级与软硬件垂直整合迅速拉平。