site logo

Marico's space

AI 开发者周刊 #26:Agents API、全双工语音、SWE-2 和成本感知 Copilot

AI技术与应用 2026-09-21 17:34:01 8

这周 AI 开发者圈子挺热闹,OpenAI 发了一堆东西,Cognition 也上了新模型,GitHub Copilot 加了成本控制。我这几天把这些都跑了一遍,踩了几个坑,这篇把重点说清楚。

核心趋势是:模型已经不再是产品的全部了。OpenAI 现在把 Codex 背后的 agent 循环和语音层拆开卖了;Cognition 的 SWE-2 强调用更少的步骤完成任务;Copilot 让你设置"成本优先"还是"质量优先",不用每次手动选模型。大家都在问同一个问题:agent 架构里哪些该自己搞,哪些该交给平台?

本期涵盖 9 月 10 日的发布(上一期之后新增的),以及截至 9 月 17 日的更新。

1. OpenAI 把 Codex 的执行框架封装进了 Agents API

OpenAI 在 9 月 10 日发布了 Agents API 公开测试版。这是一个托管的持久化 agent 运行环境,不是 Agents SDK 的别名。OpenAI 负责会话编排、上下文压缩和恢复;你的应用提供工具函数,控制 agent 如何集成到产品里。

官方文档把四个概念分得很清楚:agent 配置、执行环境、持久会话,以及会话中交换的事件和对象。进度可以通过流式传输或 Webhook 推送,会话可以接收后续任务而不从头开始。

架构文档把执行边界的划分说得很明确:

  • 无环境:执行框架可以使用远程 MCP 连接和应用处理的函数工具,不内置 shell 或工作区文件。
  • OpenAI 托管环境:OpenAI 提供沙箱用于代码执行、文件编辑和产物生成。
  • 自托管环境:你的基础设施连接执行器,但 OpenAI 仍然运行编排层。你负责资源调度、重连、关闭和文件持久化。

最后那个选项不是完全自托管 agent。把执行放到你的 VPC 里,并不等于把托管的编排层也搬过去。

定价把模型 API 费用、工具调用费用、以及 OpenAI 托管沙箱的容器费用加在一起。算整个运行的费用,包括子 agent 和重试,而不是把会话当成一次模型响应来计费。

安全文档也特别警告:agent 生成的代码可以读取暴露在环境中的凭证。把应用 API key 放在沙箱外面,限制出站目的地,尽量通过代理处理第三方凭证。一旦把密钥注入进程,沙箱也保不住它。

我的看法:这是一个重要的构建 vs 采购的转变。会话恢复和上下文压缩是特别费力的基础设施维护,租这部分服务是合理的。但要把关键业务状态和不可逆操作的审批权留在自己的应用里。先做一个只读的调查 agent,再上修复 agent。

2. GPT-Live-1 把对话和工作分离了

GPT-Live-1 已在 API 中正式可用,同样是 9 月 10 日发布。主要架构变化是全双工:语音模型可以在说话的同时听,对话可以继续进行而后台 agent 在处理推理和调用工具。

官方入门指南对比了 Realtime API 的单模型处理语音、推理和工具选择。Live 版本让你独立选择后端模型。用户可以问一个订单问题,在查询运行时纠正一个细节,然后收到结果,不用等工具调用完成。

委托指南提供了两种模式:

  • Responses 委托:Live 把请求准备好发给配置的 OpenAI 后端,然后把结果返回给对话。
  • 客户端委托:你的应用组装上下文,运行自己的 agent 或服务,然后把结果返回。需要在后端结果到达语音模型之前做自定义路由或验证时,走这条路。

客户端委托有一个容易被忽略的集成细节:委托事件里包含元数据,不是任务文本本身。需要从转录事件和应用状态构建后端请求,别以为事件就是现成的命令 payload。

模型页面显示语音会话每分钟 0.05 美元,按秒计费。后端模型和工具使用额外计费。所以一个 10 分钟的语音会话,光语音层就要 0.50 美元,还没算推理、工具调用或你的基础设施费用。

权限、确认和任务状态在两种模式下都是应用的责任。审查后端结果也不能保证语音模型在验证过程中保持沉默。要测试的是助手在操作确认之前说了什么,而不只是工具最终是否成功。

我的看法:语音变成了 agent 的接口层,而不是紧耦合的语音处理管道。这对客服工作流和解放双手的开发者协作特别有用。我第一批测试会验证:中断处理、慢查询过程中改变指令、助手能否准确区分"已请求"和"已完成"。自然对话的前提是任务状态保持真实。这个问题跟语音转文本的选择不是一回事。

3. Cognition SWE-2 目标是减少轮次,不只是提高分数

Cognition 在 9 月 10 日发布了 SWE-2,首先上线 Devin Desktop 和 CLI,Web 和 Fusion 稍后推出。发布博客说模型从 Kimi K3 后训练而来,用一次强化学习运行训练多个推理努力级别。

最实用的数据是运营指标:中等等级下,SWE-2 比 SWE-1.7 减少 58% 的轮次,费用降低 81%,测试基准是 FrontierCode 1.1 Main。Cognition 报告 SWE-2 在该基准得分 50.0%,但在 Terminal-Bench 4 上只有 27.3%。后者在对比中大幅落后于最强模型。

这些是厂商报告的评估结果,包含公开结果和内部运行的混合数据集,放在各自的模型特定框架里跑。不是独立的、统一标准的排行榜。Cognition 在发布公告中没有公布独立的 SWE-2 API 定价或可下载权重。

我的看法:有意思的优化方向是知道什么时候该停止探索、开始编辑。对编程 agent 来说,减少多余的仓库读取和重复的工具调用可能比边际 token 价格差异更重要。但"更少轮次"不等于"更好":也可能意味着跳过了验证。评估一个边界 bug 修复、一个迁移任务、一个保持行为的重构,记录:接受了哪些变更、漏掉了哪些测试、review 纠错了多少、实际使用效果如何。用你能实际使用的 Devin 能力来测试,别对着一个想象中的独立模型 API 幻想。

4. Copilot Auto 新增成本 vs 质量控制

GitHub 在 9 月 14 日加了三个 Auto 路由偏好:Efficiency 优先降低成本、Balance 平衡成本质量和延迟、Intelligence 优先质量。发布公告说功能正在向 VS Code、Copilot CLI 和 Copilot 应用推广。

这不是三套不同的模型池。每个偏好用同一个可用模型池,路由引擎评估提示词内容。Intelligence 仍然可能给简单的文档字符串任务选小模型。按实际选中的模型计费,付费订阅用户保持 10% 的 Auto 折扣。

Auto 文档补充了两个有用的约束:路由器仍然遵循套餐权限和管理员策略;路由使用自然缓存边界来避免额外的缓存相关费用。Auto 不会覆盖组织的受限模型策略。

偏好也不是消费上限。Efficiency 在任务需要时仍可能选更强大的模型。Intelligence 不保证每次响应都用最大模型。看标签之前,先检查选中的模型和实际用量。

我的看法:这比逼每个开发者维护一个脑内排行榜要好得多。但这也让横向对比变得更难,除非你记录路由决策。用相同的代表性任务跑一遍每个偏好,比较每次采纳变更的成本、延迟和 review 工作量。保持显式模型选择用于需要可复现性的评估。

快讯

  • VS Code agent 自动化:1.137 版本公开预览新增按小时、天、周重复的任务。先从维护报告或草稿 PR 入手,定义清楚运行重叠时怎么处理。同期周发布说明把 HydraFusion 的本地/云端/混合路由放进了 CLI 的实验菜单。这两个都不该跟上面的标准 Auto 偏好混淆。
  • Copilot 代码审查:现在可以自己解决已处理的评论重审,并获得 shell 工具用于构建、测试和定向脚本,在 agent 防火墙后面跑。更新还引入了 Lite 审查的 agent 组合。更多验证是好事;人工审查是否必须仍然是仓库层面的独立决策。
  • API key 治理:OpenAI 9 月 15 日加了组织和项目级别的控制,限制新 key 的创建:只能是服务账号、用户自有项目 key,或者完全禁止。组织限制优先,现有 key 不受影响。API 变更日志也记录了 9 月 10 日加的 key 过期控制。创建策略不是 retroactive 的凭证轮换。

下周四聊:托管 agent 会话如何从真实故障中恢复、全双工语音能否保持任务状态诚实、以及路由偏好在实际仓库工作上的花费。

想在邮箱里收到?订阅 AI Dev Weekly。

上期回顾:AI Dev Weekly #25

FAQ

OpenAI 的 Agents API 和 Agents SDK 是一回事吗?

不是。API 提供 OpenAI 托管的执行框架和持久会话。SDK 提供应用端编排的组件。新的 API 仍是公开测试版。

GPT-Live-1 的价格包含后端 agent 吗?

不包含。语音层每分钟 0.05 美元,按秒计费。后端模型和工具使用单独计费。

可以下载 Cognition SWE-2 或调用独立 API 吗?

发布公告中没有公布可下载权重或独立 API 定价。通过文档记录的 Devin 界面评估 SWE-2。

Copilot Efficiency 保证账单固定吗?

不保证。这是路由偏好,不是上限。按选中的模型计费,要单独测量实际用量并设置预算。