
最近折腾 AI 应用的成本优化,盯着 API 账单看了好几天,踩了几个坑,也发现了一些有意思的东西。GLM-5.3-Flash 这个模型的价格让我不得不好好算算账:官方宣称在 Artificial Analysis 智能指数上与 Claude Opus 4.8 持平,但价格只有后者的约 1/40。这篇把实际价格表、成本来源、以及什么时候该切换什么时候不该切换,说清楚。
GLM-5.3-Flash 每百万 Token(百万 tokens)的定价:
国内定价(人民币):
| 类型 | 价格 |
|---|---|
| 输入(Input) | ¥0.8 |
| 输出(Output) | ¥2.8 |
国际定价(美元):
| 类型 | 价格 |
|---|---|
| 输入(Input) | $0.3 |
| 输出(Output) | $1.2(半价期间 $0.6) |
两个参考数据:
对比一下市场行情:DeepSeek V4 Flash 官方价格约为 $0.14/$0.28 每百万 Token。GLM-5.3-Flash 处于同一个"大宗商品级低价"区间,但智能指数更高(57 vs DeepSeek V4 Pro 的 53),且 104 万 Token 的上下文窗口和原生多模态(文本/图像/视频/文件)是差异化卖点。
"约 Claude Opus 的 1/40" 是官方数据,但有两个前提需要说清楚:
这个框架很重要,因为当前这波定价浪潮的本质就是:单纯的每 Token 价格,正在变成衡量实际成本的较弱指标。
具体算一下。一个消耗 100 万输入 Token 和 100 万输出 Token 的长上下文 Agent 会话,按 GLM-5.3-Flash 国际价格:
如果一个会话主要是反复读取大型代码库,输入 Token 占比很高,那便宜的输入价格就是关键:1000 万输入 Token(大量上下文轮换)按标准价格只需 $3.00。这就是让长上下文 Agent 在经济上变得可行的核心——携带状态的成本不再是需要刻意优化的账单项目。国内价格(¥0.8 输入/¥2.8 输出)更划算,这也是 CN 价格引发关注的原因。
Agent 场景是成本结构变化最大的地方。Agent 循环本身是 Token 密集型:每个任务涉及多轮工具调用、长系统提示、重试、以及不断累积的上下文。GLM-5.3-Flash 有三个特性与这个模式高度契合:
实际效果:那些之前被归类为"只能上旗舰,只有旗舰才可靠"的工作负载,现在有了便宜一个数量级、但在 AA 指数上与前沿旗舰持平的替代选项。
官方也很坦诚:价格不是全部:
glm-5.3-flash-free)让零成本试水路径很短。还有个促销注意事项:半价是限时窗口,预算规划要用标准价格(¥0.8/¥2.8 和 $0.3/$1.2)。
如果我来管团队的 API 预算:
glm-5.3-flash-free(200 请求/天),在自己的任务组合上跑一周,对比输出质量。glm-5.3-flash,对比的是每完成任务的实际成本,而不是每 Token 成本。注意重试次数和上下文增长——那才是便宜单价悄悄变成贵任务成本的地方。GLM-5.3-Flash 代表的定价浪潮不只是"出了一个便宜模型"。而是一个 AA 智能指数 57 档位的模型——与 Claude Opus 4.8 持平、高于 DeepSeek V4 Pro——现在以 MIT 开源方式提供,价格约为旗舰官方 Token 单价的 1/40,还附赠 104 万 Token 上下文窗口和原生多模态。特别对于 Agent workload 和长上下文使用场景,这改变了"什么规模的计算你负担得起"的边界。诚实的提醒是:Token 单价比例不等于任务成本比例,促销是临时的,一个评测指数不等于质量保证。在自己的 workload 上实测,按标准价格做预算,把便宜档当作新的基准线来对标,而不是所有场景的自动替代方案。