推理、延迟与成本:AI 产品的经济学
token 怎么计价、延迟从哪来、一次功能调用到底花多少钱?本课程拆解输入输出与缓存的定价结构、延迟的构成与体感设计,给出可直接套用的成本估算算例与模型选型的成本-质量权衡框架。
📖 本页目录
为什么产品经理要懂推理经济学
传统软件的边际成本近乎为零,AI 产品不是:每一次调用都真金白银地买 GPU 时间。成本与延迟不是工程细节,而是直接决定定价、毛利率、功能形态的产品变量。不懂这两个数字的 AI PM,写不出靠谱的商业计划。
token 定价结构:三本账
主流厂商的定价普遍拆成三部分:
| 计费项 | 含义 | 相对价格 |
|---|---|---|
| 输入 token | 你发给模型的全部内容(系统提示 + 上下文 + 用户输入) | 基准 |
| 输出 token | 模型生成的内容 | 通常是输入的 2~5 倍 |
| 缓存输入 | 命中缓存后重复发送的部分 | 仅为正常输入的 1/10 左右 |
三个容易被忽略的事实:
- 系统提示词是隐形大头:每次请求都完整重发。2 万 token 的系统提示 × 每天百万次调用,就是一笔巨额固定支出。
- 输出贵在「慢」也更贵在「钱」:输出按生成速度逐 token 流出,既拉高延迟又拉高单价——「让模型少废话」是同时优化两个指标的手段。
- 缓存是省钱第一杠杆:固定不变的指令、文档、历史轮次命中缓存后价格骤降。架构设计时应把「稳定内容」与「变化内容」分离,最大化缓存命中。
延迟的构成与体感设计
一次请求的延迟 ≈ 排队时间 + 首 token 时间(TTFT)+ 逐 token 生成时间。最后一项与输出长度成正比,是长回答慢的主因。推理模型的「思考链」会显著拉长首 token 时间——用户盯着屏幕等 20 秒才有第一个字。
延迟的产品设计原则不是「越快越好」,而是管理体感:
- 流式输出:让用户看见文字逐个出现,「在干活」的感觉比绝对速度更重要;
- 进度透出:长任务展示中间步骤(「正在检索资料…正在整理…」),把等待变成可感知的过程;
- 分层响应:简单请求路由到快模型,难题再升级慢模型;
- 控制输出长度:限制作答字数、要求先给结论,直接砍掉最贵的等待段。
产品决策提示:给每个功能定延迟预算(如「首 token ≤ 2 秒」),像定内存预算一样写进需求文档。延迟超标时先查三件事:是不是思考链太长、输出太啰嗦、路由到了过强的模型——多数问题在产品设计层就能解决。
成本估算:一个完整的算例
假设做一个企业知识库问答功能,日活跃用户 1000 人,人均每天 5 次提问。采用某旗舰模型,定价按输入 $3 / 百万 token、输出 $15 / 百万 token 计。
单次调用 token 构成:
- 系统提示(角色 + 规则):1,500 token
- 检索注入的文档片段:平均 2,500 token
- 用户问题 + 对话历史:500 token
- 单次输入合计:4,500 token
- 模型回答:平均 600 token → 输出 600 token
单次成本:
输入:4,500 ÷ 1,000,000 × $3 = $0.0135
输出: 600 ÷ 1,000,000 × $15 = $0.0090
单次合计 ≈ $0.0225
月度成本:
1000 人 × 5 次/天 × 30 天 = 150,000 次/月
150,000 × $0.0225 ≈ $3,375/月(约 ¥24,000)
优化后:系统提示与高频文档片段命中缓存(按 1/10 价计,覆盖约 3,000 token 输入)、压缩回答至 400 token:
输入:1,500(无缓存)+ 3,000×0.1(缓存)= 折算 1,800 token → $0.0054
输出:400 × $15/M = $0.0060
单次 ≈ $0.0114,月成本 ≈ $1,710 —— 降了约一半
把这张表做成模板,替换模型单价与场景参数,任何功能都能在开发前算出成本量级。
模型选型:成本-质量权衡框架
选型不是找「最强模型」,而是找质量达标前提下最便宜的模型。四步流程:
- 建评测集:收集 50~100 个真实场景样本(含困难案例),定义可量化的通过标准;
- 盲测梯队:从旗舰到小模型逐档测试,记录每档的通过率与单次成本;
- 找拐点:画出「质量-成本」曲线,选择质量刚达标的最低档(质量 95% 而成本 1/10 的中型模型,常常优于质量 97% 的旗舰);
- 混合路由:把任务分层——80% 的简单请求走便宜模型,20% 难题走旗舰,整体成本可下降一个数量级。
产品决策提示:给用户的定价(订阅制 or 按量制)要在成本模型稳定后再定。早期可用「每月 N 次高级功能」的配额制控制风险;每次模型降价(行业趋势是持续降价)都是重新评估毛利与功能下放范围的触发器。
本节要点
- token 分输入、输出、缓存三本账:输出最贵、缓存最便宜,架构上分离稳定内容与变化内容以最大化缓存命中。
- 延迟 = 排队 + 首 token + 逐 token 生成;体感管理靠流式输出、进度透出与输出长度控制,给功能定延迟预算应成为惯例。
- 成本估算模板:调用次数 ×(输入 token × 输入价 + 输出 token × 输出价),先算量级再动手开发。
- 选型逻辑是「质量达标的最便宜模型」:评测集盲测找质量-成本拐点,再用分层路由把成本打下一个数量级。
- 模型价格持续下行,把每次降价当作重审毛利、定价与功能下放范围的固定动作。
章节小测
3 道题 · 检验一下刚学的内容
Q1.架构上把稳定内容与变化内容分离,主要为了什么?
Q2.限制回答字数、要求先给结论,同时优化了哪两项指标?
Q3.模型选型四步中的找拐点指的是?
答题后显示结果
完成这一节了?
打卡记录保存在你的浏览器本地,方便追踪学习进度。
学习留言
写下你的疑问或心得 —— 仅你自己和站长可见
登录 后可发布私密留言,向站长提问。