实战约 13 分钟第 25 / 30 章
数据素养:用指标而非感觉驱动 AI 产品
告别"感觉模型变好了":本课程给出 AI 产品的三层指标体系(质量、行为、成本),拆解 A/B 实验在 AI 场景的特有陷阱,并用"预期-观测-归因"框架把数据真正变成迭代决策。
📖 本页目录
“感觉”是 AI 产品最贵的决策依据
AI 产品迭代太容易靠感觉:换了一版 Prompt,“看起来回答更好了”;上了一个新功能,“用户好像更活跃了”。感觉无法复盘、无法排优先级,也无法在质量与成本冲突时做出裁决。数据素养的核心不是会跑 SQL,而是每个决策都对应一个可复算的指标。
AI 产品的三层指标体系
| 类别 | 典型指标 | 说明 |
|---|---|---|
| 质量类 | 回答准确率/任务完成率、用户满意度(点赞点踩比)、bad case 率 | 衡量“做得对不对”,离线评估集与在线反馈双轨并行 |
| 行为类 | 建议采纳率、功能渗透率、次周留存 | 衡量“用不用”,是价值验证的核心 |
| 成本类 | token 成本、单次会话成本、单位任务成本 | 衡量“值不值”,决定毛利与扩量空间 |
指标组合的原则
- 选一个北极星指标(通常是采纳率或任务完成率)代表产品价值。
- 质量与成本是护栏指标:不允许为了北极星牺牲准确率底线或烧穿成本预算。
- 每个指标先定口径再使用:“采纳率”是点击、修改后采纳,还是最终提交?口径不一致的比较都是无效比较。
产品决策提示:给每个功能写下“质量-行为-成本”三行的指标契约进 PRD。没有指标的功能不排期,没有基线的迭代不评估。
A/B 实验在 AI 场景的注意点
- 先离线后线上:新 Prompt/新模型先过固定评估集,通过后再上实验,不要拿线上流量做粗筛。
- 按用户分流,而非按请求:同一用户命中不同版本,会互相污染体验与数据。
- 警惕输出方差:模型输出天然随机,单次对比无意义,需要足够样本量与观察周期。
- 识别新奇效应:新功能的早期提升常来自新鲜感,看次周留存而非首日数据。
- 看分布不只看均值:均值提升可能来自少数重度用户,分位数延迟与分人群数据更能暴露问题。
产品决策提示:实验结论三问——提升是否显著、是否随时间衰减、是否在所有人群一致。三个都有答案再全量。
用“预期-观测-归因”框架做数据决策
- 预期:改动上线前,写下预期哪些指标变、变多少、为什么。不写预期的实验,结果出来只能“事后找说法”。
- 观测:看数据时看三层——大盘指标、分群差异(新老用户、不同场景)、代表性 bad case。数字告诉你“哪里”,case 告诉你“为什么”。
- 归因:把观测与预期的差距拆成可行动的原因(Prompt 问题/检索问题/交互问题/样本问题),明确下一步动作与负责人。
这个框架的最大价值是把“看数据”变成可复盘的过程:预期存档后,无论结果好坏,团队都多了一条可积累的判断记录。数据素养就是在这些记录里长出来的。
本节要点
- 指标体系分三层:质量(准确率/满意度)、行为(采纳率/留存)、成本(token/单次会话成本),组合方式是北极星 + 护栏。
- A/B 实验要点:先离线评估再上线、按用户分流、警惕方差与新奇效应、看分布与分群不只看均值。
- 每次迭代走“预期-观测-归因”:上线前写预期,观测时大盘 + 分群 + case 三层看,归因必须落到具体动作。
- 指标先定口径再使用,没有口径共识的指标讨论是无效讨论。
📝
章节小测
3 道题 · 检验一下刚学的内容
Q1.AI 产品三层指标体系中,「行为类」指标衡量什么?
Q2.AI 产品的 A/B 实验为什么必须按用户而非按请求分流?
Q3.新功能上线初期指标上涨,如何判断是不是新奇效应?
答题后显示结果
完成这一节了?
打卡记录保存在你的浏览器本地,方便追踪学习进度。
💬
🔒 私密学习留言
写下你的疑问或心得 —— 仅你自己和站长可见
0 / 2000
登录 后可发布私密留言,向站长提问。