进阶约 2 小时Prompt 工程实验设计数据分析
Prompt 迭代优化实验
📖 建议先学:第二篇 Prompt 工程
以电商商品摘要生成为任务,从零开始设计 prompt 并进行多轮受控迭代实验,用数据证明每轮优化的效果提升。你将练习 prompt 工程方法、实验变量控制与效果归因分析。
任务背景
「拾货商城」的商品详情页希望增加一段 60 字以内的“AI 卖点摘要”,由大模型基于商品标题、参数和买家评价自动生成。第一版 prompt 上线后,运营团队反馈摘要“经常堆砌形容词”“超过字数限制”“偶尔夸大功效有合规风险”。
你接手这个 prompt 的优化工作。算法工程师告诉你:“模型不用换,先从 prompt 下手。“你需要在有限时间内完成多轮迭代,并用数据证明改进是真实有效的,而不是”感觉变好了”。
任务要求
- 建立基线:记录当前 prompt(可自行编写一个合理的初版)在固定测试集(不少于 20 条商品数据,可虚构但需覆盖不同品类)上的表现。
- 定义评估标准:设立可量化指标,如字数达标率、要点覆盖率(是否包含核心卖点)、合规违规率(是否出现绝对化用语),以及人工主观评分(吸引力 1-5 分)。
- 受控迭代:进行至少 4 轮迭代,每轮只改一个策略(如增加角色设定、加入少样本示例、增加输出格式约束、增加违禁词清单),记录每轮 prompt 与全部输出。
- 数据对比:每轮迭代后重新跑测试集,制作指标变化表,分析每项改动带来了什么提升或退化。
- 沉淀方法论:总结哪些 prompt 技巧在该任务上有效、哪些无效,形成可复用的 prompt 模板与改进清单。
交付物清单
- 实验设计说明:测试集说明、指标定义与计算方式、迭代规则
- 每轮迭代的完整 prompt 文本与修改点说明(至少 4 轮)
- 各轮指标对比表(含基线),并附代表性输出示例
- Prompt 优化方法论总结:有效技巧清单、无效尝试及原因分析、最终推荐模板
自评标准
| 维度 | 优秀标准 |
|---|---|
| 实验严谨性 | 严格控制变量,每轮只改一处,测试集与采样参数保持一致 |
| 指标合理性 | 量化指标客观可复算,主观评分有明确 rubric,量化与主观结合 |
| 归因清晰度 | 能准确解释每个指标变化由哪项改动引起,而非笼统归为“整体变好” |
| 沉淀价值 | 方法论抽象到可复用层面,模板可直接迁移到同类文本生成任务 |
| 效率意识 | 在有限时间内合理规划迭代轮次,优先验证影响最大的假设 |
延伸思考
- prompt 优化到什么程度应该“停止”,转而考虑微调或更换模型?你的判断标准是什么?
- 如果优化后的 prompt 在 A 品类表现提升但在 B 品类退化,你会如何处理这种此消彼长?
- prompt 本质上是“代码”还是“文案”?这决定了它应该由谁维护、用什么流程管理,你的看法是什么?
完成这一节了?
打卡记录保存在你的浏览器本地,方便追踪学习进度。