能力与边界:Scaling Law、涌现与幻觉
模型不是越大越聪明那么简单。本课程讲清规模法则与能力涌现的规律、幻觉的生成机制、上下文窗口的硬约束,并给出一套产品经理判断「这个需求模型能不能做」的可操作框架,避免需求评审时踩坑。
📖 本页目录
Scaling Law:规模是第一性规律
**Scaling Law(规模法则)**是大模型领域的第一性规律:模型能力随参数量、数据量、算力的增加而可预测地提升。这条定律造就了「大力出奇迹」的时代——各家厂商拼命堆参数、堆数据、堆 GPU。
对产品经理,Scaling Law 有两层含义:
- 能力有惯性预期:下一代模型大概率比这一代强,规划产品路线图时应把「模型升级红利」计入,设计时不要为当前模型的短板做过度补偿。
- 提升是平滑的,但需求是阶跃的:准确率从 85% 到 92% 是平滑进步,而你的场景可能需要 99% 才可用——差距不是迭代一两年能填平的。
涌现:能力不是渐变的,是突变的
Scaling Law 之外有个更微妙的现象——涌现(Emergence):某些能力在小模型上几乎为零,规模跨过某个阈值后突然出现。链式推理、多步数学、指令跟随,都呈现过这种「无中生有」的跳变。
涌现的产品含义是双刃剑:
- 好消息:今天做不到的事,明天可能因为一次模型升级突然做到(多模态、长上下文都是这么来的),技术雷达要持续扫描。
- 坏消息:你无法用当前模型的能力外推下一代,也无法在小模型上验证「大模型能不能做」。用便宜模型做原型验证高端能力,结论不可靠。
产品决策提示:规划依赖「涌现中能力」的功能时,策略是「候选项」而非「承诺项」——放进技术预研清单,模型一升级就快速验证,而不是写进对客户的核心承诺。
幻觉:为什么模型会一本正经地胡说
**幻觉(Hallucination)**指模型生成看似可信、实则错误的内容。它不是 bug,是「预测下一词」机制的必然副产品:
- 训练目标是流畅,不是真实:模型学的是「什么样的续写像人话」,一个通顺的编造比生硬的事实更符合它的目标函数;
- 知识有盲区但不会说不知道:预测机制驱使它总给出「最像答案的答案」,缺乏「我不知道」的自发意识;
- 训练数据本身有错:互联网上的谣言与过时信息都被学进去了;
- 被提问方式逼着编:「秦始皇用过手机吗」这类预设错误的问题,容易诱导模型顺着编。
产品视角的反制清单(按投入从低到高):
- 提示层:允许模型说「不知道」、要求标注不确定性和引用来源;
- 架构层:RAG(检索增强生成)——先查真实资料再回答,把「凭记忆」变成「开卷考试」;
- 验证层:交叉校验、规则检查、人工审核兜底高风险输出。
核心判断公式:错误成本 × 发生概率 → 决定投入多少反制手段。写诗出错无伤大雅,法律条款出错就是事故。
上下文窗口:工作台的桌面大小
**上下文窗口(Context Window)**是模型一次能「看到」的 token 上限,可以理解为它的临时工作台:系统提示、对话历史、贴进来的文档,都要摊在这张桌上,超了就看不见。
两个常被误解的真相:
- 窗口大 ≠ 记忆好。塞满长文档后,模型对中段信息的利用率会下降(所谓「迷失在中间」),关键信息要放在开头或结尾。
- 窗口 ≠ 免费。每次请求都重发全部上下文,token 费用随对话轮次累积上涨,长对话的成本曲线是陡峭的。
产品设计上,长上下文适合「一次性吃透材料」的场景(长文档问答、批量代码分析);跨会话的持久需求(记住用户偏好、项目背景),应做专门的记忆系统,而不是硬堆上下文。
判断「这个需求模型能不能做」:一套可操作框架
需求评审时,用四问过筛:
| 问题 | 检验方法 | 红线信号 |
|---|---|---|
| 能力在不在射程内? | 用最强模型 + 精心写的 prompt 做 10~20 个真实样本测试 | 强模型 + 好 prompt 仍频繁出错 |
| 错误能不能被接住? | 评估错误类型:可校验(格式、事实可查)还是不可校验(品味、创意) | 错误不可发现且成本高 |
| 能不能给出「确定的事实」? | 检查是否依赖模型记忆硬事实(价格、库存、政策) | 关键数字来自模型而非数据源 |
| 边界情况密度高不高? | 收集长尾 case,测失败率 | 用户一句话就能问崩 |
一句话总结:模型擅长「模糊的智能」,不擅长「精确的事实」。把事实交给数据源,把判断交给模型,把兜底交给产品设计——这样的需求大概率能做。
本节要点
- Scaling Law 让能力可预期地变强,但「平滑提升」与需求的「阶跃门槛」之间可能存在长期鸿沟。
- 涌现让能力突变式出现:依赖涌现能力的功能只做候选项,不做承诺项;也不要用小模型验证大模型能力。
- 幻觉是预测机制的必然产物而非 bug,反制手段按「错误成本 × 概率」匹配投入,RAG 是事实类场景的标准解。
- 上下文窗口是临时工作台不是记忆系统:长材料适合一次性处理,跨会话需求要做持久记忆设计。
- 可行性四问:能力射程、错误可接住、事实有来源、长尾可控——过不了筛的需求先改设计再谈实现。
章节小测
3 道题 · 检验一下刚学的内容
Q1.用便宜小模型做原型,去验证旗舰模型的涌现中能力,课程的评价是?
Q2.模型准确率从 85% 升到 92%,但场景需要 99% 才可用,这说明什么?
Q3.跨会话记住用户偏好这类需求,课程建议的设计是?
答题后显示结果
完成这一节了?
打卡记录保存在你的浏览器本地,方便追踪学习进度。
学习留言
写下你的疑问或心得 —— 仅你自己和站长可见
登录 后可发布私密留言,向站长提问。