🧭AI 产品修炼场
认知约 13 分钟第 02 / 30 章

能力与边界:Scaling Law、涌现与幻觉

模型不是越大越聪明那么简单。本课程讲清规模法则与能力涌现的规律、幻觉的生成机制、上下文窗口的硬约束,并给出一套产品经理判断「这个需求模型能不能做」的可操作框架,避免需求评审时踩坑。

📖 本页目录

    Scaling Law:规模是第一性规律

    **Scaling Law(规模法则)**是大模型领域的第一性规律:模型能力随参数量、数据量、算力的增加而可预测地提升。这条定律造就了「大力出奇迹」的时代——各家厂商拼命堆参数、堆数据、堆 GPU。

    对产品经理,Scaling Law 有两层含义:

    1. 能力有惯性预期:下一代模型大概率比这一代强,规划产品路线图时应把「模型升级红利」计入,设计时不要为当前模型的短板做过度补偿。
    2. 提升是平滑的,但需求是阶跃的:准确率从 85% 到 92% 是平滑进步,而你的场景可能需要 99% 才可用——差距不是迭代一两年能填平的。

    涌现:能力不是渐变的,是突变的

    Scaling Law 之外有个更微妙的现象——涌现(Emergence):某些能力在小模型上几乎为零,规模跨过某个阈值后突然出现。链式推理、多步数学、指令跟随,都呈现过这种「无中生有」的跳变。

    涌现的产品含义是双刃剑:

    • 好消息:今天做不到的事,明天可能因为一次模型升级突然做到(多模态、长上下文都是这么来的),技术雷达要持续扫描。
    • 坏消息:你无法用当前模型的能力外推下一代,也无法在小模型上验证「大模型能不能做」。用便宜模型做原型验证高端能力,结论不可靠。

    产品决策提示:规划依赖「涌现中能力」的功能时,策略是「候选项」而非「承诺项」——放进技术预研清单,模型一升级就快速验证,而不是写进对客户的核心承诺。

    幻觉:为什么模型会一本正经地胡说

    **幻觉(Hallucination)**指模型生成看似可信、实则错误的内容。它不是 bug,是「预测下一词」机制的必然副产品:

    1. 训练目标是流畅,不是真实:模型学的是「什么样的续写像人话」,一个通顺的编造比生硬的事实更符合它的目标函数;
    2. 知识有盲区但不会说不知道:预测机制驱使它总给出「最像答案的答案」,缺乏「我不知道」的自发意识;
    3. 训练数据本身有错:互联网上的谣言与过时信息都被学进去了;
    4. 被提问方式逼着编:「秦始皇用过手机吗」这类预设错误的问题,容易诱导模型顺着编。

    产品视角的反制清单(按投入从低到高):

    • 提示层:允许模型说「不知道」、要求标注不确定性和引用来源;
    • 架构层:RAG(检索增强生成)——先查真实资料再回答,把「凭记忆」变成「开卷考试」;
    • 验证层:交叉校验、规则检查、人工审核兜底高风险输出。

    核心判断公式:错误成本 × 发生概率 → 决定投入多少反制手段。写诗出错无伤大雅,法律条款出错就是事故。

    上下文窗口:工作台的桌面大小

    **上下文窗口(Context Window)**是模型一次能「看到」的 token 上限,可以理解为它的临时工作台:系统提示、对话历史、贴进来的文档,都要摊在这张桌上,超了就看不见。

    两个常被误解的真相:

    • 窗口大 ≠ 记忆好。塞满长文档后,模型对中段信息的利用率会下降(所谓「迷失在中间」),关键信息要放在开头或结尾。
    • 窗口 ≠ 免费。每次请求都重发全部上下文,token 费用随对话轮次累积上涨,长对话的成本曲线是陡峭的。

    产品设计上,长上下文适合「一次性吃透材料」的场景(长文档问答、批量代码分析);跨会话的持久需求(记住用户偏好、项目背景),应做专门的记忆系统,而不是硬堆上下文。

    判断「这个需求模型能不能做」:一套可操作框架

    需求评审时,用四问过筛:

    问题 检验方法 红线信号
    能力在不在射程内? 用最强模型 + 精心写的 prompt 做 10~20 个真实样本测试 强模型 + 好 prompt 仍频繁出错
    错误能不能被接住? 评估错误类型:可校验(格式、事实可查)还是不可校验(品味、创意) 错误不可发现且成本高
    能不能给出「确定的事实」? 检查是否依赖模型记忆硬事实(价格、库存、政策) 关键数字来自模型而非数据源
    边界情况密度高不高? 收集长尾 case,测失败率 用户一句话就能问崩

    一句话总结:模型擅长「模糊的智能」,不擅长「精确的事实」。把事实交给数据源,把判断交给模型,把兜底交给产品设计——这样的需求大概率能做。

    本节要点

    • Scaling Law 让能力可预期地变强,但「平滑提升」与需求的「阶跃门槛」之间可能存在长期鸿沟。
    • 涌现让能力突变式出现:依赖涌现能力的功能只做候选项,不做承诺项;也不要用小模型验证大模型能力。
    • 幻觉是预测机制的必然产物而非 bug,反制手段按「错误成本 × 概率」匹配投入,RAG 是事实类场景的标准解。
    • 上下文窗口是临时工作台不是记忆系统:长材料适合一次性处理,跨会话需求要做持久记忆设计。
    • 可行性四问:能力射程、错误可接住、事实有来源、长尾可控——过不了筛的需求先改设计再谈实现。
    📝

    章节小测

    3 道题 · 检验一下刚学的内容

    Q1.用便宜小模型做原型,去验证旗舰模型的涌现中能力,课程的评价是?

    Q2.模型准确率从 85% 升到 92%,但场景需要 99% 才可用,这说明什么?

    Q3.跨会话记住用户偏好这类需求,课程建议的设计是?

    答题后显示结果

    完成这一节了?

    打卡记录保存在你的浏览器本地,方便追踪学习进度。

    💬

    学习留言

    写下你的疑问或心得 —— 仅你自己和站长可见

    🔒 私密