🧭AI 产品修炼场
认知约 12 分钟第 17 / 30 章

模型分类学:读懂 AI 模型的三个维度

市面上的模型名称眼花缭乱,本课程用三个维度建立分类框架:按模态看输入输出形态,按开放性看部署与合规,按用途看任务匹配,把模型选型从跟着感觉走变成有方法可依。

📖 本页目录

    为什么需要模型分类学

    「GPT 能做吗?」「我们该用哪个模型?」——如果讨论停留在型号名上,选型就会被厂商营销牵着走。更稳的做法是先建立坐标系:任何一个模型,都可以从模态、开放性、用途三个维度定位。先明确你的需求落在坐标系的哪个格子里,再看哪个型号填得最好。

    维度一:按模态分类

    模态指模型处理的信息形态,它直接决定产品的输入和输出形态。

    模态 输入 → 输出 典型产品场景
    文本 文字 → 文字 对话助手、文案生成、摘要
    图像理解 图片 → 描述/结构化数据 发票识别、截图分类、质检
    图像生成 文字 → 图片 素材生成、设计草图
    语音 语音 → 文字或语音 会议转写、语音客服
    视频 视频/文字 → 分析或视频 内容审核、视频脚本
    多模态 混合输入输出 截图问答、看图对话

    产品视角:先确认你的场景是「理解」还是「生成」。理解类能力(OCR、图像分类、截图解读)成熟度高,可以直接生产化;生成类能力(图像、视频)效果惊艳,但可控性与成本仍需逐案评估。

    另一个 2026 年的背景:主流旗舰(如 Gemini 3.8、DeepSeek-V4.1 Flash、Qwen3.8-Flash)已普遍原生支持多模态输入,不必再为「能不能看图」单独选型号。但「原生支持」不等于「每项视觉任务都强」,具体任务仍要实测。

    维度二:按开放性分类

    类型 含义 使用方式
    API 闭源 权重不公开,只能调用厂商接口 注册即用,按 token 计费
    开放权重 权重可下载(如 Llama、Qwen3.8、DeepSeek-V4、GLM-5) 自部署或托管,可微调

    注意「开源」与「开放权重」并不完全等同:多数开放模型的许可协议允许商用,但不同协议在商用条件、部署要求上有差异,企业采用前应过一遍协议条款。

    产品含义:开放性直接决定数据是否出域、能否深度定制、成本是按量付费还是固定投入。合规敏感场景(金融、医疗、政企)往往一开始就锁定开放权重自部署路线。

    维度三:按用途分类

    同为文本模型,用途分化已经非常细:

    用途 干什么 选型关注点
    通用对话 问答、写作、改写 综合能力、中文表现
    推理模型 数学、逻辑、多步规划 先思考后回答,延迟与成本更高
    代码模型 写代码、修缺陷 代码准确率、工具调用稳定性
    嵌入(embedding) 把文本变成向量,用于搜索 语言覆盖、检索效果
    重排序(reranker) 对检索结果精排 与向量检索搭配使用
    语音/图像生成 生成媒体内容 风格可控性、版权归属

    顺带一提,专用模型仍在细化:编程场景有 Kimi K2.7-Code、DeepSeek-V4 Flash 这类为编码与 Agent 优化的型号,Agent 能力本身也成为 2026 年各家旗舰的主打方向,选型时值得单独列为评测维度。

    产品决策提示:一个 RAG 产品至少涉及三类模型——生成模型、嵌入模型、(可选的)重排序模型。把它们当成三次独立选型,而不是「选一个模型解决全部」。还要注意联动成本:嵌入模型一旦更换,向量库需要全量重建,这类依赖要提前写进技术方案。

    三步选型流程

    1. 定格子:写下场景的模态(文本理解还是图像理解?)、开放性约束(数据能出域吗?)、用途(对话生成还是检索?);
    2. 列候选:在该格子里列 2-3 个候选,国际与国产各占一席,避免单一厂商锁定;
    3. 跑评测:用自己的真实数据做小规模评测,榜单排名只当初筛依据。

    📊 信息时效:模型版本迭代极快,本节数据以 2026 年 9 月为基准。选型时请以各厂商官网与最新基准测试为准,关注「能力匹配 > 版本新旧」。

    本节要点

    • 模态、开放性、用途三个维度构成模型选型坐标系:先定位需求,再挑型号,避免被营销话术带偏。
    • 理解类多模态(OCR、截图分类)已可生产化,生成类(图像、视频)要重点评估可控性与成本。
    • 开放性决定数据合规、定制深度与成本结构;「开源」与「开放权重」不完全等同,商用前看协议。
    • 用途分化意味着一个产品常需多种模型:生成、嵌入、重排序是三次独立选型,注意向量库重建等联动成本。
    • 榜单只做初筛,最终用自己的评测集说话。
    📝

    章节小测

    3 道题 · 检验一下刚学的内容

    Q1.课程建议用哪三个维度给模型建立选型坐标系?

    Q2.关于多模态能力的产品化判断,课程的核心观点是什么?

    Q3.选择「开放权重」路线对产品最直接的含义是什么?

    答题后显示结果

    完成这一节了?

    打卡记录保存在你的浏览器本地,方便追踪学习进度。

    💬

    学习留言

    写下你的疑问或心得 —— 仅你自己和站长可见

    🔒 私密