大模型领域的产品名称、参数规模和排行榜变化很快,用一张厂商清单入门,往往在概念尚未厘清时就被更新信息淹没。更稳定的学习方式,是先回答六个不会轻易过时的问题:输入怎样变成数字,参数如何从数据中学习,模型怎样生成输出,外部知识与工具怎样接入,运行成本由什么组成,结果为什么仍需验证。掌握这条主线后,新模型只是不同实现,而不是一套全新语言。
一幅从规则到表示学习的演进图
早期智能系统常由开发者显式编写条件与动作,优点是行为可解释,缺点是规则数量会随场景组合迅速增长。统计学习把部分规则改成从样本估计参数,机器学习进一步强调使用数据优化目标函数。神经网络通过多层可学习变换构造表示,深度学习则在数据与计算资源支持下,把这种方法扩展到视觉、语音和文本。
Transformer 使用注意力机制建模序列中不同位置的关系,成为许多语言模型和多模态模型的重要基础。它不是“理解”的证明,而是一种有效的计算结构。大规模预训练让模型在广泛数据上学习通用模式,之后再通过指令训练、偏好对齐或领域适配改变行为。技术阶段并非后者完全淘汰前者:规则仍适合确定性约束,统计模型仍适合结构清晰的小数据任务。

参数、Token 与上下文分别在说什么
- 参数
- 训练过程中被调整的数值,决定模型内部映射。B 表示十亿量级的参数数量,但更大不自动等于在每项任务上更好。
- Token
- 分词器把文本或其他模态表示切成的处理单位。一个 Token 对应多少汉字并不固定,会随分词器和内容变化。
- 上下文
- 单次推理中模型能够参考的输入、历史消息、工具结果以及已生成内容的集合,长度受服务与模型限制。
模型输出可理解为在已有上下文条件下逐步选择后续 Token。这个机制能生成连贯语言,也解释了为何回答可能流畅却事实错误:概率上顺畅的延续并不等于通过外部世界验证。上下文更长也并非无限记忆;位置、噪声和检索质量都会影响模型是否真正利用其中信息。
提示词是运行时接口,不是魔法咒语
系统指令用于声明角色、边界和输出约束,用户消息表达具体任务,工具结果与检索片段提供外部证据。清楚的提示应说明目标、可用材料、禁止事项和验收格式,必要时给少量代表性示例。提示能够改善行为,却无法补上模型从未获得的数据,也不能代替权限控制、参数校验和结果测试。
训练、微调、检索与工具调用解决不同问题
| 手段 | 主要改变 | 适合解决 | 不应被期待 |
|---|---|---|---|
| 预训练 | 基础参数与通用表示 | 广泛语言或多模态能力 | 自动掌握最新私有资料 |
| 监督微调 | 任务行为与输出风格 | 稳定格式、领域任务适配 | 低成本实时更新事实 |
| LoRA 等参数高效方法 | 少量附加可训练参数 | 资源受限的行为适配 | 保证超过全参数方案 |
| RAG | 推理时加入检索片段 | 动态知识、依据追溯 | 消除所有幻觉 |
| 工具调用 | 让程序执行外部动作 | 查询系统、计算和操作 | 让模型绕过业务授权 |
Embedding 把查询和文档映射到向量空间,用于召回语义接近的候选;Rerank 再对查询与候选进行更细的相关性排序。检索到错误片段时,生成阶段只会在错误地基上继续,因此知识库需要文档切分、元数据过滤、权限校验和离线评测。工具调用则把函数名称、参数模式交给模型,真正执行仍由应用代码负责验证。
Agent 与 Workflow 的差别在控制权
Agent 让模型动态选择步骤和工具,适合开放探索;Workflow 把关键步骤、条件和重试提前定义,适合合规与稳定性要求高的流程。两者可以组合,例如工作流先做鉴权和分类,在受控分支中允许 Agent 搜索。选型依据不是哪种更“智能”,而是错误代价、可解释需求与任务变化程度。
多模态并不是简单把图片贴进对话
文本、图像和语音需要各自的编码方式,再映射到模型可共同处理的表示。视觉模型可能回答画面关系,语音链路还涉及唤醒、端点检测、识别与合成。一个语音助手完成“给联系人拨号”,通常要经过声音采集、语音转文字、意图识别、联系人查询、工具授权、拨号结果确认和语音反馈;任何一个环节出错,都不能归咎或归功于单一大模型。
- 输入质量决定可用信息上限,例如噪声语音会影响识别。
- 模态转换可能丢失细节,应保存原始输入用于审计。
- 执行现实动作前需要确认与权限,不应仅凭生成文本触发。
- 评测要覆盖整条端到端链路,而非只看模型单项分数。
量化与显存估算是一项容量规划
参数通常以不同数值精度存储和计算。降低位宽可以减少模型权重占用并提升部分硬件上的吞吐,但精度损失取决于模型、量化方法、校准数据和任务,不存在适用于所有模型的统一“最低位数”。权重大小可用“参数数目×每参数字节数”做第一步估算,却不是完整显存需求。
推理还要容纳运行时缓冲、激活和 KV Cache;并发数、批量大小、上下文长度、框架实现与并行策略都会改变峰值。训练则额外包含梯度、优化器状态和更大激活。容量测试应在目标硬件上用真实请求逐步提高上下文与并发,记录峰值、吞吐和尾延迟,同时预留安全空间,不能只依赖一个经验系数采购设备。
自建还是按量使用取决于负载曲线
调用量小而波动时,按量接口减少硬件闲置与维护;持续稳定且对数据隔离有严格要求时,自建可能更可控。比较时应把设备折旧、电力、机房、运维、模型升级、服务可用性和数据出境要求都纳入。先用小规模真实流量测算单位任务成本,再决定部署方式,比按爱好购买硬件更可靠。
应用边界要由错误后果决定
内容草拟、信息归类、代码解释和知识检索通常允许人审后使用;医疗、法律、财务、安全控制等高风险领域则需要专业人员、确定性规则和可追溯证据。模型能给出像答案的文本,却不会自动知道资料是否过时、输入是否被污染或工具返回是否可信。隐私数据在发送前应最小化和脱敏,并明确保存期限。
- 先定义任务成功标准与不可接受错误。
- 准备覆盖正常、边界和对抗输入的评测集。
- 把检索依据、工具参数和模型输出纳入日志。
- 设置人工复核、拒答和回滚机制。
- 上线后持续抽样,防止数据或供应商变化造成漂移。
入门阶段最重要的成果,不是记住某个模型有多少参数,而是能把一个需求拆成数据、模型、知识、工具、基础设施和治理六层,并说明每层如何验收。产品会更替,接口会变化,但这套问题清单仍能帮助判断新能力究竟解决了哪一段,以及风险被留在了哪里。
本文《第一次搭建大模型知识框架:别从产品名单开始》由 xkmchenmu 发布于 xkmchenmu Blog。 转载请保留原文链接并注明出处。
支付宝扫一扫