LLMNotes

第 31 章:大师之路

zjc 于 2026-01-31 发布

这是《LLM 应用开发 零基础实战指南》的独立章节版。本章从概念、实操和生产排查三个视角展开,代码块保留了原书可直接运行的版本。 从会用 API 到能设计可靠 LLM 系统,中间是对模型边界、数据质量、业务目标、安全风险和工程演进的持续理解。

31.1 能力模型

阶段 能力
入门 调 API、写 Prompt、解析输出
初级 构建聊天、抽取、分类服务
中级 RAG、工具调用、评测和观测
高级 Agent、权限、护栏、成本治理
专家 平台化、质量体系、组织落地
大师 在不确定能力上设计可靠业务系统

31.2 技术路线

建议顺序:

Prompt 与结构化输出
  -> API 网关与流式
     -> 文档解析和 RAG
        -> 混合检索与重排
           -> 工具调用与 Agent
              -> 安全和权限
                 -> 评测和观测
                    -> 平台化

不要一开始就追求复杂 Agent。先把单点任务做稳定,再组合成流程。

31.3 数据能力

LLM 系统工程师必须懂数据:

  1. 数据源和更新频率;
  2. 文档结构;
  3. 数据质量;
  4. 权限和合规;
  5. 版本治理;
  6. 标注规范;
  7. 坏案例闭环;
  8. 数据分布漂移。

很多“模型问题”最终是数据治理问题。

31.4 评测能力

建立习惯:

  1. 改任何配置前先有基线;
  2. 每次只改一个关键变量;
  3. 记录版本组合;
  4. 指标分层;
  5. 高风险场景单独看;
  6. 线上反馈回流;
  7. 不用单例案例下结论。

31.5 安全意识

默认问自己:

  1. 数据从哪里来;
  2. 用户能看什么;
  3. 工具能改什么;
  4. 失败最坏影响是什么;
  5. 是否有审批;
  6. 是否可回滚;
  7. 是否可审计;
  8. 日志是否泄露隐私。

31.6 架构演进

v1 单场景服务
  -> v2 共用模型网关
     -> v3 RAG 平台
        -> v4 工具和 Agent 平台
           -> v5 评测和安全中心
              -> v6 多租户治理

平台化不要过早。先让至少两个真实场景复用同一批能力,再抽象。

31.7 技术选型

选型原则:

  1. 先明确需求和约束;
  2. 用可替换适配层隔离 SDK;
  3. 存储选型看过滤、规模和一致性;
  4. 模型看能力、成本、延迟和合规;
  5. 安全能力必须可测试;
  6. 生态变化快,避免深度绑定细节;
  7. 做小规模原型和压测。

31.8 学习方法

有效学习:

  1. 做端到端小项目;
  2. 构造自己的评测集;
  3. 做坏案例复盘;
  4. 读官方变更日志;
  5. 复现论文或博客结论;
  6. 写模块笔记;
  7. 参与开源讨论;
  8. 给团队分享。

无效学习:

  1. 只收集工具清单;
  2. 只跑官方示例;
  3. 频繁换框架;
  4. 不做评测;
  5. 忽视安全;
  6. 把演示当生产。

31.9 大师判断

面对新需求时,大师会先问:

  1. 业务成功标准是什么;
  2. 错误成本多高;
  3. 是否必须用模型;
  4. 需要什么数据;
  5. 权限边界是什么;
  6. 如何验证;
  7. 如何降级;
  8. 如何演进;
  9. 成本是否合理;
  10. 团队能否维护。

31.10 个人成长清单

基础:API、Prompt、JSON schema、流式
检索:解析、切块、向量、混合检索、rerank
Agent:工具、状态、预算、恢复
安全:注入、权限、脱敏、审批
质量:数据集、评测、trace、回归
工程:缓存、成本、延迟、灰度

每学一个主题,都完成一个可运行示例和一个失败案例分析。

本章小结

大师之路不是追新模型,而是能把不确定能力转化为可靠产品:控制数据和质量,控制权限和风险,控制成本和延迟,并通过评测持续演进。模型会继续变化,这些工程原则会长期有效。

思考题

  1. 你当前项目最容易出问题的是哪一层?
  2. 如何建立自己的坏案例库?
  3. 平台化应该从哪个复用能力开始?
  4. 新模型出现时如何评估是否替换?
  5. 一年后你希望掌握哪些可验证能力?