这是《LLM 应用开发 零基础实战指南》的独立章节版。本章从概念、实操和生产排查三个视角展开,代码块保留了原书可直接运行的版本。 从会用 API 到能设计可靠 LLM 系统,中间是对模型边界、数据质量、业务目标、安全风险和工程演进的持续理解。
31.1 能力模型
| 阶段 | 能力 |
|---|---|
| 入门 | 调 API、写 Prompt、解析输出 |
| 初级 | 构建聊天、抽取、分类服务 |
| 中级 | RAG、工具调用、评测和观测 |
| 高级 | Agent、权限、护栏、成本治理 |
| 专家 | 平台化、质量体系、组织落地 |
| 大师 | 在不确定能力上设计可靠业务系统 |
31.2 技术路线
建议顺序:
Prompt 与结构化输出
-> API 网关与流式
-> 文档解析和 RAG
-> 混合检索与重排
-> 工具调用与 Agent
-> 安全和权限
-> 评测和观测
-> 平台化
不要一开始就追求复杂 Agent。先把单点任务做稳定,再组合成流程。
31.3 数据能力
LLM 系统工程师必须懂数据:
- 数据源和更新频率;
- 文档结构;
- 数据质量;
- 权限和合规;
- 版本治理;
- 标注规范;
- 坏案例闭环;
- 数据分布漂移。
很多“模型问题”最终是数据治理问题。
31.4 评测能力
建立习惯:
- 改任何配置前先有基线;
- 每次只改一个关键变量;
- 记录版本组合;
- 指标分层;
- 高风险场景单独看;
- 线上反馈回流;
- 不用单例案例下结论。
31.5 安全意识
默认问自己:
- 数据从哪里来;
- 用户能看什么;
- 工具能改什么;
- 失败最坏影响是什么;
- 是否有审批;
- 是否可回滚;
- 是否可审计;
- 日志是否泄露隐私。
31.6 架构演进
v1 单场景服务
-> v2 共用模型网关
-> v3 RAG 平台
-> v4 工具和 Agent 平台
-> v5 评测和安全中心
-> v6 多租户治理
平台化不要过早。先让至少两个真实场景复用同一批能力,再抽象。
31.7 技术选型
选型原则:
- 先明确需求和约束;
- 用可替换适配层隔离 SDK;
- 存储选型看过滤、规模和一致性;
- 模型看能力、成本、延迟和合规;
- 安全能力必须可测试;
- 生态变化快,避免深度绑定细节;
- 做小规模原型和压测。
31.8 学习方法
有效学习:
- 做端到端小项目;
- 构造自己的评测集;
- 做坏案例复盘;
- 读官方变更日志;
- 复现论文或博客结论;
- 写模块笔记;
- 参与开源讨论;
- 给团队分享。
无效学习:
- 只收集工具清单;
- 只跑官方示例;
- 频繁换框架;
- 不做评测;
- 忽视安全;
- 把演示当生产。
31.9 大师判断
面对新需求时,大师会先问:
- 业务成功标准是什么;
- 错误成本多高;
- 是否必须用模型;
- 需要什么数据;
- 权限边界是什么;
- 如何验证;
- 如何降级;
- 如何演进;
- 成本是否合理;
- 团队能否维护。
31.10 个人成长清单
基础:API、Prompt、JSON schema、流式
检索:解析、切块、向量、混合检索、rerank
Agent:工具、状态、预算、恢复
安全:注入、权限、脱敏、审批
质量:数据集、评测、trace、回归
工程:缓存、成本、延迟、灰度
每学一个主题,都完成一个可运行示例和一个失败案例分析。
本章小结
大师之路不是追新模型,而是能把不确定能力转化为可靠产品:控制数据和质量,控制权限和风险,控制成本和延迟,并通过评测持续演进。模型会继续变化,这些工程原则会长期有效。
思考题
- 你当前项目最容易出问题的是哪一层?
- 如何建立自己的坏案例库?
- 平台化应该从哪个复用能力开始?
- 新模型出现时如何评估是否替换?
- 一年后你希望掌握哪些可验证能力?