这是《Linux 零基础实战指南》的独立章节版。本章从概念、实操和生产排查三个视角展开,代码块保留了原书可直接运行的版本。 掌握 Linux 的标志不是记住所有命令,而是能在复杂系统中定位问题、设计边界、自动化治理,并通过证据和指标持续改进。本章给出成长阶段、能力矩阵、学习计划和实践项目。
31.1 五个阶段
Level 1 使用者
会命令行、文件、权限、进程
|
v
Level 2 管理者
会 systemd、磁盘、网络、日志、安全
|
v
Level 3 排障者
能定位 CPU、内存、IO、网络和应用问题
|
v
Level 4 架构治理者
能设计部署、容量、监控、安全和自动化
|
v
Level 5 专家
能读内核文档和源码,优化系统与大规模平台
31.2 能力矩阵
| 能力 | 初级 | 中级 | 高级 |
|---|---|---|---|
| 命令行 | 常用命令 | 管道和脚本 | 工具链和自动化 |
| 文件系统 | 查看文件 | 权限与挂载 | IO 与一致性治理 |
| 进程 | ps/top | 信号与 systemd | 生命周期和资源隔离 |
| 性能 | 看 CPU | 定位瓶颈 | 建立容量模型 |
| 网络 | ping/curl | 分层排障 | 内核栈与架构优化 |
| 安全 | 基础权限 | SSH 与防火墙 | 零信任和审计体系 |
| 治理 | 手工操作 | Ansible | 平台化和自服务 |
31.3 每日实践
建议每天做一个实验:
周一:进程与 systemd
周二:内存和 IO
周三:网络排障
周四:Shell 与 Ansible
周五:安全和审计
周六:压测和性能分析
周日:复盘和文档
记录格式:
问题:
环境:
命令:
输出:
结论:
风险:
改进:
31.4 必做实验清单
实验一:优雅停机
写一个捕获 SIGTERM 的服务
-> systemd 停止
-> 观察 journal
-> 调整 TimeoutStopSec
实验二:磁盘水位
生成大文件
-> 观察 df / du / iostat
-> 删除并被进程持有
-> lsof +L1 分析
实验三:网络丢包
用 tc 制造丢包
-> 观察 retrans 和 ss
-> 抓包确认
-> 恢复环境
实验四:cgroup 限流
创建 systemd 服务
-> 设置 CPUQuota
-> 压测
-> 观察 cpu.stat throttled
实验五:自动化初始化
编写 Ansible role
-> 用户、目录、服务、日志、监控
-> dry-run
-> 测试环境验证
31.5 项目训练
项目一:主机巡检平台
功能:
- 批量采集主机指标;
- 检查 systemd failed;
- 磁盘和 inode 水位;
- 安全基线;
- 生成报告;
- 告警。
产出:Web 看板和定时报告。
项目二:发布系统
功能:
- 制品校验;
- 批次发布;
- 健康检查;
- 自动回滚;
- 审计日志;
- 配置版本。
验收:模拟失败发布时自动恢复。
项目三:故障演练平台
功能:
- CPU 压力;
- 内存压力;
- 磁盘满;
- 网络丢包;
- 进程退出;
- 服务限流。
产出:可重复的演练手册和监控验证报告。
31.6 阅读路径
推荐顺序:
man bash
man procfs
man signal
man systemd.unit
man sysctl
Linux Kernel Documentation
Brendan Gregg 性能分析资料
Linux insides
内核源码
读法:
- 带实验读;
- 记录版本差异;
- 从工具输出反推机制;
- 从机制回到生产场景;
- 不把单个内核参数当万能结论。
31.7 90 天计划
第 1 到 15 天:
命令行、文件、权限、进程、基础网络
第 16 到 30 天:
systemd、日志、磁盘、软件包、Shell 脚本
第 31 到 50 天:
CPU、内存、IO、网络栈、性能工具
第 51 到 70 天:
安全、SSH、防火墙、备份、监控
第 71 到 90 天:
Ansible、高负载部署、故障演练、复盘报告
每周产出一份实验报告,每月完成一次故障演练。
31.8 长期习惯
- 所有变更先想回滚;
- 所有结论要给证据;
- 所有高危命令先确认目标;
- 所有重复操作自动化;
- 所有阈值结合业务;
- 所有故障沉淀监控;
- 所有密钥可轮换;
- 所有备份做恢复演练;
- 所有配置进入仓库;
- 所有系统持续更新。
31.9 职业方向
后端工程师:
进程模型、IO、网络、容器限制、服务部署、性能 profile
SRE:
监控、容量、自动化、故障演练、应急响应、可靠性治理
平台工程师:
镜像、部署、配置管理、内部工具、自服务体系
安全工程师:
账号权限、审计、入侵检测、漏洞治理、零信任
内核或性能工程师:
调度、内存、IO、eBPF、内核源码、专项优化
本章小结
从 0 到大师的 Linux 路径,是从操作者到排障者,再到系统治理者和性能专家。持续进步来自实验、压测、故障复盘、自动化和文档阅读。最终目标是在任何生产事故中,都能分层定位、快速恢复、讲清证据并沉淀改进。
思考题
- 评估你当前所处的阶段和三个短板。
- 设计个人 90 天 Linux 实验计划。
- 为团队制定主机安全基线。
- 设计一次磁盘满导致服务故障的演练。
- 写一份你所在系统的高可用部署方案。