LinuxNotes

第 31 章:大师之路

zjc 于 2026-01-31 发布

这是《Linux 零基础实战指南》的独立章节版。本章从概念、实操和生产排查三个视角展开,代码块保留了原书可直接运行的版本。 掌握 Linux 的标志不是记住所有命令,而是能在复杂系统中定位问题、设计边界、自动化治理,并通过证据和指标持续改进。本章给出成长阶段、能力矩阵、学习计划和实践项目。

31.1 五个阶段

Level 1 使用者
  会命令行、文件、权限、进程
      |
      v
Level 2 管理者
  会 systemd、磁盘、网络、日志、安全
      |
      v
Level 3 排障者
  能定位 CPU、内存、IO、网络和应用问题
      |
      v
Level 4 架构治理者
  能设计部署、容量、监控、安全和自动化
      |
      v
Level 5 专家
  能读内核文档和源码,优化系统与大规模平台

31.2 能力矩阵

能力 初级 中级 高级
命令行 常用命令 管道和脚本 工具链和自动化
文件系统 查看文件 权限与挂载 IO 与一致性治理
进程 ps/top 信号与 systemd 生命周期和资源隔离
性能 看 CPU 定位瓶颈 建立容量模型
网络 ping/curl 分层排障 内核栈与架构优化
安全 基础权限 SSH 与防火墙 零信任和审计体系
治理 手工操作 Ansible 平台化和自服务

31.3 每日实践

建议每天做一个实验:

周一:进程与 systemd
周二:内存和 IO
周三:网络排障
周四:Shell 与 Ansible
周五:安全和审计
周六:压测和性能分析
周日:复盘和文档

记录格式:

问题:
环境:
命令:
输出:
结论:
风险:
改进:

31.4 必做实验清单

实验一:优雅停机

写一个捕获 SIGTERM 的服务
  -> systemd 停止
     -> 观察 journal
        -> 调整 TimeoutStopSec

实验二:磁盘水位

生成大文件
  -> 观察 df / du / iostat
     -> 删除并被进程持有
        -> lsof +L1 分析

实验三:网络丢包

用 tc 制造丢包
  -> 观察 retrans 和 ss
     -> 抓包确认
        -> 恢复环境

实验四:cgroup 限流

创建 systemd 服务
  -> 设置 CPUQuota
     -> 压测
        -> 观察 cpu.stat throttled

实验五:自动化初始化

编写 Ansible role
  -> 用户、目录、服务、日志、监控
     -> dry-run
        -> 测试环境验证

31.5 项目训练

项目一:主机巡检平台

功能:

  1. 批量采集主机指标;
  2. 检查 systemd failed;
  3. 磁盘和 inode 水位;
  4. 安全基线;
  5. 生成报告;
  6. 告警。

产出:Web 看板和定时报告。

项目二:发布系统

功能:

  1. 制品校验;
  2. 批次发布;
  3. 健康检查;
  4. 自动回滚;
  5. 审计日志;
  6. 配置版本。

验收:模拟失败发布时自动恢复。

项目三:故障演练平台

功能:

  1. CPU 压力;
  2. 内存压力;
  3. 磁盘满;
  4. 网络丢包;
  5. 进程退出;
  6. 服务限流。

产出:可重复的演练手册和监控验证报告。

31.6 阅读路径

推荐顺序:

man bash
man procfs
man signal
man systemd.unit
man sysctl
Linux Kernel Documentation
Brendan Gregg 性能分析资料
Linux insides
内核源码

读法:

  1. 带实验读;
  2. 记录版本差异;
  3. 从工具输出反推机制;
  4. 从机制回到生产场景;
  5. 不把单个内核参数当万能结论。

31.7 90 天计划

第 1 到 15 天:

命令行、文件、权限、进程、基础网络

第 16 到 30 天:

systemd、日志、磁盘、软件包、Shell 脚本

第 31 到 50 天:

CPU、内存、IO、网络栈、性能工具

第 51 到 70 天:

安全、SSH、防火墙、备份、监控

第 71 到 90 天:

Ansible、高负载部署、故障演练、复盘报告

每周产出一份实验报告,每月完成一次故障演练。

31.8 长期习惯

  1. 所有变更先想回滚;
  2. 所有结论要给证据;
  3. 所有高危命令先确认目标;
  4. 所有重复操作自动化;
  5. 所有阈值结合业务;
  6. 所有故障沉淀监控;
  7. 所有密钥可轮换;
  8. 所有备份做恢复演练;
  9. 所有配置进入仓库;
  10. 所有系统持续更新。

31.9 职业方向

后端工程师:

进程模型、IO、网络、容器限制、服务部署、性能 profile

SRE:

监控、容量、自动化、故障演练、应急响应、可靠性治理

平台工程师:

镜像、部署、配置管理、内部工具、自服务体系

安全工程师:

账号权限、审计、入侵检测、漏洞治理、零信任

内核或性能工程师:

调度、内存、IO、eBPF、内核源码、专项优化

本章小结

从 0 到大师的 Linux 路径,是从操作者到排障者,再到系统治理者和性能专家。持续进步来自实验、压测、故障复盘、自动化和文档阅读。最终目标是在任何生产事故中,都能分层定位、快速恢复、讲清证据并沉淀改进。

思考题

  1. 评估你当前所处的阶段和三个短板。
  2. 设计个人 90 天 Linux 实验计划。
  3. 为团队制定主机安全基线。
  4. 设计一次磁盘满导致服务故障的演练。
  5. 写一份你所在系统的高可用部署方案。