Linux 服务器运维实战:从选型到故障排查全攻略 - 夜莺博客

Linux 服务器运维实战:从选型到故障排查全攻略

Linux 服务器承载着企业核心业务,稳定性和性能直接决定应用质量,而"从选型到故障排查"的完整能力正是运维工程师的核心竞争力。发行版选错了后期维护成本翻倍,参数调优没有数据支撑就是瞎调,故障排查没有流程就是救火。本文系统梳理 Linux 服务器运维全流程:发行版选择、性能优化、安全加固、监控告警与故障排查,帮助运维人员真正掌控自己的服务器。

发行版选择

生产环境稳定性第一:RHEL 及免费衍生版 Rocky Linux、AlmaLinux 适合长期支持和大规模部署;Ubuntu Server LTS 社区资源丰富、软件更新频繁,适合开发测试和云原生场景(Docker/K8s);Debian 资源占用极低、稳定版几乎没有 bug,适合轻量场景。没有最好的发行版,只有最匹配业务需求的发行版。

性能优化要点

# 观察 CPU:wa 高说明磁盘是瓶颈,sy 高检查系统调用
top / htop
# 减少内存交换,让活跃进程驻留物理内存
vm.swappiness = 10~20   # /etc/sysctl.conf
# 磁盘 IO:频繁读写的目录挂独立 SSD 分区,加 noatime
# 网络高并发
net.core.somaxconn
net.ipv4.tcp_tw_reuse

每一次参数调优都应在测试环境验证后再上线,用 iostatperf 定位瓶颈,而不是凭感觉改参数。

安全加固基线

  • 修改 SSH 默认配置:PermitRootLogin no、更改监听端口、PasswordAuthentication no 仅密钥认证。
  • 安装 fail2ban 自动拦截多次失败 IP。
  • 用 iptables/firewalld 只开放必要端口(80、443、22 等)。
  • 敏感目录启用 SELinux 或 AppArmor,进程被攻破也无法越权读取 /etc/shadow。

监控与告警

htop 交互查看进程资源、nmon 记录历史性能、iftop 实时查看带宽。建议每天用 cron 检查磁盘剩余空间、内存剩余量和服务存活状态,异常立即告警。监控不是事后补救,而是提前预防。

故障排查标准路径

uptime              # 负载,超过核心数2倍说明过载
dmesg -T | tail -20 # 内核报错:OOM killer、磁盘坏道
journalctl -xe      # 应用报错(如 Nginx 502 常见 php-fpm 挂掉)
strace -p [PID]     # 跟踪进程卡在哪个 IO/网络操作
lsof -i :80         # 端口占用
du -sh /* | sort -rh  # 磁盘满定位
ps aux --sort=-%mem   # 内存泄漏排查

结合 Linux 性能排障指南Linux 运维 33 个排障技巧Chrony 时间同步排障 可以搭建完整的 Linux 运维知识体系。

原文链接:https://www.linuxcool.com/linux%E7%B3%BB%E7%BB%9F%E6%9C%8D%E5%8A%A1%E5%99%A8%E8%BF%90%E7%BB%B4%E5%AE%9E%E6%88%98-%E4%BB%8E%E9%80%89%E5%9E%8B%E5%88%B0%E6%95%85%E9%9A%9C%E6%8E%92%E6%9F%A5%E5%85%A8%E6%94%BB%E7%95%A5