Linux 运维高阶命令实战:五大场景故障排查指南 - 夜莺博客

Linux 运维高阶命令实战:五大场景故障排查指南

作为运维工程师,只会基础命令只能完成简单的文件操作,真正定位性能瓶颈、分析日志异常、排查网络磁盘故障,靠的是高阶命令的组合运用。本文结合生产实战经验,把运维高频命令按系统监控、日志分析、进程管理、磁盘运维、网络调试五大场景分类,逐条拆解核心用途、常用参数与落地用法,帮助你在服务器负载飙高、日志报错刷屏、磁盘空间爆满、网络链路中断时快速定位问题。

一、系统性能监控与瓶颈定位

top -d 2
top -p 1234
htop
iostat -d -x 1

top 是排查负载过高的第一选择,配合 -p 指定进程、-u 过滤用户;生产环境推荐 htop,支持鼠标操作、树形展示进程父子关系。iostat 用于磁盘 IO 专项分析,%util 持续超过 80% 基本可判定 IO 瓶颈,await 过高代表磁盘处理缓慢。

二、日志排查与文本智能处理

tail -f app.log
tail -F app.log
grep -C 5 "ERROR" app.log
grep -r "Exception" /var/log/
awk '{print $1}' nginx.access.log
awk '$10>100' nginx.access.log

tail、grep、awk 构成日志分析铁三角:tail -F 适配日志切割场景,grep 的 -C 显示上下文、-r 递归检索,awk 可实现 IP 提取、请求过滤和访问量统计(awk '{count[$1]++} END{for(ip in count) print ip, count[ip]}')。

三、进程管理与异常恢复

ps -ef | grep java
ps aux
pstree -p

ps 静态快照搭配管道筛选指定服务进程;pstree 以树形展示父子关系,专门排查守护进程异常、子进程僵死、进程启动失败等问题。

四、磁盘存储排查与文件管理

df -h
df -i
du -sh /var/log/
find / -size +100M -type f
find /var/log/ -mtime +7 -type f -exec rm -rf {} \;

df -i 解决"磁盘有空间但无法创建文件"的 inode 耗尽问题;du 找出真正占空间的大目录;find 按大小、时间、权限多条件检索,批量清理过期日志。

五、网络连通性与路由故障调试

ping -c 4 -i 2 192.168.1.1
traceroute www.example.com
mtr www.example.com

ping 验证基础连通性,traceroute 追踪路由节点定位网关位置,mtr 是 ping 与 traceroute 的整合升级版,可实时统计每个节点的丢包率与平均延迟,是生产环境首选。

实战技巧总结

优先选用增强工具(htop 替代 top、mtr 替代 traceroute);善用管道组合命令实现筛选、排序、统计一站式操作;摒弃死记参数思维,掌握核心场景用法;线上高危操作(find 批量删除、kill 终止进程)务必先查询确认,避免误操作引发生产事故。

更多 Linux 排障内容:适合初学者的 17 个最佳 Linux 网络故障排查命令tcpdump 抓包实战指南

原文链接:https://openeuler.csdn.net/6a101432662f9a54cb765a5a.html