1.
概述与适用范围
目的:说明本文针对使用台湾机房且经 CN2 线路访问的服务器常见故障的排查与处理流程。适用对象:有 Linux/Windows 基础、能执行远程命令的初学运维人员。结构:按步骤给出命令示例与预期结果,便于实操。
2.
基础硬件与系统启动检查
操作步骤:1) 物理检查(电源、网线、交换机指示灯)。2) 登录主机(SSH/远程桌面),在 Linux 上运行 ip addr / ifconfig、ethtool eth0 查看链路;Windows 用 ipconfig /all。3) 查看启动日志:Linux 用 dmesg | tail -n 50 与 journalctl -xe,Windows 查看事件查看器。4) 若网卡未启用,执行 sudo ip link set dev eth0 up(或 Windows 网络适配器启用)。
3.
基本连通性诊断(ping/traceroute/mtr)
步骤:1) ping 默认网关:ping -c 6 <网关IP>,若丢包或超时先检查交换机。2) 向外部 IP(如 8.8.8.8)ping:ping -c 10 8.8.8.8,注意延迟与丢包率。3) 路由追踪:Linux 用 traceroute -n <目标> 或 mtr -rwzbc100 <目标>(mtr 能给出每跳丢包率)。Windows 用 tracert。4) 记录结果:若在 CN2 边缘出现大量丢包,说明可能是运营商线路或上游问题。
4.
端口与服务可达性检查
步骤:1) 检查本地服务:sudo systemctl status <服务>;确认服务监听:ss -tulnp | grep <端口>。2) 远端端口连通性:telnet
<端口> 或 nc -vz <端口>。3) Windows 检查:netstat -ano 与 tasklist /svc 对应 PID。4) 若本地服务正常但外部不可达,检查防火墙(iptables -L -n ; nft list ruleset ; ufw status),适当允许端口并保存规则。
5.
MTU、MSS、分片问题诊断与调整
步骤:1) 测试路径 MTU:ping -M do -s -c 1 <目标>(Linux),逐步减小 payload,找到最大不分片大小。2) 若发现分片导致大包丢失,调整网卡 MTU:sudo ip link set dev eth0 mtu 1460(依据测试结果),并在路由器/负载均衡上设置 MSS clamping。3) 重测:再次使用 mtr/iperf3(安装:sudo apt install iperf3)确认吞吐与丢包改善。
6.
网络故障的高级诊断(BGP/路由)
步骤:1) 初步确认是否为路由问题:traceroute 展示到某处跳点延迟飙升或丢包。2) 使用运营商 Looking Glass(搜索“CN2 looking glass”)查询到达目标的 AS 路径与策略。3) 若确认为 CN2 路由问题,记录 traceroute 与 mtr 的输出、时间戳,并联系 ISP 工单上报,附上日志与测试命令输出。
7.
性能与资源检查(CPU/内存/磁盘/IO)
步骤:1) top 或 htop 查看 CPU/内存占用;iostat -x 1 3 查看磁盘 IO。2) 检查磁盘空间:df -h 与 du -sh /var/log/*;清理日志或扩容。3) 检查网络队列/丢包:ethtool -S eth0(查看网卡错误计数)。4) 对应处理:杀死异常进程、重启服务、扩容磁盘或调整 IO 优先级。
8.
日志收集与制作问题工单
步骤:1) 收集关键日志:/var/log/syslog、/var/log/messages、/var/log/nginx/*、dmesg 输出与 mtr/traceroute/ping 输出。2) 将日志压缩:sudo tar czf diagnostic_$(date +%F_%T).tgz /var/log/... && scp 到本地。3) 工单内容要点:故障现象、开始时间、影响范围、关键测试输出(ping/traceroute/mtr)、系统信息(uname -a,ip route),并附上压缩包与截图。
9.
日常运维流程与自动化建议
步骤:1) 建立监控(Prometheus+Grafana 或 Zabbix),监控 ping、丢包率、带宽、磁盘、CPU。2) 建立定期巡检脚本:每日的 ping/traceroute 到关键节点并将结果入库/告警。3) 建立应急 SOP:若丢包>5% 自动重启网络服务并通知值班;若无法恢复,自动打开并上传诊断包到指定位置,通知上游 ISP。
10.
问题与回答 1
问:如何快速定位是服务器自身问题还是 CN2 线路问题? 答:先从本机开始(检查本地网卡、服务、防火墙),然后 ping 网关与外网、使用 traceroute/mtr。如本机到网关无丢包但到外网某跳开始丢包,则多为线路/上游问题;若本机到网关就有丢包或网卡错误计数上升,优先排查本地硬件或配置。
11.
问题与回答 2
问:CN2 线路常见的特殊故障有哪些,如何规避? 答:常见有路由策略变动导致经路不稳定、跨境链路拥塞和 MTU 导致分片丢包。规避:保持与 ISP 的沟通通道、使用多线路/冗余出口、使用 MTU/MSS 测试并设置合适值,同时部署监控及时发现延迟/丢包。
12.
问题与回答 3
问:如果 ISP 不配合处理 CN2 问题,我该怎么办? 答:收集完整证据(mtr/traceroute、时间线、业务影响截图),升级工单并要求工程师在路由器上看实时流量;同时可临时绕路(切换到其他出口或使用公网加速/VPN),并在服务上做降级策略保证用户基本可用。
来源:台湾服务器cn2常见故障诊断与运维处理流程面向初学者的总结