1. 准备与初步信息收集
在开始排查前,先准备好:云主机控制面板登陆(账户、API密钥)、公网IP、控制台(VNC/KVM)入口、最近快照或备份位置。记录故障时间、影响范围、是否业务中断。获取系统信息命令:uname -a, lsb_release -a, cat /etc/os-release;网络信息:ip addr show, ip route show;确保你能通过控制面板访问串口/远程控制台以备SSH不可用时使用。
2. 无法SSH登录的排查步骤
步骤1:控制面板打开VNC/KVM控制台,尝试本地登录。步骤2:检查SSH服务状态:systemctl status sshd 或 service sshd status。步骤3:查看最近的认证日志:sudo tail -n 200 /var/log/auth.log 或 /var/log/secure。步骤4:确认防火墙与安全组:sudo iptables -L -n -v, sudo nft list ruleset, 或云面板安全组规则,放行22端口。步骤5:若因密钥或密码问题,使用控制台reset密码或替换~/.ssh/authorized_keys后重启sshd。
3. 网络连通性与延迟问题
步骤1:从本地运行 ping -c 4 <公网IP> 检查丢包与延迟。步骤2:若丢包,远程控制台执行 ping 目标(如8.8.8.8)与 traceroute/tracert 确定路由(Linux: traceroute -n 8.8.8.8;Windows: tracert)。步骤3:检查云主机网卡配置:ip addr, ethtool eth0。步骤4:若是国际出入口/海缆延迟,联系台湾机房提供商查询BGP与出口链路,提供traceroute输出与时间戳。
4. CPU、内存与磁盘性能异常
步骤1:查看整体资源:top 或 htop,free -m,vmstat 1 5。步骤2:查看磁盘使用:df -h,du -sh /var/log/* 排查日志膨胀。步骤3:IO问题用 iostat -xz 1 3 或 atop、iotop 查看哪个进程占用。步骤4:若是进程泄露,使用 systemctl restart <服务> 或 kill -9
,必要时限制进程(nice/ionice/systemd cgroup)。步骤5:若磁盘已满,清理临时日志、旋转日志或扩容云盘与在线扩容文件系统(例如 xfs_growfs 或 resize2fs)。
5. 服务无法启动与端口监听检查
首先用 systemctl status <服务名> 查看错误日志;然后 journalctl -u <服务名> -n 200 查看详细。用 ss -tulpn | grep :<端口> 检查是否被其它进程占用。若配置文件错误,执行服务自检命令(如 nginx -t, apachectl configtest, mysqld --help --verbose)并修复配置后重启。记得查看SELinux/APPARMOR策略:getenforce 或 aa-status。
6. 磁盘损坏、文件系统错乱与数据恢复
步骤1:用 dmesg | tail 检查内核是否报错SCSI或I/O错误。步骤2:将云盘卸载并在控制面板挂到救援实例或启动到rescue模式(大多数台湾云商提供)。步骤3:在救援环境用 fsck /dev/vdX -y 修复文件系统,注意先做好快照。步骤4:若数据重要且fsck失败,联系供应商申请底层快照并交给专业数据恢复;切勿在原盘做太多写操作。
7. DNS、域名与邮件发送被拦截
DNS解析问题先用 dig @8.8.8.8 域名 +short,确认解析是否在DNS层正确。若邮件发送被退回或进入黑名单,用 smtp diag(如 swaks)检查端口25/587连通性。台湾云主机有时默认屏蔽25端口,联系提供商申请解封或使用第三方SMTP服务并配置SPF/DKIM/DMARC。
8. 快照、备份与恢复操作具体步骤
步骤1:先在控制面板创建当前实例快照或磁盘快照。步骤2:若需要回滚,创建新实例并选择快照作为系统盘或将快照挂载到救援实例检查。步骤3:验证恢复后服务配置(网络、安全组、IP指派),若使用固定公网IP,确保IP解绑再绑定或按提供商流程恢复。
9. 联系提供商时要提供的信息与常见请求模板
联系工单请提供:实例ID、公网IP、故障开始时间和时区、控制面板操作记录、步骤执行结果(如 traceroute、dmesg、journalctl 输出片段)、是否需要紧急重启/重装。请求类型常见:解封端口、重建网络、申请底层快照、硬件更换、磁盘扩容或迁移。
10. 日常运维建议与监控配置
建议安装监控和告警(Prometheus+Grafana、Zabbix或云厂商自带监控),设置CPU/内存/磁盘I/O/网络阈值告警。定期自动化快照(每天或每周),并演练恢复流程。启用日志轮转(logrotate),并把重要日志异地备份到对象存储或SIEM。
11. 安全防护与权限管理
禁用root直接SSH登录,使用非标准端口或Cloud Firewall并开启双因素。用ssh-key、限制来源IP、配置Fail2Ban或CSF防爆破。定期更新系统补丁并关注台湾地区的法律合规与数据主权要求。
12. 故障排查示例:实例无法访问网页(综合步骤)
步骤1:控制面板确认实例状态为running。步骤2:控制台登录检查 nginx/apache 是否运行(systemctl status nginx)。步骤3:ss -tulpn | grep :80 确认监听;若未监听检查配置文件。步骤4:检查防火墙与安全组是否放行80/443。步骤5:从外网 traceroute 到公网IP 查网络路径。步骤6:如确认为提供商网络问题,提交traceroute、ping丢包样本与实例ID给支持。
13. 问:台湾云主机常见的供应商侧故障有哪些,我需要怎么准备证据?
答:常见有公网出口拥塞、物理机故障、网络BGP问题和机房断电。准备证据包括:traceroute 输出、ping 丢包与延迟样本(带时间戳)、控制台日志(dmesg/journalctl 的报错片段)、实例ID与故障时间。将这些信息一并提交工单可加速定位。
14. 问:如果磁盘空间满导致服务挂掉,如何安全释放空间?
答:先用 du -sh /* 和 du -sh /var/log/* 找出大文件,优先清理日志(logrotate 手动触发或压缩旧日志),删除临时缓存(apt-get clean、yum clean all、rm -rf /tmp/*)。避免直接删除/var/lib下数据库文件;若要移动,先做快照并在救援模式下操作。
15. 问:遇到跨国网络延迟或丢包,是自己能解决还是必须找厂商?
答:先自行进行 ping/traceroute 与多点检测(不同运营商/不同地区),排除本地ISP或本地路由问题;如果问题出现在云提供商出口或骨干(traceroute 显示在机房后就出现丢包/高延迟),需要提交证据给供应商处理,他们可调整BGP或修复链路。
来源:快速上手台湾服务器公司云主机 常见故障与排查方法汇总