首先用物理层和链路层排查区别。建议在宿主机或交换机侧执行链路检测,如使用ethtool查看接口状态(ethtool ethX),确认速率/双工;在虚拟机内用ip link、ethtool或ethtool -S查看统计信息,观察RX/TX错误、丢包和碰撞计数。
其次通过ping和traceroute定位层次:从宿主机ping VM和上游网关,再从VM向外网ping。若宿主机到上游通畅而VM到宿主机异常,多为虚拟化或虚拟交换问题;若宿主机链路闪断或接口down,则为物理G口或交换机问题。
常用工具包括:ethtool(网口状态与统计)、tcpdump(抓包分析)、iperf3(带宽测试)、mtr或traceroute(路由与丢包追踪)、ss/netstat(连接状态)。
使用要点:用iperf3做双向测试(server在VPS或宿主机,client在对端),记录窗口、并发流数和丢包;tcpdump抓包时指定具体端口与IP,结合Wireshark分析重传、RST、ICMP错误等;ethtool -S可以定位网卡驱动层面错误计数。
如在VPS上运行:iperf3 -s(作为服务端),在对端运行iperf3 -c VPS_IP -t 60 -P 4。抓包示例:tcpdump -i eth0 host 对端IP and tcp,保存为pcap供离线分析。
第一步,稳定复现并记录时间窗口,设置连续监控(mtr或smokeping)。第二步,分层定位:物理链路->宿主机->虚拟网络(vSwitch/bridge)->VPS内核/应用。每层做短时日志与统计抓取。
第三步,逐步排除:在宿主机或上游交换机开启端口镜像,抓取高峰期包;调整iperf并发流数以观察是否为带宽饱和或队列丢包;检查网卡驱动与中断(查看/proc/interrupts),是否存在中断风暴或RSS问题。
立即采取的应急步骤:备份当前配置并记录错误日志(dmesg, syslog);短期内切换业务至备用链路或备用机房;联系机房/运营商确认物理链路、光纤、SFP模块及交换机端口状态。
技术处理上,先更换SFP模块与网线,调整速率/双工为固定值做对比测试;如为交换机端口问题,可尝试将端口重启、迁移至其他端口或重启对应设备以排除状态异常。
定期更新网卡驱动、内核补丁,并在低峰期做无缝切换测试;为关键VPS准备网络健康监控(SNMP、流量采样),并配置告警策略,当丢包/延时超阈值立即通知运维。
故障记录应包含时间线、影响范围、重现步骤、抓包与统计附件(pcap、iperf日志、ethtool输出、dmesg与syslog片段)、操作历史(开关端口、重启设备等)及最终处理结果。建议使用工单系统统一存档,标注优先级与状态。
复盘时归纳故障根因、采取措施、未解决项和后续预防建议(如增加监控、优化队列调度或更换硬件),并把关键命令和分析思路形成模板,供团队快速响应下次类似问题。
