本文面向在国内节点接入或经由大陆到台湾的 cn2台湾 线路运维人员,概述定位故障的核心思路:先判定影响范围(业务/链路/路由/域名),再按可复现性与可量化指标(丢包、延迟、重传、抖动)逐层排查,并提供一套命令与取证清单,帮助在最短时间内定位并推动修复。
在 国内cn2 到台湾的场景,常见故障点包括本地接入交换(链路层)、边界路由器(BGP 会话/策略)、运营商中间链路(丢包/拥塞)、海外出口点(PE/PEER)和对端台湾机房的接入。优先判断是单点主机、子网还是整个 ASN 受影响,有助于缩小范围。
延迟和丢包通常源于链路拥塞、路由绕行、MTU 不一致或中间设备丢包策略。链路拥塞会在高峰期显现,路由策略变更可能导致路径突变增加 RTT,MTU/分片问题引起偶发丢包(尤其是 VPN / GRE / IPSec 场景)。还需警惕 ISP 的流量清洗、黑洞和中间链路维护。
优先级建议:1) 本地链路(物理/接口) 2) 边界路由与 BGP 会话 3) 中间路径(traceroute/mtr) 4) 应用或服务器自身(连接数/队列/负载) 5) DNS 与负载均衡。定位时先用 ping/mtr/traceroute 确定跃点,再结合后台指标判断是链路丢包还是应用问题。
实操步骤:先用 mtr -rwz 跑到目标 IP,观察哪一跳开始增加丢包或 RTT;若是同一跳持续丢包,多为该跃点问题;用 tcpdump -i eth0 host 目标IP and port 进行双向抓包比对;在边界路由器上查看 show ip bgp summary、show bgp neighbors、netstat/ss 连通情况与接口错误计数。
必备工具与命令:ping(带包大小与间隔)、mtr/traceroute、tcpdump(-s0 -w 文件)、tshark、ss/netstat、ifconfig/ip link、ethtool、show ip bgp、show route、bgp table、snmpwalk 与流量监控(sFlow/NetFlow)。抓包应包含双方时间戳、接口名与方向,方便提供给上游 ISP 或对端定位。
简单链路故障(接口 down、物理错误)典型 5-30 分钟能发现;中间路由或拥塞定位需 30-120 分钟;跨运营商或间歇性抖动常需数小时到一天,取决于取证(抓包、历史流量)和是否需要 ISP 协同。关键是先锁定故障类型并生成可复现步骤,便于推动联调。
沟通时提供清晰证据:影响时间窗口、flowshow/NetFlow 摘要、mtr/traceroute 输出、抓包(pcap)、BGP 对等状态与路由变化记录。明确期望(如要求对端查看某跃点或调整黑洞策略)并给出可复现命令,避免模糊描述浪费沟通时间。
检查 ACL、防火墙策略、NAT、GRE/IPSec 隧道与 MTU 配置,常见误配置会导致握手超时或分片问题。路由策略(社区、前缀过滤)错配会引起流向变化,BGP Flap 或 route-reflectors 也可能产生短时可达性问题,需查看 BGP update 记录。
复原步骤:先做临时绕路或流量分流(BGP prepend/weight/local-preference 或流量工程)以恢复业务,再排查根因。后续建议做持续监控(延迟/丢包报警)、定期 BGP 老化与路由可视化、MTU 校验脚本与抓包保存策略,关键链路开启 sFlow/NetFlow 便于回溯。
间歇性问题往往无法重现,历史抓包、sFlow 与监控数据是追溯根因的唯一途径。保存证据可以在与 ISP 协同或申诉时提供量化依据,加速问题确认与 SLA 处理,因此应建立自动化取证与告警策略。