连不上、丢包、路由黑洞——实时流量问题最讨厌。本文直接给出能落地的互联与路由设置要点,帮助工程师把 CN2 1G 链路从“跑不稳”变成“可观测、可控”。
在对接中国电信香港 CN2 1G 前,先确认 ASN、公网前缀、物理 VLAN、端口速率及对端联系人;缺一不可,这一步决定后续配合效率与故障响应速度。
在实际项目落地中,我们经常见到因 ASN 对接错误或前缀掐错导致的可用性事故。建议:向运营商索要对端 ASN、对等 IP、VLAN ID、MTU 建议值以及紧急联络人——并把这些信息写入工单与变更单。常用的实体:BGP、VLAN、MTU、对端联系人。下一步是把这些要素映射到路由策略。
首句结论:物理链路必须跑满 1G,MTU 建议与 CN2 对齐(通常 1500 或 9000),并启用 LLDP 以验证物理邻居信息,避免链路层不一致导致上层路由异常。
操作清单:校验光纤面板、SFP 型号、端口速率固定为 1G、MTU 双向一致、端口描述写明对端 ASN 与工单号;启用 LLDP,记录接口协商信息。我们常在实测中发现 MTU 差 1 字节就会导致 PMTUD 问题。这样做能在 BGP 建立前排除链路层干扰,接下来进入 BGP 配置细节。
第一句要点:对等时使用明确的 AS号、对等 IP、max-prefix(或 prefix-limit)与 keepalive/holdtime 设置,并在对端允许的情况下启用 BFD 提高故障检测速度。
根据我们以往对该行业的观察,最常见的错误是未设置 max-prefix 或未同步 prefix-list,导致路由震荡或断流。推荐配置项:声明本端 ASN、ping 测试对等 IP、设置 prefix-limit(避免内网事故放大)、配置 route-map 做入/出路由过滤、开启 BFD(如支持)以实现亚秒级探测。关键实体:prefix-limit、route-map、AS-path、local-preference。下一步讲具体的路由策略细化与策略冲突排查。
首句结论:对外公布前缀前用严格的 prefix-list+route-map 进行过滤;用 AS-path、community 与 local-preference 实现流量引导与黑名单排除。
实操建议:对入站路由应用严格 prefix-list 只接受对端授权前缀;对出站用 route-map 限制 origin、AS-path 长度与社区标记;把客户前缀标注 community,结合本地策略调整 local-preference 或 MED。不要直接信任对端公告的任何路由——做过滤,做记录。下一步转到安全与清洗层面的配置。
第一句结论:把 DDoS 防护放在链路与路由两端:链路层限速、BGP 社区触发清洗或黑洞,必要时与运营商协同启用高防 IP 或流量清洗服务。
不少同行反馈:遇到大流量时第一反应是改路由,但更有效的是结合流量清洗与 BGP 社区切换策略。实体术语:高防IP、流量清洗、BGP 社区、黑洞路由(null0)。建议建立应急 playbook:触发指标(pps/带宽阈值)、自动脚本下发社区、人工确认后启用清洗或黑洞。做好这些,能把故障从“全网崩溃”降为“短时丢包”。下一步说明上线前的验证与观测项。
首句结论:上线前做三类验证:对等连通性(ICMP/TCP)、路由一致性(AS-path/prefix 检查)、流量回路测试(MTR/iperf),并部署 BGP 监控与告警。
具体步骤:1)对等建立后核验 route-view 与本地 RIB;2)用 MTR 观察延迟与抖动;3)在低峰进行流量注入测试并观察黑洞/清洗触发效果;4)启用 BGP-live 警报、BFD 报警、SNMP/流量采样(NetFlow/sFlow)。在实际项目落地中,这套流程能显著减少上线后的火速回滚。最后给出可执行的清单。
第一句结论:一份明确的上线清单能避免 70% 的人为疏漏:物理、BGP 信息、路由过滤、DDoS 策略、测试项与联系人都要逐项签收。
这份清单是下一步运维常态化的起点;执行完这一项,整个 CN2 1G 链路就进入可观测与可控阶段。
行业共识句:在多数场景下,严格的路由过滤与 prefix-limit 配置比盲目调整优先级更能降低大规模故障风险;自动化的监控与清洗联动能把故障恢复时间从小时级降到分钟级。