High-Performance-Network-Ar.../docs/chapter2.md

2.5 KiB
Executable File
Raw Permalink Blame History

第2章OpTel——秒级故障探测与定位技术

2.1 背景与挑战

光网络故障会严重影响骨干网WAN业务的SLA造成巨大经济损失——光网络每分钟故障造成的平均损失达到$8000。

传统故障定位系统存在三大局限:

挑战 具体问题
多级管控架构 不同厂商控制器/网管不统一,系统架构设计不统一,难以构建全网统一视图
SNMP协议局限 轮询消耗大量CPU周期设备侧CPU性能不足无法批量高精度采集指标
控制器资源受限 无法支撑高并发、高精度、多指标性能数据采集及实时数据分析

2.2 OpTel 三大创新

创新一:开放解耦合构建统一设备模型

  • 设备模型:构建细粒度设备模型组件,支撑不同类型设备的统一抽象
  • 数据模型:构建设备组件具体描述,屏蔽不同厂商设备性能差异
  • 逻辑组件间关联映射指定组件之间物理数据流通行为
  • 组件数据描述表明厂商设备物理能力差异

创新二光层流式遥测Optical Telemetry

执行流程

  1. Controller向设备配置发送Yang文件进行配置
  2. Manager解析Yang文件并配置Aggregator数据上送周期和Agent采集参数
  3. Agent从Module中读取数据后周期性上送到Cache
  4. Aggregator周期性读Cache数据并传给Controller

模块架构

  • 管控模块CUTelemetry Manager接收配置、Aggregator聚合上送、Cache缓存数据
  • 板卡模块CardTelemetry Agent采集性能数据、Module数据源

核心优势:一次性配置、周期性上送,大幅降低设备侧开销

创新三:基于云的实时分析平台

  • 海量数据存储在云端引入负载均衡每天支撑数十Tb级数据存储
  • 故障指纹:基于历史数据构建故障指纹库,进行快速故障根因分析和定位

2.3 实验验证

故障类型 定位速度 性能提升
光纤事件(抖动、中断、劣化) 秒级 30倍以上
硬件设备故障 1分钟以内 100倍以上
电力相关事件 30秒内 100倍以上

结论:构建了世界上最高精度的大规模光网络数据采集系统,故障定位时间降低数个数量级。

思考题

  1. 为什么传统SNMP协议无法满足大规模光网络的故障检测需求
  2. OpTel的「故障指纹」技术是如何实现快速根因分析的