GenAI-Deployment-Practice/docs/chapter2.md

2.7 KiB
Executable File
Raw Permalink Blame History

第2章太极 Angle HCF 推理加速框架

2.1 概述

Angle HCFHigh-performance Computing Framework是太极平台的核心推理加速框架基于 NVIDIA TensorRT-LLM 构建,为大模型推理提供高性能、低延迟的加速方案。

核心功能

  • 推理加速:基于 TensorRT-LLM 的推理优化
  • 服务化:基于 Triton Inference Server 的部署能力
  • 压缩算法适配:与模型压缩框架协同,实现量化/稀疏模型的加速推理

2.2 性能与显存优化

Attention 加速

  • Flash-Attention V1/V2:高效的注意力计算优化
  • Flash-Decoding:解码阶段的 KV-Cache 缓存优化
  • PagedAttention:提高显存利用率,支持更大的 Batch Size

层间 Buffer 共享

  • 复用 GEMM 优化:并行计算、缓存、共享 Buffer 等
  • 减少无效的解码计算

扩展优化

  • Embedding 并行与共享:减少 Embedding 查询开销
  • 共享 Workspace:减少显存分配频率
  • 显存优化:逐层优化显存使用模式

2.3 压缩适配

量化压缩

Angle HCF 通过自定义 CUDA Kernel 实现高效的量化推理:

量化精度 吞吐提升
INT8 1.8x
INT8 + INT4 混合 1.9x
INT4 2.0x

量化算法支持

  • Weight-only 量化
  • SmoothQuant Q1/Q2/Q3
  • Easy-Quant

稀疏压缩

结构化稀疏推理的实现与性能效果:

描述 FP16 (ms) FP16 Sparse (ms) 加速比
Context Decoder Attention input gemm 8.452 5.815 -31.2%
Attention output gemm 3.488 2.540 -27.2%
FFN gemm 1 11.487 8.073 -29.7%
FFN gemm 2 11.478 8.958 -21.9%
Self Decoder Attention input gemm 0.122 0.098 -19.6%
Attention output gemm 0.046 0.030 -34.0%
FFN gemm 1 0.160 0.112 -30.0%
FFN gemm 2 0.158 0.109 -31.0%

稀疏度2:4 结构化稀疏

2.4 服务化

基础功能

  • Triton 基础动态 Batch:动态批处理提高吞吐
  • 流式输出:支持流式推理响应
  • Group 调度:请求分组管理

高级功能

  • 请求拒绝:修正请求拒绝机制,防止积压造成雪崩
  • 主动终止:服务端主动终止无效请求,减少资源浪费
  • Continuous Batching:迭代级调度,持续提高吞吐

2.5 性能对比

Angle HCF 框架在性能上相比主流开源方案具有明显优势:

  • 相比 DeepSpeed-Inference:性能吞吐占优
  • 相比 vLLM:性能吞吐占优

学习要点

  • Angle HCF 推理加速的核心技术路径
  • Attention 优化与显存优化的主要方法
  • 量化与稀疏压缩在推理加速中的实现
  • 服务化部署的关键能力