2.7 KiB
Executable File
2.7 KiB
Executable File
第2章:太极 Angle HCF 推理加速框架
2.1 概述
Angle HCF(High-performance Computing Framework)是太极平台的核心推理加速框架,基于 NVIDIA TensorRT-LLM 构建,为大模型推理提供高性能、低延迟的加速方案。
核心功能
- 推理加速:基于 TensorRT-LLM 的推理优化
- 服务化:基于 Triton Inference Server 的部署能力
- 压缩算法适配:与模型压缩框架协同,实现量化/稀疏模型的加速推理
2.2 性能与显存优化
Attention 加速
- Flash-Attention V1/V2:高效的注意力计算优化
- Flash-Decoding:解码阶段的 KV-Cache 缓存优化
- PagedAttention:提高显存利用率,支持更大的 Batch Size
层间 Buffer 共享
- 复用 GEMM 优化:并行计算、缓存、共享 Buffer 等
- 减少无效的解码计算
扩展优化
- Embedding 并行与共享:减少 Embedding 查询开销
- 共享 Workspace:减少显存分配频率
- 显存优化:逐层优化显存使用模式
2.3 压缩适配
量化压缩
Angle HCF 通过自定义 CUDA Kernel 实现高效的量化推理:
| 量化精度 | 吞吐提升 |
|---|---|
| INT8 | 1.8x |
| INT8 + INT4 混合 | 1.9x |
| INT4 | 2.0x |
量化算法支持:
- Weight-only 量化
- SmoothQuant Q1/Q2/Q3
- Easy-Quant
稀疏压缩
结构化稀疏推理的实现与性能效果:
| 层 | 描述 | FP16 (ms) | FP16 Sparse (ms) | 加速比 |
|---|---|---|---|---|
| Context Decoder | Attention input gemm | 8.452 | 5.815 | -31.2% |
| Attention output gemm | 3.488 | 2.540 | -27.2% | |
| FFN gemm 1 | 11.487 | 8.073 | -29.7% | |
| FFN gemm 2 | 11.478 | 8.958 | -21.9% | |
| Self Decoder | Attention input gemm | 0.122 | 0.098 | -19.6% |
| Attention output gemm | 0.046 | 0.030 | -34.0% | |
| FFN gemm 1 | 0.160 | 0.112 | -30.0% | |
| FFN gemm 2 | 0.158 | 0.109 | -31.0% |
稀疏度:2:4 结构化稀疏
2.4 服务化
基础功能
- Triton 基础动态 Batch:动态批处理提高吞吐
- 流式输出:支持流式推理响应
- Group 调度:请求分组管理
高级功能
- 请求拒绝:修正请求拒绝机制,防止积压造成雪崩
- 主动终止:服务端主动终止无效请求,减少资源浪费
- Continuous Batching:迭代级调度,持续提高吞吐
2.5 性能对比
Angle HCF 框架在性能上相比主流开源方案具有明显优势:
- 相比 DeepSpeed-Inference:性能吞吐占优
- 相比 vLLM:性能吞吐占优
学习要点
- Angle HCF 推理加速的核心技术路径
- Attention 优化与显存优化的主要方法
- 量化与稀疏压缩在推理加速中的实现
- 服务化部署的关键能力