Update 基于AI Agent开发范式的国产GPU大模型算子推理库优化方案.md

This commit is contained in:
FrRay 2026-06-23 13:59:02 +08:00
parent 3d82d79844
commit 3576c5eb81
1 changed files with 3 additions and 3 deletions

View File

@ -54,9 +54,9 @@
| 内容 | 说明 |
|------|------|
| 迁移FlashInfer的关键算子到MACA平台并优化性能 | 版本FlashInfer-ai/FlashInfer 0.2.8<br>API<br>BatchPrefillWithRaggedKVCacheWrapper<br>- headdim64/128/256, qk192+vo128 for mla<br>BatchPrefillWithPagedKVCacheWrapper<br>- headdim64/128/256<br>BatchMLAPagedAttentionWrapper<br>- headdim qk576+vo512<br>BatchDecodeWithPagedKVCacheWrapper<br>- headdim64/128/256<br>语言:MACA/C++<br>数据类型BF16<br>page size[1, 16]<br>seqlen1K~180K选自真实大模型且seqlen取值随机以增加泛化性 |
| 迁移FlashAttention的关键算子到MACA平台并优化性能 | 版本Dao-AILab/FlashAttention 2.6.3<br>APIflash_attn_with_kvcache<br>语言:MACA/C++<br>数据类型BF16<br>headdim[32, 64, 96, 128, 160, 192, 224, 256, 512]其中128、256、512高优<br>page size16<br>seqlen1K~180K选自真实大模型且seqlen取值随机以增加泛化性 |
| 迁移Fused MOE算子到MACA平台并优化性能 | APIFused MOE<br>语言Tilelang/Triton/MACA C<br>精度INT8 W8A8<br>shape: n_tokens, n_experts, topK, N, K均选自真实大模型在典型切分典型seqlen, batchsize的真实取值 |
| 迁移FlashInfer的关键算子到MACA平台并优化性能 | 版本FlashInfer-ai/FlashInfer 0.2.8<br>API<br>BatchPrefillWithRaggedKVCacheWrapper<br>- headdim64/128/256, qk192+vo128 for mla<br>BatchPrefillWithPagedKVCacheWrapper<br>- headdim64/128/256<br>BatchMLAPagedAttentionWrapper<br>- headdim qk576+vo512<br>BatchDecodeWithPagedKVCacheWrapper<br>- headdim64/128/256<br>语言:Tilelang/Triton/MACA C++<br>数据类型BF16<br>page size[1, 16]<br>seqlen1K~180K选自真实大模型且seqlen取值随机以增加泛化性 |
| 迁移FlashAttention的关键算子到MACA平台并优化性能 | 版本Dao-AILab/FlashAttention 2.6.3<br>APIflash_attn_with_kvcache<br>语言:Tilelang/Triton/MACA C++<br>数据类型BF16<br>headdim[32, 64, 96, 128, 160, 192, 224, 256, 512]其中128、256、512高优<br>page size16<br>seqlen1K~180K选自真实大模型且seqlen取值随机以增加泛化性 |
| 迁移Fused MOE算子到MACA平台并优化性能 | APIFused MOE<br>语言Tilelang/Triton/MACA C++<br>精度INT8 W8A8<br>shape: n_tokens, n_experts, topK, N, K均选自真实大模型在典型切分典型seqlen, batchsize的真实取值 |
提交可复现的算子优化的源码、测试及测试框架、性能测试脚本、性能报告、Agent/Skill以及对应的PPT和文档。