forked from metax-maca/op_optimization
Merge pull request 'Update 基于AI Agent开发范式的国产GPU大模型算子推理库优化方案.md' (#43) from FrRay/op_optimization:master into master
This commit is contained in:
commit
1ba46ed02a
|
|
@ -54,9 +54,9 @@
|
|||
|
||||
| 内容 | 说明 |
|
||||
|------|------|
|
||||
| 迁移FlashInfer的关键算子到MACA平台,并优化性能 | 版本:FlashInfer-ai/FlashInfer 0.2.8<br>API:<br>BatchPrefillWithRaggedKVCacheWrapper<br>- headdim64/128/256, qk192+vo128 for mla<br>BatchPrefillWithPagedKVCacheWrapper<br>- headdim64/128/256<br>BatchMLAPagedAttentionWrapper<br>- headdim qk576+vo512<br>BatchDecodeWithPagedKVCacheWrapper<br>- headdim64/128/256<br>语言:MACA/C++<br>数据类型:BF16<br>page size:[1, 16]<br>seqlen:1K~180K,选自真实大模型,且seqlen取值随机以增加泛化性 |
|
||||
| 迁移FlashAttention的关键算子到MACA平台,并优化性能 | 版本:Dao-AILab/FlashAttention 2.6.3<br>API:flash_attn_with_kvcache<br>语言:MACA/C++<br>数据类型:BF16<br>headdim:[32, 64, 96, 128, 160, 192, 224, 256, 512],其中128、256、512高优<br>page size:16<br>seqlen:1K~180K,选自真实大模型,且seqlen取值随机以增加泛化性 |
|
||||
| 迁移Fused MOE算子到MACA平台,并优化性能 | API:Fused MOE<br>语言:Tilelang/Triton/MACA C;<br>精度:INT8 W8A8;<br>shape: n_tokens, n_experts, topK, N, K均选自真实大模型,在典型切分,典型seqlen, batchsize的真实取值 |
|
||||
| 迁移FlashInfer的关键算子到MACA平台,并优化性能 | 版本:FlashInfer-ai/FlashInfer 0.2.8<br>API:<br>BatchPrefillWithRaggedKVCacheWrapper<br>- headdim64/128/256, qk192+vo128 for mla<br>BatchPrefillWithPagedKVCacheWrapper<br>- headdim64/128/256<br>BatchMLAPagedAttentionWrapper<br>- headdim qk576+vo512<br>BatchDecodeWithPagedKVCacheWrapper<br>- headdim64/128/256<br>语言:Tilelang/Triton/MACA C++<br>数据类型:BF16<br>page size:[1, 16]<br>seqlen:1K~180K,选自真实大模型,且seqlen取值随机以增加泛化性 |
|
||||
| 迁移FlashAttention的关键算子到MACA平台,并优化性能 | 版本:Dao-AILab/FlashAttention 2.6.3<br>API:flash_attn_with_kvcache<br>语言:Tilelang/Triton/MACA C++<br>数据类型:BF16<br>headdim:[32, 64, 96, 128, 160, 192, 224, 256, 512],其中128、256、512高优<br>page size:16<br>seqlen:1K~180K,选自真实大模型,且seqlen取值随机以增加泛化性 |
|
||||
| 迁移Fused MOE算子到MACA平台,并优化性能 | API:Fused MOE<br>语言:Tilelang/Triton/MACA C++;<br>精度:INT8 W8A8;<br>shape: n_tokens, n_experts, topK, N, K均选自真实大模型,在典型切分,典型seqlen, batchsize的真实取值 |
|
||||
|
||||
提交可复现的算子优化的源码、测试及测试框架、性能测试脚本、性能报告、Agent/Skill,以及对应的PPT和文档。
|
||||
|
||||
|
|
|
|||
Loading…
Reference in New Issue