From 3576c5eb8117c41699f696d55a150f8781205dfd Mon Sep 17 00:00:00 2001 From: FrRay <1077376663@qq.com> Date: Tue, 23 Jun 2026 13:59:02 +0800 Subject: [PATCH] =?UTF-8?q?Update=20=E5=9F=BA=E4=BA=8EAI=20Agent=E5=BC=80?= =?UTF-8?q?=E5=8F=91=E8=8C=83=E5=BC=8F=E7=9A=84=E5=9B=BD=E4=BA=A7GPU?= =?UTF-8?q?=E5=A4=A7=E6=A8=A1=E5=9E=8B=E7=AE=97=E5=AD=90=E6=8E=A8=E7=90=86?= =?UTF-8?q?=E5=BA=93=E4=BC=98=E5=8C=96=E6=96=B9=E6=A1=88.md?= MIME-Version: 1.0 Content-Type: text/plain; charset=UTF-8 Content-Transfer-Encoding: 8bit --- ...式的国产GPU大模型算子推理库优化方案.md | 6 +++--- 1 file changed, 3 insertions(+), 3 deletions(-) diff --git a/基于AI Agent开发范式的国产GPU大模型推理算子库优化/基于AI Agent开发范式的国产GPU大模型算子推理库优化方案.md b/基于AI Agent开发范式的国产GPU大模型推理算子库优化/基于AI Agent开发范式的国产GPU大模型算子推理库优化方案.md index 9a54d4e..758c3ca 100644 --- a/基于AI Agent开发范式的国产GPU大模型推理算子库优化/基于AI Agent开发范式的国产GPU大模型算子推理库优化方案.md +++ b/基于AI Agent开发范式的国产GPU大模型推理算子库优化/基于AI Agent开发范式的国产GPU大模型算子推理库优化方案.md @@ -54,9 +54,9 @@ | 内容 | 说明 | |------|------| -| 迁移FlashInfer的关键算子到MACA平台,并优化性能 | 版本:FlashInfer-ai/FlashInfer 0.2.8
API:
BatchPrefillWithRaggedKVCacheWrapper
- headdim64/128/256, qk192+vo128 for mla
BatchPrefillWithPagedKVCacheWrapper
- headdim64/128/256
BatchMLAPagedAttentionWrapper
- headdim qk576+vo512
BatchDecodeWithPagedKVCacheWrapper
- headdim64/128/256
语言:MACA/C++
数据类型:BF16
page size:[1, 16]
seqlen:1K~180K,选自真实大模型,且seqlen取值随机以增加泛化性 | -| 迁移FlashAttention的关键算子到MACA平台,并优化性能 | 版本:Dao-AILab/FlashAttention 2.6.3
API:flash_attn_with_kvcache
语言:MACA/C++
数据类型:BF16
headdim:[32, 64, 96, 128, 160, 192, 224, 256, 512],其中128、256、512高优
page size:16
seqlen:1K~180K,选自真实大模型,且seqlen取值随机以增加泛化性 | -| 迁移Fused MOE算子到MACA平台,并优化性能 | API:Fused MOE
语言:Tilelang/Triton/MACA C;
精度:INT8 W8A8;
shape: n_tokens, n_experts, topK, N, K均选自真实大模型,在典型切分,典型seqlen, batchsize的真实取值 | +| 迁移FlashInfer的关键算子到MACA平台,并优化性能 | 版本:FlashInfer-ai/FlashInfer 0.2.8
API:
BatchPrefillWithRaggedKVCacheWrapper
- headdim64/128/256, qk192+vo128 for mla
BatchPrefillWithPagedKVCacheWrapper
- headdim64/128/256
BatchMLAPagedAttentionWrapper
- headdim qk576+vo512
BatchDecodeWithPagedKVCacheWrapper
- headdim64/128/256
语言:Tilelang/Triton/MACA C++
数据类型:BF16
page size:[1, 16]
seqlen:1K~180K,选自真实大模型,且seqlen取值随机以增加泛化性 | +| 迁移FlashAttention的关键算子到MACA平台,并优化性能 | 版本:Dao-AILab/FlashAttention 2.6.3
API:flash_attn_with_kvcache
语言:Tilelang/Triton/MACA C++
数据类型:BF16
headdim:[32, 64, 96, 128, 160, 192, 224, 256, 512],其中128、256、512高优
page size:16
seqlen:1K~180K,选自真实大模型,且seqlen取值随机以增加泛化性 | +| 迁移Fused MOE算子到MACA平台,并优化性能 | API:Fused MOE
语言:Tilelang/Triton/MACA C++;
精度:INT8 W8A8;
shape: n_tokens, n_experts, topK, N, K均选自真实大模型,在典型切分,典型seqlen, batchsize的真实取值 | 提交可复现的算子优化的源码、测试及测试框架、性能测试脚本、性能报告、Agent/Skill,以及对应的PPT和文档。