From 7291f856884233e4e1f19e01a1d480e820f256ac Mon Sep 17 00:00:00 2001 From: FrRay <1077376663@qq.com> Date: Tue, 23 Jun 2026 11:40:16 +0800 Subject: [PATCH] =?UTF-8?q?=E5=B0=86=20START=5FHERE.md=20=E9=87=8D?= =?UTF-8?q?=E5=91=BD=E5=90=8D=E4=B8=BA=20=E9=80=89=E6=89=8B=E5=85=A5?= =?UTF-8?q?=E5=8F=A3.md=EF=BC=8C=E6=9B=B4=E6=96=B0=E8=AF=AD=E8=A8=80?= =?UTF-8?q?=E5=88=97=E4=B8=8E=20Q&A?= MIME-Version: 1.0 Content-Type: text/plain; charset=UTF-8 Content-Transfer-Encoding: 8bit --- README.md | 1 + .../{START_HERE.md => 选手入口.md} | 22 ++++++++++++++----- 2 files changed, 18 insertions(+), 5 deletions(-) rename 基于AI Agent开发范式的国产GPU大模型推理算子库优化/{START_HERE.md => 选手入口.md} (88%) diff --git a/README.md b/README.md index e380cad..8d6f9fc 100644 --- a/README.md +++ b/README.md @@ -46,6 +46,7 @@ **赛题二相关资料** - [赛题二方案:基于 AI Agent 开发范式的国产 GPU 大模型推理算子库优化方案](基于AI%20Agent开发范式的国产GPU大模型推理算子库优化/基于AI%20Agent开发范式的国产GPU大模型算子推理库优化方案.md) +- [赛题二选手入口](基于AI%20Agent开发范式的国产GPU大模型推理算子库优化/选手入口.md) - [模力方舟 Agent 部署准备教程](基于AI%20Agent开发范式的国产GPU大模型推理算子库优化/模力方舟Agent部署准备教程.md) - [赛题二说明及资料参考](基于AI%20Agent开发范式的国产GPU大模型推理算子库优化/赛题说明.md) diff --git a/基于AI Agent开发范式的国产GPU大模型推理算子库优化/START_HERE.md b/基于AI Agent开发范式的国产GPU大模型推理算子库优化/选手入口.md similarity index 88% rename from 基于AI Agent开发范式的国产GPU大模型推理算子库优化/START_HERE.md rename to 基于AI Agent开发范式的国产GPU大模型推理算子库优化/选手入口.md index 8f2b516..9458874 100644 --- a/基于AI Agent开发范式的国产GPU大模型推理算子库优化/START_HERE.md +++ b/基于AI Agent开发范式的国产GPU大模型推理算子库优化/选手入口.md @@ -6,11 +6,11 @@ 三个方向,任选其一或多个: -| 方向 | 任务 | 技术约束 | -|------|------|---------| -| **FlashInfer** | 将 BatchPrefill / BatchDecode / MLA 等 Attention Kernel 迁移至 MACA 平台并完成性能优化。重点调优维度:headdim、seqlen、page_size | MACA C++,BF16,headdim 64/128/256,seqlen 1K–180K | -| **FlashAttention** | 将 `flash_attn_with_kvcache` 接口迁移至 MACA 平台并完成性能优化。重点调优维度:headdim(高优 128/256/512)、seqlen | MACA C++,BF16,headdim 32–512,page_size=16 | -| **Fused MoE** | 将 INT8 量化 MoE 算子迁移至 MACA 平台并完成性能优化。重点调优维度:token 路由、专家计算、访存路径 | Tilelang / Triton / MACA C,INT8 W8A8,真实模型 shape | +| 方向 | 任务 | 开发语言 | 技术约束 | +|------|------|---------|---------| +| **FlashInfer** | 将 BatchPrefill / BatchDecode / MLA 等 Attention Kernel 迁移至 MACA 平台并完成性能优化。重点调优维度:headdim、seqlen、page_size | MACA C++ / Tilelang / Triton | BF16,headdim 64/128/256,seqlen 1K–180K | +| **FlashAttention** | 将 `flash_attn_with_kvcache` 接口迁移至 MACA 平台并完成性能优化。重点调优维度:headdim(高优 128/256/512)、seqlen | MACA C++ / Tilelang / Triton | BF16,headdim 32–512,page_size=16 | +| **Fused MoE** | 将 INT8 量化 MoE 算子迁移至 MACA 平台并完成性能优化。重点调优维度:token 路由、专家计算、访存路径 | MACA C++ / Tilelang / Triton | INT8 W8A8,真实模型 shape | ## 提交物 @@ -114,3 +114,15 @@ A:以各算子 baseline 性能为基准(约 50 分),硬件理论上限 **Q:排行榜怎么排?** A:每个任务单独计分,一个任务一个榜。两个赛题在 XPU-OJ 的榜单得分规则一致。多次提交取最好一次有效提交。正确性测试不通过的作品不计入排行榜。 + +**Q:三个方向是任选一个,还是必须全做?** + +A:任选其一,也可以做多个方向。每个方向独立计分、独立排名。 + +**Q:FlashInfer 方向下面有多个子题,需要全做还是选做?** + +A:FlashInfer 方向包含 Ragged Prefill、Paged Prefill、MLA Paged Attention、Paged Decode 等子任务。各子任务是否独立计分、提交方式与提交次数等细则,请以 OJ 平台题面说明及组委会后续通知为准。 + +**Q:应该什么时候做第一次 OJ 提交?性能没达标能交吗?** + +A:没有最低性能门槛——正确性通过即可进入排名。建议开发初期就提交一个只过正确性的版本,验证编译、接口、提交链路正常,确认流程跑通后再迭代优化冲榜。