选手入口.md:重命名 + 方向表增加语言列 + 补充 Q&A #40
|
|
@ -46,6 +46,7 @@
|
|||
**赛题二相关资料**
|
||||
|
||||
- [赛题二方案:基于 AI Agent 开发范式的国产 GPU 大模型推理算子库优化方案](基于AI%20Agent开发范式的国产GPU大模型推理算子库优化/基于AI%20Agent开发范式的国产GPU大模型算子推理库优化方案.md)
|
||||
- [赛题二选手入口](基于AI%20Agent开发范式的国产GPU大模型推理算子库优化/选手入口.md)
|
||||
- [模力方舟 Agent 部署准备教程](基于AI%20Agent开发范式的国产GPU大模型推理算子库优化/模力方舟Agent部署准备教程.md)
|
||||
- [赛题二说明及资料参考](基于AI%20Agent开发范式的国产GPU大模型推理算子库优化/赛题说明.md)
|
||||
|
||||
|
|
|
|||
|
|
@ -6,11 +6,11 @@
|
|||
|
||||
三个方向,任选其一或多个:
|
||||
|
||||
| 方向 | 任务 | 技术约束 |
|
||||
|------|------|---------|
|
||||
| **FlashInfer** | 将 BatchPrefill / BatchDecode / MLA 等 Attention Kernel 迁移至 MACA 平台并完成性能优化。重点调优维度:headdim、seqlen、page_size | MACA C++,BF16,headdim 64/128/256,seqlen 1K–180K |
|
||||
| **FlashAttention** | 将 `flash_attn_with_kvcache` 接口迁移至 MACA 平台并完成性能优化。重点调优维度:headdim(高优 128/256/512)、seqlen | MACA C++,BF16,headdim 32–512,page_size=16 |
|
||||
| **Fused MoE** | 将 INT8 量化 MoE 算子迁移至 MACA 平台并完成性能优化。重点调优维度:token 路由、专家计算、访存路径 | Tilelang / Triton / MACA C,INT8 W8A8,真实模型 shape |
|
||||
| 方向 | 任务 | 开发语言 | 技术约束 |
|
||||
|------|------|---------|---------|
|
||||
| **FlashInfer** | 将 BatchPrefill / BatchDecode / MLA 等 Attention Kernel 迁移至 MACA 平台并完成性能优化。重点调优维度:headdim、seqlen、page_size | MACA C++ / Tilelang / Triton | BF16,headdim 64/128/256,seqlen 1K–180K |
|
||||
| **FlashAttention** | 将 `flash_attn_with_kvcache` 接口迁移至 MACA 平台并完成性能优化。重点调优维度:headdim(高优 128/256/512)、seqlen | MACA C++ / Tilelang / Triton | BF16,headdim 32–512,page_size=16 |
|
||||
| **Fused MoE** | 将 INT8 量化 MoE 算子迁移至 MACA 平台并完成性能优化。重点调优维度:token 路由、专家计算、访存路径 | MACA C++ / Tilelang / Triton | INT8 W8A8,真实模型 shape |
|
||||
|
||||
## 提交物
|
||||
|
||||
|
|
@ -114,3 +114,15 @@ A:以各算子 baseline 性能为基准(约 50 分),硬件理论上限
|
|||
**Q:排行榜怎么排?**
|
||||
|
||||
A:每个任务单独计分,一个任务一个榜。两个赛题在 XPU-OJ 的榜单得分规则一致。多次提交取最好一次有效提交。正确性测试不通过的作品不计入排行榜。
|
||||
|
||||
**Q:三个方向是任选一个,还是必须全做?**
|
||||
|
||||
A:任选其一,也可以做多个方向。每个方向独立计分、独立排名。
|
||||
|
||||
**Q:FlashInfer 方向下面有多个子题,需要全做还是选做?**
|
||||
|
||||
A:FlashInfer 方向包含 Ragged Prefill、Paged Prefill、MLA Paged Attention、Paged Decode 等子任务。各子任务是否独立计分、提交方式与提交次数等细则,请以 OJ 平台题面说明及组委会后续通知为准。
|
||||
|
||||
**Q:应该什么时候做第一次 OJ 提交?性能没达标能交吗?**
|
||||
|
||||
A:没有最低性能门槛——正确性通过即可进入排名。建议开发初期就提交一个只过正确性的版本,验证编译、接口、提交链路正常,确认流程跑通后再迭代优化冲榜。
|
||||
Loading…
Reference in New Issue