diff --git a/README.md b/README.md index fab5cf9..55c4d30 100644 --- a/README.md +++ b/README.md @@ -29,9 +29,17 @@ 大模型推理高并发、长序列、高调用频次的特性,让 FlashInfer、FlashAttention、Fused MOE 等核心算子,直接决定吞吐、延迟与显存开销,左右每 Token 综合成本。 -本赛题打破传统人工调优模式,立足AI Agent 开发新范式,面向沐曦国产 GPU 及 MXMACA 软件栈,支持参赛团队构建 / 使用 AI Agent,完成算子迁移、代码理解、性能分析、Kernel 自动优化、Benchmark 迭代全流程。 +本赛题面向沐曦国产 GPU 及 MXMACA 软件栈,鼓励参赛团队构建或使用 AI Agent / Skill 工作流,围绕推理算子库开展代码理解、算子迁移、性能分析、Kernel 优化、自动调优、Benchmark 验证和多轮迭代,探索“Agent 驱动算子优化”的新型开发范式。 -从底层算子发力,提速推理、节省显存、拉高 GPU 利用率,从根源压缩每 Token 推理成本,筑牢国产 GPU 推理生态壁垒。 +参赛作品应体现 AI Agent 在底层算子优化过程中的实际参与能力,而不是仅停留在概念说明、文档生成或简单代码补全层面。参赛团队需要理解大模型推理算子库的计算逻辑、国产 GPU / MXMACA 软件栈的开发方法,以及 AI Agent / Skill 优化工作流,在保证正确性、稳定性和可复现性的前提下,提升相关算子或端到端推理链路在国产 GPU 上的执行性能。 + +参赛选手可围绕以下推理算子库或核心算子,选择一类或多类任务开展优化工作: + +- **FlashInfer 关键算子迁移与优化**:面向 Prefill、Decode、Paged KV Cache、MLA Attention 等推理场景,完成 MACA 平台适配与性能优化; +- **FlashAttention 关键算子迁移与优化**:围绕 `flash_attn_with_kvcache` 等核心接口,提升长序列场景下的 Attention 计算性能; +- **MCTLASS / Fused MoE 算子优化**:聚焦 MoE 模型中的稀疏专家计算,优化 Fused MoE 算子的执行效率; + +最终成果应包括可复现的源码、测试框架、性能测试脚本、性能报告、Agent / Skill 工作流,以及对应的文档和展示材料。评审将重点考察性能提升效果、Agent / Skill 工作流的可复现性,以及文档说明与演示报告的完整性。 **赛题二相关资料**