readme赛题二说明更新

This commit is contained in:
Beckylu 2026-06-03 09:54:40 +08:00
parent 750cf39aab
commit b9840d08f8
1 changed files with 10 additions and 2 deletions

View File

@ -29,9 +29,17 @@
大模型推理高并发、长序列、高调用频次的特性 FlashInfer、FlashAttention、Fused MOE 等核心算子直接决定吞吐、延迟与显存开销左右每 Token 综合成本。
本赛题打破传统人工调优模式立足AI Agent 开发新范式面向沐曦国产 GPU  MXMACA 软件栈支持参赛团队构建 / 使用 AI Agent完成算子迁移、代码理解、性能分析、Kernel 自动优化、Benchmark 迭代全流程
本赛题面向沐曦国产 GPU 及 MXMACA 软件栈,鼓励参赛团队构建或使用 AI Agent / Skill 工作流围绕推理算子库开展代码理解、算子迁移、性能分析、Kernel 优化、自动调优、Benchmark 验证和多轮迭代探索“Agent 驱动算子优化”的新型开发范式
从底层算子发力提速推理、节省显存、拉高 GPU 利用率从根源压缩每 Token 推理成本筑牢国产 GPU 推理生态壁垒。
参赛作品应体现 AI Agent 在底层算子优化过程中的实际参与能力,而不是仅停留在概念说明、文档生成或简单代码补全层面。参赛团队需要理解大模型推理算子库的计算逻辑、国产 GPU / MXMACA 软件栈的开发方法,以及 AI Agent / Skill 优化工作流,在保证正确性、稳定性和可复现性的前提下,提升相关算子或端到端推理链路在国产 GPU 上的执行性能。
参赛选手可围绕以下推理算子库或核心算子,选择一类或多类任务开展优化工作:
- **FlashInfer 关键算子迁移与优化**:面向 Prefill、Decode、Paged KV Cache、MLA Attention 等推理场景,完成 MACA 平台适配与性能优化;
- **FlashAttention 关键算子迁移与优化**:围绕 `flash_attn_with_kvcache` 等核心接口,提升长序列场景下的 Attention 计算性能;
- **MCTLASS / Fused MoE 算子优化**:聚焦 MoE 模型中的稀疏专家计算,优化 Fused MoE 算子的执行效率;
最终成果应包括可复现的源码、测试框架、性能测试脚本、性能报告、Agent / Skill 工作流以及对应的文档和展示材料。评审将重点考察性能提升效果、Agent / Skill 工作流的可复现性,以及文档说明与演示报告的完整性。
**赛题二相关资料**