赛题二说明更新

This commit is contained in:
Beckylu 2026-06-03 09:58:28 +08:00
parent b9840d08f8
commit 36f02341eb
1 changed files with 2 additions and 2 deletions

View File

@ -27,13 +27,13 @@
### 赛题二基于 AI Agent 开发范式的国产 GPU 大模型推理算子库优化
大模型推理高并发、长序列、高调用频次的特性 FlashInfer、FlashAttention、Fused MOE 等核心算子直接决定吞吐、延迟与显存开销左右每 Token 综合成本。
大模型推理具有高并发、长序列、高调用频次等特点FlashInfer、FlashAttention、Fused MoE 等核心算子直接决定模型服务的吞吐、延迟与显存开销,影响单 Token 综合推理成本。
本赛题面向沐曦国产 GPU 及 MXMACA 软件栈,鼓励参赛团队构建或使用 AI Agent / Skill 工作流围绕推理算子库开展代码理解、算子迁移、性能分析、Kernel 优化、自动调优、Benchmark 验证和多轮迭代探索“Agent 驱动算子优化”的新型开发范式。
参赛作品应体现 AI Agent 在底层算子优化过程中的实际参与能力,而不是仅停留在概念说明、文档生成或简单代码补全层面。参赛团队需要理解大模型推理算子库的计算逻辑、国产 GPU / MXMACA 软件栈的开发方法,以及 AI Agent / Skill 优化工作流,在保证正确性、稳定性和可复现性的前提下,提升相关算子或端到端推理链路在国产 GPU 上的执行性能。
参赛选手可围绕以下推理算子库或核心算子,选择一类或多类任务开展优化工作:
参赛团队可围绕以下推理算子库或核心算子,选择一类或多类任务开展优化工作:
- **FlashInfer 关键算子迁移与优化**:面向 Prefill、Decode、Paged KV Cache、MLA Attention 等推理场景,完成 MACA 平台适配与性能优化;
- **FlashAttention 关键算子迁移与优化**:围绕 `flash_attn_with_kvcache` 等核心接口,提升长序列场景下的 Attention 计算性能;