From 36f02341eb595f4bce574d2a125c97a2f50ace7b Mon Sep 17 00:00:00 2001 From: Beckylu <648245013@qq.com> Date: Wed, 3 Jun 2026 09:58:28 +0800 Subject: [PATCH] =?UTF-8?q?=E8=B5=9B=E9=A2=98=E4=BA=8C=E8=AF=B4=E6=98=8E?= =?UTF-8?q?=E6=9B=B4=E6=96=B0?= MIME-Version: 1.0 Content-Type: text/plain; charset=UTF-8 Content-Transfer-Encoding: 8bit --- README.md | 4 ++-- 1 file changed, 2 insertions(+), 2 deletions(-) diff --git a/README.md b/README.md index 55c4d30..f0d1463 100644 --- a/README.md +++ b/README.md @@ -27,13 +27,13 @@ ### 赛题二:基于 AI Agent 开发范式的国产 GPU 大模型推理算子库优化 -大模型推理高并发、长序列、高调用频次的特性,让 FlashInfer、FlashAttention、Fused MOE 等核心算子,直接决定吞吐、延迟与显存开销,左右每 Token 综合成本。 +大模型推理具有高并发、长序列、高调用频次等特点,FlashInfer、FlashAttention、Fused MoE 等核心算子直接决定模型服务的吞吐、延迟与显存开销,影响单 Token 综合推理成本。 本赛题面向沐曦国产 GPU 及 MXMACA 软件栈,鼓励参赛团队构建或使用 AI Agent / Skill 工作流,围绕推理算子库开展代码理解、算子迁移、性能分析、Kernel 优化、自动调优、Benchmark 验证和多轮迭代,探索“Agent 驱动算子优化”的新型开发范式。 参赛作品应体现 AI Agent 在底层算子优化过程中的实际参与能力,而不是仅停留在概念说明、文档生成或简单代码补全层面。参赛团队需要理解大模型推理算子库的计算逻辑、国产 GPU / MXMACA 软件栈的开发方法,以及 AI Agent / Skill 优化工作流,在保证正确性、稳定性和可复现性的前提下,提升相关算子或端到端推理链路在国产 GPU 上的执行性能。 -参赛选手可围绕以下推理算子库或核心算子,选择一类或多类任务开展优化工作: +参赛团队可围绕以下推理算子库或核心算子,选择一类或多类任务开展优化工作: - **FlashInfer 关键算子迁移与优化**:面向 Prefill、Decode、Paged KV Cache、MLA Attention 等推理场景,完成 MACA 平台适配与性能优化; - **FlashAttention 关键算子迁移与优化**:围绕 `flash_attn_with_kvcache` 等核心接口,提升长序列场景下的 Attention 计算性能;