From f34ce724d264f1094305e2a2e26bc7dccf43fec9 Mon Sep 17 00:00:00 2001 From: Beckylu <648245013@qq.com> Date: Fri, 5 Jun 2026 17:07:54 +0800 Subject: [PATCH] =?UTF-8?q?=E8=B5=9B=E9=A2=98=E4=BA=8C=E8=AF=B4=E6=98=8E?= =?UTF-8?q?=E5=8E=BB=E6=8E=89=E7=AE=97=E5=8A=9B=E5=88=B8?= MIME-Version: 1.0 Content-Type: text/plain; charset=UTF-8 Content-Transfer-Encoding: 8bit --- .../赛题说明.md | 74 +++---------------- 1 file changed, 12 insertions(+), 62 deletions(-) diff --git a/基于AI Agent开发范式的国产GPU大模型推理算子库优化/赛题说明.md b/基于AI Agent开发范式的国产GPU大模型推理算子库优化/赛题说明.md index 07f0029..24a70ce 100644 --- a/基于AI Agent开发范式的国产GPU大模型推理算子库优化/赛题说明.md +++ b/基于AI Agent开发范式的国产GPU大模型推理算子库优化/赛题说明.md @@ -4,65 +4,7 @@ 本赛题旨在提升国产 GPU 平台(如沐曦 MACA 平台)上的大模型推理核心算子性能,通过使用或构建 AI Agent / Skill 工作流,在国产 GPU(MACA 软件栈)上完成大模型推理核心算子库的迁移适配与性能突破。 -### 环境准备 -#### 开发环境设置 - -1. **在沐曦开发者社区领取算力券** - - * 领取链接:[https://developer.metax-tech.com/activities/6](https://developer.metax-tech.com/activities/6) - - * 登录平台 - - ![platform login](https://origin.picgo.net/2026/06/04/platform-login626620122b08424d.png) - - * 首次登录需要先进行注册(使用邮箱或者手机号进行注册) - - ![platform registration](https://origin.picgo.net/2026/06/04/platform-registrationdb267074af39bf4c.png) - - * 登录成功后进行第二步-邮箱验证,填入自己的邮箱。 - - ![email verification](https://origin.picgo.net/2026/06/04/email-verificationc3f391bb747318e0.png) - - * 第三步,提交申请。 - - ![submit application](https://origin.picgo.net/2026/06/04/submit-application3bf7ac4724e13ae8.png) - - * 获得兑换码 - - ![get redeem code](https://origin.picgo.net/2026/06/04/get-redeem-code3f6a20e5f9cbbd38.png) - -2. **在模力方舟平台兑换算力券** - - * 平台链接:[https://ai.gitee.com/](https://ai.gitee.com/) - - * 1.登录模力方舟平台 - - ![ai.gitee login](https://origin.picgo.net/2026/06/04/ai.gitee-login7d9fe2b5e35e3a92.png) - - * 2.进入费用中心 - 算力券 , 点击右上角“兑换” - - ![redeem compute voucher](https://origin.picgo.net/2026/06/04/redeem-compute-voucher0eb15e2f3f9b7bbd.png) - -3. **租用算力** - - * 模力方舟算力市场链接:https://ai.gitee.com/compute - - * 选择沐曦芯片厂商,并根据项目要求选择相应的配置。 - - ![rent compute](https://origin.picgo.net/2026/06/04/rent-compute1197cc6d884ce429.png) - -4. **创建实例** - -专属镜像文件: - -![create instance1](https://origin.picgo.net/2026/06/04/create-instance10ab33dd1b7e14727.png) - -![create instance2](https://origin.picgo.net/2026/06/04/create-instance23666efb720fefa60.png) - -![create instance3](https://origin.picgo.net/2026/06/04/create-instance3f18b4323644d3447.png) - -  进入算力容器,刚创建的实例默认开机状态,点击工具-lab开始项目创作。 ## 二、任务方向 @@ -221,9 +163,9 @@ flashInfer 将分页 KV Cache 视作一个**块稀疏矩阵**,并巧妙地 2. **`kv_layout`**:输入 K/V 张量的显存布局格式,可以是 `NHD` 或 `HND`。默认 **`'NHD'`** * NHD:`(seq_len, num_heads, head_dim)` - + * HND:`(num_heads, seq_len, head_dim)` - + 3. **`backend`**:底层实现引擎。可选值包括 `auto`、`fa2`、`fa3`、`cudnn`、`cutlass` 或 `cute-dsl`,默认值为 `auto`。系统会根据显卡架构自动选择最优后端。其中 `cute-dsl` 是专为最新一代 Blackwell 架构(如 SM100+ 系列)准备的算子。 4. **`jit_args`** & **`jit_kwargs`**:用于即时编译(JIT, Just-In-Time)的参数列表和字典参数。如果提供,框架将会在运行时动态编译底层算子(手动实现算子);否则,直接使用预编译好的默认算子。 @@ -454,7 +396,11 @@ run(q: Tensor, paged_kv_cache: Tensor | Tuple[Tensor, Tensor], *args, q_scale: f * 一个 5D 张量,形状为:`[max_num_pages, 2, page_size, num_kv_heads, head_dim]`,如果 `kv_layout` 是 `NHD`,以及 `[max_num_pages, 2, num_kv_heads, page_size, head_dim]`,如果 `kv_layout` 是 `HND`。其中 `paged_kv_cache[:, 0]` 是 key 缓存,`paged_kv_cache[:, 1]` 是 value 缓存 -教程链接:FlashInfer 迁移 Baseline 实战 + + +#### 教程链接: + +FlashInfer 迁移 Baseline 实战 ### Track 2:FlashAttention 关键算子迁移与优化 @@ -705,4 +651,8 @@ MoE 的主要优势体现在预训练和训练阶段的算力效率上,但在 INT8 量化是一种用于减少模型大小和计算复杂度的方法,特别是在深度学习模型中。它通过将浮点数(通常是 FP32)转换为 8 位整数 (INT 8),从而减少内存使用和提高计算效率。 -教程链接:Fused MoE Baseline 入门:快速跑通最小闭环教程 + + +#### 教程链接: + +Fused MoE Baseline 入门:快速跑通最小闭环教程