forked from metax-maca/op_optimization
赛题二说明去掉算力券
This commit is contained in:
parent
2783cf5142
commit
f34ce724d2
|
|
@ -4,65 +4,7 @@
|
|||
|
||||
本赛题旨在提升国产 GPU 平台(如沐曦 MACA 平台)上的大模型推理核心算子性能,通过使用或构建 AI Agent / Skill 工作流,在国产 GPU(MACA 软件栈)上完成大模型推理核心算子库的迁移适配与性能突破。
|
||||
|
||||
### 环境准备
|
||||
|
||||
#### 开发环境设置
|
||||
|
||||
1. **在沐曦开发者社区领取算力券**
|
||||
|
||||
* 领取链接:[https://developer.metax-tech.com/activities/6](https://developer.metax-tech.com/activities/6)
|
||||
|
||||
* 登录平台
|
||||
|
||||

|
||||
|
||||
* 首次登录需要先进行注册(使用邮箱或者手机号进行注册)
|
||||
|
||||

|
||||
|
||||
* 登录成功后进行第二步-邮箱验证,填入自己的邮箱。
|
||||
|
||||

|
||||
|
||||
* 第三步,提交申请。
|
||||
|
||||

|
||||
|
||||
* 获得兑换码
|
||||
|
||||

|
||||
|
||||
2. **在模力方舟平台兑换算力券**
|
||||
|
||||
* 平台链接:[https://ai.gitee.com/](https://ai.gitee.com/)
|
||||
|
||||
* 1.登录模力方舟平台
|
||||
|
||||

|
||||
|
||||
* 2.进入费用中心 - 算力券 , 点击右上角“兑换”
|
||||
|
||||

|
||||
|
||||
3. **租用算力**
|
||||
|
||||
* 模力方舟算力市场链接:https://ai.gitee.com/compute
|
||||
|
||||
* 选择沐曦芯片厂商,并根据项目要求选择相应的配置。
|
||||
|
||||

|
||||
|
||||
4. **创建实例**
|
||||
|
||||
专属镜像文件:
|
||||
|
||||

|
||||
|
||||

|
||||
|
||||

|
||||
|
||||
进入算力容器,刚创建的实例默认开机状态,点击工具-lab开始项目创作。
|
||||
|
||||
## 二、任务方向
|
||||
|
||||
|
|
@ -221,9 +163,9 @@ flashInfer 将分页 KV Cache 视作一个**块稀疏矩阵**,并巧妙地
|
|||
|
||||
2. **`kv_layout`**:输入 K/V 张量的显存布局格式,可以是 `NHD` 或 `HND`。默认 **`'NHD'`**
|
||||
* NHD:`(seq_len, num_heads, head_dim)`
|
||||
|
||||
|
||||
* HND:`(num_heads, seq_len, head_dim)`
|
||||
|
||||
|
||||
3. **`backend`**:底层实现引擎。可选值包括 `auto`、`fa2`、`fa3`、`cudnn`、`cutlass` 或 `cute-dsl`,默认值为 `auto`。系统会根据显卡架构自动选择最优后端。其中 `cute-dsl` 是专为最新一代 Blackwell 架构(如 SM100+ 系列)准备的算子。
|
||||
|
||||
4. **`jit_args`** & **`jit_kwargs`**:用于即时编译(JIT, Just-In-Time)的参数列表和字典参数。如果提供,框架将会在运行时动态编译底层算子(手动实现算子);否则,直接使用预编译好的默认算子。
|
||||
|
|
@ -454,7 +396,11 @@ run(q: Tensor, paged_kv_cache: Tensor | Tuple[Tensor, Tensor], *args, q_scale: f
|
|||
|
||||
* 一个 5D 张量,形状为:`[max_num_pages, 2, page_size, num_kv_heads, head_dim]`,如果 `kv_layout` 是 `NHD`,以及 `[max_num_pages, 2, num_kv_heads, page_size, head_dim]`,如果 `kv_layout` 是 `HND`。其中 `paged_kv_cache[:, 0]` 是 key 缓存,`paged_kv_cache[:, 1]` 是 value 缓存
|
||||
|
||||
教程链接:<a href="https://gitlink.org.cn/metax-maca/op_optimization/tree/master/%E5%9F%BA%E4%BA%8EAI%20Agent%E5%BC%80%E5%8F%91%E8%8C%83%E5%BC%8F%E7%9A%84%E5%9B%BD%E4%BA%A7GPU%E5%A4%A7%E6%A8%A1%E5%9E%8B%E6%8E%A8%E7%90%86%E7%AE%97%E5%AD%90%E5%BA%93%E4%BC%98%E5%8C%96/FlashInfer%20%E8%BF%81%E7%A7%BB%20Baseline%20%E5%AE%9E%E6%88%98.md">FlashInfer 迁移 Baseline 实战</a>
|
||||
|
||||
|
||||
#### 教程链接:
|
||||
|
||||
<a href="https://gitlink.org.cn/metax-maca/op_optimization/tree/master/%E5%9F%BA%E4%BA%8EAI%20Agent%E5%BC%80%E5%8F%91%E8%8C%83%E5%BC%8F%E7%9A%84%E5%9B%BD%E4%BA%A7GPU%E5%A4%A7%E6%A8%A1%E5%9E%8B%E6%8E%A8%E7%90%86%E7%AE%97%E5%AD%90%E5%BA%93%E4%BC%98%E5%8C%96/FlashInfer%20%E8%BF%81%E7%A7%BB%20Baseline%20%E5%AE%9E%E6%88%98.md">FlashInfer 迁移 Baseline 实战</a>
|
||||
|
||||
### Track 2:FlashAttention 关键算子迁移与优化
|
||||
|
||||
|
|
@ -705,4 +651,8 @@ MoE 的主要优势体现在预训练和训练阶段的算力效率上,但在
|
|||
|
||||
INT8 量化是一种用于减少模型大小和计算复杂度的方法,特别是在深度学习模型中。它通过将浮点数(通常是 FP32)转换为 8 位整数 (INT 8),从而减少内存使用和提高计算效率。
|
||||
|
||||
教程链接:<a href="https://gitlink.org.cn/metax-maca/op_optimization/tree/master/%E5%9F%BA%E4%BA%8EAI%20Agent%E5%BC%80%E5%8F%91%E8%8C%83%E5%BC%8F%E7%9A%84%E5%9B%BD%E4%BA%A7GPU%E5%A4%A7%E6%A8%A1%E5%9E%8B%E6%8E%A8%E7%90%86%E7%AE%97%E5%AD%90%E5%BA%93%E4%BC%98%E5%8C%96/Fused%20MoE%20Baseline%E5%85%A5%E9%97%A8%EF%BC%9A%E5%BF%AB%E9%80%9F%E8%B7%91%E9%80%9A%E6%9C%80%E5%B0%8F%E9%97%AD%E7%8E%AF%E6%95%99%E7%A8%8B.md">Fused MoE Baseline 入门:快速跑通最小闭环教程</a>
|
||||
|
||||
|
||||
#### 教程链接:
|
||||
|
||||
<a href="https://gitlink.org.cn/metax-maca/op_optimization/tree/master/%E5%9F%BA%E4%BA%8EAI%20Agent%E5%BC%80%E5%8F%91%E8%8C%83%E5%BC%8F%E7%9A%84%E5%9B%BD%E4%BA%A7GPU%E5%A4%A7%E6%A8%A1%E5%9E%8B%E6%8E%A8%E7%90%86%E7%AE%97%E5%AD%90%E5%BA%93%E4%BC%98%E5%8C%96/Fused%20MoE%20Baseline%E5%85%A5%E9%97%A8%EF%BC%9A%E5%BF%AB%E9%80%9F%E8%B7%91%E9%80%9A%E6%9C%80%E5%B0%8F%E9%97%AD%E7%8E%AF%E6%95%99%E7%A8%8B.md">Fused MoE Baseline 入门:快速跑通最小闭环教程</a>
|
||||
|
|
|
|||
Loading…
Reference in New Issue