forked from metax-maca/op_optimization
修改教程
This commit is contained in:
parent
b132af5648
commit
4fc75e51fa
|
|
@ -158,7 +158,7 @@ EOF
|
|||
#克隆代码仓库
|
||||
git clone https://gitlink.org.cn/metax-maca/op_optimization.git
|
||||
#切换到fused moe目录下benchmark项目
|
||||
cd op_optimization/基于AI\ Agent开发范式的国产GPU大模型推理算子库优化/operator_task_package/fused_moe_task_package/benchmark
|
||||
cd op_optimization/基于AI Agent开发范式的国产GPU大模型推理算子库优化/operator_task_package/fused_moe_task_package/benchmark
|
||||
```
|
||||
|
||||
|
||||
|
|
@ -333,23 +333,6 @@ bash scripts/run_fused_moe_i8_tn_benchmark.sh --backend all --warmup 5 --iters 2
|
|||
|
||||
本节的冒烟提交只用于验证函数接口、索引逻辑和提交流程;性能优化请在正确性通过后再进行。
|
||||
|
||||
#### 提交前准备
|
||||
|
||||
##### 代码准备
|
||||
|
||||
建议在工作目录下保留一个候选版本目录,例如:
|
||||
|
||||
```bash
|
||||
mkdir -p oj/problem_1_fused_moe
|
||||
```
|
||||
|
||||
本教程建议把 OJ 提交源码先保存为:
|
||||
|
||||
```text
|
||||
oj/problem_1_fused_moe/solution001.cu
|
||||
```
|
||||
|
||||
真正提交时,只需要把这个文件里的内容复制到 XPU-OJ 提交框。
|
||||
|
||||
##### 账号准备
|
||||
|
||||
|
|
@ -400,11 +383,10 @@ Candidate 就是一次可复现的候选方案。
|
|||
|
||||
这样后续多次打榜时,不会忘记哪一版代码对应哪一次提交结果。
|
||||
|
||||
### 步骤 7:实现 Fused MoE GEMM CUDA MACA 冒烟代码
|
||||
### 步骤 7:以 CUDA MACA 语言为例实现冒烟代码
|
||||
|
||||
本节以当前 XPU-OJ 题目 **1. Fused MoE GEMM** 为例。
|
||||
本节以 CUDA MACA 语言为例介绍冒烟代码的编写方式,选手提交阶段可自行选择 Triton、CUDA MACA 或 TileLang 作为实现语言。
|
||||
|
||||
题目要求你提交一份 CUDA 源码,并提供固定的 C 符号。评测程序会调用这个符号,并检查你是否把结果正确写入 `out`。
|
||||
|
||||
#### 接口约定
|
||||
|
||||
|
|
@ -446,7 +428,7 @@ token(r) = token_ids[r] / topk
|
|||
expert(r) = expert_ids[r / 128]
|
||||
```
|
||||
|
||||
再说得直白一点:
|
||||
注意:
|
||||
|
||||
* `token_ids` 不是直接拿来当 `a` 的行号,要先除以 `topk`;
|
||||
|
||||
|
|
@ -734,7 +716,7 @@ extern "C" void run_kernel(
|
|||
|
||||
3. 进入比赛页面; [](https://www.picgo.net/image/image6.4ScJM4)
|
||||
|
||||
4. 找到题目: ```text1. Fused MoE GEMM```
|
||||
4. 找到题目: ```text1. Fused MoE i8 tn```
|
||||
|
||||
5. 点击题目进入详情页;
|
||||
|
||||
|
|
|
|||
Loading…
Reference in New Issue