diff --git a/基于AI Agent开发范式的国产GPU大模型推理算子库优化/MCTLASS_Fused MoE 算子优化.md b/基于AI Agent开发范式的国产GPU大模型推理算子库优化/MCTLASS_Fused MoE 算子优化.md index be3dd01..c29c08d 100644 --- a/基于AI Agent开发范式的国产GPU大模型推理算子库优化/MCTLASS_Fused MoE 算子优化.md +++ b/基于AI Agent开发范式的国产GPU大模型推理算子库优化/MCTLASS_Fused MoE 算子优化.md @@ -158,7 +158,7 @@ EOF #克隆代码仓库 git clone https://gitlink.org.cn/metax-maca/op_optimization.git #切换到fused moe目录下benchmark项目 -cd op_optimization/基于AI\ Agent开发范式的国产GPU大模型推理算子库优化/operator_task_package/fused_moe_task_package/benchmark +cd op_optimization/基于AI Agent开发范式的国产GPU大模型推理算子库优化/operator_task_package/fused_moe_task_package/benchmark ``` @@ -333,23 +333,6 @@ bash scripts/run_fused_moe_i8_tn_benchmark.sh --backend all --warmup 5 --iters 2 本节的冒烟提交只用于验证函数接口、索引逻辑和提交流程;性能优化请在正确性通过后再进行。 -#### 提交前准备 - -##### 代码准备 - -建议在工作目录下保留一个候选版本目录,例如: - -```bash -mkdir -p oj/problem_1_fused_moe -``` - -本教程建议把 OJ 提交源码先保存为: - -```text -oj/problem_1_fused_moe/solution001.cu -``` - -真正提交时,只需要把这个文件里的内容复制到 XPU-OJ 提交框。 ##### 账号准备 @@ -400,11 +383,10 @@ Candidate 就是一次可复现的候选方案。 这样后续多次打榜时,不会忘记哪一版代码对应哪一次提交结果。 -### 步骤 7:实现 Fused MoE GEMM CUDA MACA 冒烟代码 +### 步骤 7:以 CUDA MACA 语言为例实现冒烟代码 -本节以当前 XPU-OJ 题目 **1. Fused MoE GEMM** 为例。 +本节以 CUDA MACA 语言为例介绍冒烟代码的编写方式,选手提交阶段可自行选择 Triton、CUDA MACA 或 TileLang 作为实现语言。 -题目要求你提交一份 CUDA 源码,并提供固定的 C 符号。评测程序会调用这个符号,并检查你是否把结果正确写入 `out`。 #### 接口约定 @@ -446,7 +428,7 @@ token(r) = token_ids[r] / topk expert(r) = expert_ids[r / 128] ``` -再说得直白一点: +注意: * `token_ids` 不是直接拿来当 `a` 的行号,要先除以 `topk`; @@ -734,7 +716,7 @@ extern "C" void run_kernel( 3. 进入比赛页面; [![image6](https://origin.picgo.net/2026/06/23/image6047f2ac4bd2a0f08.png)](https://www.picgo.net/image/image6.4ScJM4) -4. 找到题目: ```text1. Fused MoE GEMM``` +4. 找到题目: ```text1. Fused MoE i8 tn``` 5. 点击题目进入详情页;