diff --git a/基于AI Agent开发范式的国产GPU大模型推理算子库优化/Fused MoE 算子入门:从 Benchmark 验证到 XPU-OJ 接口提交.md b/基于AI Agent开发范式的国产GPU大模型推理算子库优化/Fused MoE 算子入门:从 Benchmark 验证到 XPU-OJ 接口提交.md index f06eb9d..aa5bcc2 100644 --- a/基于AI Agent开发范式的国产GPU大模型推理算子库优化/Fused MoE 算子入门:从 Benchmark 验证到 XPU-OJ 接口提交.md +++ b/基于AI Agent开发范式的国产GPU大模型推理算子库优化/Fused MoE 算子入门:从 Benchmark 验证到 XPU-OJ 接口提交.md @@ -379,9 +379,8 @@ bash scripts/run_fused_moe_i8_tn_benchmark.sh --backend all --warmup 5 --iters 2 **操作:** -1. 厘清 Benchmark 和 XPU-OJ 的区别: - -赛事镜像中的 Benchmark 脚本用于理解目标算子的调用方式、输入输出 shape 和性能基线;XPU-OJ 题包用于定义最终评测接口、数据范围、参考输出和精度要求。 +1. 厘清 Benchmark 和 XPU-OJ 的区别:赛事镜像中的 Benchmark 脚本用于理解目标算子的调用方式、输入输出 shape 和性能基线;XPU-OJ 题包用于定义最终评测接口、数据范围、参考输出和精度要求。 + | 维度 | Benchmark 脚本 | XPU-OJ 提交 | | :--- | :--- | :--- | @@ -395,12 +394,12 @@ bash scripts/run_fused_moe_i8_tn_benchmark.sh --backend all --warmup 5 --iters 2 2. 理解完成 benchmark 验证并成功建立性能基线后,需要完成以下转换: - 1. 从 benchmark 脚本中理解目标 API; - 2. 在对应 OJ 平台【题目描述】中查看 `run_kernel(...)` 接口; - 3. 对照 OJ 平台【题目描述】中的输入 shape、数据范围和精度要求; - 4. 编写自己的 `run_kernel(...)`; - 5. 在 OJ 平台提交 `run_kernel(...)`,先通过正确性校验; - 6. 正确性通过后,再对比 benchmark 耗时 / OJ 耗时继续优化。 + a. 从 benchmark 脚本中理解目标 API; + b. 在对应 OJ 平台【题目描述】中查看 `run_kernel(...)` 接口; + c. 对照 OJ 平台【题目描述】中的输入 shape、数据范围和精度要求; + d. 编写自己的 `run_kernel(...)`; + e. 在 OJ 平台提交 `run_kernel(...)`,先通过正确性; + f. 正确性通过后,再对比 benchmark 耗时 / OJ 耗时继续优化。 #### Step 7:登录 XPU-OJ 平台并进入题目页面