diff --git a/基于AI Agent开发范式的国产GPU大模型推理算子库优化/Fused MoE 算子入门:从 Benchmark 验证到 XPU-OJ 接口提交.md b/基于AI Agent开发范式的国产GPU大模型推理算子库优化/Fused MoE 算子入门:从 Benchmark 验证到 XPU-OJ 接口提交.md index 4d4fc16..a65fbbf 100644 --- a/基于AI Agent开发范式的国产GPU大模型推理算子库优化/Fused MoE 算子入门:从 Benchmark 验证到 XPU-OJ 接口提交.md +++ b/基于AI Agent开发范式的国产GPU大模型推理算子库优化/Fused MoE 算子入门:从 Benchmark 验证到 XPU-OJ 接口提交.md @@ -378,22 +378,26 @@ bash scripts/run_fused_moe_i8_tn_benchmark.sh --backend all --warmup 5 --iters 2 **目标:**理解 Benchmark 和 XPU-OJ 在线评测任务的不同,完成从 Benchmark 到 XPU-OJ 提交的转换。 -**操作:** - +**操作:** 1. 厘清 Benchmark 和 XPU-OJ 的区别: 赛事镜像中的 Benchmark 脚本用于理解目标算子的调用方式、输入输出 shape 和性能基线;XPU-OJ 题包用于定义最终评测接口、数据范围、参考输出和精度要求。 -| **维度** | **Benchmark 脚本** | **XPU-OJ 提交** | -| --- | --- | --- | -| **目的** | 理解算子接口、建立性能基线 | 统一环境下的正确性+性能评测 | -| **接口形式** | Python API | 三种接口供选择:CUDA Maca(`extern "C"`)、TileLang(Python `@jit`)和 Triton(Python `@triton.jit`) | -| **函数签名** | `backend_fn(...)` | `run_kernel(...)` | -| **数据范围** | 多种 head\_dim / batch\_size / seq\_len 组合 | 固定参数范围(以题包为准) | -| **验证** | 无自动正确性校验,人工对比输出数值 | 强制通过 `torch.allclose(rtol=2e-2, atol=5e-3)` | -| **输出** | 终端直接输出 | 排行榜得分 | - +
+ +
维度 +Benchmark 脚本 +XPU-OJ 提交 + +目的理解算子接口、建立性能基线统一环境下的正确性+性能评测 +接口形式Python API三种接口供选择:CUDA Maca(`extern "C"`)、TileLang(Python `@jit`)和 Triton(Python `@triton.jit`) +函数签名`backend_fn(...)``run_kernel(...)` +数据范围多种 head_dim / batch_size / seq_len 组合固定参数范围(以题包为准) +验证无自动正确性校验,人工对比输出数值强制通过 `torch.allclose(rtol=2e-2, atol=5e-3)` +输出终端直接输出排行榜得分 + + 2. 理解完成 benchmark 验证并成功建立性能基线后,需要完成以下转换: @@ -554,7 +558,7 @@ bash scripts/run_fused_moe_i8_tn_benchmark.sh --backend all --warmup 5 --iters 2 | $T_k