修正 fused_moe 教程

This commit is contained in:
Xinyi Wu (i26343) - Application Ecology 2026-07-08 17:21:53 +08:00
parent bf17669650
commit 73fde4ea0f
1 changed files with 16 additions and 12 deletions

View File

@ -378,22 +378,26 @@ bash scripts/run_fused_moe_i8_tn_benchmark.sh --backend all --warmup 5 --iters 2
**目标:**理解 Benchmark  XPU-OJ 在线评测任务的不同完成从 Benchmark  XPU-OJ 提交的转换。
**操作:**
**操作:**
1. 厘清 Benchmark  XPU-OJ 的区别
赛事镜像中的 Benchmark 脚本用于理解目标算子的调用方式、输入输出 shape 和性能基线XPU-OJ 题包用于定义最终评测接口、数据范围、参考输出和精度要求。
| **维度** | **Benchmark 脚本** | **XPU-OJ 提交** |
| --- | --- | --- |
| **目的** | 理解算子接口、建立性能基线 | 统一环境下的正确性+性能评测 |
| **接口形式** | Python API | 三种接口供选择CUDA Maca`extern "C"`、TileLangPython `@jit`)和 TritonPython `@triton.jit` |
| **函数签名** | `backend_fn(...)` | `run_kernel(...)` |
| **数据范围** | 多种 head\_dim / batch\_size / seq\_len 组合 | 固定参数范围(以题包为准) |
| **验证** | 无自动正确性校验,人工对比输出数值 | 强制通过 `torch.allclose(rtol=2e-2, atol=5e-3)` |
| **输出** | 终端直接输出 | 排行榜得分 |
<center>
<table border="1" style="border-collapse: collapse; width: 100%; text-align: left;">
<tr style="background-color: #f2f2f2;"><th style="padding: 8px;">维度
<th style="padding: 8px;">Benchmark 脚本
<th style="padding: 8px;">XPU-OJ 提交
目的理解算子接口、建立性能基线统一环境下的正确性+性能评测
接口形式Python API三种接口供选择CUDA Maca`extern "C"`、TileLangPython `@jit`)和 TritonPython `@triton.jit`
函数签名`backend_fn(...)``run_kernel(...)`
数据范围多种 head_dim / batch_size / seq_len 组合固定参数范围(以题包为准)
验证无自动正确性校验,人工对比输出数值强制通过 `torch.allclose(rtol=2e-2, atol=5e-3)`
输出终端直接输出排行榜得分
</center>
2. 理解完成 benchmark 验证并成功建立性能基线后需要完成以下转换
@ -554,7 +558,7 @@ bash scripts/run_fused_moe_i8_tn_benchmark.sh --backend all --warmup 5 --iters 2
| $T_k<T_h$ | 大于 100  | 超越理论估算可能因估算偏保守 |
| $T_k≫T_b$ | 接近 0 分 | 远慢于 Baseline |
#### Step 13:榜单查看与优化方向
#### Step 11:榜单查看与优化方向
**目标:**掌握榜单查看方法,了解自身排名位置,并制定针对性的代码优化策略。