修正 fused_moe 教程

This commit is contained in:
Xinyi Wu (i26343) - Application Ecology 2026-07-08 17:23:17 +08:00
parent 73fde4ea0f
commit 72bebcf3d4
1 changed files with 11 additions and 17 deletions

View File

@ -379,25 +379,19 @@ bash scripts/run_fused_moe_i8_tn_benchmark.sh --backend all --warmup 5 --iters 2
**目标:**理解 Benchmark  XPU-OJ 在线评测任务的不同完成从 Benchmark  XPU-OJ 提交的转换。
**操作:**
1. 厘清 Benchmark 和 XPU-OJ 的区别:
1. 厘清 Benchmark  XPU-OJ 的区别
赛事镜像中的 Benchmark 脚本用于理解目标算子的调用方式、输入输出 shape 和性能基线XPU-OJ 题包用于定义最终评测接口、数据范围、参考输出和精度要求。
<center>
<table border="1" style="border-collapse: collapse; width: 100%; text-align: left;">
<tr style="background-color: #f2f2f2;"><th style="padding: 8px;">维度
<th style="padding: 8px;">Benchmark 脚本
<th style="padding: 8px;">XPU-OJ 提交
赛事镜像中的 Benchmark 脚本用于理解目标算子的调用方式、输入输出 shape 和性能基线XPU-OJ 题包用于定义最终评测接口、数据范围、参考输出和精度要求。
目的理解算子接口、建立性能基线统一环境下的正确性+性能评测
接口形式Python API三种接口供选择CUDA Maca`extern "C"`、TileLangPython `@jit`)和 TritonPython `@triton.jit`
函数签名`backend_fn(...)``run_kernel(...)`
数据范围多种 head_dim / batch_size / seq_len 组合固定参数范围(以题包为准)
验证无自动正确性校验,人工对比输出数值强制通过 `torch.allclose(rtol=2e-2, atol=5e-3)`
输出终端直接输出排行榜得分
</center>
| 维度 | Benchmark 脚本 | XPU-OJ 提交 |
| :--- | :--- | :--- |
| **目的** | 理解算子接口、建立性能基线 | 统一环境下的正确性+性能评测 |
| **接口形式** | Python API | 三种接口供选择CUDA Maca`extern "C"`、TileLangPython `@jit`)和 TritonPython `@triton.jit` |
| **函数签名** | `backend_fn(...)` | `run_kernel(...)` |
| **数据范围** | 多种 head_dim / batch_size / seq_len 组合 | 固定参数范围(以题包为准) |
| **验证** | 无自动正确性校验,人工对比输出数值 | 强制通过 `torch.allclose(rtol=2e-2, atol=5e-3)` |
| **输出** | 终端直接输出 | 排行榜得分 |
2. 理解完成 benchmark 验证并成功建立性能基线后需要完成以下转换