forked from metax-maca/op_optimization
修正 fused_moe 教程
This commit is contained in:
parent
73fde4ea0f
commit
72bebcf3d4
|
|
@ -379,25 +379,19 @@ bash scripts/run_fused_moe_i8_tn_benchmark.sh --backend all --warmup 5 --iters 2
|
|||
**目标:**理解 Benchmark 和 XPU-OJ 在线评测任务的不同,完成从 Benchmark 到 XPU-OJ 提交的转换。
|
||||
|
||||
**操作:**
|
||||
|
||||
1. 厘清 Benchmark 和 XPU-OJ 的区别:
|
||||
|
||||
1. 厘清 Benchmark 和 XPU-OJ 的区别:
|
||||
|
||||
赛事镜像中的 Benchmark 脚本用于理解目标算子的调用方式、输入输出 shape 和性能基线;XPU-OJ 题包用于定义最终评测接口、数据范围、参考输出和精度要求。
|
||||
|
||||
<center>
|
||||
<table border="1" style="border-collapse: collapse; width: 100%; text-align: left;">
|
||||
<tr style="background-color: #f2f2f2;"><th style="padding: 8px;">维度
|
||||
<th style="padding: 8px;">Benchmark 脚本
|
||||
<th style="padding: 8px;">XPU-OJ 提交
|
||||
赛事镜像中的 Benchmark 脚本用于理解目标算子的调用方式、输入输出 shape 和性能基线;XPU-OJ 题包用于定义最终评测接口、数据范围、参考输出和精度要求。
|
||||
|
||||
目的理解算子接口、建立性能基线统一环境下的正确性+性能评测
|
||||
接口形式Python API三种接口供选择:CUDA Maca(`extern "C"`)、TileLang(Python `@jit`)和 Triton(Python `@triton.jit`)
|
||||
函数签名`backend_fn(...)``run_kernel(...)`
|
||||
数据范围多种 head_dim / batch_size / seq_len 组合固定参数范围(以题包为准)
|
||||
验证无自动正确性校验,人工对比输出数值强制通过 `torch.allclose(rtol=2e-2, atol=5e-3)`
|
||||
输出终端直接输出排行榜得分
|
||||
|
||||
</center>
|
||||
| 维度 | Benchmark 脚本 | XPU-OJ 提交 |
|
||||
| :--- | :--- | :--- |
|
||||
| **目的** | 理解算子接口、建立性能基线 | 统一环境下的正确性+性能评测 |
|
||||
| **接口形式** | Python API | 三种接口供选择:CUDA Maca(`extern "C"`)、TileLang(Python `@jit`)和 Triton(Python `@triton.jit`) |
|
||||
| **函数签名** | `backend_fn(...)` | `run_kernel(...)` |
|
||||
| **数据范围** | 多种 head_dim / batch_size / seq_len 组合 | 固定参数范围(以题包为准) |
|
||||
| **验证** | 无自动正确性校验,人工对比输出数值 | 强制通过 `torch.allclose(rtol=2e-2, atol=5e-3)` |
|
||||
| **输出** | 终端直接输出 | 排行榜得分 |
|
||||
|
||||
|
||||
2. 理解完成 benchmark 验证并成功建立性能基线后,需要完成以下转换:
|
||||
|
|
|
|||
Loading…
Reference in New Issue