修正 fused_moe 教程

This commit is contained in:
Xinyi Wu (i26343) - Application Ecology 2026-07-08 17:57:47 +08:00
parent 69def4e063
commit db044853c5
1 changed files with 30 additions and 4 deletions

View File

@ -812,13 +812,39 @@ bash scripts/run_fused_moe_i8_tn_benchmark.sh --backend all --warmup 5 --iters 2
```
6. **生成 OJ 提交代码**
```plaintext
我正在做 XPU-OJ 的 Fused MoE 算子优化题目,需要生成一个最小冒烟提交版本。
请根据下面接口写一份完整 Python 代码:
def run_kernel(a, b_col_major, scale_a, scale_b, moe_weights, token_ids, expert_ids, topk, out):
...
题目语义:
1. N = 128K = 128
2. EM = num_tokens * topk且 EM 是 128 的倍数;
3. token(r) = token_ids[r] // topk
4. expert(r) = expert_ids[r // 128]
5. b_col_major 的布局是 [expert, n, k]
6. 结果必须原地写入 out
7. out 的 dtype 是 bfloat16
8. 正确性优先,不需要优化性能。
代码要求:
1. 函数名和参数顺序必须完全一致;
2. 不要添加 torch.Tensor 类型注解;
3. 不要依赖外部文件;
4. 不要打印调试信息;
5. 不要返回新 tensor只写入 out
6. 请输出一份可以直接复制到 XPU-OJ 提交框的完整代码。
```
7. **KernelSwift 系统搜索算子**
```plaintext
请帮我在算子广场检索 fused_moe 算子
```
```plaintext
请帮我在算子广场检索 fused_moe 算子
```
## 九、常见问题与注意事项