forked from metax-maca/op_optimization
修正 fused_moe 教程
This commit is contained in:
parent
69def4e063
commit
db044853c5
|
|
@ -812,13 +812,39 @@ bash scripts/run_fused_moe_i8_tn_benchmark.sh --backend all --warmup 5 --iters 2
|
|||
```
|
||||
|
||||
6. **生成 OJ 提交代码**
|
||||
|
||||
```plaintext
|
||||
我正在做 XPU-OJ 的 Fused MoE 算子优化题目,需要生成一个最小冒烟提交版本。
|
||||
|
||||
请根据下面接口写一份完整 Python 代码:
|
||||
|
||||
def run_kernel(a, b_col_major, scale_a, scale_b, moe_weights, token_ids, expert_ids, topk, out):
|
||||
...
|
||||
|
||||
题目语义:
|
||||
1. N = 128,K = 128;
|
||||
2. EM = num_tokens * topk,且 EM 是 128 的倍数;
|
||||
3. token(r) = token_ids[r] // topk;
|
||||
4. expert(r) = expert_ids[r // 128];
|
||||
5. b_col_major 的布局是 [expert, n, k];
|
||||
6. 结果必须原地写入 out;
|
||||
7. out 的 dtype 是 bfloat16;
|
||||
8. 正确性优先,不需要优化性能。
|
||||
|
||||
代码要求:
|
||||
1. 函数名和参数顺序必须完全一致;
|
||||
2. 不要添加 torch.Tensor 类型注解;
|
||||
3. 不要依赖外部文件;
|
||||
4. 不要打印调试信息;
|
||||
5. 不要返回新 tensor,只写入 out;
|
||||
6. 请输出一份可以直接复制到 XPU-OJ 提交框的完整代码。
|
||||
```
|
||||
|
||||
7. **KernelSwift 系统搜索算子**
|
||||
|
||||
|
||||
```plaintext
|
||||
请帮我在算子广场检索 fused_moe 算子
|
||||
```
|
||||
```plaintext
|
||||
请帮我在算子广场检索 fused_moe 算子
|
||||
```
|
||||
|
||||
## 九、常见问题与注意事项
|
||||
|
||||
|
|
|
|||
Loading…
Reference in New Issue