diff --git a/基于AI Agent开发范式的国产GPU大模型推理算子库优化/Fused MoE 算子入门:从 Benchmark 验证到 XPU-OJ 接口提交.md b/基于AI Agent开发范式的国产GPU大模型推理算子库优化/Fused MoE 算子入门:从 Benchmark 验证到 XPU-OJ 接口提交.md index 709a259..760f983 100644 --- a/基于AI Agent开发范式的国产GPU大模型推理算子库优化/Fused MoE 算子入门:从 Benchmark 验证到 XPU-OJ 接口提交.md +++ b/基于AI Agent开发范式的国产GPU大模型推理算子库优化/Fused MoE 算子入门:从 Benchmark 验证到 XPU-OJ 接口提交.md @@ -812,13 +812,39 @@ bash scripts/run_fused_moe_i8_tn_benchmark.sh --backend all --warmup 5 --iters 2 ``` 6. **生成 OJ 提交代码** + + ```plaintext + 我正在做 XPU-OJ 的 Fused MoE 算子优化题目,需要生成一个最小冒烟提交版本。 + + 请根据下面接口写一份完整 Python 代码: + + def run_kernel(a, b_col_major, scale_a, scale_b, moe_weights, token_ids, expert_ids, topk, out): + ... + + 题目语义: + 1. N = 128,K = 128; + 2. EM = num_tokens * topk,且 EM 是 128 的倍数; + 3. token(r) = token_ids[r] // topk; + 4. expert(r) = expert_ids[r // 128]; + 5. b_col_major 的布局是 [expert, n, k]; + 6. 结果必须原地写入 out; + 7. out 的 dtype 是 bfloat16; + 8. 正确性优先,不需要优化性能。 + + 代码要求: + 1. 函数名和参数顺序必须完全一致; + 2. 不要添加 torch.Tensor 类型注解; + 3. 不要依赖外部文件; + 4. 不要打印调试信息; + 5. 不要返回新 tensor,只写入 out; + 6. 请输出一份可以直接复制到 XPU-OJ 提交框的完整代码。 + ``` 7. **KernelSwift 系统搜索算子** - -```plaintext -请帮我在算子广场检索 fused_moe 算子 -``` + ```plaintext + 请帮我在算子广场检索 fused_moe 算子 + ``` ## 九、常见问题与注意事项