From db044853c5f120eff8e66ddf0714b6b9be9e4c2e Mon Sep 17 00:00:00 2001 From: "Xinyi Wu (i26343) - Application Ecology" Date: Wed, 8 Jul 2026 17:57:47 +0800 Subject: [PATCH] =?UTF-8?q?=E4=BF=AE=E6=AD=A3=20fused=5Fmoe=20=E6=95=99?= =?UTF-8?q?=E7=A8=8B?= MIME-Version: 1.0 Content-Type: text/plain; charset=UTF-8 Content-Transfer-Encoding: 8bit --- ...Benchmark 验证到 XPU-OJ 接口提交.md | 34 ++++++++++++++++--- 1 file changed, 30 insertions(+), 4 deletions(-) diff --git a/基于AI Agent开发范式的国产GPU大模型推理算子库优化/Fused MoE 算子入门:从 Benchmark 验证到 XPU-OJ 接口提交.md b/基于AI Agent开发范式的国产GPU大模型推理算子库优化/Fused MoE 算子入门:从 Benchmark 验证到 XPU-OJ 接口提交.md index 709a259..760f983 100644 --- a/基于AI Agent开发范式的国产GPU大模型推理算子库优化/Fused MoE 算子入门:从 Benchmark 验证到 XPU-OJ 接口提交.md +++ b/基于AI Agent开发范式的国产GPU大模型推理算子库优化/Fused MoE 算子入门:从 Benchmark 验证到 XPU-OJ 接口提交.md @@ -812,13 +812,39 @@ bash scripts/run_fused_moe_i8_tn_benchmark.sh --backend all --warmup 5 --iters 2 ``` 6. **生成 OJ 提交代码** + + ```plaintext + 我正在做 XPU-OJ 的 Fused MoE 算子优化题目,需要生成一个最小冒烟提交版本。 + + 请根据下面接口写一份完整 Python 代码: + + def run_kernel(a, b_col_major, scale_a, scale_b, moe_weights, token_ids, expert_ids, topk, out): + ... + + 题目语义: + 1. N = 128,K = 128; + 2. EM = num_tokens * topk,且 EM 是 128 的倍数; + 3. token(r) = token_ids[r] // topk; + 4. expert(r) = expert_ids[r // 128]; + 5. b_col_major 的布局是 [expert, n, k]; + 6. 结果必须原地写入 out; + 7. out 的 dtype 是 bfloat16; + 8. 正确性优先,不需要优化性能。 + + 代码要求: + 1. 函数名和参数顺序必须完全一致; + 2. 不要添加 torch.Tensor 类型注解; + 3. 不要依赖外部文件; + 4. 不要打印调试信息; + 5. 不要返回新 tensor,只写入 out; + 6. 请输出一份可以直接复制到 XPU-OJ 提交框的完整代码。 + ``` 7. **KernelSwift 系统搜索算子** - -```plaintext -请帮我在算子广场检索 fused_moe 算子 -``` + ```plaintext + 请帮我在算子广场检索 fused_moe 算子 + ``` ## 九、常见问题与注意事项