xiangchenCheng
  • Joined on 2026-07-17
51b410663a fix(moe_topk_sum_group_idx): Manifest 参数补 kw_only 与默认值
xiangchenCheng created pull request ccf-ai-infra/TileOPs-Metax#49 2026-08-06 01:05:12 +08:00
[moe_topk_sum_group_idx] feat: 新增 MetaX C500 分组 top-k 选择算子实现
2db726ee35 perf(moe_topk_sum_group_idx): 组间排名仅在轮数真的更少时才分摊
973e5709d6 perf(moe_topk_sum_group_idx): 组间排名改为 lane-striped 分摊
147476d886 refactor(moe_topk_sum_group_idx): wavefront 数接入 default_config 协议
07b5b65ccb test(moe_topk_sum_group_idx): 零 token 路径断言未构造 kernel
a1008fab85 test(moe_topk_sum_group_idx): 用手算值独立锚定 PyTorch oracle
Compare 30 commits »
5e1754b6e3 perf(moe_topk_sum_group_idx): 组间排名仅在轮数真的更少时才分摊
e621a32dbc perf(moe_topk_sum_group_idx): 组间排名改为 lane-striped 分摊
4876fe1e46 refactor(moe_topk_sum_group_idx): wavefront 数接入 default_config 协议
0949965e40 test(moe_topk_sum_group_idx): 零 token 路径断言未构造 kernel
c235e43c3f test(moe_topk_sum_group_idx): 用手算值独立锚定 PyTorch oracle
Compare 2 commits »
2558eb6379 test(moe_topk_sum_group_idx): 锁定 lane 覆盖不变量与混合同分稳定性
68a25bd7f5 perf(moe_topk_sum_group_idx): shared 访问改为对角线 swizzle 消除 bank 冲突
84f46b7200 perf(moe_topk_sum_group_idx): 组间排名改为无分支计数
1f08cb9ffe style(moe_topk_sum_group_idx): kernel builder 缓存改用仓库默认 maxsize
fdf426d2a3 feat(moe_topk_sum_group_idx): Manifest 转 implemented 并登记 kernel_map
4370f2e4b9 fix(moe_topk_sum_group_idx): eval_roofline 对齐 Manifest 的 flops 公式
c988048e64 fix(moe_topk_sum_group_idx): 基准跟随 Manifest 的 scores_shape 契约
9856b6e7ea perf(moe_topk_sum_group_idx): lane 映射改为 group x expert 分块
Compare 16 commits »
1f08cb9ffe style(moe_topk_sum_group_idx): kernel builder 缓存改用仓库默认 maxsize
fdf426d2a3 feat(moe_topk_sum_group_idx): Manifest 转 implemented 并登记 kernel_map
4370f2e4b9 fix(moe_topk_sum_group_idx): eval_roofline 对齐 Manifest 的 flops 公式
c988048e64 fix(moe_topk_sum_group_idx): 基准跟随 Manifest 的 scores_shape 契约
9856b6e7ea perf(moe_topk_sum_group_idx): lane 映射改为 group x expert 分块
Compare 16 commits »
d00d27a589 style(moe_topk_sum_group_idx): kernel builder 缓存改用仓库默认 maxsize
f333fcf387 feat(moe_topk_sum_group_idx): Manifest 转 implemented 并登记 kernel_map
9586117f1b fix(moe_topk_sum_group_idx): eval_roofline 对齐 Manifest 的 flops 公式
7e1790b28f fix(moe_topk_sum_group_idx): 基准跟随 Manifest 的 scores_shape 契约
d339d36621 perf(moe_topk_sum_group_idx): lane 映射改为 group x expert 分块
Compare 11 commits »
d00d27a589 style(moe_topk_sum_group_idx): kernel builder 缓存改用仓库默认 maxsize
f333fcf387 feat(moe_topk_sum_group_idx): Manifest 转 implemented 并登记 kernel_map
9586117f1b fix(moe_topk_sum_group_idx): eval_roofline 对齐 Manifest 的 flops 公式
Compare 3 commits »
7e1790b28f fix(moe_topk_sum_group_idx): 基准跟随 Manifest 的 scores_shape 契约
d339d36621 perf(moe_topk_sum_group_idx): lane 映射改为 group x expert 分块
d4546e4179 perf(moe_topk_sum_group_idx): 每 block 2 个 token-warp 填满 C500 wavefront
a4d099c376 fix(moe_topk_sum_group_idx): 基准记录真实 PyTorch 基线
0c3db066a4 fix(moe_topk_sum_group_idx): 统一基准基线标签
Compare 9 commits »
1f96637009 perf(moe_topk_sum_group_idx): lane 映射改为 group x expert 分块
81128f2853 perf(moe_topk_sum_group_idx): 每 block 2 个 token-warp 填满 C500 wavefront
076ba3eca7 fix(moe_topk_sum_group_idx): 基准记录真实 PyTorch 基线
7f65843f50 fix(moe_topk_sum_group_idx): 统一基准基线标签
f9bda756d3 bench(moe_topk_sum_group_idx): 添加 C500 性能基准
d8ae2a0fed feat(moe_topk_sum_group_idx): 迁移 C500 TileLang Kernel
Compare 30 commits »
e2f0b0c647 [moe_topk_sum_group_idx] feat: 按 review 改进 workloads/roofline/bench 契约
92ee4bdd54 [PR A] 确认规范,同意合并
Compare 2 commits »
xiangchenCheng created pull request ccf-ai-infra/TileOPs-Metax#31 2026-08-04 11:13:47 +08:00
[moe_topk_sum_group_idx] feat: 新增 spec-only Manifest
2b0f5bd3d7 [moe_topk_sum_group_idx] feat: 新增 spec-only Manifest
4efe72d12e [PR A] 确认规范,同意合并
81a39fda24 [quant_per_channel_cast_fused] feat: 完善 4 variant(shape_rules/roofline/workloads 按队友 review 改进)
76af4399a8 [quant_per_channel_cast_fused] feat: 补充 gather + rescale+expand variant(完整 4 种输入场景)
3519c7186b [quant_per_channel_cast_fused] feat: 补充 gather/expand variant(pos_to_token 场景)
Compare 23 commits »