2.3 KiB
2.3 KiB
算子优化参考知识库
本目录面向后续不同算子的优化工作,不以某一个算子为中心。内容分为通用方法、
MetaX C500 架构、TileLang/CUDA MACA 后端、性能分析、优化模式、失败案例和
可复用模板。flashinfer_ragged_prefill 是第一个完整案例。
使用入口
新算子从以下顺序开始:
- 复制
08_templates/new_operator_checklist.md建立任务清单。 - 阅读
01_methodology/operator_optimization_lifecycle.md。 - 根据
01_methodology/performance_modeling.md建立 FLOPs、字节数和资源预算。 - 按
04_profiling/profiling_workflow.md收集证据。 - 每个候选填写
08_templates/experiment_record.md,不得只记录成功版本。 - 使用
01_methodology/optimization_decision_tree.md选择下一步。
内容可信度
架构和工具信息使用以下标签:
OFFICIAL:来自官方文档或安装包源码。RUNTIME:来自当前设备 API、mx-smi或工具输出。COMPILER:来自生成代码或编译器资源报告。PROFILE:来自 mcTracer/mcProfiler 实测。INFERENCE:根据证据推断,仍需实验验证。
容器显存容量、切片比例、驱动版本属于环境事实,不自动等于芯片固定规格。
维护规则
- 原始代码、日志、JSON、CSV 和 PDF 保留在各算子项目中;本库只保存方法、 结论和索引,避免复制后出现多个不一致版本。
- 版本结论必须标明
retained、rejected、inconclusive或failed。 - 性能结论必须给出原始 kernel 时间、测量环境、样本数和比较基线。
- 不在文档中记录 SSH 密码、访问令牌或其他凭据。
- TileLang 优化必须同时检查 DSL、生成 CU 和设备指标。
目录
01_methodology 通用优化生命周期、性能模型和决策树
02_architecture MetaX C500 执行模型、存储和资源事实
03_backends TileLang 与 CUDA MACA 编程/编译经验
04_profiling mcTracer、mcProfiler 和指标解释
05_optimization_patterns 可跨算子复用的优化模式
06_failure_catalog 编译、正确性、性能和测量失败
07_case_studies 完整算子案例
08_templates 新任务和实验记录模板
09_artifact_index 原始资料位置索引