operator_task_package/ref
chenxizhu a82453ba53 update 2026-08-03 05:32:37 +00:00
..
01_methodology update mla 2026-07-18 01:47:50 +00:00
02_architecture/metax_c500 update mla 2026-07-18 01:47:50 +00:00
03_backends update mla 2026-07-18 01:47:50 +00:00
04_profiling update mla 2026-07-18 01:47:50 +00:00
05_optimization_patterns update mla 2026-07-18 01:47:50 +00:00
06_failure_catalog update mla 2026-07-18 01:47:50 +00:00
07_case_studies/flashinfer_ragged_prefill update mla 2026-07-18 01:47:50 +00:00
08_templates update mla 2026-07-18 01:47:50 +00:00
09_artifact_index update 2026-08-03 05:32:37 +00:00
README.md update mla 2026-07-18 01:47:50 +00:00

README.md

算子优化参考知识库

本目录面向后续不同算子的优化工作,不以某一个算子为中心。内容分为通用方法、 MetaX C500 架构、TileLang/CUDA MACA 后端、性能分析、优化模式、失败案例和 可复用模板。flashinfer_ragged_prefill 是第一个完整案例。

使用入口

新算子从以下顺序开始:

  1. 复制 08_templates/new_operator_checklist.md 建立任务清单。
  2. 阅读 01_methodology/operator_optimization_lifecycle.md
  3. 根据 01_methodology/performance_modeling.md 建立 FLOPs、字节数和资源预算。
  4. 04_profiling/profiling_workflow.md 收集证据。
  5. 每个候选填写 08_templates/experiment_record.md,不得只记录成功版本。
  6. 使用 01_methodology/optimization_decision_tree.md 选择下一步。

内容可信度

架构和工具信息使用以下标签:

  • OFFICIAL:来自官方文档或安装包源码。
  • RUNTIME:来自当前设备 API、mx-smi 或工具输出。
  • COMPILER:来自生成代码或编译器资源报告。
  • PROFILE:来自 mcTracer/mcProfiler 实测。
  • INFERENCE:根据证据推断,仍需实验验证。

容器显存容量、切片比例、驱动版本属于环境事实,不自动等于芯片固定规格。

维护规则

  • 原始代码、日志、JSON、CSV 和 PDF 保留在各算子项目中;本库只保存方法、 结论和索引,避免复制后出现多个不一致版本。
  • 版本结论必须标明 retainedrejectedinconclusivefailed
  • 性能结论必须给出原始 kernel 时间、测量环境、样本数和比较基线。
  • 不在文档中记录 SSH 密码、访问令牌或其他凭据。
  • TileLang 优化必须同时检查 DSL、生成 CU 和设备指标。

目录

01_methodology       通用优化生命周期、性能模型和决策树
02_architecture      MetaX C500 执行模型、存储和资源事实
03_backends          TileLang 与 CUDA MACA 编程/编译经验
04_profiling         mcTracer、mcProfiler 和指标解释
05_optimization_patterns  可跨算子复用的优化模式
06_failure_catalog   编译、正确性、性能和测量失败
07_case_studies      完整算子案例
08_templates         新任务和实验记录模板
09_artifact_index    原始资料位置索引