operator_task_package/ref/04_profiling/profiling_workflow.md

926 B
Raw Permalink Blame History

性能分析工作流

1. 稳定基线

TileLang/CUDA kernel 单独运行JIT 和输入生成在计时外。记录 median/P10/P90、 样本数、warmup 和环境快照。

2. 资源与生成代码

先获得 grid/block/shared/register/private再看主循环 CU。资源超限或生成 no-op 时无需进入 profiler。

3. mcTracer

回答:目标 kernel 是谁、运行多久、是否连续、是否混入其他 kernel/memcpy、 host launch 是否构成空隙、实际资源是多少。

4. mcProfiler

只对已确认 symbol 使用 --kernelnames。先采核心指标,再按需要采 pipeline duty。 per-kernel 报告优先于 aggregate report。

5. 交叉验证

  • profiler cycles/time 应与普通 benchmark 同方向。
  • 两次 per-kernel 样本应接近。
  • --single-pass 全局流量主要用于同口径趋势。
  • 修改后同时比较时间、资源、stall、duty 和生成代码。