926 B
926 B
性能分析工作流
1. 稳定基线
TileLang/CUDA kernel 单独运行;JIT 和输入生成在计时外。记录 median/P10/P90、 样本数、warmup 和环境快照。
2. 资源与生成代码
先获得 grid/block/shared/register/private,再看主循环 CU。资源超限或生成 no-op 时无需进入 profiler。
3. mcTracer
回答:目标 kernel 是谁、运行多久、是否连续、是否混入其他 kernel/memcpy、 host launch 是否构成空隙、实际资源是多少。
4. mcProfiler
只对已确认 symbol 使用 --kernelnames。先采核心指标,再按需要采 pipeline duty。
per-kernel 报告优先于 aggregate report。
5. 交叉验证
- profiler cycles/time 应与普通 benchmark 同方向。
- 两次 per-kernel 样本应接近。
--single-pass全局流量主要用于同口径趋势。- 修改后同时比较时间、资源、stall、duty 和生成代码。