Delete 基于AI Agent开发范式的国产GPU大模型算子推理库优化方案.md

This commit is contained in:
yyyymmm 2026-06-02 18:01:34 +08:00
parent 1049f55ba3
commit f71c5d593e
1 changed files with 0 additions and 198 deletions

View File

@ -1,198 +0,0 @@
# 题目编号XH-202628
# 基于AI Agent开发范式的国产GPU大模型推理算子库优化比赛方案
## 一、发榜单位
- **企业名称**:沐曦集成电路(上海)股份有限公司
- **企业类型**:民营企业
- **企业地址**上海市浦东新区海科路999弄8栋C8栋。
## 二、题目名称
基于AI Agent开发范式的国产GPU大模型推理算子库优化
## 三、题目介绍
### 1. 题目背景
大模型进入规模化应用阶段后推理性能已经成为影响模型服务成本、响应速度和产业落地能力的关键因素。相比训练阶段推理阶段具有调用频次高、并发压力大、上下文长度持续增长、部署环境复杂等特点对底层GPU软件栈和推理算子库提出了更高要求。
在大模型推理链路中Attention、FlashAttention、KV Cache、GEMM、算子融合、量化计算、长上下文处理等底层能力直接决定了模型推理的吞吐、延迟、显存占用和服务稳定性。以FlashInfer、FlashAttention等为代表的推理算子库已经成为提升大模型推理效率的重要基础软件。
与此同时AI Coding与Agent技术正在改变软件开发方式。过去依赖专家经验和人工反复调参的底层优化工作已经出现新的开发范式通过Agent完成代码理解、性能分析、候选实现生成、自动Benchmark、错误修复、参数搜索和迭代优化这使得Agent能力不仅是Coding Agent而能深入GPU基础软件优化过程。
### 2. 目标介绍
面向国产GPU的大模型推理参赛者需要使用/构建AI Agent通过自动代码理解、算子迁移、性能分析、Kernel 优化、Benchmark验证等方式优化FlashInfer、MCTLASS等推理算子库在国产GPU/MXMACA软件栈上的性能表现。
以Agent/Skill驱动FlashInfer、MCTLASS等大模型推理算子库在国产GPU上的自动迁移、自动优化、自动验证与性能迭代用Agent推动算子优化效率用Skill沉淀优化经验用国产GPU建立推理生态壁垒。
### 3. 选题意义
本赛题围绕国产GPU上的大模型推理算子库优化实现"Agent+Skill+Benchmark+国产GPU"的新型技术路线推动国产GPU推理生态走向"推理高性能、优化可复现、经验可沉淀、生态可持续"。
## 四、参赛对象
参赛对象为2026年6月1日以前正式注册的国内全日制非成人教育的普通高等学校在校专科生、本科生、硕士和博士研究生不含在职研究生以及全日制职业教育本科、高职高专在校学生可通过学生赛道申报作品参赛。
参赛对象可以团队或个人形式参赛每个团队不超过10人每件作品可由不超过3名指导教师进行指导。可以跨专业、跨学校、跨地域组队但同一团队所有成员均应符合本赛道相关年龄、身份要求。每件作品只可由1所高等院校、科研院所等作为参赛主体提交申报。
## 五、答题要求
本赛题面向国产GPU大模型推理场景鼓励参赛团队构建或使用AI Agent/Skill工作流对FlashInfer、FlashAttention、MCTLASS本次聚焦Fused MOE算子等大模型推理算子库开展迁移适配、性能分析、Kernel优化、自动调优、算子融合和Benchmark验证。
本赛题要求参赛团队将Agent真正用于底层算子优化过程使其能够参与并辅助完成代码理解、性能分析、优化生成、测试验证和多轮迭代。参赛作品应体现"Agent驱动算子优化"的技术特征,而不是仅停留在概念说明、文档生成或简单代码补全层面。
参赛团队需围绕国产GPU平台上的大模型推理算子库优化完成一类或多类任务。鼓励参赛团队在保证正确性、稳定性和可复现性的前提下提升相关算子或端到端推理链路在国产GPU上的执行性能。
本赛题鼓励参赛团队使用各类AI Agent、Skill、AI Coding、智能体开发平台和自动化调优工具参与推理算子库优化过程参赛团队可使用Claude Code、OpenCode、OpenAI Codex、OpenClaw、CodeBuddy、Cursor等开发工具也可使用自研Agent/Skill工作流。
通过本赛题期望形成一批面向国产GPU的大模型推理算子优化成果、Agent优化工作流、Skill模块、Benchmark方法和工程实践案例为国产GPU大模型推理生态建设提供支撑。
### 任务算子性能调优Agent/Skill
| 内容 | 说明 |
|------|------|
| 迁移FlashInfer的关键算子到MACA平台并优化性能 | 版本FlashInfer-ai/FlashInfer 0.2.8<br>API<br>BatchPrefillWithRaggedKVCacheWrapper<br>- headdim64/128/256, qk192+vo128 for mla<br>BatchPrefillWithPagedKVCacheWrapper<br>- headdim64/128/256<br>BatchMLAPagedAttentionWrapper<br>- headdim qk576+vo512<br>BatchDecodeWithPagedKVCacheWrapper<br>- headdim64/128/256<br>语言MACA/C++<br>数据类型BF16<br>page size[1, 16]<br>seqlen1K~180K选自真实大模型且seqlen取值随机以增加泛化性 |
| 迁移FlashAttention的关键算子到MACA平台并优化性能 | 版本Dao-AILab/FlashAttention 2.6.3<br>APIflash_attn_with_kvcache<br>语言MACA/C++<br>数据类型BF16<br>headdim[32, 64, 96, 128, 160, 192, 224, 256, 512]其中128、256、512高优<br>page size16<br>seqlen1K~180K选自真实大模型且seqlen取值随机以增加泛化性 |
| 迁移Fused MOE算子到MACA平台并优化性能 | APIFused MOE<br>语言Tilelang/Triton/MACA C<br>精度INT8 W8A8<br>shape: n_tokens, n_experts, topK, N, K均选自真实大模型在典型切分典型seqlen, batchsize的真实取值 |
提交可复现的算子优化的源码、测试及测试框架、性能测试脚本、性能报告、Agent/Skill以及对应的PPT和文档。
## 六、作品评选标准
本赛题采用"自动评测打榜 + 专家综合评审 + 终审擂台赛答辩"相结合的评价机制。自动评测结果作为作品性能表现的重要依据专家评审重点考察作品的技术路线、Agent 参与深度、工程质量、创新性和可复现性。
### (一)打榜机制
本赛题设置阶段性排行榜和最终排行榜。参赛团队可在规定时间内多次提交作品,系统根据统一评测环境、统一数据集、统一 Benchmark 脚本和统一评分规则进行自动评测,并生成榜单排名。
#### 1. 榜单设置
主办方设置以下榜单:
| 榜单名称 | 评价重点 | 适用作品 |
|----------|----------|----------|
| Agent自动优化算子性能榜 | 单个算子或算子库在指定输入规模下的性能提升也包含Agent/Skill在优化流程中的参与深度和自动化能力包含了Agent工具链、AutoTune、Benchmark自动化作品 | FlashInfer、FlashAttention、MCTLASS等算子优化作品 |
Agent自动优化算子性能榜依据客观性能指标排名后续将根据提交的Agent流程核对复现
#### 2. 自动评测流程
每次打榜提交后,系统按照以下流程进行评测:
作品提交 → 环境检查 → 编译构建 → 正确性测试 → Benchmark性能评测 → 稳定性与回归检查 → 生成评测报告 → 更新排行榜。
只有通过正确性测试和基础稳定性测试的作品,才进入性能排名。未通过正确性测试的作品不计入性能榜。
#### 3. 评测指标
赛题将提供对应算子的自动化测试程序和目标测试集。目标测试集中的测试用例来源于真实公开大模型或主流大模型推理负载例如DeepSeek-V4、GLM-5.1、Kimi-K2.5、Step-3.5-Flash、MiniMax M2.5/M2.7、MiMo-V2等模型在典型序列长度sequence length简称seqlen、批大小batch size、head数、head dimension、数据类型等条件下的实际输入形态。
测试程序将自动评测参赛作品的正确性与综合性能。其中,正确性为必须达成的基础目标,包括功能正确性、数值精度达标、边界条件通过和运行流程完整。未通过正确性测试的作品不进入性能排名。
在正确性通过的前提下,测试程序将自动统计作品在目标测试集上的综合性能表现,包括延迟、吞吐、显存占用、稳定性以及不同输入规模下的覆盖情况,并按照预先公布的权重计算加权平均性能得分。该得分作为算子性能榜和相关任务排名的主要依据。
#### 4. 复现与反作弊要求
为保证榜单结果真实有效,参赛作品需满足以下要求:
1. 作品必须能够在主办方指定环境中复现;
2. 不得通过识别测试样例、硬编码输出、跳过计算等方式刷榜;
3. 不得牺牲计算正确性换取性能提升;
4. 不得利用未授权接口、系统漏洞或评测环境漏洞获取不当成绩;
5. 主办方有权对异常成绩进行复测、要求补充说明或取消排名。
如参赛作品在复现过程中无法稳定达到提交成绩,主办方可根据复测结果调整其榜单成绩。
### (二)作品评选标准
提交作品最终评价采用100分制权重计划如下
| 类别 | 评审维度 | 权重 | 说明 |
|------|----------|------|------|
| 客观评测 | 性能提升效果 | 60% | 在保证准确性和稳定性及精度等的前提下相比基线版本在延迟、吞吐、Token/s、显存占用等方面取得的提升 |
| 客观评测 | Agent/Skill 的可复现性 | 20% | Agent真实参与源码理解、代码生成、性能分析、自动调优、Benchmark和多轮迭代按照可复现程度打分<br>功能能复现5分<br>性能复现达提交标称的60%以上10分<br>性能复现达提交标称的80%以上15分<br>性能复现达提交标称的90%以上20分 |
| 客观评测+主观评测 | 文档说明与演示报告 | 20% | 技术报告、README、运行说明、演示视频、答辩材料是否清晰完整按照材料完备和质量程度打分。 |
## 七、作品提交时间
2026年5月至9月上旬各参赛团队选择榜单中的题目开展研发攻关各高校、科研机构等组织协调机构应组织学生和青年科技工作者参赛安排专业人员给予指导为参赛团队提供支持保障。
2026年9月5日前各参赛团队要向发榜单位完成作品提交具体要求详见作品提交方式。
2026年9月20日前由发榜单位完成初审确定入围终审擂台赛的晋级作品和团队。
2026年10月安排专门团队提供帮助和指导各晋级团队完善作品。
2026年11月组织终审擂台赛角逐"擂主"。
## 八、参赛报名及作品提交方式
### (一)报名方式
1. 参赛选手登录"挑战杯"官网www.tiaozhanbei.net在"揭榜挂帅"擂台赛报名入口注册账号,登录大赛申报系统在线填写报名信息。报名信息提交后,下载打印系统生成的报名表。
2. 申报人在报名表对应位置加盖所在学校或所在单位公章。
3. 将盖章版报名表扫描件上传至报名系统,等待系统审核。请参赛选手注意查看审核状态,如审核不通过,需重新提交。
4. 系统开放报名时间为2026年5月30日—6月30日逾期后系统将自动关闭报名功能。
### (二)作品提交方式
作品的提交除提到的客观评测外,在初赛/总决赛截止时间点前参赛团队应将所有要求的材料包括可复现的算子优化的源码、测试及测试框架、性能测试脚本、性能报告、Agent/Skill以及对应的PPT和文档等统一打包压缩提交至邮箱opensource@metax-tech.com。压缩包命名方式为申报人所在单位-申报人姓名-作品名称-联系电话例如XX 大学-张XX-XX方案-手机号)。
除参赛报名表外各参赛组提交的文档、源代码和相关文件不得携带任何参赛学校、老师和学生的个人信息。同时各参赛团队在提交作品时同步报送1份经报名系统审核通过的参赛报名表报名表所有信息须与系统内填报内容完全一致。
## 九、赛事保障
1. **算力资源支持**参赛选手在完成报名后提供对应线上的曦云C500等在线算力资源券。
2. **技术培训**:赛前赛中至少组织 2 场线上培训,提供培训回放及答疑文档;另外届时会根据实际情况,决定是否组织线下的专场培训。
3. **专家指导**:建立线上答疑社群,由沐曦股份技术团队指导,定期回复技术问题。
4. **交流平台**:在沐曦股份开发者社区开设赛事专属社区板块,支持参赛团队分享经验、交流问题,促进技术共创。
5. **技术文档和课程**
## 十、设奖情况及奖励措施
### 1. 设奖情况
按参赛作品数量比例设奖,原则上评出 "擂主"1个、特等奖5个一等奖5个、二等奖6个、三等奖8个获奖比例不超过参赛作品总数的30%,从特等奖中角逐出擂主团队。
### 2. 奖励措施
- **奖金奖励**擂主奖励10万元/个叠加特等奖后奖金特等奖奖励2万/个一等奖奖励1万元/个二等奖奖励0.5万元/个三等奖奖励0.2万元/个。以上奖金均为税后金额。
- **高端GPU奖励**擂主团队2张GPU加速卡不叠加特等奖GPU奖励特等奖团队1张GPU加速卡。
- **实习奖励**:优秀获奖者有机会参与之江&沐曦股份 "南湖之新"联合培养计划;所有获奖团队可获得赛事荣誉证书。
- **曝光支持**:获奖作品可在沐曦股份开发者社区展示,作品可提供成果孵化与应用推广支持。
备注从特等奖中角逐出擂主团队奖金10万元已叠加特等奖奖金擂主不叠加特等奖GPU奖励。
### 3. 奖金发放方式
比赛结束后单位比赛专班工作人员与获奖团队取得联系填写奖金申请表赛事终审结果公示无异议后公示期约1个月在30个工作日内通过银行转账一次性发放至团队负责人指定账户上述所列奖金均为税后奖金。
## 十一、比赛专班联系方式
### 1. 专家指导团队
- 顾问专家董老师联系电话13482748718
- 顾问专家武老师联系电话18951640525
- 顾问专家韩老师联系电话18017474835
负责比赛期间技术指导保障。
### 2. 赛事服务团队
- 联络专员杨老师联系电话15201842467
- 联络专员章老师联系电话13501701786
负责比赛期间组织服务及后期相关赛务协调联络。
### 3. 联系时间
比赛期间工作日9:0017:00
## 附:发榜单位简介
沐曦集成电路上海股份有限公司股票代码688802.SH成立于2020年9月于2025年12月成功登陆科创板。总部位于上海并在北京、南京、成都、杭州、深圳、武汉、长沙等地设立全资子公司及研发中心。作为一家专注于全栈GPU芯片及解决方案的集成电路设计企业致力于打造世界一流的GPU芯片及计算平台成为数字经济的算力基石。
公司拥有技术完备、设计和产业化经验丰富的团队核心成员平均拥有近20年高性能GPU产品端到端研发经验曾主导过十多款世界主流高性能GPU产品研发及量产。目前公司已推出全面覆盖人工智能训练和推理、通用计算、图形渲染和科学智能等场景的四大序列产品并配套自研 MXMACA 软件栈,真正实现了"软硬协同",满足"高能效"和"高通用性"的算力需求。2025年起公司坚持"开放协同、自主可控"的方向,全面推进计算生态以及产业生态的建设。在计算生态层面,公司以自主研发的 MXMACA 全栈软件栈为核心,积极拥抱开源,打造自主、开放、兼容的通用计算开源生态;在产业生态层面,公司依托"1+6+X"战略布局,以数字算力底座为基,持续深耕金融、医疗健康、能源、教科研、交通、大文娱六大重点行业,同步积极探索具身智能、低空经济等新兴领域,为数字经济与新质生产力发展提供坚实算力支撑。