Delete 基于国产软件栈的推理前沿算子优化比赛方案.md

This commit is contained in:
yyyymmm 2026-06-02 18:01:28 +08:00
parent c328ebd679
commit 1049f55ba3
1 changed files with 0 additions and 225 deletions

View File

@ -1,225 +0,0 @@
# 题目编号XH-202608
# 基于国产软件栈大模型推理前沿算子优化
## 比赛方案
### 一、发榜单位
沐曦集成电路(上海)股份有限公司
### 二、题目名称
基于国产软件栈大模型推理前沿算子优化
### 三、题目介绍
我国在AI算法创新与应用落地方面已取得显著成就主流大模型在算法层面已与国际先进水平并跑乃至部分领跑。然而绝大多数可公开下载和部署的大模型其底层推理代码与性能优化均深度适配于国际主流AI生态。这种深度绑定在中美科技竞争长期化、复杂化的今天已成为我国人工智能产业自主发展的潜在风险。在此背景下需要构建基于全国产软件生态的核心算子库为国产大模型和国产算力芯片的协同创新与规模化应用浇筑自主可控的软件"地基"。
在此背景下国产自主研发并于2025年开源的TileLang作为一种专为AI算子开发设计的领域专用语言DSL其核心是将高性能计算中的"分块技术"Tile作为首要优化对象自动推导并实施适合目标硬件的优化策略让开发者更专注于算法逻辑本身。TileLang具有高效率、自动化、强兼容和开放生态的特性成为构建国产软件生态中重要的开源项目。沐曦股份MXMACA软件栈已与TileLang完成深度适配和验证可作为后端接入TileLang构建贯穿上层框架到底层硬件的、全国产化的AI软件生态。
本次比赛聚焦于大模型推理中3个关键前沿算子以TileLang作为核心开发语言以沐曦股份MXMACA作为软件栈后端以曦云系列C500处理器为硬件算力开展基于全国产软件生态的深度性能优化与实践。选择的算子包括
1. Fused Moe Gemm
2. DeepSeek V3/R1所用Multi-Head Latent AttentionQK dim576 + VO dim512
3. Native Sparse Attention
其中Fused moe gemm是一种针对混合专家模型的关键核心算子。混合专家模型通过门控网络动态选择少数专家进行处理通过稀疏激活特性带来参数规模的优势但也带来计算细碎化硬件算力资源利用不充分的问题。Fused moe gemm通过计算融合优化技术解决这一技术挑战该算子输入多个独立的专家权重矩阵、经过路由分配的输入激活张量输出所有专家各自的计算结果经后续处理如聚合后形成该MoE层的最终输出。该算子的技术核心在于通过将多个独立的专家矩阵乘法GEMM分组并融合为一个统一的内核进行计算提升硬件算力利用率加速大模型推理。
DeepSeek V3中的MLAMulti-head Latent Attention算法通过将KV cache压缩为低秩潜在向量在保持与标准多头注意力相当性能的同时将KV cache显存占用大幅减小显著降低了长序列推理的显存瓶颈其创新的解耦旋转位置编码和优化的矩阵吸收机制不仅提升了推理效率还通过减少访存次数和增强计算强度在大模型场景下实现了更高的吞吐量和更低的延迟特别适合需要处理超长上下文的应用场景。有赖于MLA算法和MOE等关键技术DeepSeek V3-671B的性能在很长一段时间内领跑国际先进开、闭源模型的水平。
DeepSeek提出的Native Sparse Attention算法通过硬件原生的稀疏计算模式将超长文本的注意力计算复杂度从O(n²)降至O(n√n)在保持模型性能几乎无损的同时实现了数倍的推理速度提升和50%以上的显存节省NSA创新地通过分块稀疏模式和动态稀疏度调整机制不仅避免了传统稀疏注意力中的负载不均衡问题还通过优化的内存访问模式显著提高了GPU利用率特别适合长上下文场景下的高效推理。实验表明在64k长度序列上NSA在解码、前向传播和反向传播各个阶段都实现了显著加速同时在通用基准测试、长上下文任务和指令推理方面保持或超越了全注意力模型的性能有效解决了长上下文建模中的计算瓶颈问题。
本次比赛聚焦于上述算子的性能优化,要求参赛选手理解算子的计算逻辑, TileLang的基本语法和GPU算子的常见优化方法在保证精度的同时提升算子性能。大赛将提供编程环境功能和性能测试集助力团队快速上手并开展实践。
### 四、参赛对象
参赛对象为2026年6月1日以前正式注册的国内全日制非成人教育的普通高等学校在校专科生、本科生、硕士和博士研究生不含在职研究生以及全日制职业教育本科、高职高专在校学生可通过学生赛道申报作品参赛。
参赛对象可以团队或个人形式参赛每个团队不超过10人每件作品可由不超过3名指导教师进行指导。可以跨专业、跨学校、跨地域组队但同一团队所有成员均应符合本赛道相关年龄、身份要求。每件作品只可由1所高等院校、科研院所等作为参赛主体提交申报。
### 五、答题要求
#### (一)初赛作品要求
根据提供的基础样例使用TileLang在MXMACA平台上实现和优化Fused Moe Gemm算子并需要在基础样例Fused Moe Gemm算法测试API端到端耗时性能上有提升作为晋级决赛的基本要求。评判标准分两个层级基本功能和性能加分层级。
1. **基本功能层级评判标准**
Fused Moe Gemm功能test集通过率99%以上,并有参考样例性能的提升。
2. **性能加分层级评判标准**
在满足基本功能层级评判标准的基础上全部参赛选手实现的Fused Moe Gemm算法测试API端到端耗时warmup 10次重复100次取平均耗时按耗时长短排名耗时越短排名越高并且会在决赛有10分评分会根据初赛性能排序作为依据如下
- 第1名 +10分
- 第2名 +9分
- 第3名 +8分
- 第4名 +7分
- 第5名 +6分
- 第6名 +5分
- 第7名 +4分
- 第8名 +3分
- 第9名 +2分
- 第10名 +1分
#### (二)决赛作品要求
1. 根据基础参考样例使用TileLang提交MLA或者NSA算子实现并优化性能考虑到2个算子难度有差异请选手从2个算子任选一个作为决赛参赛评比注意MLA技术分最高80分则决赛最终80*0.6=48分2个算子评价如下
**使用TileLang在MXMACA平台上实现和优化DeepSeekV3 MLA算子【技术分满分80分】**,技术分拆分如下:
- **基本功能层级评判标准技术分40分**
MLA功能test集通过率99%按照通过case数目折算得分例如80%覆盖40*80%=32分
- **性能加分层级评判标准技术分40分**
在满足基本功能层级评判标准的基础上全部参赛选手实现的MLA算法测试API端到端耗时warmup 10次重复100次取平均耗时按耗时长短排名耗时越短排名越高
- 第1名 +40分
- 第2名 +38分
- 第3名 +36分
- 第4名 +34分
- 第5名 +32分
- 第6名 +30分
- 第7名 +28分
- 第8名 +26分
- 第9名 +24分
- 第10名 +22分
- 第11名 +20分
- 第12名 +18分
- 第13名 +16分
- 第14名 +14分
- 第15名 +12分
- 第16名 +10分
- 第17名 +8分
- 第18名 +6分
- 第19名 +4分
- 第20名 +2分
2. **使用TileLang在MXMACA平台上实现和优化NSA【技术分满分100分】**,技术分拆分如下:
- **基本功能层级评判标准技术分40分**
NSA forward API功能test集通过率99%按照通过case数目折算得分例如80%覆盖40*80%=32分
- **性能加分层级评判标准技术分60分例如满分客观分为50*0.3=15分**
在满足基本功能层级评判标准的基础上全部参赛选手实现的NSA算法使用64K seqlen的输入测试API端到端耗时warmup 10次重复50次取平均耗时按耗时长短排名耗时越短排名越高
- 第1名 +60分
- 第2名 +57分
- 第3名 +54分
- 第4名 +51分
- 第5名 +48分
- 第6名 +45分
- 第7名 +42分
- 第8名 +39分
- 第9名 +36分
- 第10名 +33分
- 第11名 +30分
- 第12名 +27分
- 第13名 +24分
- 第14名 +21分
- 第15名 +18分
- 第16名 +15分
- 第17名 +12分
- 第18名 +9分
- 第19名 +6分
- 第20名 +3分
### 六、作品评选标准
提交作品最终评价及权重如下:
| 类别 | 评审维度 | 权重 | 说明 |
|------|----------|------|------|
| 客观评测 | 技术实现分 | 60% | 根据决赛选择的题目的技术得分*0.6给出技术实现分(备注:MLA技术最高分80分NSA技术分最高100分。 |
| | 初赛排名加分 | 10% | 根据初赛名次取前10规则给与相应分数。 |
| 主观评测 | 展示质量 | 20% | 根据提交代码质量、Demo 视频与测试报告完整度给分。 |
| | 创新性与可扩展性 | 10% | 是否体现独特机制、具备推广潜力和上游合并社区价值。 |
### 七、作品提交时间
2026年5月至9月上旬各参赛团队选择榜单中的题目开展研发攻关各高校、科研机构等组织协调机构应组织学生和青年科技工作者参赛安排专业人员给予指导为参赛团队提供支持保障。
2026年9月各参赛团队要向发榜单位完成作品提交具体要求详见作品提交方式。
2026年9月由发榜单位完成初审确定入围终审擂台赛的晋级作品和团队。
2026年10月安排专门团队提供帮助和指导各晋级团队完善作品。
2026年11月组织终审擂台赛角逐"擂主"。
### 八、参赛报名及作品提交方式
#### (一)报名方式
1. 参赛选手登录"挑战杯"官网www.tiaozhanbei.net在"揭榜挂帅"擂台赛报名入口注册账号,登录大赛申报系统在线填写报名信息。报名信息提交后,下载打印系统生成的报名表。
2. 申报人在报名表对应位置加盖所在学校或所在单位公章。
3. 将盖章版报名表扫描件上传至报名系统,等待系统审核。请参赛选手注意查看审核状态,如审核不通过,需重新提交。
4. 系统开放报名时间为2026年5月30日—6月30日逾期后系统将自动关闭报名功能。
#### (二)作品提交方式
参赛团队应于规定时间内将申报作品统一打包压缩提交至大赛申报系统以及"挑战杯"官网。作品的提交除提到的客观评测外,在初赛/总决赛截止时间点前,参赛团队应将所有要求的材料,包括技术方案文档 (PDF)、日志与结果文件、展示视频10分钟总决赛、算法介绍 PPT总决赛、源代码或 Notebook可选建议提交或开源打包成 .zip 格式压缩包提交至 opensource@metax-tech.com。压缩包命名方式为申报人所在单位申报人姓名作品名称联系电话例如XX 大学张XXXX方案手机号)。
如出现作品相关材料因"挑战杯"官网附件大小容量限制无法提交的情况可提交一份无法提交的情况说明附无法提交界面截图盖校团委章后扫描程pdf作为作品材料提交至"挑战杯"官网,同步将作品相关材料全部发送至上述制定邮箱。
1. 算法设计报告详细说明kernel设计的技术方案、创新点和实现步骤给出算法伪代码
2. 功能测试报告针对发榜单位提供的功能测试集合提供完整的参数设置、计算结果的精度与golden校验对比报告
3. 性能测试报告:针对发榜单位提供的性能测试集合,提供完整的参数设置、性能测试结果分析报告
4. 源代码用TileLang实现算子的完整源码代码包括功能和性能测试源码编译、运行test/benchmark方式的README.md文档
除参赛报名表外各参赛组提交的文档、源代码和模型文件不得携带任何参赛学校、老师和学生的个人信息。同时各参赛团队在提交作品时同步报送1份经报名系统审核通过的参赛报名表报名表所有信息须与系统内填报内容完全一致。
### 九、赛事保障
1. **算力资源支持**参赛选手在完成报名后提供对应线上的曦云C500在线算力资源。
2. **技术培训**:赛前赛中至少组织 2 场线上培训,提供培训回放及答疑文档;另外届时会根据实际情况,决定是否组织线下的专场培训。
3. **专家指导**:建立线上答疑社群,由沐曦股份技术团队指导,定期回复技术问题。
4. **交流平台**:在沐曦股份开发者社区开设赛事专属社区板块,支持参赛团队分享经验、交流问题,促进技术共创。
5. **技术文档和课程**
1. 提供 TileLang /MXMACA 技术文档
2. 提供算子 baseline 示例
3. 提供测试集、评测脚本
4. 配备技术答疑团队
5. 组织线上技术讲解/ Q&A
### 十、设奖情况及奖励措施
#### 1. 设奖情况
按参赛作品数量比例设奖,原则上评出 "擂主"1个、特等奖5个一等奖5个、二等奖6个、三等奖8个获奖比例不超过参赛作品总数的30%,从特等奖中角逐出擂主团队。
#### 2. 奖励措施
- **奖金奖励**擂主奖励10万元/个叠加特等奖后奖金特等奖奖励2万/个一等奖奖励1万元/个二等奖奖励0.5万元/个三等奖奖励0.2万元/个。
- **高端GPU奖励**擂主团队2张GPU加速卡不叠加特等奖GPU奖励特等奖团队1张GPU加速卡。
- **实习奖励**:优秀获奖者有机会参与之江&沐曦股份 "南湖之新"联合培养计划;所有获奖团队可获得赛事荣誉证书。
- **曝光支持**:获奖作品可在沐曦股份开发者社区展示,作品可提供成果孵化与应用推广支持。
备注从特等奖中角逐出擂主团队奖金10万元已叠加特等奖奖金擂主不叠加特等奖GPU奖励。
#### 3. 奖金发放方式
比赛结束后单位比赛专班工作人员与获奖团队取得联系填写奖金申请表赛事终审结果公示无异议后公示期约1个月在30个工作日内通过银行转账一次性发放至团队负责人指定账户上述所列奖金均为税后奖金。
### 十一、比赛专班联系方式
#### 1. 专家指导团队
- 顾问专家马老师联系电话13811784391
- 顾问专家芦老师联系电话15395820130
- 顾问专家刘老师联系电话18210506627
负责比赛期间技术指导保障。
#### 2. 赛事服务团队
- 联络专员杨老师联系电话15201842467
- 联络专员章老师联系电话13501701786
负责比赛期间组织服务及后期相关赛务协调联络。
#### 3. 联系时间
比赛期间工作日9:0017:00
### 附:发榜单位简介
沐曦集成电路上海股份有限公司股票代码688802.SH成立于2020年9月于2025年12月成功登陆科创板。总部位于上海并在北京、南京、成都、杭州、深圳、武汉、长沙等地设立全资子公司及研发中心。作为一家专注于全栈GPU芯片及解决方案的集成电路设计企业致力于打造世界一流的GPU芯片及计算平台成为数字经济的算力基石。
公司拥有技术完备、设计和产业化经验丰富的团队核心成员平均拥有近20年高性能GPU产品端到端研发经验曾主导过十多款世界主流高性能GPU产品研发及量产。目前公司已推出全面覆盖人工智能训练和推理、通用计算、图形渲染和科学智能等场景的四大序列产品并配套自研 MXMACA 软件栈,真正实现了"软硬协同",满足"高能效"和"高通用性"的算力需求。2025年起公司坚持"开放协同、自主可控"的方向,全面推进计算生态以及产业生态的建设。在计算生态层面,公司以自主研发的 MXMACA 全栈软件栈为核心,积极拥抱开源,打造自主、开放、兼容的通用计算开源生态;在产业生态层面,公司依托"1+6+X"战略布局,以数字算力底座为基,持续深耕金融、医疗健康、能源、教科研、交通、大文娱六大重点行业,同步积极探索具身智能、低空经济等新兴领域,为数字经济与新质生产力发展提供坚实算力支撑。