op_optimization/README.md

123 lines
7.0 KiB
Markdown
Raw Permalink Blame History

This file contains invisible Unicode characters

This file contains invisible Unicode characters that are indistinguishable to humans but may be processed differently by a computer. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

# 降低Token 成本攻坚国产推理生态沐曦两大赛题登陆 2026 揭榜挂帅擂台赛邀青年共破局
2026 年度中国青年科技创新「揭榜挂帅」擂台赛正式启幕。沐曦股份重磅发布两大 AI 算力硬核榜题聚焦国产 GPU 大模型推理算子优化以硬核赛事搭建科研攻关平台邀全国青年学子、科研人才揭榜攻坚用技术重构推理效率用创新拉低每 Token 算力成本
## 两大重磅赛题 直击推理成本核心痛点
### 赛题一:基于国产软件栈大模型推理前沿算子优化
当前主流大模型底层代码深度绑定海外生态,国产算力缺少自主可控的核心算子库,成为成本优化与产业安全的双重短板。
本赛题依托国产开源 TileLang语言 + 沐曦 MXMACA 全栈软件栈 + 曦云 C500 算力聚焦三大业界前沿高价值算子攻坚
🔹 Fused Moe Gemm优化 MoE 模型稀疏计算提升算力利用率
🔹 MLAMulti-Head Latent Attention适配 DeepSeek V3压缩 KV Cache 显存破解长序列成本瓶颈
🔹 NSANative Sparse Attention实现超长文本推理加速显存节省超 50%
初赛攻坚 Fused Moe Gemm、决赛冲刺 MLA/NSA全程基于全国产技术栈开发优化打造自主可控的低成本大模型推理算子底座。
**赛题一相关资料**
- [赛题一方案:基于国产软件栈的推理前沿算子优化比赛方案](基于国产软件栈大模型推理前沿算子优化/基于国产软件栈的推理前沿算子优化比赛方案.md)
- [TileLang MACA 构建指南(模力方舟)](基于国产软件栈大模型推理前沿算子优化/tilelang_maca_build_guide_模力方舟.md)
- [TileLang 算子 sample 跑通测试指南](基于国产软件栈大模型推理前沿算子优化/race_tests_run_guide基于tilelang算子sample跑通测试.md)
- [赛题一国产软件栈样例说明](基于国产软件栈大模型推理前沿算子优化/基于国产软件栈的大模型推理前沿算子优化TileLangSample%20算子获取说明.md)
- [TileLang 训练营学习资料](https://www.gitlink.org.cn/ccf-ai-infra/Intro-ops/about)
### 赛题二基于 AI Agent 开发范式的国产 GPU 大模型推理算子库优化
大模型推理具有高并发、长序列、高调用频次等特点FlashInfer、FlashAttention、Fused MoE 等核心算子直接决定模型服务的吞吐、延迟与显存开销,影响单 Token 综合推理成本。
本赛题面向沐曦国产 GPU 及 MXMACA 软件栈,鼓励参赛团队构建或使用 AI Agent / Skill 工作流围绕推理算子库开展代码理解、算子迁移、性能分析、Kernel 优化、自动调优、Benchmark 验证和多轮迭代探索“Agent 驱动算子优化”的新型开发范式。
参赛作品应体现 AI Agent 在底层算子优化过程中的实际参与能力,而不是仅停留在概念说明、文档生成或简单代码补全层面。参赛团队需要理解大模型推理算子库的计算逻辑、国产 GPU / MXMACA 软件栈的开发方法,以及 AI Agent / Skill 优化工作流,在保证正确性、稳定性和可复现性的前提下,提升相关算子或端到端推理链路在国产 GPU 上的执行性能。
参赛团队可围绕以下推理算子库或核心算子,选择一类或多类任务开展优化工作:
- **FlashInfer 关键算子迁移与优化**:面向 Prefill、Decode、Paged KV Cache、MLA Attention 等推理场景,完成 MACA 平台适配与性能优化;
- **FlashAttention 关键算子迁移与优化**:围绕 `flash_attn_with_kvcache` 等核心接口,提升长序列场景下的 Attention 计算性能;
- **MCTLASS / Fused MoE 算子优化**:聚焦 MoE 模型中的稀疏专家计算,优化 Fused MoE 算子的执行效率;
最终成果应包括可复现的源码、测试框架、性能测试脚本、性能报告、Agent / Skill 工作流以及对应的文档和展示材料。评审将重点考察性能提升效果、Agent / Skill 工作流的可复现性,以及文档说明与演示报告的完整性。
**赛题二相关资料**
- [赛题二方案:基于 AI Agent 开发范式的国产 GPU 大模型推理算子库优化方案](基于AI%20Agent开发范式的国产GPU大模型推理算子库优化/基于AI%20Agent开发范式的国产GPU大模型算子推理库优化方案.md)
- [赛题二选手入口](基于AI%20Agent开发范式的国产GPU大模型推理算子库优化/选手入口.md)
- [模力方舟 Agent 部署准备教程](基于AI%20Agent开发范式的国产GPU大模型推理算子库优化/模力方舟Agent部署准备教程.md)
- [赛题二说明及资料参考](基于AI%20Agent开发范式的国产GPU大模型推理算子库优化/赛题说明.md)
### **两个赛题统一使用模力方舟上的镜像PyTorch-Agent / 2.8.0 / Python 3.12 / maca 3.7.2.1**
## 参赛对象
面向全国全日制专科、本科、硕博在校生非在职40 周岁以下青年科技人才均可参与
可个人 / 团队组队团队≤10 跨专业、跨校、跨地域自由组队最多 3 名指导老师带队。
## 丰厚赛事激励
**现金奖金激励**
擂主 10 万元、特等奖 2 万元、一等奖 1 万元、二等奖 0.5 万元、三等奖 0.2 万元
**硬件福利加码**
擂主直得 2 张沐曦高端 GPU 加速卡、特等奖专属 GPU 加速卡
**成长专属权益**
优秀获奖者直通沐曦 & 之江联合培养计划、赛事官方荣誉证书
**生态曝光扶持**
优秀作品入驻沐曦开发者社区 & 启悟学习社区,成果孵化 + 产业落地全方位赋能
## 全程赛事保障 助力全力攻坚
提供曦云 C500 在线算力资源券无需自备硬件
线上专项技术培训 + 回放文档,零基础也能快速上手
沐曦股份资深技术专家社群常驻答疑,定期解惑攻关难题
官方提供技术文档、算子基线样例、标准测试集与评测脚本
赛事交流群:
![image](赛事二维码.jpg)
## 关键时间节点
5.30-6.30 赛事报名
5-9  课题攻关
9月初审
10-11月 终审擂台赛
## 算力获取和使用
沐曦开发者社区活动页面,完成新人礼任务,提前熟悉 C500 在线算力使用。https://developer.metax-tech.com/activities/6
学生可通过登录启悟社区后跳转沐曦开发者社区领取100元算力代金券。(https://developer.metax-tech.com/activities/11)
报名赛事后还可额外获得300元算力代金券https://developer.metax-tech.com/activities/17
使用指南:[模力方舟快速使用 SOP](模力方舟快速使用SOP.md)
青年挺膺担当,科创筑梦算力!
加入沐曦股份“揭榜挂帅”赛题深耕国产 GPU 算子优化用技术降低每 Token 推理成本共建自主可控 AI 算力新生态
👇 报名通道:登录挑战杯官网[2026年度中国青年科技创新“揭榜挂帅”擂台赛学生赛道](https://2026.tiaozhanbei.net/)揭榜挂帅入口报名