diff --git a/基于AI Agent开发范式的国产GPU大模型推理算子库优化/基于AI Agent开发范式的国产GPU大模型算子推理库优化方案.md b/基于AI Agent开发范式的国产GPU大模型推理算子库优化/基于AI Agent开发范式的国产GPU大模型算子推理库优化方案.md
index 758c3ca..35fe370 100644
--- a/基于AI Agent开发范式的国产GPU大模型推理算子库优化/基于AI Agent开发范式的国产GPU大模型算子推理库优化方案.md
+++ b/基于AI Agent开发范式的国产GPU大模型推理算子库优化/基于AI Agent开发范式的国产GPU大模型算子推理库优化方案.md
@@ -106,15 +106,19 @@ Agent自动优化算子性能榜依据客观性能指标排名(后续将根据
如参赛作品在复现过程中无法稳定达到提交成绩,主办方可根据复测结果调整其榜单成绩。
-### (二)作品评选标准
-提交作品最终评价采用100分制,权重计划如下:
-| 类别 | 评审维度 | 权重 | 说明 |
-|------|----------|------|------|
-| 客观评测 | 性能提升效果 | 60% | 在保证准确性和稳定性及精度等的前提下,相比基线版本,在延迟、吞吐、Token/s、显存占用等方面取得的提升 |
-| 客观评测 | Agent/Skill 的可复现性 | 20% | Agent真实参与源码理解、代码生成、性能分析、自动调优、Benchmark和多轮迭代,按照可复现程度打分:
功能能复现:5分
性能复现达提交标称的60%以上:10分
性能复现达提交标称的80%以上:15分
性能复现达提交标称的90%以上:20分 |
-| 客观评测+主观评测 | 文档说明与演示报告 | 20% | 技术报告、README、运行说明、演示视频、答辩材料是否清晰完整,按照材料完备和质量程度打分。 |
+### (二)作品评选标准及计分规则
+
+提交作品最终评价采用100分制,由客观评测和专家评审共同组成。其中,性能提升效果采用自动评测方式计分,Agent/Skill可复现性及文档说明与演示报告由专家依据评分标准进行综合评审。
+
+| 类别 | 评审维度 | 权重 | 说明 |
+| ----------------- | ---------------------- | ---- | ------------------------------------------------------------ |
+| 客观评测 | 性能提升效果 | 60% | ① 本赛题设置 **FlashInfer、FlashAttention、MCTLASS Fused MoE** 三个任务,各任务基于 **XPU-OJ 在线评测平台**独立进行自动评测和榜单排名;
② 各任务独立计分,不直接比较不同任务的原始性能指标;“性能提升效果”按各任务内排名计分,最高 **60 分**;
③ 参赛团队可选择一个或多个任务参赛,最终只取其中得分最高的一个任务计入“性能提升效果”,不叠加计分;
④ 每个任务支持 **MACA C++、Triton、TileLang** 三种开发语言,参赛团队可任选一种或多种提交,每个任务取通过正确性和稳定性测试的最高成绩参与排名;
⑤ FlashInfer任务包含多个指定 API 子任务,参赛团队可任选一种或多种提交,每个任务取通过正确性和稳定性测试的最高成绩参与排名;
⑥ 各任务以 XPU-OJ 榜单分数作为客观评测依据。XPU-OJ 榜单中的 **baseline 分数为 50 分**,表示官方基准实现对应的榜单水平;本评分项 **60 分** 为“性能提升效果”满分,二者属于不同分值体系;
⑦ 每个任务取榜单分数高于 **50 分** 的**前 30 名** 计分。第 1 名得 **60 分**,第 30 名得 **2 分**,其余名次按排名递减,每下降 1 名扣 2 分。未进入前 30 名或榜单分数未高于 50 分的提交,不获得“性能提升效果”加分;
⑧ 未通过正确性测试或稳定性测试的作品,客观评测得分记为 **0 分**。 |
+| 客观评测 | Agent/Skill 的可复现性 | 20% | Agent 应真实参与源码理解、代码生成、性能分析、自动调优、Benchmark 和多轮迭代等优化过程。根据可复现程度评分:
① 功能可复现:**5 分**;
② 性能复现达到提交标称成绩 **60%** 以上:**10 分**;
③ 性能复现达到提交标称成绩 **80%** 以上:**15 分**;
④ 性能复现达到提交标称成绩 **90%** 以上:**20 分**。
**组委会会对提交的内容进行严格审查,严禁抄袭,如有发现则取消成绩。* |
+| 客观评测+主观评测 | 文档说明与演示报告 | 20% | 根据参赛团队提交的**技术报告、README、运行说明、性能测试报告、Agent/Skill说明文档、演示视频及答辩材料**等,对材料的**完整性、规范性、技术表达质量和工程可复现性**进行综合评分。 |
+
+注:参赛团队应按照本方案第五章和第八章要求提交完整作品材料。未按要求提交作品、材料缺失或无法完成复现的,将影响相应评分项得分。
## 七、作品提交时间
diff --git a/算子优化相关课程整理.md b/算子优化相关课程整理.md
new file mode 100644
index 0000000..68c8d0d
--- /dev/null
+++ b/算子优化相关课程整理.md
@@ -0,0 +1,43 @@
+# 算子优化相关课程整理(持续更新中)
+
+本文档整理了 FlashAttention、FlashInfer、MoE / Fused MoE 等方向的课程、视频、论文和工程资料,供同学们在参加算子优化相关课程和赛题前预习使用。
+
+## 一、FlashAttention / FlashInfer 相关课程
+
+| 资源 | 类型 | 建议学习点 | 适用方向 |
+| --- | --- | --- | --- |
+| [Stanford CS336: Language Modeling from Scratch](https://cs336.stanford.edu/)
[B站字幕版:Stanford CS336 Spring 2025](https://www.bilibili.com/video/BV18BbkzbEr9/) | 高校公开课 | Transformer、GPU / TPU、Kernels、Triton、LLM 推理;Assignment 2 涉及 Triton 实现 FlashAttention-2 | FlashAttention、Triton、算子实现 |
+| [CMU 11-868: Large Language Model Systems](https://llmsystem.github.io/llmsystem2025spring/docs/Syllabus/) | 高校公开课件 | GPU Programming、Transformer 加速、MoE、Optimizing Attention、KV Cache、LLM Serving | LLM 推理系统、FlashInfer |
+| [B站:Flash Attention 为什么那么快?原理讲解](https://www.bilibili.com/video/BV1UT421k7rA) | 中文视频 | 理解 FlashAttention 如何减少显存访问、提升 Attention 性能 | FlashAttention 入门 |
+| [B站:从 Online Softmax 到 FlashAttention-2](https://www.bilibili.com/video/BV1aa4y1r7Fb) | 中文视频 | Online Softmax、分块计算、数值稳定性、FlashAttention-2 推导 | FlashAttention 原理 |
+| [B站:CUDA Mode Lecture 41 - FlashInfer](https://www.bilibili.com/video/BV1vP9gYbEbf/) | 专题录播 | FlashInfer 相关课程内容,理解推理阶段 kernel 优化 | FlashInfer、推理 kernel |
+| [B站:手写 FlashAttention v1 & v2 baseline](https://www.bilibili.com/video/BV1zM4m1S7gg/) | 实现类视频 | CUDA 手写 FlashAttention v1 / v2 的 baseline 实现 | FlashAttention 实现 |
+| [FlashInfer 官方文档](https://docs.flashinfer.ai/) | 工程文档 | FlashAttention、PageAttention、prefill / decode、MoE kernel API | FlashInfer 工程实践 |
+| [FlashInfer 论文](https://arxiv.org/abs/2501.01005) | 原论文 | 面向 LLM 推理的 attention engine 和自定义 kernel 设计 | FlashInfer 原理 |
+
+## 二、MoE 相关资料
+
+| 资源 | 类型 | 建议学习点 | 适用方向 |
+| --- | --- | --- | --- |
+| [B站:清华大学 / OpenBMB 大模型公开课 - MoE](https://www.bilibili.com/video/BV1pf421z757?p=5) | 中文视频 | MoE 路由机制、专家模型和工程实现 | MoE 入门 |
+| [YouTube:MoE 原理讲解 1](https://www.youtube.com/watch?v=U8J32Z3qV8s) | 英文课程 | MoE 基本概念、稀疏激活和专家路由 | MoE 原理 |
+| [YouTube:MoE 原理讲解 2](https://www.youtube.com/watch?v=RcJ1YXHLv5o) | 英文课程 | MoE 模型结构和训练 / 推理问题 | MoE 原理 |
+| [B站:MoE 相关视频 1](https://www.bilibili.com/video/BV1jH4y177DL/) | 中文视频 | MoE 基础概念补充 | MoE 入门 |
+| [B站:MoE 相关视频 2](https://www.bilibili.com/video/BV1uUPieDEK1/) | 中文视频 | MoE 结构与实现补充 | MoE 入门 |
+| [B站:MoE 源码实现细节](https://www.bilibili.com/video/BV19N411G7J2/) | 中文视频 | MoE 源码实现、路由和专家计算流程 | MoE 工程实现 |
+| [B站:MoE 发展历程介绍](https://www.bilibili.com/video/BV1y7wZeeE96/) | 中文视频 | MoE 技术发展脉络 | MoE 背景知识 |
+| [B站:MoE 模型中的通信优化](https://www.bilibili.com/video/BV1NQGx6mELa/) | 中文视频 | MoE 中的通信、并行和性能瓶颈 | Expert Parallelism、通信优化 |
+| [B站:MoE 模型推理加速](https://www.bilibili.com/video/BV1CE421M77X/) | 中文视频 | MoE 推理加速和算子优化思路 | Fused MoE、推理优化 |
+| [Outrageously Large Neural Networks: The Sparsely-Gated MoE Layer](https://arxiv.org/abs/1701.06538) | 原论文 | 稀疏门控 MoE、Top-K 路由机制 | MoE 基础论文 |
+| [GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding](https://arxiv.org/abs/2006.16668) | 原论文 | 将 MoE 用于 Transformer,自动分片和跨设备专家并行 | Expert Parallelism、分布式 MoE |
+
+## 三、FlashAttention 论文与进阶材料
+
+| 资源 | 类型 | 建议学习点 | 适用方向 |
+| --- | --- | --- | --- |
+| [FlashAttention 论文](https://arxiv.org/abs/2205.14135) | 原论文 | IO-aware exact attention、显存访问优化 | FlashAttention 核心原理 |
+| [FlashAttention-2 论文](https://arxiv.org/abs/2307.08691) | 原论文 | 并行划分、work partitioning、kernel 级优化 | FlashAttention 进阶 |
+| [FlashAttention-3 论文](https://arxiv.org/abs/2407.08608) | 原论文 | 面向 Hopper GPU 的异步计算、TMA、FP8 优化 | 新硬件 attention kernel |
+| [FlashAttention - Tri Dao Stanford MLSys #67](https://www.youtube.com/watch?v=gMOAud7hZg4) | 作者讲座 | FlashAttention 作者讲解设计思想、核心算法和性能分析 | 论文理解 |
+| [MedAI #54: FlashAttention](https://www.youtube.com/watch?v=FThvfkXWqtE) | 专题讲座 | IO-aware attention、算法动机和性能收益 | 论文补充讲解 |
+| [GPU Mode: CUTLASS and FlashAttention-3](https://research.colfax-intl.com/gpu-mode-cutlass-and-flashattention-3/) | 工程文章 / 讲座 | CUTLASS 实现、Hopper kernel 优化、FlashAttention-3 工程细节 | GPU kernel 进阶 |