diff --git a/基于AI Agent开发范式的国产GPU大模型推理算子库优化/赛题说明.md b/基于AI Agent开发范式的国产GPU大模型推理算子库优化/赛题说明.md
index 24a70ce..11cf68b 100644
--- a/基于AI Agent开发范式的国产GPU大模型推理算子库优化/赛题说明.md
+++ b/基于AI Agent开发范式的国产GPU大模型推理算子库优化/赛题说明.md
@@ -63,7 +63,7 @@ $\text{Attention}(Q, K, V) = \text{softmax}\left(\frac{QK^T}{\sqrt{d_k}}\right)V
传统的实现中,显存分配要求是**物理连续**的。
-* **分配逻辑:** 由于不知道用户最终会生成多少个 Token,系统只能“往大了猜”,按照模型允许的最大长度(例如 2048)为每个新请求一次性预留一长条连续的显存。
+* **分配逻辑:** 由于不知道用户最终会生成多少个 Token,系统只能“往大了猜”,按照模型允许的最大长度(例如 2048)为每个新请求一次性预留一长条连续���显存。
* **问题:**这样的分配方法容易造成**内部显存碎片化,显存利用率不高**,很容易引起“gpu显存利用不足”的问题,进而影响模型推理时的吞吐量。
@@ -400,7 +400,7 @@ run(q: Tensor, paged_kv_cache: Tensor | Tuple[Tensor, Tensor], *args, q_scale: f
#### 教程链接:
-FlashInfer 迁移 Baseline 实战
+FlashInfer关键算子迁移与优化
### Track 2:FlashAttention 关键算子迁移与优化