forked from metax-maca/op_optimization
添加教程链接
This commit is contained in:
parent
4431f3f290
commit
65cfafd259
|
|
@ -63,7 +63,7 @@ $\text{Attention}(Q, K, V) = \text{softmax}\left(\frac{QK^T}{\sqrt{d_k}}\right)V
|
|||
|
||||
传统的实现中,显存分配要求是**物理连续**的。
|
||||
|
||||
* **分配逻辑:** 由于不知道用户最终会生成多少个 Token,系统只能“往大了猜”,按照模型允许的最大长度(例如 2048)为每个新请求一次性预留一长条连续的显存。
|
||||
* **分配逻辑:** 由于不知道用户最终会生成多少个 Token,系统只能“往大了猜”,按照模型允许的最大长度(例如 2048)为每个新请求一次性预留一长条连续<EFBFBD><EFBFBD><EFBFBD>显存。
|
||||
|
||||
* **问题:**这样的分配方法容易造成**内部显存碎片化,显存利用率不高**,很容易引起“gpu显存利用不足”的问题,进而影响模型推理时的吞吐量。
|
||||
|
||||
|
|
@ -400,7 +400,7 @@ run(q: Tensor, paged_kv_cache: Tensor | Tuple[Tensor, Tensor], *args, q_scale: f
|
|||
|
||||
#### 教程链接:
|
||||
|
||||
<a href="https://gitlink.org.cn/metax-maca/op_optimization/tree/master/%E5%9F%BA%E4%BA%8EAI%20Agent%E5%BC%80%E5%8F%91%E8%8C%83%E5%BC%8F%E7%9A%84%E5%9B%BD%E4%BA%A7GPU%E5%A4%A7%E6%A8%A1%E5%9E%8B%E6%8E%A8%E7%90%86%E7%AE%97%E5%AD%90%E5%BA%93%E4%BC%98%E5%8C%96/FlashInfer%20%E8%BF%81%E7%A7%BB%20Baseline%20%E5%AE%9E%E6%88%98.md">FlashInfer 迁移 Baseline 实战</a>
|
||||
<a href="https://gitlink.org.cn/xiao_xiao/op_optimization/webIDE/tree/master/%E5%9F%BA%E4%BA%8EAI%20Agent%E5%BC%80%E5%8F%91%E8%8C%83%E5%BC%8F%E7%9A%84%E5%9B%BD%E4%BA%A7GPU%E5%A4%A7%E6%A8%A1%E5%9E%8B%E6%8E%A8%E7%90%86%E7%AE%97%E5%AD%90%E5%BA%93%E4%BC%98%E5%8C%96/FlashInfer%E5%85%B3%E9%94%AE%E7%AE%97%E5%AD%90%E8%BF%81%E7%A7%BB%E4%B8%8E%E4%BC%98%E5%8C%96.md">FlashInfer关键算子迁移与优化</a>
|
||||
|
||||
### Track 2:FlashAttention 关键算子迁移与优化
|
||||
|
||||
|
|
|
|||
Loading…
Reference in New Issue