大语言模型的技术-算法原理

大模型推理优化策略

7.1 显存优化
- PagedAttention
  - KV cache，其具有以下特点:1. 显存占用大，14b级别的模型，每个token需要约0.7M-1M的显存；2. 动态变化：KV 缓存的大小取决于序列长度，这是高度可变和不可预测的。因此，这对有效管理 KV cache 挑战较大。该研究发现，由于碎片化和过度保留，现有系统浪费了 60% – 80% 的显存。
  - 为了解决这个问题，该研究引入了 PagedAttention，这是一种受操作系统中虚拟内存和分页经典思想启发的注意力算法。与传统的注意力算法不同，PagedAttention 允许在非连续的内存空间中存储连续的 key 和 value 。具体来说，PagedAttention 将每个序列的 KV cache 划分为块，每个块包含固定数量 token 的键和值。在注意力计算期间，PagedAttention 内核可以有效地识别和获取这些块。因为块在内存中不需要连续，因而可以用一种更加灵活的方式管理 key 和 value ，就像在操作系统的虚拟内存中一样：可以将块视为页面，将 token 视为字节，将序列视为进程。序列的连续逻辑块通过块表映射到非连续物理块中。物理块在生成新 token 时按需分配。在 PagedAttention 中，内存浪费只会发生在序列的最后一个块中。这使得在实践中可以实现接近最佳的内存使用，仅浪费不到 4%。
  - PagedAttention 还有另一个关键优势 —— 高效的内存共享。例如在并行采样中，多个输出序列是由同一个 prompt 生成的。在这种情况下，prompt 的计算和内存可以在输出序列中共享。PagedAttention 自然地通过其块表格来

大语言模型的技术-算法原理

大模型推理优化策略

最新关注

热文推荐

数据库实验8 视图

2023版Postman接口测试使用全指南(原来使用 Postman测试API接口如此简单)

关于前端的实操试题

解决JDK URLEncoder.encode 编码空格变 + 号

ANTLR4规则解析生成器(三)：遍历语法分析树

com.alibaba.druid.pool.DruidDataSource: create connection error, errorCode 0, state 08S01

大语言模型的技术-算法原理

大模型推理优化策略

相关文章

最新关注

热文推荐