本题要求实现一个带容量上限 K 的 KV Cache 管理器,核心操作是在插入新 token 时,若缓存超出容量则淘汰注意力分数最低的 token(分数相同则淘汰位置编号较小者),并在查询时按位置升序输出所有缓存项。
需要维护两种检索需求:
在大语言模型(LLM)的自回归推理中,KV Cache 用于缓存历史 token 的 Key 和 Value 张量,其显存占用随序列长度线性增长。为支持长上下文,工业界采用动态稀疏策略:设定容量上限 K,仅保留注意力分数最高的 K 个 token,超出时淘汰分数最低者。
任务描述
实现一个稀疏 KV Cache 管理器,支持:
Scan the QR code below with WeChat to sign in
First-time scan will create your account automatically
请使用微信扫描下方二维码完成注册