根据 block_table 收集 K/V 页
block_table[b][i] 表示第 b 条序列的第 i 个逻辑块对应哪个物理页。
因此对于每个 batch b,需要按照 block_table[b] 的顺序依次读取:
实现分页注意力(Paged Attention,vLLM 风格)。
KV 缓存不再连续存储,而是存放在固定大小的页(block)中。block_table 将逻辑块索引映射到物理页索引,从而实现非连续的内存分配。
首先根据 block_table 收集每条序列对应的 K/V 页,将其拼接并截取到 context_len,然后执行标准缩放点积注意力计算。
Scan the QR code below with WeChat to sign in
First-time scan will create your account automatically
请使用微信扫描下方二维码完成注册