答案:C.把 KV-Cache 切成固定长度的页再按页管理(Paged Attention) 解析:Paged Attention 把 KV 按固定页存放,减少碎片、便于复用,从而压显存并提高长文本 decode 吞吐。A 每步 PCA 代价高且不是常用推理策略;B 的 FlashAttention 优化算子,并不靠丢掉 KV-Cache 来省显存;D 按 token LRU 会打乱注意力所需的历史。
答案:B.泊松分布 解析:n=400 较大、p=0.005 很小,不合格件数近似 B(400,0.005),可再用泊松逼近,λ=np=2。伯努利对应单次 0-1 试验;均匀分布与题意无关;np=2 偏小,不宜用正态逼近。
1、LLM 在线推理要压 KV-Cache 显存、提高长序列 decode 吞吐,常用做法是 {{ select(1) }}
2、一批零件不合格率为 0.005。任取 400 件,不合格件数 Y 通常近似为哪种分布? {{ select(2) }}
3、RLHF 里过度优化奖励模型会出现奖励黑客。下列哪项不属于这类现象? {{ select(3) }}
4、某群体中年龄落在 20–29 岁的比例为 0.3,其余年龄为 0.7。两个年龄段里女性比例都是 0.55。随机遇到一名女性,她属于 20–29 岁的后验概率是 {{ select(4) }}
5、NLP 流水线里 Tokenizer 做的是 {{ select(5) }}
Scan the QR code below with WeChat to sign in
First-time scan will create your account automatically
请使用微信扫描下方二维码完成注册