答案:C
首 token 等待几乎不变,说明预填充不是瓶颈;变慢的是后续逐 token 生成,应优先优化解码、KV Cache 与连续批处理。改预填充、检索切分或训练流程,都对不上“输出越长越慢、TTFT 基本不变”的现象。
1、某推理服务在回答简短问题时延迟正常;当提示词要求模型输出较长的逐步推理过程时,首个 token 的等待时间变化不大,但后续生成速度明显变慢,总耗时随输出长度增长。此时应优先优化哪个环节? {{ select(1) }}
2、大语言模型生成文本时,保持各词元的 logits 不变且最高得分词元唯一,将采样温度由 1 调整为 0.5。以下说法正确的是? {{ select(2) }}
3、将 30、20、40、10、25、22 依次插入一棵初始为空的 AVL 树。完成全部必要的旋转后,最终根节点的值是多少? {{ select(3) }}
4、不加入位置编码时,若重新排列输入的 token,关于编码器中的全连接自注意力与解码器中的因果自注意力,下列判断正确的是? {{ select(4) }}
5、使用同一批用户的曝光日志比较模型 A 和模型 B。每个用户可能产生多次曝光,现需估计两个模型指标差的置信区间。以下哪种重采样方式更合适? {{ select(5) }}
Scan the QR code below with WeChat to sign in
First-time scan will create your account automatically
请使用微信扫描下方二维码完成注册