#P5253. 第1题-选择题
-
Tried: 10
Accepted: 2
Difficulty: 5
所属公司 :
阿里
时间 :2026年8月15日-阿里巴巴Agent岗
第1题-选择题
答案+解析
一、通用技术 · 单选题
1
答案:C
首 token 等待几乎不变,说明预填充不是瓶颈;变慢的是后续逐 token 生成,应优先优化解码、KV Cache 与连续批处理。改预填充、检索切分或训练流程,都对不上“输出越长越慢、TTFT 基本不变”的现象。
一、通用技术 · 单选题
1、某推理服务在回答简短问题时延迟正常;当提示词要求模型输出较长的逐步推理过程时,首个 token 的等待时间变化不大,但后续生成速度明显变慢,总耗时随输出长度增长。此时应优先优化哪个环节? {{ select(1) }}
- 优先加速预填充,把提示词编码和输入 token 的并行计算再压一档
- 先改向量库的切分方式和召回条数,认为延迟主要来自检索
- 优化解码阶段的逐 token 计算、KV Cache 访问与连续批处理
- 回头做训练数据清洗、学习率调度和检查点保存
2、大语言模型生成文本时,保持各词元的 logits 不变且最高得分词元唯一,将采样温度由 1 调整为 0.5。以下说法正确的是? {{ select(2) }}
- 各词元概率按相同比例缩小后再归一化,分布形状保持不变
- 分布更集中,最高分词元概率上升,且该词元仍然是最高分
- 只有生成速度降低,词元概率分布和采样结果均不会变化
- 分布更平坦,低分词元概率上升,最高分词元仍然不变
3、将 30、20、40、10、25、22 依次插入一棵初始为空的 AVL 树。完成全部必要的旋转后,最终根节点的值是多少? {{ select(3) }}
- 30
- 20
- 22
- 25
4、不加入位置编码时,若重新排列输入的 token,关于编码器中的全连接自注意力与解码器中的因果自注意力,下列判断正确的是? {{ select(4) }}
- 两者均为置换不变,重排输入不会改变输出内容
- 前者保持置换等变,后者通常不保持这一性质
- 两者均保持置换等变,因果掩码不会改变这一性质
- 前者不保持置换等变,后者仍会随输入同步重排
5、使用同一批用户的曝光日志比较模型 A 和模型 B。每个用户可能产生多次曝光,现需估计两个模型指标差的置信区间。以下哪种重采样方式更合适? {{ select(5) }}
- 将每次曝光视为独立样本,分别重采样 A、B 结果后再比较指标均值
- 将用户随机分成两半,一半只计算 A,另一半只计算 B,再比较指标
- 保留全部曝光不重采样,按曝光数直接使用独立同分布的正态近似
- 按用户成组重采样,并在每次抽样后重算 A、B 指标差
6、一个使用旋转位置编码(RoPE)的模型从 8K 上下文扩展到 64K。直接使用原训练配置后,短文本表现基本不变,但长文本中相隔很远的 token 更容易出现位置关系混淆。以下判断最严谨的是? {{ select(6) }}
- 保持位置频率不变,重点增加解码并行度与批处理规模以改善长距离位置关系
- 扩大 KV Cache 容量后,主要用短文本基准确认上下文扩展是否成功
- 比较不同 RoPE 缩放配置在长上下文和远距离依赖上的表现,必要时补充长上下文训练
- 保持原 RoPE 配置,将超过 8K 的位置编号映射回已有位置区间进行复用
二、通用技术 · 多选题
7、关于预训练(PT)、监督微调(SFT)和基于反馈的强化学习阶段,以下哪些说法正确? {{ multiselect(7) }}
- 预训练可通过大规模语料学习语言规律和通用表示
- SFT 只修改推理时的提示词,不会更新模型参数
- 强化学习阶段可利用奖励或偏好信号优化模型行为
- SFT 通常使用输入与目标输出样本调整模型参数
8、一个检索模块维护非降序数组 [1,2,2,2,5,7],下标从 0 开始。定义 lower(x) 为第一个值大于等于 x 的元素下标;若不存在则返回数组长度 6。模块准备利用查找结果之差统计数组中值落在闭区间 [L,R] 中的元素数量。按照上述查找规则和区间统计要求,以下哪些判断正确? {{ multiselect(8) }}
- 统计闭区间 [2,5] 时,lower(6)-lower(2) 返回 4,正好覆盖三个 2 和一个 5
- 当 R 是整数类型最大值时,仍可先计算 R+1 再调用 lower,溢出可以忽略
- 对当前数组,lower(2) 返回 1,因为下标 1 是第一个值不小于 2 的位置
- 对当前数组,lower(6) 的结果为 6,因为数组中没有等于 6 的元素,应返回数组长度
9、比较两个可调用工具的 Agent 方案,希望判断新方案是否在真实任务上稳定提升。以下哪些评测设计合理? {{ multiselect(9) }}
- 除任务成功率外,同时记录工具调用正确性、执行延迟和运行成本
- 自动裁判多次评分较一致时,无需人工抽检即可作为最终评价标准
- 在同一批任务和相同工具版本下运行方案,并按任务配对比较结果
- 分别在最终测试集上挑选两个方案的最佳提示词,再比较最高得分
10、关于 Bagging、Boosting 和决策树,以下哪些说法正确? {{ multiselect(10) }}
- 只要继续增加决策树深度,训练误差和泛化误差都会同步持续下降
- Bagging 通常基于重采样数据并行训练多个基模型,再聚合预测结果
- Boosting 通常顺序训练多个基学习器,使后续模型重点修正已有错误
- 决策树每次选择纯度提升最大的划分,都能保证测试误差持续下降
11、团队为文档问答系统升级 Embedding 模型,并使用近似最近邻索引进行召回。若希望检索结果稳定且便于评估,以下哪些做法合理? {{ multiselect(11) }}
- 先召回候选文档,再按需要使用更精细的模型进行重排
- 把内积作为余弦相似度的实现时,不再统一查询和文档的归一化流程
- 查询和文档使用兼容的模型版本及相同的向量处理方式
- 新旧模型维度一致时,先保留旧文档向量并只更新查询向量进行评估
12、准备将长序列模型中的全量注意力(full attention)替换为线性注意力(linear attention)。在评估该方案时,以下哪些判断合理? {{ multiselect(12) }}
- 全量注意力显式建模 token 两两交互时,计算或存储开销通常随序列长度平方增长
- 沿用相同 Q/K/V 投影后,可直接按全量注意力的效果基线评估,无需重测排序关系
- 部分线性注意力通过核映射或状态累积重排计算,可降低长序列开销
- 若任务依赖精确远距离匹配,应单独验证替换后的召回和长程依赖能力
三、方向卷 · 单选题(自然语言处理卷)
13、某 RAG 问答系统升级后,离线评测显示 Recall@5 从 0.62 升至 0.88,重排 nDCG@5 从 0.71 升至 0.84,但答案忠实度仍为 0.54,且大量回答包含检索片段中不存在的断言。下一步最应优先改进哪个环节? {{ select(13) }}
- 继续扩大召回 top-k,并把更多候选片段写入上下文
- 约束生成仅使用证据,并对无依据问题拒答
- 更换 Embedding 模型,并重新训练检索与重排索引
- 增大文档切片长度,并取消重叠以减少重复上下文
14、知识库每天全量更新一次,Embedding 模型保持不变。更新期间要求线上查询不中断,并且一次查询不能同时召回新旧版本的文档片段。以下哪种索引更新方案更合适? {{ select(14) }}
- 在线逐条删除旧向量,删除完成后再写入新向量
- 先用新语料继续预训练模型,再保留原有检索索引
- 离线构建新版本索引,校验后原子切换检索别名
- 把新旧文档同时追加到当前索引,由生成模型自行去重
四、方向卷 · 多选题(自然语言处理卷)
15、某对话语言模型完成偏好后训练,相对训练前模型进行同分布盲测时,后训练模型的胜率为 62%,无差别水平为 50%,该胜率的 95% 置信区间为 [58%,66%];事实问答得分保持 71 分,分布外良性请求的拒答率从 4% 升至 13%。根据这些结果,可以得出哪些结论? {{ multiselect(15) }}
- 拒答率变化应纳入后训练收益与代价评估
- 现有结果支持将偏好收益外推到分布外任务
- 该偏好集上的胜率提升具有统计支持
- 事实得分不变更可能由评测集难度不足造成
16、某命名实体识别模型对句子中的每个 token 输出 BIO 标签的发射分数。第二个位置的最高发射标签是 O,但加入线性链 CRF 后,维特比解码选择了 I-ORG,使完整路径成为合法的 B-ORG、I-ORG。以下判断正确的有哪些? {{ multiselect(16) }}
- 路径总分同时包含发射分数与标签转移分数
- 线性链 CRF 采用逐位置归一化计算序列条件概率
- 维特比先固定逐位置最高标签再计算路径转移分数
- 调整转移分数可改变路径而无需重算编码表示