#P5183. 选择题
-
Tried: 79
Accepted: 5
Difficulty: 5
所属公司 :
华为
时间 :2026年7月24日-AI方向
选择题
T1
答案:B.11
解析:由于 X 与 Y 独立,故 Var(Z)=22Var(X)+(−1)2Var(Y)=4×2+3=11。。
T2
答案:C.降低显存峰值
1、独立随机变量 X∼N(1,2)(均值1,方差2),Y∼N(2,3)。则 Z=2X−Y 的方差是?
{{ select(1) }}
- 1
- 11
- 7
- 5
2、在训练大模型时使用 activation checkpointing(激活检查点)主要是为了:
{{ select(2) }}
- 减少模型参数数量
- 自动提高数值精度
- 降低显存峰值
- 尽可能保存中间激活以加速反向传播
3、设某连续型随机变量 X 的概率密度函数为 f(x)={c(1−x2),0,−1≤x≤1其他,则常数 c 的值为:
{{ select(3) }}
- 1
- 21
- 43
- 23
4、为什么在深度学习优化中常用 L2 正则化来提升稳定性?
{{ select(4) }}
- 它能限制权重大小,降低模型对输入微小扰动的敏感度
- 它能保证全局最优解
- 它可以消除所有零特征值
- 它可以缩短训练时间
5、当使用交叉熵损失函数时,若真实标签为one-hot编码 [0,1,0],模型输出概率为 [0.1,0.8,0.1],其损失值为多少?
{{ select(5) }}
- log(0.8)
- −log(0.8)
- −(log(0.1)+log(0.8)+log(0.1))
- 0.8
6、在进行 PCA 之前,为什么通常建议先对特征做标准化处理?
{{ select(6) }}
- 因为标准化可以直接得到主成分
- 因为 PCA 只能处理服从正态分布的数据
- 因为标准化可以让不同量纲的特征在方差计算中更公平
- 因为标准化后特征一定会线性无关
7、在复杂多模态预测任务(如 VQA)中,后融合(Late Fusion)是指?
{{ select(7) }}
- 仅使用图像特征
- 使用独立的编码器后,仅在决策层融合特征
- 在输入层将图文拼接
- 使用单一 Transformer 处理所有模态
8、在深度神经网络(Deep Neural Networks)的典型结构中,**隐藏层(Hidden Layer)**的主要作用是:
{{ select(8) }}
- 负责显示模型的最终预测结果(如分类标签或回归数值)。
- 接收外部输入的原始数据,并将其直接传递给输出层。
- 通过多层次的非线性变换,从原始特征中自动提取和构造更高阶的特征表示。
- 存储训练过程中的损失函数值,以便计算梯度的方向。
9、某电商的智能客服平台为了挖掘用户痛点,以便进行产品改进,通过分析大量未标注的用户问题,对用户常见问题进行自动分类,针对该任务下面说法正确的是?
{{ select(9) }}
- 为了提升产品质量进行问题分析,属于强化学习
- 对用户问题生成了分类,属于生成式学习
- 对未标注的用户问题进行分类,属于无监督学习
- 对已有的用户问题进行分类,属于监督学习
10、当用户评分数据存在明显的评分尺度差异时(如用户A评分范围1-5,用户B评分范围3-5),更适合使用?
{{ select(10) }}
- 汉明距离
- 欧几里得距离
- 皮尔逊相关系数
- 曼哈顿距离
11、在 vLLM 中,PagedAttention 使用固定大小的 Block(默认 16 或 32 token)来管理 KV Cache,每个序列的 KV 被映射到若干逻辑块。如果将 Block Size 设为 1,会产生什么主要问题? {{ select(11) }}
- 模型无法加载
- 显存利用率达到 100%
- 计算吞吐量大幅提升
- Mapping Table 元数据开销过大且访问不连续
12、在评估预训练数据质量时,"困惑度(Perplexity)"常被用作指标。对一份高质量、符合目标分布的文本,模型对其计算的困惑度通常表现为? {{ select(12) }}
- 困惑度越高,表示数据越符合模型分布
- 困惑度仅用于评估生成多样性
- 困惑度越低,表示模型对数据的预测越准确
- 困惑度与数据质量无关
13、某模型推理时,KVCache 采用"滑动窗口"机制(窗口大小为 20),Prefill 阶段处理 30 个 token 的 prompt,Decode 阶段已生成 15 个 token,此时 KVCache 中保留的 token 数量及自注意力计算的上下文长度分别为( ) {{ select(13) }}
- 20个,20个
- 15个,20个
- 30+15=45个,45个
- 20个,15个
14、关于奇异值分解(SVD, Singular Value Decomposition),下列哪项说法正确? {{ select(14) }}
- U 和 V 可以取为正交矩阵
- 做 SVD 必须要求矩阵可逆
- 只有方阵才能做 SVD
- 奇异值可以为任意负数
15、关于余弦相似度(Cosine Similarity)与欧几里得距离(Euclidean Distance)的特性,以下说法最准确的是? {{ select(15) }}
- 余弦相似度仅反映向量的方向相对关系;欧几里得距离同时反映方向差异和绝对长度差异
- 将两个向量单位化(归一化到单位长度)后,余弦相似度与欧几里得距离可以相互转换,结果等价
- 两者都只反映向量的方向差异,与向量长度无关
- 余弦相似度考虑向量的绝对长度,欧几里得距离不考虑
16、关于重计算(activation checkpointing),训练时少保存中间激活、反向传播时再重算,下列说法正确的是哪些? {{ multiselect(16) }}
- 代价是反向传播时需要额外的前向重算
- 它一定同时降低训练时间
- 它只适用于推理阶段
- 它通过减少保存中间激活来降低显存占用
17、关于训练与推理阶段的显存优化策略,下列哪些判断更合理? {{ multiselect(17) }}
- 只要使用了 KV cache,生成阶段显存就与层数无关
- PagedAttention 主要用于改进推理阶段 KV cache 的分页管理与碎片问题
- 训练阶段可用重计算来换取更低的激活显存占用
- 降低数据类型位宽通常也能减少 KV cache 占用
18、下列关于 ResNet 中的 shortcut connection 描述正确的是 {{ multiselect(18) }}
- shortcut connection 有利于缓解深度神经网络的梯度消失问题
- shortcut connection 让网络具备了恒等映射能力,确保随着网络层数的增加,深层网络性能不会差于浅层网络性能
- shortcut connection 如果仅是一个 identity mapping 的直接通路,相当于把输入直接传给输出,对神经网络不会有好处,所以必须在残差通路上添加参数
- shortcut connection 应用广泛,在 MLP、CNN、RNN 等不同网络结构中均可添加
19、下面关于点积和余弦相似度的比较中,哪些说法是正确的? {{ multiselect(19) }}
- 如果两归零向量的点积为负,则它们的余弦相似度也必然为负
- 在 LLM 的 Softmax 注意力计算前使用余弦相似度代替点积,由于余弦值被限制在 [−1,1],如果缺少足够大的温度系数或缩放因子,可能会导致模型由于注意力分布过于平缓而无法收敛
- 点积不仅衡量方向的相似性,还包含了特征"强度(模长)"的信息
- 余弦相似度可以看作是两个向量经过 L2 范数归一化后的点积
20、在多模态 Agent(结合文本、图像输入,实现复杂任务规划)训练中,网络包含双分支结构:文本分支(Transformer 编码器)、图像分支(ViT 编码器),两分支输出经融合层(线性映射 + Swish 激活)后输入决策层,反向传播需同步更新两分支参数。结合多模态 Agent 训练特点与反向传播原理,下列说法正确的有( ) {{ multiselect(20) }}
- 多模态 Agent 反向传播时,有时需要对两分支的梯度进行归一化处理,使梯度幅值保持一致,避免参数更新失衡
- 若文本分支与图像分支的反向传播梯度幅值差异过大,会导致某一分支参数更新过快,Agent 任务规划出现模态偏倚(如过度依赖文本 / 图像)
- Swish 激活函数在输入为正且较大时,其导数接近 1,这有助于缓解反向传播中的梯度消失,适配多模态融合层的梯度传递
- 若图像分支 ViT 编码器深层出现梯度爆炸,可通过反向传播中的梯度裁剪限制梯度范数,同时不影响文本分支的梯度更新