#P5262. 第1题-选择题
-
Tried: 135
Accepted: 2
Difficulty: 5
所属公司 :
华为
时间 :2026年8月19日-AI方向
第1题-选择题
答案与解析
单选题
1
答案:
A.极度集中在 0 附近,绝大多数随机向量彼此几乎正交
解析:高维空间几何现象,维度越高,两个随机均匀向量夹角越接近90°,余弦相似度趋近0,高维下随机向量近似正交。
1、在极高维度的特征空间(如维度 d≥4096)中,如果随机采样两个均匀分布的向量,它们的余弦相似度分布会 {{ select(1) }}
- 极度集中在 0 附近,绝大多数随机向量彼此几乎正交
- 呈现均匀分布,在 [−1,1] 之间等概率出现
- 呈现明显的双峰分布,集中在 −1 和 1
- 极度集中在 1 附近,维度灾难导致所有向量相互趋同
2、在FlashAttention优化中,Tiling(分块)策略的主要目的是什么? {{ select(2) }}
- 提高模型参数量
- 提升浮点运算的精度
- 减少对HBM的访问,将计算限制在SRAM中
- 实现模型并行训练
3、设 T:Rn→Rm 为一个映射。若对任意向量 u,v 以及任意标量 α 满足,则称映射 T 为线性变换。在线性代数中,任意线性变换都可以通过哪种结构表示 {{ select(3) }}
- 向量加法
- 随机映射
- 矩阵乘法 Ax
- 标量函数
4、在处理大规模数据集时,为了降低层次凝聚聚类(HAC)的内存占用,以下哪种做法是合理的 {{ select(4) }}
- 维护所有样本的完整关系信息以提高聚类质量
- 使用全量距离矩阵进行计算以确保精度
- 仅保存完整的距离矩阵而不做任何压缩处理
- 采用稀疏近邻图替代稠密全量距离矩阵
5、音视频联合生成模型(如VideoLDM、Stable Video Diffusion)中,音频条件通常如何注入视频生成过程? {{ select(5) }}
- 将音频转换为频谱图作为第一帧,用图像扩散模型生成后续帧
- 音频仅在推理时作为提示词(prompt)输入,训练时不使用
- 通过音频编码器提取时序特征,经交叉注意力或AdaIN注入视频UNet的时序层
- 直接将原始音频波形与视频帧的特征层进行拼接
6、在循环神经网络(RNN)中,处理长序列时容易遇到的主要问题是? {{ select(6) }}
- 梯度消失或梯度爆炸
- 训练速度过慢
- 显存占用过大
- 参数过多
7、关于Transformer的编码器‑解码器架构(如原始Transformer)与仅解码器架构(如GPT系列)的区别,下列说法正确的 {{ select(7) }}
- 两种架构用到的训练数据一般相同,可以复用
- 编码器‑解码器架构中,解码器没有自注意力机制
- 仅解码器架构使用双向注意力,编码器‑解码器架构使用单向注意力
- 仅解码器架构完全舍弃了交叉注意力机制
8、设 (A,B,C) 为事件,已知
(1) A 与 B 互斥 (2) (P(A)=0.25,P(B)=(0.15),P(C)=(0.4)0) (3) P(A∩C)=0.1,P(B∩C)=0.05
则 P(A∪B∣C) 为:
{{ select(8) }}
- ((0.3)75)
- (0.3)
- (0.15)
- (0.4)
9、某大模型采用PagedAttention管理KV Cache,将KV Cache划分为大小为4KB的页,现有5KB、2KB、3KB碎片,下面说法关于分页分配正确的是的是() {{ select(9) }}
- PagedAttention无法利用小于4KB的碎片,3个碎片均无法分配,仍为碎片化
- 5KB碎片可分配1个4KB页,剩余1KB碎片;2KB+3KB碎片可合并为5KB,分配1个4KB页
- 仅5KB碎片可分配1个4KB页,2KB、3KB碎片无法利用,仍为碎片
- 3个碎片均可直接分配4KB页,实现无碎片利用
10、若随机变量 X∼N(0,σ2),则其四阶中心矩 E[X4] 等于 {{ select(10) }}
- σ4
- 3σ4
- 2σ4
- 0
11、在二分类任务中,以下哪一项最准确地描述了精确率(Precision) {{ select(11) }}
- 所有样本中预测正确的比例
- 正负样本数量之比
- 实际为正的样本中,被预测为正的比例
- 预测为正的样本中,真正为正的比例
12、在混合专家模型(MoE)中,一个Transformer Block 的专家并行的核心思想
{{ select(12) }}
- Experts 分布到不同 NPU/GPU
- Attention 切分
- LayerNorm 切分
- Embedding 切分
13、在反向传播中累积梯度时,最可能导致数值下溢(underflow) {{ select(13) }}
- 对非常小的梯度做累加并保存在低精度格式
- 权重初始化为较大值,造成稍微更新一下,就溢出了
- 多次使用ReLU激活,产生大量0梯度,造成极小的数
- 增大学习率,导致网络梯度过大
14、关于GPT系列模型的训练范式,下列描述正确的是? {{ select(14) }}
- 预训练时不使用位置编码
- 使用双向上下文进行预训练
- 采用掩码语言建模作为预训练目标
- 使用自回归方式预测下一个词
15、动量法的主要作用是? {{ select(15) }}
- 减少模型的参数量
- 防止过拟合
- 加速收敛,并抑制梯度在狭窄山谷中的震荡
- 增加梯度的方差
16、关于正则化线性回归模型,下列说法正确的有 {{ multiselect(16) }}
- Lasso使用L1惩罚,可以进行特征选择
- 岭回归使用L2惩罚,可以将某些系数精确压缩到0
- 岭回归的解是唯一的,而Lasso的解可能不唯一
- 正则化参数越大,模型复杂度越低
17、在传统HuggingFace Transformers推理中,每个请求分页分配在内存管理中有哪些优势? {{ multiselect(17) }}
- 允许不同请求共享相同Prefix的显存
- 减少模型权重显存
- 消除最大长度预留导致的内部碎片
- 动态按需分配KV Cache
18、 某大模型推理场景需求:单卡显存32GB,模型权重(FP16)占用10G显存碎片化问题,提升显存利用率,下列优化方案组合合理的有() {{ multiselect(18) }}
- 采用重计算策略,缓存部分KV向量,减少KV Cache总占用
- 启用PagedAttention,解决显存碎片化,提升显存利用率
- 采用INT8量化KV Cache,将精度从FP16转为INT8,降低显存占用
- 启用KV Cache滑动窗口(窗口大小=512),控制KV Cache最大占用
19、在处理长文本时,RoPE(旋转位置编码)在推理时的特点有: {{ multiselect(19) }}
- 会显著增加 KV Cache 的体积
- 在计算注意力得分时融入相对位置信息
- 具有一定程度的长度外推性
- 不依赖固定长度的绝对位置编码
20、下列哪些是解决RNN梯度消失问题的常用方法? {{ multiselect(20) }}
- 合适的权重初始化
- 使用ReLU作为激活函数
- 使用LSTM或GRU
- 梯度裁剪