#P5197. 第1题-选择题
-
Tried: 14
Accepted: 3
Difficulty: 5
所属公司 :
华为
时间 :2026年8月5日-AI方向
第1题-选择题
答案与解析
T1
答案:D.对所有 xi 减去最大值:xi′=xi−max(x),再计算 Softmax
解析:减去最大值不会改变 Softmax 的结果,同时可保证指数项不大于 1,避免数值溢出。
T2
答案:A.输入是图像和文本问题,输出是文本答案
1、softmax(x)i=∑jexjexi,当 xi 较大(如 >1000)会导致数值溢出。正确的稳定化实现是:
{{ select(1) }}
- 对 xi 进行 L2 归一化后再计算指数
- 对所有 xi 除以最大值:xi′=xi/max(x),再计算 softmax
- 使用双精度浮点数(FP64)存储中间结果
- 对所有 xi 减去最大值:xi′=xi−max(x),再计算 softmax
2、视觉问答(Visual Question Answering, VQA)是典型的多模态任务,它的输入和输出分别是什么?
{{ select(2) }}
- 输入是图像和文本问题,输出是文本答案
- 输入是文本,输出是图像
- 输入是文本答案,输出是图像和文本问题
- 输入是图像,输出是图像
3、某智能体采用分层强化学习(HRL)进行通信网络故障诊断的任务规划,将“故障检测-根因定位-配置修复-业务验证”的复杂任务分解为4个具有严格依赖关系的子任务:子任务A(故障检测)、子任务B(根因定位)、子任务C(配置修复)、子任务D(业务验证)。任务规则与奖惩机制如下:
-
任务依赖约束:子任务必须按顺序执行(A-B-C-D)。只有当前一个子任务成功完成后,才能执行下一个子任务;如果某个子任务执行失败,则后续所有子任务立即被跳过,不再执行。
-
基础奖惩规则:
- 子任务A:成功完成获得奖励 RA=5,失败则获得惩罚 PA=−RA/2;
- 子任务B:成功完成获得奖励 RB=8,失败则获得惩罚 PB=−RB/4;
- 子任务C:成功完成获得奖励 RC=12,失败则获得惩罚 PC=−RC/3;
- 子任务D:成功完成获得奖励 RD=16,失败则获得惩罚 PD=−RD/4。
- 级联惩罚规则:若某个子任务失败,除了该子任务的基础失败惩罚外,还会为当前失败子任务追加一个额外的惩罚,称为“级联惩罚”。级联惩罚的数值等于后续所有被跳过的子任务的基础奖励的平均值,并以负值形式累加到总奖励中。
注意:被跳过的子任务本身不获得任何奖励或惩罚,仅失败子任务会触发级联惩罚。
已知该Agent在一次执行中,成功完成了子任务A,子任务B执行失败,因此子任务C和D被跳过。请计算此次执行获得的总奖励值( )
{{ select(3) }}
- −4
- −11
- −25
- 3
4、已知离散单词x的嵌入向量为 vx=[2,3]T,单词y的嵌入向量为 vy=[4,1]T,采用欧氏距离计算两者的相似度(距离越小,相似度越高),则欧氏距离为( )
{{ select(4) }}
- 5
- 13
- 10
- 8
5、某单个人工神经元:输入 x=2,权重 w=1,偏置 b=0,激活函数为恒等变换 y=wx+b,损失函数 L=21(y−t)2,标签 t=5。使用反向传播计算 ∂w∂L 结果为( )
{{ select(5) }}
- −3
- 3
- −6
- 6
6、某推荐系统中用户与短视频评分数据的矩阵维度为 [1000×800],若使用SVD分解,保留秩为 50,存储空间可减少的比例约为?
{{ select(6) }}
- 88.74%
- 87.74%
- 85.74%
- 86.74%
7、两家公司A、B生产同款芯片,A供应 70%,B供应 30%。A的次品率 2%,B的次品率 4%。随机抽到一个次品,来自B公司的概率是:
{{ select(7) }}
- 约 63.2%
- 约 53.8%
- 约 46.2%
- 30%
8、在文本相似度计算中,常使用余弦相似度衡量两个向量的方向相似性,其定义为
cos(θ)=∥x∥∥y∥xTy
设
x=(1,0,1),y=(1,1,0)。
求余弦相似度。
{{ select(8) }}
- 0.5
- 1
- 0.707
- 0.25
9、给定3个数据点 (0,1),(1,2),(2,5),其二次插值多项式在 x=1.5 处的值为:
{{ select(9) }}
- 3.125
- 3.5
- 3.75
- 3.25
10、在大模型RAG系统中,针对通信故障文本的语义检索场景,需计算未归一化向量的余弦相似度(核心语义匹配指标)。
已知:
- 用户查询向量 q=[0.8,1.2,1.6,2.0]
- 历史故障案例向量 c=[1.0,0.8,1.4,1.8]
要求:计算两向量的余弦相似度(结果保留3位小数),并判断该值对应的匹配等级(≥0.95 为极高匹配,0.85∼0.95 为高匹配,<0.85 为中等匹配),下列结论完全正确的是( )
{{ select(10) }}
- 余弦相似度 ≈0.842,属于中等匹配
- 余弦相似度 ≈0.989,属于极高匹配
- 余弦相似度 ≈0.948,属于高匹配
- 余弦相似度 ≈0.896,属于高匹配
11、在统计推断中,最大似然估计(MLE)的本质可以被理解为一种“逆向思考”。假设我们已知某随机过程符合某种分布,但不知道该分布的具体参数 θ。在观察到一组具体的样本数据 X 后,MLE 的核心操作是:
{{ select(11) }}
- 计算样本的均值和方差,并直接将其作为总体分布的参数估计值。
- 预先设定参数 θ 的先验分布,然后根据观测数据 X 计算 θ 的后验概率分布。
- 通过不断增加样本量,使得估计值在概率上收敛于真实参数 θ。
- 寻找一个 θ,使得在该参数下,产生这组观测数据 X 的可能性(Likelihood)达到最大。
12、在逻辑回归中,评价模型性能的常用指标不包括
{{ select(12) }}
- 对数损失(Log Loss)
- AUC(ROC曲线下面积)
- 准确率(Accuracy)
- 均方误差(MSE)
13、在端侧推理过程中,以下哪项因素最可能导致实际使用的峰值内存显著超过模型文件本身的大小?
{{ select(13) }}
- 中间激活、临时 buffer 和多分支并发执行
- 输出类别数固定
- 训练集规模过大
- 标签类别过少
14、在数据分析中,需要描述一组数据的“典型水平”或“中心位置”,下列哪个统计量最适合用于描述数据的集中趋势?
{{ select(14) }}
- 偏度
- 均值
- 标准差
- 方差
15、GSPO 引入序列级(sequence-level)重要性采样比率的主要原因是什么?
{{ select(15) }}
- 减少长序列中 token 级比率(token-level ratio)的高方差问题。
- 提高探索能力
- 消除奖励模型偏差
- 使算法变为离线策略(off-policy)
16、以下关于Householder变换(利用反射矩阵 H=I−2vvT 将向量反射到坐标轴方向的正交变换)的性质,正确的有:
{{ multiselect(16) }}
- Householder矩阵是正交矩阵
- Householder矩阵的行列式为+1
- Householder QR分解比Gram-Schmidt正交化在数值上更稳定
- Householder矩阵是对称矩阵
17、早期停止(Early Stopping)是一种简单有效的正则化方法。以下关于早期停止的说法中,正确的有?
{{ multiselect(17) }}
- 可以设置 patience 参数,允许验证集误差在停止前连续几轮不下降
- 早期停止会根据验证集的表现选择最佳轮数的模型
- 早期停止选择的模型在验证集上误差最低,但在测试集上一定最好
- 早期停止限制了模型的训练时间,从而限制了模型能学习的数据量
18、在深度学习模型的梯度下降优化过程中,梯度矩阵的秩与零空间特性对模型训练效果影响显著。已知某卷积神经网络(CNN)训练时的梯度矩阵 A∈R1000×2000,其秩 r(A)=500,结合线性代数中秩-零空间定理及深度学习优化原理,以下说法正确的有( )
{{ multiselect(18) }}
- 若梯度矩阵的零空间维度较高,说明在当前参数点处存在多个参数更新方向使每个样本的梯度在该方向上的投影为零,损失函数沿一阶变化为零,可能导致优化陷入平坦区域或鞍点
- 零空间维度越高,代表梯度矩阵的有效信息维度越低,参数更新时存在大量“无效方向”
- 该梯度矩阵的零空间维度 dimN(A)=1500
- 增大训练批次大小可直接降低梯度矩阵的零空间维度,从而提升模型优化的稳定性
19、考虑逻辑回归在在线学习(Online Learning)场景下的性质,以下哪些说法正确?
{{ multiselect(19) }}
- 在线逻辑回归每次用一个样本更新参数,等价于 batch size=1 的随机梯度下降
- AdaGrad 等自适应学习率方法在稀疏特征的在线场景中优于固定学习率
- 在概念漂移(Concept Drift)场景下,在线学习比批量训练更能适应数据分布变化
- 使用固定学习率的在线逻辑回归能保证严格收敛到全局最优解
20、训练大模型时常见的工程实践/训练稳定性手段有哪些?
{{ multiselect(20) }}
- 学习率 warmup(预热)
- 完全不使用任何学习率调度(schedule),固定学习率从头到尾
- 梯度裁剪(gradient clipping)
- 混合精度训练(FP16/BF16)