答案与解析
T1
答案:D.对所有 xi 减去最大值:xi′=xi−max(x),再计算 Softmax
解析:减去最大值不会改变 Softmax 的结果,同时可保证指数项不大于 1,避免数值溢出。
T2
答案:A.输入是图像和文本问题,输出是文本答案
1、softmax(x)i=∑jexjexi,当 xi 较大(如 >1000)会导致数值溢出。正确的稳定化实现是:
{{ select(1) }}
- 对 xi 进行 L2 归一化后再计算指数
- 对所有 xi 除以最大值:xi′=xi/max(x),再计算 softmax
- 使用双精度浮点数(FP64)存储中间结果
- 对所有 xi 减去最大值:xi′=xi−max(x),再计算 softmax
2、视觉问答(Visual Question Answering, VQA)是典型的多模态任务,它的输入和输出分别是什么?
{{ select(2) }}
- 输入是图像和文本问题,输出是文本答案
- 输入是文本,输出是图像
- 输入是文本答案,输出是图像和文本问题
- 输入是图像,输出是图像
3、某智能体采用分层强化学习(HRL)进行通信网络故障诊断的任务规划,将“故障检测-根因定位-配置修复-业务验证”的复杂任务分解为4个具有严格依赖关系的子任务:子任务A(故障检测)、子任务B(根因定位)、子任务C(配置修复)、子任务D(业务验证)。任务规则与奖惩机制如下:
-
任务依赖约束:子任务必须按顺序执行(A-B-C-D)。只有当前一个子任务成功完成后,才能执行下一个子任务;如果某个子任务执行失败,则后续所有子任务立即被跳过,不再执行。
-
基础奖惩规则:
- 子任务A:成功完成获得奖励 RA=5,失败则获得惩罚 PA=−RA/2;
- 子任务B:成功完成获得奖励 RB=8,失败则获得惩罚 PB=−RB/4;
- 子任务C:成功完成获得奖励 RC=12,失败则获得惩罚 PC=−RC/3;
- 子任务D:成功完成获得奖励 RD=16,失败则获得惩罚 PD=−RD/4。
- 级联惩罚规则:若某个子任务失败,除了该子任务的基础失败惩罚外,还会为当前失败子任务追加一个额外的惩罚,称为“级联惩罚”。级联惩罚的数值等于后续所有被跳过的子任务的基础奖励的平均值,并以负值形式累加到总奖励中。
注意:被跳过的子任务本身不获得任何奖励或惩罚,仅失败子任务会触发级联惩罚。
已知该Agent在一次执行中,成功完成了子任务A,子任务B执行失败,因此子任务C和D被跳过。请计算此次执行获得的总奖励值( )
{{ select(3) }}
- −4
- −11
- −25
- 3
4、已知离散单词x的嵌入向量为 vx=[2,3]T,单词y的嵌入向量为 vy=[4,1]T,采用欧氏距离计算两者的相似度(距离越小,相似度越高),则欧氏距离为( )
{{ select(4) }}
- 5
- 13
- 10
- 8
5、某单个人工神经元:输入 x=2,权重 w=1,偏置 b=0,激活函数为恒等变换 y=wx+b,损失函数 L=21(y−t)2,标签 t=5。使用反向传播计算 ∂w∂L 结果为( )
{{ select(5) }}