T1
答案:A.人类偏好排序 解析:在RLHF中,奖励模型的训练直接依赖于人类对模型生成结果的偏好排序数据,这些数据用于学习一个模拟人类偏好的奖励函数。
T2 答案:
1、在RLHF中,reward model的训练依赖于: {{ select(1) }}
2、若模型中attention部分head数h=8,GQA分组数g=2,则K/V矩阵的共享情况是 {{ select(2) }}
3、缩放点积注意力(Scaled Dot-Product Attention)与点积注意力(Dot-Product Attention)的区别是什么?假设键向量的维度为dk。 {{ select(3) }}
4、现有同一问题的两个算法A和B,A的时间复杂度为O(nk),B的时间复杂度为O(nlog(n)k),且已知该问题的规模仅与正整数n和k有关。以下说法正确的是 {{ select(4) }}
5、多模态Transformer中,若视觉输入被分块(patch)处理,以下关于分块的描述(一般情况下)哪项正确? {{ select(5) }}
Scan the QR code below with WeChat to sign in
First-time scan will create your account automatically
请使用微信扫描下方二维码完成注册