答案:B.权重衰减与自适应参数更新解耦 解析:Adam 的权重衰减会和自适应梯度绑在一起,相当于对梯度做 L2;AdamW 把衰减从梯度更新里拆开,直接作用在参数上。显存、梯度平稳性、混合精度都不是它相对 Adam 的核心改动。
答案:D.91,72,83,58,46,15,41,8,27,19,33
1、预训练大模型时改用 AdamW 而不用 Adam,相对后者最关键的差异是() {{ select(1) }}
2、将关键字 8,15,27,41,19,83,91,72,58,46,33 依次插入初始为空的大根堆 H,得到的 H 是() {{ select(2) }}
3、一般图上做精确推断(边缘化/条件边缘化)时,Junction Tree(或变量消元)常说“树宽较小时才划算”。其时间/空间代价的主导因素应理解为() {{ select(3) }}
4、为不同网络挑选优化器时,下列说法错误的是() {{ select(4) }}
5、栈 S1、S2 中存整数,队列 Q 中存操作符。函数 Fun() 依次执行:
已知 S1 自底向顶为 3,5,7,14(14 在栈顶),S2 自底向顶为 8,6,4,3(3 在栈顶),Q 自队头向队尾为 −,+,&,∗(∗ 在队尾)。调用 3 次 Fun() 后,S1 栈顶是() {{ select(5) }}
Scan the QR code below with WeChat to sign in
First-time scan will create your account automatically
请使用微信扫描下方二维码完成注册