答案:C.给定前缀后按自回归方式做生成式微调 解析:GPT 为 decoder-only,下游适配通常做因果语言建模或指令微调,由前缀触发自回归生成。A 把模型当成 encoder+分类头;B 的 segment embedding 来自句对编码(如 BERT);D 是掩码语言模型做法,均非 GPT 微调常态。
答案:D.避免低精度梯度因幅值过小而下溢成零 解析:损失缩放先放大 loss,反传后再把梯度缩回,避免 FP16 等格式把过小梯度下溢成 0。它并不直接加快 GEMM、节省激活显存或专门压低更新噪声。
1、对 decoder-only 的 GPT 类模型做下游适配时,实践中最常见的用法是哪一种? {{ select(1) }}
2、采用自动混合精度(AMP,如 FP16/BF16 与 FP32 并用)训练大模型时,对损失做 scaling 的核心动机是? {{ select(2) }}
3、下列做法里,估计参数时不显式引入先验分布的是() {{ select(3) }}
4、讨论大模型时所说的“涌现能力”(Emergent Abilities),通常指哪类现象? {{ select(4) }}
5、设总体 X 的分布为 P(X=1)=21−θ,P(X=2)=P(X=3)=41+θ。现有独立样本 1,2,2,3,1,2,3,2,1,则 θ 的最大似然估计为() {{ select(5) }}
In following contests:
Scan the QR code below with WeChat to sign in
First-time scan will create your account automatically
请使用微信扫描下方二维码完成注册