答案:A. 同时接近似幂律比例增大模型参数数、训练 token 数和训练步数。
解析:
Kaplan 等人在 2020 年的 Scaling Laws 工作里发现,语言模型的训练损失在模型规模、训练数据量(token 数)和计算量(步数)之间呈幂律关系,想高效降低损失,需要在这三者之间按近似幂律比例共同扩展,而不是只单独放大模型参数、embedding 维度或批大小。
1、根据2020年 Kaplan 等人的 Tranformer “Scaling Laws”,若在给定计算预算下想最小化语言模型的训练损失,应当 {{ select(1) }}
2、设 S=R 为实对称矩阵,下列每项说法与“S正交对角化”等价? {{ select(2) }}
3、假设输入图片的维度是 224×224×3,卷积神经网络的第一层中有5个卷积核,每个卷积核尺寸为7×7,具有1填充且步骤为1,并给出样例的输出的速度是多少 {{ select(3) }}
4、已知函数 f(x)=x2 ,用中心差分公式 ,取步长 h=0.1 ,计算 f‘(1) 数值结果为 {{ select(4) }}
5、给定数据:x=[1,2,3],y=[1,4,9]。用最小二乘法拟合直线 y=a+bx,则系数b为? {{ select(5) }}
Scan the QR code below with WeChat to sign in
First-time scan will create your account automatically
请使用微信扫描下方二维码完成注册