1、答案: B. prefill主要受算力限制,decode主要受内存/访存限制
解析: Prefill一次处理大量Token,矩阵乘法规模大、并行度高,通常偏计算密集;Decode逐Token生成,计算并行度低且需反复读取模型权重,因此通常更受显存带宽限制。
2、答案: B. 模型出现欠拟合,需要增大模型容量
解析: 训练精度持续上升、训练loss下降,但验证精度先升后降、验证loss上升,是典型过拟合。L2正则化和Early Stopping都可缓解,而增大模型容量可能进一步加剧过拟合,因此B不合理。
1、在LLM推理服务中,prefill与decode两阶段的典型瓶颈分别更接近哪种特征: {{ select(1) }}
2、在Transformer文本分类模型训练中,观察到如下表现:训练集精度持续上升至97%,训练loss持续下降;验证集精度上升到一定峰值后明显回落,验证loss持续上升。据此判断与应对方案,不合理的是() {{ select(2) }}
3、在使用PCA进行降维时,通常通过什么指标来选择保留的主成分数量 {{ select(3) }}
4、在Transformer Block中,Residual Add(残差相加)后通常紧接着执行RMSNorm。在推理优化中,这两个算子融合的主要目的是? {{ select(4) }}
5、在Top-P(Nucleus Sampling,核采样)策略中,参数p=0.9代表什么含义? {{ select(5) }}
By signing up a CodeFun2000 universal account, you can submit code and join discussions in all online judging services provided by us.