A. 第1题-选择题
第1题-选择题
You cannot submit for this problem because the contest is ended. You can click "Open in Problem Set" to view this problem in normal mode.
一、单选题
1
答案:B
Tokenizer 把文本切成 token 并映射为整数 ID,供后续嵌入层使用。渲染成点阵、对齐音素谱、输出句法树都不是分词器的职责。
2
答案:A
一、单选题
1、园区门禁日志要写入检索库。入库前需把每条自然语言记录切成模型可消费的离散记号。Tokenizer 的主要作用是: {{ select(1) }}
- 把字符渲染成点阵图再送入卷积
- 把文本分成整数 ID 序列
- 把句子强制对齐到音素谱
- 直接输出依存句法树
2、夜班质检从一批零件中随机抽 m=10 件,每件为次品的概率为 π=0.3,记次品件数为 K∼Binomial(m=10, π=0.3)。则 E[K2] 为: {{ select(2) }}
- 11.1
- 4.2
- 5.2
- 3.9
3、夜间文档问答推理集群对比两种 KV Cache 显存方案。关于 PagedAttention 与传统 Attention 的显存管理区别,下列说法错误的是() {{ select(3) }}
- 调度器用一张逻辑页到物理块的映射表跟踪每条会话占用的块,生成结束时按映射回收
- 传统Attention的KV Cache显存占用与序列长度正相关,PagedAttention可突破该关联
- 连续分配方案会为每条请求预留一整段相邻显存存放 KV Cache,长会话结束后容易留下难以再分配的空洞
- 分页方案把 KV Cache 切成固定大小的块,彼此不相邻的空闲块也能重新挂到新请求上
4、振动传感器时序网络采用 Swish 激活 h(z)=z⋅σ(γz)。当 γ→∞ 时,h(z) 逼近以下哪个函数 {{ select(4) }}
- Softplus
- ELU
- ReLU
- 恒等映射
**5、桁架静力验算得到上三角刚度矩阵 H=−100410542,则 ∣H+(H∗)−1∣= () 注:H∗ 表示矩阵 H 的伴随矩阵 (也称为余子矩阵的转置),有 HH∗=H∗H=∣H∣I {{ select(5) }}
- −21
- 41
- −41
- 21
6、高压线路巡检要识别绝缘子裂纹。漏检(把真实裂纹错判为正常)的处置成本远高于误报。模型评估时应优先关注哪个指标? {{ select(6) }}
- 轮廓系数
- 决定系数 R2
- 均方根误差
- 召回率
7、园区导览助手先用监督微调打底,再用人类偏好评分器做对齐。过度追逐评分器分数会出现“奖励黑客”或过优化。以下哪个现象不属于这类典型表现? {{ select(7) }}
- 模型在面对它在预训练阶段从未见过的,全新的领域知识问题时,无法给出准确的回答。
- 评分器若把“带表情和客套话”当成优质回复,模型就会在每句后堆大量无信息礼貌用语刷分。
- 多轮对话后开始迎合评分器里被放大的“绝对肯定”口吻,把不确定事实说成百分之百。
- 为了显得已经办结,会捏造工单号和并不存在的处理进度。
8、测绘组要用 Newton 迭代求方程 g(t)=t2−3=0 的正根,用来标定杆长。初值 t0=2,求第一次迭代后的近似值 t1: {{ select(8) }}
- 2.25
- 1.25
- 1.75
- 2.5
9、体渲染 CUDA 内核因寄存器压力过大导致寄存器溢出时,溢出的数据会被存储到哪种内存中? {{ select(9) }}
- 纹理内存
- 指令缓存
- 局部内存(Local Memory,由全局内存物理支持)
- 主机页锁定内存
10、零件合格判定采用二元逻辑回归,已训练参数 θ=[0.5,−1.0],β=−1.0。现输入特征 u=[2,1],用 Sigmoid 计算 P(y=1∣u),结果最接近的是以下哪个值? {{ select(10) }}
- 0.56
- 0.27
- 0.60
- 0.43
11、语音转写大模型在自回归推理时,用分组查询注意力 (Grouped-Query Attention, GQA) 替代标准多头注意力 (MHA)。关于 GQA 与 MHA、MQA (Multi-Query Attention) 的对比,以下描述最准确的是? {{ select(11) }}
- GQA 通过让多组 Query 头共享同一组 Key 和 Value 头,实现了计算效率和模型性能的折中;其 K/V 头的数量介于 MHA(与 Query 头数相等)和 MQA(只有一个 K/V 头)之间。
- 先把全部 Query 头平均成一个向量,再用该向量对全部 Key 做一次注意力。
- 每一层随机丢掉一半注意力头,用剩余头的输出做集成。
- 用深度可分离卷积替换注意力,从而不再缓存 Key 与 Value。
12、实验室对同一浓度滴定 3 次,读数为 {3.0,3.2,2.8},真值为 3.0。均方根误差是 {{ select(12) }}
- 0.4
- 0.163
- 0.2
- 0.282
13、档案室要把扫描件灰度矩阵做分解压缩。矩阵奇异值分解(SVD)无法直接应用于以下哪个场景? {{ select(13) }}
- 决策树分类
- 仓储备货矩阵做低秩近似以压缩存储
- 证件扫描件去噪
- 公文-词项矩阵抽取主题
14、工单分类只有少量标注,希望尽量不动底座权重做适配。关于 Prompt Tuning(或 Prefix Tuning)的描述,正确的是? {{ select(14) }}
- 只替换最后一层分类头并微调该头
- 在输入前添加可学习的连续向量,仅更新这些向量的参数
- 把所有注意力层的权重一起反传更新
- 用教师模型的 logits 训练一个更小的学生网络
15、温湿度校准台记录两路读数 U、W。已知 Cov(U,W)=10,Var(U)=4,Var(W)=25,则 U 和 W 的相关系数是? {{ select(15) }}
- 0.8
- 0.1
- 0.5
- 1.0
二、多选题
16、水文站用梯形公式、Simpson 公式对水位曲线做数值积分。以下哪些因素会影响计算结果的精度 {{ multiselect(16) }}
- 数值积分方法的代数精度(如 Simpson 法的代数精度高于梯形法)
- 计算机的浮点数精度(如单精度vs.双精度)
- 积分区间的划分数量(步长越小,精度越高)
- 被积函数的光滑性(函数越光滑,误差越小)
17、矿石光谱要分成若干品类,用高斯混合模型配合 EM 算法估计。GMM 的 M-step 解析解需要 {{ multiselect(17) }}
- 均值更新为加权平均
- 各成分权重和为 1
- 各高斯成分必须共用同一个协方差矩阵
- 协方差矩阵正定
18、六次称重得到样本集合 S={3, 4, 5, 3, 8, 7},以下描述正确的是? {{ multiselect(18) }}
- 众数=3
- 极差=4
- 方差=11/3
- 平均数=5
19、病理切片描述模型要在院外新分布上仍能用。以下哪些因素会影响其泛化能力? {{ multiselect(19) }}
- 训练数据的规模
- 把验证集并入训练集反复训练到训练误差为零
- 正则化技术的应用
- 数据集的多样性
- 模型参数的数量
20、产线缺陷检测 CNN 在卷积块后插入 Batch Normalization。关于其正则化效果,正确的说法有: {{ multiselect(20) }}
- 会把每一层激活的方差按训练步数线性放大,从而更容易过拟合
- 允许使用更大的学习率,间接提升模型泛化能力
- 启用后即可删掉所有权重衰减,不再需要任何额外正则
- 动机是通过减少内部协变量偏移(Internal Covariate Shift)降低过拟合风险
华为AI模拟周赛-2026秋招第一场
- Status
- Done
- Rule
- IOI
- Problem
- 3
- Start at
- 2026-9-8 19:00
- End at
- 2026-9-8 21:00
- Duration
- 2 hour(s)
- Host
-
TaZi
- Partic.
- 262