#P5237. 第1题-选择题
-
Tried: 5
Accepted: 0
Difficulty: 5
所属公司 :
大疆
时间 :2026年8月14日
第1题-选择题
答案+解析
一、单选题
1
答案:C
MQA 全 head 共享 K/V,GQA 分组共享,MLA 低秩压缩 K/V,目标都是压推理期 KV cache。三者结构并不等价;MLA 也不是“精度必然远差于 MQA”;它们主要影响推理显存,而非“只改训练吞吐”。
1.单选题
1、MQA、GQA、MLA 与推理期 KV cache 的关系,正确的是? {{ select(1) }}
- 三者只抬高训练吞吐,对推理时 KV cache 占用几乎没有影响
- MLA 精度必然远低于 MQA,落地时基本不可用
- MQA 让所有 head 共用一组 K/V,GQA 按组共享,MLA 用低秩潜变量压缩 K/V,三者都以压缩 KV cache 显存为主要目标
- MQA / GQA / MLA 的数学形式完全相同,差别只在论文命名
2、关于 Whisper 模型,下列哪项正确? {{ select(2) }}
- 架构被限定为纯 CTC,禁止使用自回归解码
- 训练数据只覆盖 LibriSpeech,不包含网页字幕语料
- 在约 68 万小时网页字幕上做弱监督多任务训练,输入 log-Mel 频谱,零样本多语种 ASR 能力较强
- 只能输出转写文本,不具备翻译能力
3、Qwen-VL / InternVL 一类模型的 dynamic resolution,正确理解是? {{ select(3) }}
- 依靠 StyleGAN 先“生成”高清图,再送进 ViT
- 所有图像统一强制缩放到 224×224,不做动态分块
- 官方明确不支持超过 1K 分辨率的输入
- 按图像纵横比选择最接近的分块方案,使 patch token 数量与内容量匹配,从而在任意分辨率下保留细节
4、Transformer 中 pre-LN 与 post-LN,哪项说法成立? {{ select(4) }}
- pre-LN 与 post-LN 可证明恒等,替换后训练动态不变
- 深层堆叠时 post-LN 更稳,因此是当前大模型默认选择
- pre-LN 把 LayerNorm 放在残差分支之前,训练数值更稳,也被大模型更广泛采用
- 使用 pre-LN 时必须配合 warmup,而 post-LN 绝对不需要 warmup
5、DINOv2 特征与 SAM 特征在下游任务上的差异,正确的是? {{ select(5) }}
- DINOv2 语义可分性强,常作分类/检测/分割 backbone;SAM 对 mask 边界更友好,更适合可提示分割
- 两套特征空间完全对齐,下游可直接互换权重
- DINOv2 只能做聚类可视化,不能作为可微调 backbone
- SAM 更擅长 ImageNet 分类,DINOv2 更擅长交互式抠图
6、RAG 与 long-context in-context 的对比,哪项正确? {{ select(6) }}
- long-context 已全面淘汰 RAG,工业界不再做检索增强
- RAG 按需检索短证据写入 prompt,通常更能控制推理成本;把大段知识直接塞进超长上下文成本更高,也更易出现 lost-in-the-middle
- RAG 只能检索纯文本,无法扩展到图像或表格证据
- 两条路线数学同构,可以无条件互换
7、SigLIP 相对 CLIP 最关键的差异是? {{ select(7) }}
- SigLIP 放弃图文对比,改走 masked image modeling
- SigLIP 只对中文图文对有效,英文语料无效
- 两者损失形式相同,差别只在学习率调度曲线
- 用 sigmoid pairwise loss 替换 InfoNCE,从而不必对 batch 内全部负样本做 softmax 归一化,更利于放大 batch
8、ACT(Action Chunking Transformer)一次预测未来 k 步动作块,主要动机是? {{ select(8) }}
- 应固定 k=1 逐步预测;chunk 越长控制一定越差,因此禁止 chunk
- 一次输出未来 k 步动作块,可缓解逐步滚动带来的累积误差与非马尔可夫性,再配合 temporal ensemble 提升平滑度
- ACT 规范要求严格单步输出,不允许 chunk
- chunk 只对离散分类动作有效,连续控制场景无效
9、AdamW 相对 Adam 的关键改进是? {{ select(9) }}
- AdamW 不再维护二阶矩,以此换取显存
- AdamW 只适用于图像分类,序列模型应禁用
- AdamW 等价于 Adam 再加 L2,只是换了名字
- AdamW 将 weight decay 从梯度更新中解耦并直接作用于参数,与 Adam+L2 不等价,大模型训练通常更稳
2.多选题
10、关于 NeRF / 3DGS 及相关加速方案,正确的有? {{ select(10) }}
- NeRF 必须全部废弃,任意场景都应只保留 3DGS
- Instant-NGP 借助多分辨率哈希编码,常把训练从小时级压到分钟级
- TensoRF / Plenoxels 用张量分解或体素网格做显式表征,可减少乃至免除 MLP 推理
- gsplat / Nerfstudio 提供可扩展开源实现,常作研究与工程基线
11、关于视觉编码器演进,正确的有? {{ select(11) }}
- DFN(Data Filtering Network)侧重预训练前的数据筛选与清洗
- CLIP ViT 是 VLM 里常见视觉 backbone 之一,依赖大规模图文对比学习
- 视觉 encoder 一律必须冻结,任何微调都会破坏跨模态对齐
- SigLIP 用 sigmoid loss 替代 softmax,支持更大 batch,并被多款 MLLM 采用
12、关于主流 LLM 推理与服务框架,正确的有? {{ select(12) }}
- vLLM 基于 PagedAttention 提供高吞吐服务
- SGLang 结合结构化前端与 RadixAttention 复用前缀 KV cache,擅长多轮与工具调用
- MLC-LLM / llama.cpp 覆盖手机、桌面等跨端部署
- TensorRT-LLM 面向 NVIDIA GPU 深挖算子与图优化,追求更高吞吐
13、关于语音增强(SE)与去噪,正确的有? {{ multiselect(13) }}
- 深度 SE 必须依赖成对干净-噪声数据,自监督路线不可行
- RNNoise 是轻量「传统方法 + DNN」实时降噪,常见于会议场景
- DNSMOS 可作为无参考语音质量评估 proxy,用于 SE 训练或评测
- DEMUCS / SEMamba 等用深度网络在时域或时频域做端到端分离
14、关于 LLM Agent 的 Memory 与向量库,正确的有? {{ select(14) }}
- Episodic memory 记录时间戳与事件流,便于回放和失败复盘
- 短期记忆多半落在上下文窗口,长期记忆常落到向量库或结构化存储
- Memory 与 RAG 互斥,同一系统只能启用其中一种
- FAISS / Chroma / Qdrant / Milvus / Weaviate 都是常见开源向量库选项
15、关于 TTS 主流路线,正确的有? {{ multiselect(15) }}
- StyleTTS 可结合参考风格向量做可控音色与语调
- TTS 与 ASR 目标相反却数学等价,实现上可直接互换
- VITS 是端到端变分自编码 + Flow,声码器与声学模型联合训练
- VALL-E / VoiceCraft 走 codec token + 类 LLM 自回归,支持 zero-shot 声音克隆
16、关于多智能体(Multi-Agent)常见范式,正确的有? {{ select(16) }}
- AutoGen 以对话消息编排多 Agent 协作
- CAMEL 用 role-playing,让两个 Agent 分饰用户与助手推进任务
- CrewAI 用「角色 + 任务 + 流程」组织协作
- 复杂任务上多 Agent 一定全面优于单 Agent,且几乎没有通信开销
17、关于 Transformer 位置编码,正确的有? {{ multiselect(17) }}
- RoPE 对 Q/K 做旋转,支持相对位置,并可用 NTK / YaRN 扩长
- Sinusoidal 是固定三角函数、无需学习;可外推但能力有限
- ALiBi 在 attention 分数上加线性偏置,外推较好且无需显式位置向量
- Learnable 位置编码在 ViT 中常见,但对未训练长度通常不能直接外推
18、关于 LLM 压缩与量化,正确的有? {{ select(18) }}
- SmoothQuant 在权重与激活间做等价缩放,把量化难点从激活挪到权重侧,便于 INT8
- SqueezeLLM / GPTQ / AWQ 都属于 PTQ 类权重量化
- 一旦量化到 4bit,推理精度必然不可恢复,应一律禁用
- bitsandbytes 的 NF4 是常用 4bit 实现,常配合 QLoRA 做低成本微调
19、关于 BEV 与 Occupancy 感知,正确的有? {{ multiselect(19) }}
- BEV / Occupancy 已彻底淘汰全部 2D 感知链路
- CenterPoint / BEVDet 在 BEV 空间做检测,相对纯图像 detector 常能减少后处理
- BEVFormer 用 spatial cross-attention 与 temporal self-attention 在 BEV 空间融合多视图
- Occupancy 用 3D 体素刻画占据,可表达不规则形状物体
20、关于 VLA / RLHF 中的策略优化,正确的有? {{ multiselect(20) }}
- DPO 可直接从成对偏好得到闭式更新,不必单独训 reward model
- PPO 用 clip 限制更新幅度,是 RLHF 里常见优化器
- 只要做强化学习就必须先训 RM;DPO / GRPO 也不例外
- GRPO 用组内相对优势估计,可省掉单独 critic
21、关于多模态评测基准,正确的有? {{ multiselect(21) }}
- MMMU 侧重大学多学科图文推理,考察复杂多模态能力
- 通过单一 benchmark 就足以证明泛化,无需组合评测
- MMBench / SEED-Bench 从感知、认知、推理等维度覆盖通用能力
- TextVQA / DocVQA 强调文字与文档理解,考验 OCR 与推理联动