会员专享
请先
登录,登录后可使用今日免费解锁;
开通会员后可解锁完整内容。
答案+解析
一、单选题
1
答案:C
densification 是在梯度大或尺度不匹配处做 clone / split,用来补欠拟合区域。换成泊松后端、训练期锁死个数、只统一放大半径,都不是这件事。
一、单选题
1、展厅要把文物点云做成可交互的三维高斯场景。训练中途会做 densification。下列说法正确的是?
{{ select(1) }}
- densification 用泊松重建替换高斯表示,训练中途切换几何后端
- densification 仅在导出 mesh 时执行一次,训练阶段冻结高斯个数
- 在梯度较大或高斯尺寸不匹配的区域做 clone / split,动态增加或分裂高斯,提升欠拟合区域的重建质量
- densification 只把所有高斯半径统一放大一倍,不增不减个数
2、值班日志检索要把很长的 token 序列送进注意力层,显存已经打满。讨论 FlashAttention 的核心机制时,下列说法正确的是?
{{ select(2) }}
- 通过在线 softmax 与分块(tiling)把 attention 显存从 O(N²) 降到 O(N),数值等价原实现
- 把注意力矩阵改成随机投影后不可逆压缩,显存下降但无法还原原分数
- 只在 CPU 上用稀疏掩码跳过计算,GPU kernel 保持不变
- 用固定窗口截断 key/value,超出窗口的位置直接丢弃且不可恢复
3、巡检照片问答台要把摄像头画面和值班提问送进同一套语言模型。关于 LLaVA 系列视觉–语言对齐的典型做法,下列说法正确的是?
{{ select(3) }}
- 把图像像素直接当词表 id 查 embedding,不再经过视觉编码器
- 用两层 MLP projector 把视觉 encoder 特征映射到 LLM 的 token embedding 空间,与文本 token 拼接后送入 LLM
- 用对比学习把整图压成一个标量分数,再与文本相似度相乘
- 训练时删掉文本 token,只让 LLM 读视觉特征
4、货架俯拍要做商品检测。骨干从 ViT 换成 Swin Transformer。关于 Swin 相对 ViT 的关键差异,下列说法正确的是?
{{ select(4) }}
- Swin 把整图展平后只做一层全局平均池化,不再计算任何注意力
- Swin 强制输入分辨率必须是 224,其他尺寸直接拒绝
- Swin 用 FFT 把空间混合换成频域点乘,与窗口无关
- Swin 用 window attention + shifted window,把复杂度从 O(N²) 降到 O(N),并保留跨窗口信息交换
5、分拣机械臂要根据料箱画面给出抓取轨迹。策略头在确定性 MLP 和 Diffusion Policy 之间选型。下列说法正确的是?
{{ select(5) }}
- 通过条件扩散过程建模多模态动作分布,可表示"多种同样合理"的动作,并输出稳定的动作 chunk
- 把动作空间离散成 4 个方向按键,用分类头一次输出
- 用卡尔曼滤波替代策略网络,不再学习视觉条件
- 推理时把扩散步数固定为 0,直接输出噪声本身作为动作