#P5295. 第1题-选择题
-
Tried: 0
Accepted: 0
Difficulty: 5
所属公司 :
荣耀
时间 :2026年8月25日
第1题-选择题
答案与解析
1、 答案:A.Ta
解析:Left(字符串,n),从字符串左侧截取n个字符,Left('Tableau is good', 2)截取前2个字符得到Ta。
2、 答案:C.reduceByKey 是 Transformation 算子
1、执行下面这段代码后,打印出的数组是什么?
import numpy
arr = numpy.array([1, 2, 3])
numpy.append(arr, 4)
numpy.delete(arr, 2)
print(arr)
{{ select(1) }}
[1 2 4][1 3 4][2 3 4][1 2 3]
2、关于 Hive 库与表,下列说法正确的是? {{ select(2) }}
- Hive 从早期版本起就默认提供完整的行级 INSERT / UPDATE / DELETE,与常见关系库无差别
- 内部表和外部表只是建表语法不同,DROP 时对 HDFS 数据的处理完全一样
- 数据库在 metastore 里主要是一层命名空间,对应一套目录
CREATE DATABASE时不能用LOCATION指定存储路径
3、SQL 里要把一个表达式显式转成另一种数据类型,应使用哪个函数? {{ select(3) }}
concatisnumericchangecast
4、在 Tableau 中把字段拖到「颜色」:一类字段会给每个成员单独着色,另一类字段会生成渐变。这两类依次是? {{ select(4) }}
- 连续值,离散值
- 地理角色,离散值
- 经度,度量
- 离散值,连续值
5、Spark 中 reduceByKey 与 groupByKey 的差别,下列哪句正确?
{{ select(5) }}
- 两者都会在 map 端先做合并
groupByKey会在 map 端合并,reduceByKey不会- 两者都不会在 map 端合并
reduceByKey会在 map 端先合并,groupByKey不会
6、关于业务指标体系,下列描述正确的是? {{ select(6) }}
- 指标体系就是把互不相关的指标堆在一份报表里
- 一套指标体系里最多只允许放一个指标
- 指标体系通常从多个维度把业务梳理成可对照的指标集合
- 指标体系不能用来判断当前业务是否运转正常
7、下面代码的运行结果是?
import numpy as np
a = np array([2,3,3])
print(a)
{{ select(7) }}
[2, 3, 3]- 报错
array([2, 3, 3])[[2, 3, 3]]
8、Tableau 中 LEFT('Tableau is good', 2) 的返回值是?
{{ select(8) }}
isTa- 执行报错
good
9、关于 Hive 索引,下列哪一句是错误的? {{ select(9) }}
- Hive 从 1.x 到 3.x 一直完整保留索引功能,各版本都能建索引
- Hive 只提供能力有限的索引
- 在指定列上建索引后,通常会多出一张索引表
- 可以用
EXPLAIN观察语句是否走索引
10、某市降雨量每 10 分钟记一行,表 data 中该日数据如下(时间列为索引):
rainfall
2021-09-01 00:00:00 40
2021-09-01 00:10:00 84
2021-09-01 00:20:00 3
2021-09-01 00:30:00 38
2021-09-01 00:40:00 59
...
2021-09-01 23:10:00 54
2021-09-01 23:20:00 24
2021-09-01 23:30:00 58
2021-09-01 23:40:00 56
2021-09-01 23:50:00 43
要把 data 重采样成「每个整点一小时内降雨量之和」,得到新表 df。示例:
2021-09-01 00:00:00 266
2021-09-01 01:00:00 161
...
2021-09-01 23:00:00 251
下列哪段能得到 df?
{{ select(10) }}
df = data.resample('T').sum()df = data.resample('D').sum()df = data.resample('H').sum()df = data.resample('W').sum()
11、下面关于 Spark RDD 的说法,哪一句是错误的? {{ select(11) }}
- Lineage 会记下 RDD 的元数据以及经历过的转换
- 窄依赖指多个子 RDD 的分区共同依赖同一个父 RDD 分区
- 缓存是迭代计算和交互式查询变快的关键手段
- RDD 只提供粗粒度转换,即在大批记录上执行同一种操作
12、下列哪一项通常不归入「用户类」指标? {{ select(12) }}
- 留存率
- 活跃率
- PV(页面浏览量)
- 新增用户数
13、关于 Hive 命令行交互,下列哪一句是错误的? {{ select(13) }}
- CLI 里的
exit会像事务型数据库那样先回滚未提交数据再退出 hive -f用来执行文件中的 SQLhive -e可以不进入交互窗口、一次性跑完 SQL- 直接运行
hive会进入交互式 CLI
14、下面代码打印的 shape 是?
import numpy as np
a = np.array([[2,4,6],[1,5,3]])
print(a.shape)
{{ select(14) }}
(2, 3)(3, 2)23
15、DAX 中求两表交集应使用哪个函数? {{ select(15) }}
EXCEPTUNIONINTERSECTUNION ALL
16、分析目的是把复杂问题拆成可下手的小问题,应优先选用哪种方法? {{ select(16) }}
- 多维度拆解
- 逻辑树分析
- PEST 分析
- 对比分析
17、关于 Hive 数据定义,下列哪一句是错误的? {{ select(17) }}
- 默认库路径一般在 HDFS 的
/user/hive/warehouse/ - 用
locate指定数据库在 HDFS 上的存放位置 - 用
CREATE DATABASE创建数据库 - 分区表对应 HDFS 上的独立目录,目录里是该分区的数据文件
18、下列关于 Spark 算子类型的判断,哪一句正确? {{ select(18) }}
groupByKey是 ActioncountByKey是 TransformationsortByKey是 ActionreduceByKey是 Transformation
19、在 Power BI 中用 CALCULATE 时,要激活模型里那条未激活的关系,应使用哪个函数?
{{ select(19) }}
RELATEDUSERELATIONSHIPRELATEDTABLELOOKUPVALUE
20、关于用户指标,下列哪一句是错误的? {{ select(20) }}
- 留存率可以反映功能对用户的粘性
- 日新增用户用来衡量当天新进来的用户规模
- 活跃率 = 活跃用户数 / 总用户数
- 次日留存率 = 第 2 天的全部用户数 / 第 1 天的总用户数
21、下面代码的输出是?
import numpy as np
arr = np.arange(15)
sli = slice(2, 10, 3)
print(arr[sli])
{{ select(21) }}
[2 5 8]2 5 8(无括号)[2 5 8 11 14][3 6 9]
22、关于 Flink 状态分类,下列哪一项不是合法类别? {{ select(22) }}
- keyed state
- operator state
- broadcast state
- transform state
23、成绩表 t_stu_course_score 如下,需要按课程取出分数最高的两名学生。哪条 SQL 正确?
| name | course | score |
|---|---|---|
| 张三 | 语文 | 90 |
| 数学 | 80 | |
| 英语 | 90 | |
| 李四 | 语文 | 91 |
| 数学 | 77 | |
| 英语 | 60 | |
| 王五 | 语文 | 66 |
| 数学 | 99 | |
| 英语 | 88 | |
| 赵六 | 语文 | 98 |
| 数学 | 100 | |
| 英语 | 70 | |
| {{ select(23) }} | ||
SELECT name, course, score FROM (SELECT name, course, score, ROW_NUMBER() OVER (PARTITION BY name ORDER BY score DESC) AS rk FROM t_stu_course_score) t WHERE rk <= 2SELECT name, course, score FROM t_stu_course_score ORDER BY score DESC LIMIT 2SELECT name, course, score FROM (SELECT name, course, score, ROW_NUMBER() OVER (PARTITION BY course ORDER BY score DESC) AS rk FROM t_stu_course_score) t WHERE rk <= 2SELECT name, course, ROW_NUMBER() OVER (PARTITION BY course ORDER BY score DESC) AS rk FROM t_stu_course_score GROUP BY name, course HAVING rk <= 2
24、要在 Tableau 里把坐标轴文字设成粗体,正确做法是? {{ select(24) }}
- 右键轴 →「格式」→ 把字体改为粗体
- 右键轴 →「编辑轴」→ 在刻度范围里改成粗体
- 主菜单「格式」→「字段标签」→ 设为粗体
- 选中轴后按
Ctrl+B/Command+B
25、要表现「某一部分占总体的比重」,最合适的图是? {{ select(25) }}
- 折线图
- 饼图
- 散点图
- 柱状图
26、已有一维数组 students 与对应成绩 scores,要取出 Henry、Helen 的成绩得到 array([77, 94])。哪段代码正确?
{{ select(26) }}
- 使用 Python 的
or:names = (students == 'Henry') or (students == 'Helen'),再scores[names] - 使用按位或:
names = (students == 'Henry') | (students == 'Helen'),再scores[names] - 使用 Python 的
and:names = (students == 'Henry') and (students == 'Helen'),再scores[names] - 使用按位与:
names = (students == 'Henry') & (students == 'Helen'),再scores[names]
27、Hive 2.x 中,下列哪项可以作为服务存在? {{ select(27) }}
- 只有 HiveServer2,没有 Metastore
- WebHCat Server、Hive Metastore Server、HiveServer2 都是
- 只有 WebHCat Server
- 只有 Hive Metastore Server
28、数组 n 为 [2.1, 1.9, 0.3, 1.1, -1.2, 3.8, -2.1]。向下取整后要得到
[ 2. 1. 0. 1. -2. 3. -3. ]
下列哪句正确? {{ select(28) }}
m = np.ceil(n)m = np.trunc(n)m = np.around(n)m = np.floor(n)
29、关于 Hive 数据操作,下列哪一句是错误的? {{ select(29) }}
- 往表里写数据只能用
INSERT INTO,不能用LOAD DATA或INSERT OVERWRITE - 建表时可用
LOCATION指定数据路径 TRUNCATE只能清空管理表(内部表),不能用来清空外部表数据- 装载数据可以使用
LOAD DATA
30、下列四段代码,哪一段的打印结果与另外三段都不同? {{ select(30) }}
np.concatenate((a, b)),其中a=[[0,4,8],[1,5,9]],b=[[2,6,10],[3,7,11]](默认轴)print(a.T),其中a = np.arange(12).reshape(3, 4)np.concatenate((a, b), axis=1),a、b同上两个(2, 3)数组print(np.transpose(a)),其中a = np.arange(12).reshape(3, 4)
31、把 Tableau 工作表导出为图像文件时,下列哪种格式一般不可用? {{ select(31) }}
- JPEG(
.jpg/.jpeg) - PNG
- BMP
- TIFF
32、关于指标体系的作用,下列哪一句不正确? {{ select(32) }}
- 指标体系应尽量少用比率、占比这类比例指标
- 可以评估业务哪里能改进、下一步往哪走
- 可以通过拆解指标定位当前问题
- 可以用来监控业务是否异常
33、表 test(name) 有四行:tom、tom_green、tomly、lily。语句
SELECT * FROM test WHERE name RLIKE 'tom.*'
会返回几行? {{ select(33) }}
- 2
- 3
- 1
- 0
34、Hive 中音乐表 music、收藏表 user_music、关注表 user_follow 如下。
music:
| id | name |
|---|---|
| 1 | 漠河舞厅 |
| 2 | 天外飞来物 |
| 3 | 金玉良缘 |
| 4 | 天下无双 |
| 5 | 一笑江湖 |
user_music:
| user_id | music_id |
|---|---|
| 1 | 1 |
| 2 | |
| 3 | 2 |
| 4 | 3 |
user_follow:
| user_id | follow_id |
|---|---|
| 1 | 3 |
| 4 | |
| 2 | 1 |
执行:
SELECT
m.user_id AS user_id,
concat_ws(',', collect_set(n.music_name))
FROM
(
SELECT user_id, follow_id
FROM user_follow
WHERE user_id = 1
) m
LEFT JOIN
(
SELECT
t0.user_id AS user_id,
t0.music_id AS music_id,
t1.name AS music_name
FROM user_music t0
LEFT JOIN music t1
ON t0.music_id = t1.id
) n
ON m.follow_id = n.user_id
GROUP BY m.user_id
输出应是? {{ select(34) }}
1 天下无双,金玉良缘1 天外飞来物,金玉良缘1 天外飞来物,漠河舞厅1 天外飞来物,一笑江湖
35、报表里已经算完销售额,现在只要画面上留下黑色商品。在计算后的筛选里,应选用哪个 DAX 函数? {{ select(35) }}
ALLSELECTEDALLFILTERSKEEPFILTERS