读入数据(JSON):train 为 [[text, label], ...],test 为 ["text1", ...]。
数据清洗:
" ".join(text.split()))。特征工程:
在自动化社区内容审核中,我们需要对用户的英文留言进行快速倾向判断,以区分其整体态度是积极(记为 1)还是消极(记为 0)。请你实现一个完整的文本分类流程,仅允许使用 numpy、pandas 和 scikit-learn 三个库。
具体步骤如下:
文本清洗:将所有留言文本转为小写,并移除多余空白——去掉首尾空白,并将内部连续空白字符压缩为单个空格。
特征抽取:
CountVectorizer 参数 ngram_range=(1,2),min_df=1,token_pattern=r'(?u)\b\w+\b' 对清洗后的文本构建词袋计数特征。TfidfTransformer 将计数特征转换为 TF-IDF 表示。
Scan the QR code below with WeChat to sign in
First-time scan will create your account automatically
请使用微信扫描下方二维码完成注册