No testdata at current.
题目大致需求
给一批尚未展示的候选短视频,离线预测每条被展示后达到有效完播的概率。只能使用请求到达与展示前可获得的信息,不能使用展示后才产生的日志字段。程序从命令行接收输入 CSV,为每个 candidate_id 输出 completion_probability(0~1),顺序与输入逐行对应。可用 data/train.csv、data/valid.csv 训练,需处理缺失值、新创作者和不同候选量,运行时间控制在 60 秒内。
做题步骤安排
先读题,画开发地图。 别急着写代码。读 SCHEMA.md,区分展示前字段和展示后日志字段,确认标签是 effective_completion。用 pandas 在本地统计字段缺失率和分布,只把摘要给 AI,别把整个大文件丢进对话。让 AI 列出核心字段、潜在泄漏点、实现顺序和风险项。
搭基线与验证框架。 用 valid.csv 做时序验证,先跑通最简单的历史完播率均值模型,确认 main.py 的输入输出链路、CSV 格式和 ID 一一对应。固定随机种子,保证可复现。
分模块开发,写完即测。 把代码拆成数据加载、特征工程、模型训练、推理输出四部分,每步跑样例脚本。失败时把完整报错给 AI,并加限制:“只修当前问题,不重构其他已通过模块”。
特征注意信息时间。 只用展示前特征:作者历史完播率、视频年龄、时长、请求时段、候选池大小等。历史统计在训练集内计算,避免向未来泄漏;新 creator_id 用全局均值回退。
主动造边界测试。 样例只测 happy path。额外自测缺失值、新类别、输入行重排、候选数变化、概率是否在 [0,1]、ID 是否有重复或遗漏。
交卷前 AI 自审。 给 AI 明确指令:“检查字段是否只来自展示前、输出列名是否准确、随机种子是否固定、ID 是否一一对应、有无硬编码路径、是否联网、运行时间是否合规。列出所有疑点。”发现问题定点修复;如果得分卡住,果断新开会话换思路,并保留最高分版本。
By signing up a CodeFun2000 universal account, you can submit code and join discussions in all online judging services provided by us.