摘要
本发明公开了一种基于机器学习的数据质量控制与预处理的方法,该方法具体包括如下步骤:S1,对长时间序列构造三段时间窗口,并对数据进行预处理;S2,利用统计判别算法过滤掉数据集的正样本,获取负样本数据集;S3,对于负样本数据集,构建单分类模型进行判决,完成异常值的处理;S4,获取S1中预处理后的数据集,采用监督‑无监督混合训练方法对数据集进行优化,获取缺测值填补后的数据集;S5,填补执行与多维验证,对S4中获取的缺测值填补后的数据集通过随机森林模型进行结果验证,完成缺测值的填补。本发明通过预处理前的动态时间窗口划分,构建短、中、长三时段滑动窗口,同步提取统计,解决传统方法因窗口固定导致的长期关联捕捉不足问题。