摘要
本发明公开了一种基于差异统计的癌症早筛模型的构建方法及系统,属于癌症模型训练技术领域,具体包括:首先提取正常样本与癌症样本的循环游离DNA原始特征,整合后聚类筛选高癌比例簇中的正常样本作为目标组;通过对比目标组与剩余正常组、癌症组与剩余正常组的树模型特征重要性分析,得到第一特征集和第二特征集;获取共同特征集,从所述第二待定特征集中剔除所述共同特征集,得到目标特征集,基于所述目标特征集构建初始分类模型;依次对每个共同特征进行增量训练,得到对应的增量模型和性能评分,并选择性能评分的增量模型作为最终模型,该方法通过聚类引导的对比样本筛选和差异化特征分析,有效提升癌症检测模型的区分能力与泛化性能。