摘要
本发明公开了一种基于熵理论及情感分析的文本数据置信评估方法。首先构建与目标群体相关的关键词集合,利用关键词集合从训练集中筛选含有关键词的文本数据,或与目标群体密切相关的文本数据。然后通过情感分析模型对文本数据进行情感分类,统计不同情感类别的文本数据数量,计算各类别的概率。然后基于信息熵的计算方式,计算文本数据集对目标群体的情感偏向及偏向程度。该方法能够量化文本数据集中针对特定目标群体的情感分布不均衡性,可以使用该指导大模型的训练与优化,提升数据治理和算法公平性,且具有良好的扩展性和推广前景。