摘要
本发明公开了一种多维度大模型测试评价方法及系统,属于人工智能测试技术领域,融合基础模型、平台能力与应用性能实现多维度大模型测试评价,包括:基础模型能力评价,包括敏感词库+BERT语义双引擎安全检测和上下文依赖测试链;模型平台能力评价,包括预置LLM智能标注和双人背靠背数据回流;应用性能评价,包括字符扰动鲁棒性测试和LIME可解释性分级评估;通过RESTful异构模型纳管接口实现大模型全栈测试,基于GPU衰减率量化实现国产化兼容性适配验证。本发明解决现有技术对平台工程化能力、安全合规性及国产化支持的评价缺失问题,实现三维能力耦合评测,解决国产化适配难题,填补大模型全栈测试技术空白。