摘要
本发明提出一种面向复杂系统的结合贝叶斯网络与双Q学习的智能维修排故方法,旨在解决传统启发式策略决策效率低、路径不优、维修成本高的问题。该方法首先根据系统结构与因果依赖关系构建贝叶斯网络模型,并结合FMECA分析结果设定各节点先验概率;随后利用蒙特卡洛方法生成排故样本,在线下训练双Q学习模型,融合观测与维修成本,优化维修动作策略。为提高策略收敛性与稳定性,引入观测动作筛选机制及动作屏蔽技术,实现多步排故过程中的动态决策优化。本发明兼具因果建模能力与强化学习自适应性,具备较强的鲁棒性与实时性,适用于飞行器、汽车等关键装备的智能维护与故障诊断场景。