摘要
本发明公开了一种基于多模态感知的强化学习导航方法及系统,适用于医院、仓储、机场等动态环境。设备通过双目RGB、热成像与毫米波雷达采集环境数据,经跨模态注意力网络融合后,由语义识别模块解析当前场景(候诊区、走廊等),再由PPO策略网络结合语义规则实时生成控制指令。系统支持语音与手势交互,采用轻量化BERT‑Tiny解析语音并加权融合手势目标,λ自适应环境噪声。训练阶段在仿真环境中加入语义区域奖励,使策略在<5万步内收敛,显著优于传统SLAM。硬件由Jetson Xavier边缘单元、麦克风阵列、鱼眼摄像头及安全监控单元构成,实现98.7%动态避障成功率,无需预建地图,具备高灵活性与低训练成本。