摘要
本发明提供了一种基于视觉模型的目标导向视频语义通信系统,包括:语义提取器,基于SAM2模型,用于处理原始视频,生成分割掩码并提取语义信息;ViMamba编码器,用于对语义提取器的输出进行信道编码;信道适应模块,用于基于物理信道的信噪比信息优化编码序列ViMamba解码器,用于进行信道解码,得到特征序列;语义重建器,用于基于特征序列进行语义重建,恢复数据并输出目标视频。本发明解决了视频中冗余语义信息干扰大、深层语义编码能力不足以及在复杂信道环境下通信鲁棒性差的问题,在保障语义完整性的前提下,实现视频数据的高效压缩与鲁棒传输,大幅提升了语义通信的整体性能和适应性。