1.一种自适应感知的重载列车群组运行能量管理方法,其特征在于,包括:根据当前时刻的总线电压以及给定的总线参考电压,采用电压闭环电路,生成负载需求的总参考电流;根据当前时刻的锂电池和超级电容的电压、电流,分别计算锂电池和超级电容的荷电状态;根据锂电池和超级电容的荷电状态以及负载需求的总参考电流,通过基于TD3-BC离线学习算法的智能体获取低通滤波器的截止频率;其中,所述通过基于TD3-BC离线学习算法的智能体,训练方法为:(1)从历史运行数据中提取经验并存储到经验回放池,每条经验包括:当前状态s、实际动作a、执行动作a的奖励r、下一状态s';其中:状态由锂电池的和超级电容的荷电状态以及负载需求的总参考电流构成,每类状态数据均经过归一化处理;动作是指低通滤波器的截止频率;(2)初始化基于TD3-BC离线学习算法的智能体,包括策略网络 、两个Q网络 和 、策略目标网络 、两个Q目标网络 和 ;其中,策略网络 用于在给定状态下生成低通滤波器的截止频率,θ是策略网络的参数;两个Q网络 和 ,用于估计当前状态和动作的价值, 和 是两个Q网络的参数;策略目标网络 用于平稳生成目标动作, 是策略目标网络的参数;两个Q目标网络 和 ,用于平稳生成目标Q值, 和 是两个Q目标网络的参数;(3)从经验回放池中随机采样一批经验数据,训练基于TD3-BC离线学习算法的智能体;使用截止频率调整后的低通滤波器对总参考电流进行滤波,得到总参考电流的高频成分和低频成分,并将其中的高频成分作为超级电容的参考电流,低频成分作为锂电池的参考电流;根据锂电池和超级电容的参考电流,分别采用电流闭环电路,生成各自的双向 DC/DC转换器的占空比;基于得到的占空比驱动控制对应的双向DC/DC转换器。
2.根据权利要求1所述的自适应感知的重载列车群组运行能量管理方法,其特征在于,锂电池根据 确定其荷电状态,其荷电状态更新计算方法为: ;其中, 表示锂电池在第 时刻的荷电状态, 为锂电池的标称电荷量, 为锂电池在第 时刻的电荷量, 表示锂电池在第 时刻的荷电状态, 为锂电池在第 时刻的电流, 表示相邻时刻的时长。
3.根据权利要求1所述的自适应感知的重载列车群组运行能量管理方法,其特征在于,超级电容根据 确定其荷电状态,采用以下计算式更新超级电容的荷电状态: ;其中, 表示超级电容在第 时刻的荷电状态, 表示超级电容在第 时刻的端电压, 表示超级电容的标称电压, 表示超级电容在第 时刻的荷电状态, 表示相邻时刻的时长, 为超级电容在第 时刻的电流, 为超级电容的最大电压, 为超级电容的电容量。
4.根据权利要求1所述的自适应感知的重载列车群组运行能量管理方法,其特征在于,使用经验数据训练基于TD3-BC离线学习算法的智能体具体包括:(1)使用策略目标网络 生成下一个状态s’对应的目标动作 ,并计算目标Q值: ; ;其中, 是噪声,c是噪声的裁剪范围; 用于限制噪声 的幅度在 之间;y是目标Q值;r:当前动作a在状态s得到的即时奖励;γ:折扣因子,用于权衡未来奖励与当前奖励的重要性; 和 :两个Q目标网络 和 对下一个状态s′和目标动作a′的估计值;(2)通过最小化损失函数 来更新Q网络: ;其中,i∈{1,2},分别对应两个Q网络;N:每次从经验回放池中抽取的样本数量; 表示第i个Q网络对状态s和实际动作 a 的Q值;(3)更新策略网络:一方面,计算TD3策略损失 : ;其中, :Q网络 输出在状态s下采取动作 时的Q值; :即策略网络 基于当前状态s生成的动作;另一方面,计算行为克隆损失 : ;其中, 是经验回放池中各经验与状态s对应的实际动作;然后再对TD3策略损失和行为克隆损失进行加权组合,得到策略网络的混合损失函数 : ;其中,α是超参数,用于调节行为克隆损失与TD3损失的权重;(4)目标网络软更新: ; ; ;其中, 是软更新系数。
5.根据权利要求1所述的自适应感知的重载列车群组运行能量管理方法,其特征在于,低通滤波器的截止频率取值区间为[1,5Hz]。
6.一种自适应感知的重载列车群组运行能量管理装置,其特征在于,包括电压电流采集模块、控制模块、驱动模块以及2个双向 DC/DC 转换器;所述2个双向DC/DC转换器分别设置于锂电池和超级电容的输出端,且并联输出为总线负载提供电源;所述电压电流采集模块中设有电压传感器和电流传感器,电压传感器用于采集总线电压、 超级电容电压、锂电池电压,电流传感器用于采集锂电池电流和超级电容电流;所述控制模块用于:基于采集电路模块采集的数据,采用权利要求1-5任一项所述的自适应感知的重载列车群组运行能量管理方法,生成各双向DC/DC转换器的占空比;所述驱动模块用于:基于占空比驱动控制对应的双向DC/DC转换器。