失效
一种基于强化学习的电力大模型流水线冻结训练优化方法
摘要
本发明提供一种基于强化学习的电力大模型流水线冻结训练优化方法,主要包含两个部分:基于梯度和梯度变化量的冻结决策算法、基于强化学习的冻结训练优化方法。本发明首先设计了基于梯度和梯度变化量的冻结决策算法,以获得良好的冻结判断标准及冻结策略。然后针对如何在训练过程中动态调整冻结判断标准的阈值以适应不同时间点模型状态差异的问题,提出一种基于强化学习的冻结训练优化方法,以梯度变化量、梯度大小及冻结策略实施前后一定训练轮次所需时间等数据为基础,通过强化学习方法动态调整冻结判断标准阈值,从而在加速训练和保障精度中取得平衡,最终提高电力大模型训练效率。
暂无引用专利



