1.一种基于平均奖赏强化学习的MTO企业订单接受方法,其特征在于:包括以下步骤:步骤一:订单信息假设假设MTO企业通过单一生产线生产,且市场上存在n种类型的顾客订单,订单信息包括顾客优先级μ、价格p、数量Q、单位产品生产成本c、提前期LT及最迟交货期DT;步骤二:确定系统状态集根据步骤一,若系统中有n种订单类型,则系统状态可由向量S表示:S=(μ,p,Q,LT,DT,T),其中T表示决策阶段之前已接受的订单仍需要的生产时间;步骤三:确定系统动作集根据步骤一,当有顾客订单到达时,需要做出接受和拒绝订单的决策,模型中的动作集合可由向量A=(a 1 ,a 2 )表示,其中a 1 表示接受订单,a 2 表示拒绝订单;步骤四:确定立即回报函数MTO企业在做出是否接受订单决策后,获得的立即回报函数为:公式中I=p*Q,表示获得该订单的利润,C=c*Q,表示消耗的生产成本,Y表示企业的延期惩罚成本,N表示产生库存成本的费用,J表示订单的拒绝成本;步骤五:构建订单接受模型根据系统状态集、系统动作集和立即回报函数构建半马尔科夫决策过程订单接受模型,并基于平均奖赏强化学习的思想模拟现实的MTO企业订单接受问题,根据贝尔曼最优定理,半马尔科夫决策过程问题中相应的最优策略为:其中 表示决策期m获得的平均回报,t m 表示决策期m由状态s转移到状态s'的时间;步骤六:订单接受模型求解采用强化学习平均奖赏作为评价目标,通过平均奖赏强化学习SMART算法对半马尔科夫决策过程订单接受模型进行求解,并在SMART算法中运用贪心算法对订单进行排序,得到订单接收最优决策,平均奖赏强化学习SMART算法的更新公式为:式中α表示学习率,m表示当前迭代索引,r m (s,a,s′)表示在状态s采取动作a后获得的立即回报,t m (s,a,s′)表示由状态s转移到s'的时间,R m 表示第m个决策时期的累积回报,ρ m 表示第m个决策时期的平均回报,t m 表示第m个决策时期的累计时间。
2.根据权利要求1所述的一种基于平均奖赏强化学习的MTO企业订单接受方法,其特征在于:所述步骤一中,顾客订单达到服从参数为λ的泊松分布,订单的价格和需求数量均服从均匀分布。
3.根据权利要求1所述的一种基于平均奖赏强化学习的MTO企业订单接受方法,其特征在于:所述步骤二中,基于有限产能的MTO企业,T有最大上限值,并且有n种订单类型,则系统的状态集合S共有n*T个状态。
4.根据权利要求1所述的一种基于平均奖赏强化学习的MTO企业订单接受方法,其特征在于:所述步骤四中,r(s,a)的三个等式从上之下分别表示当Q(s,a 1 )>Q(s,a 2 )时,且在当前状态下订单能插入到当前的生产计划中,立即回报等于接受该订单所获得的净利润,当Q(s,a 1 )>Q(s,a 2 )时,但在当前状态下订单不能插入到当前的生产计划中,立即回报等于损失的订单净利润,当Q(s,a 1 )<Q(s,a 2 )时,立即回报等于拒绝成本。
5.根据权利要求1所述的一种基于平均奖赏强化学习的MTO企业订单接受方法,其特征在于:所述步骤四中,企业的延期惩罚成本Y=μ*u*{(T+Q/b)-LT},其中u表示单位时间延期惩罚成本,b表示为企业的单位生产能力。
6.根据权利要求1所述的一种基于平均奖赏强化学习的MTO企业订单接受方法,其特征在于:所述步骤四中,顾客在提前期之前生产出来的产品不提前取货,导致产品被暂存在MTO企业仓库中所产生的库存成本费用N=Q*h*{LT-(T+Q/b)},其中h表示单位时间单位产品储存成本。
7.根据权利要求1所述的一种基于平均奖赏强化学习的MTO企业订单接受方法,其特征在于:所述步骤六中,采用随着仿真迭代次数的增加而减小的探索性概率e保证平均奖赏强化学习SMART算法的收敛性,且α和e按照DCM方案衰减:式中χ表示任意大的实数。