失效

一种平滑集上的无投影分布式在线学习方法

罗来龙、郭得科、胡煜晗、赵亚威
中国人民解放军国防科技大学

摘要

本发明提出了一种平滑集上的无投影分布式在线学习方法,该方法试图找到一个近似梯度,以确保下一个决策在<Image he="53" wi="49" file="DDA0003532823930000011.GIF" imgContent="drawing" imgFormat="GIF" orientation="portrait" inline="yes"/>中,在每次迭代中,每个玩家都会执行以下步骤:查询所有邻居的对偶变量,并更新对偶变量;计算下一个动作,并判断该动作指向的新决策是否在可行集<Image he="53" wi="49" file="DDA0003532823930000012.GIF" imgContent="drawing" imgFormat="GIF" orientation="portrait" inline="yes"/>中;若新决策点在可行集<Image he="53" wi="49" file="DDA0003532823930000013.GIF" imgContent="drawing" imgFormat="GIF" orientation="portrait" inline="yes"/>中,则更新新决策;若决策点不在可行集<Image he="53" wi="48" file="DDA0003532823930000014.GIF" imgContent="drawing" imgFormat="GIF" orientation="portrait" inline="yes"/>中,则通过快速近似投影算法找到能落在可行集<Image he="53" wi="49" file="DDA0003532823930000015.GIF" imgContent="drawing" imgFormat="GIF" orientation="portrait" inline="yes"/>中的新决策。本方法利用近似投影的方法提高了计算效率,同时控制了噪声,并保证了算法对遗憾是无害的,且能够获得最优遗憾<Image he="105" wi="464" file="DDA0003532823930000016.GIF" imgContent="drawing" imgFormat="GIF" orientation="portrait" inline="yes"/>其中G用来度量损失函数的范数,D用来度量决策空间的大小,μ用来度量近似投影引起的噪声的大小。 本发明提出了一种平滑集上的无投影分布式在线学习方法,该方法试图找到一个近似梯度,以确保下一个决策在中,在每次迭代中,每个玩家都会执行以下步骤:查询所有邻居的对偶变量,并更新对偶变量;计算下一个动作,并判断该动作指向的新决策是否在可行集中;若新决策点在可行集中,则更新新决策;若决策点不在可行集中,则通过快速近似投影算法找到能落在可行集中的新决策。本方法利用近似投影的方法提高了计算效率,同时控制了噪声,并保证了算法对遗憾是无害的,且能够获得最优遗憾其中G用来度量损失函数的范数,D用来度量决策空间的大小,μ用来度量近似投影引起的噪声的大小。

暂无引用专利