基于非负矩阵分解更新规则的部分可观察马尔可夫决策过程信念状态空间降维算法

仵博; 陈鑫; 郑红燕; 冯延蓬

首页> 中文期刊> 《电子与信息学报》 >基于非负矩阵分解更新规则的部分可观察马尔可夫决策过程信念状态空间降维算法

基于非负矩阵分解更新规则的部分可观察马尔可夫决策过程信念状态空间降维算法

开具论文收录证明 >>

期刊封面封底目录下载 >>

文献代查 >>

页面导航

摘要
著录项
相似文献
相关主题

摘要

针对求解部分可观察马尔可夫决策过程(POMDP)规划问题时遭遇的“维数诅咒”，该文提出了一种基于非负矩阵分解(NMF)更新规则的 POMDP 信念状态空间降维算法，分两步实现低误差高维降维。第1步，利用POMDP 的结构特性，将状态、观察和动作进行可分解表示，然后利用动态贝叶斯网络的条件独立对其转移函数进行分解压缩，并去除概率为零的取值，降低信念状态空间的稀疏性。第2步，采用信念状态空间值直接降维方法，使降维后求出的近似最优策略与原最优策略保持一致，使用NMF更新规则来更新信念状态空间，避免Krylov迭代，加快降维速度。该算法不仅保证降维前后值函数不发生改变，又保留了其分段线性凸特性。实验结果表明，该算法具有较低误差率和较高收敛性。%For the curse of dimensionality encountered in solving the planning in Partially Observable Markov Decision Processes (POMDP), this paper presents a novel approach to compress belief states space using Non-negative Matrix Factorization (NMF) updating rules, which reduces high dimensional belief states space by two steps. First, the algorithm adopts factored representations of states, observations and actions by exploiting the structure of factored POMDP, then decomposes and compresses transition functions by exploiting conditional independence of dynamic Bayesian network, and then removes the zero probability to lower the sparsity of belief states space. Second, it adopts value-directed compression approach to make the obtained approximate belief states after dimension reduction be consistent with the original optimal, and exploits NMF updating rules instead of Krylov iterations to accelerate the dimension reduction. The proposed algorithm not only guarantees the value function and reward function of the belief states unchanged after reducing dimensions, but also keeps the piecewise linear and convex property to compute the optimal policy by using dynamic programming. Experiments demonstrate that the proposed belief compression algorithm has lower error rates and higher convergence.

著录项

来源
《电子与信息学报》 |2013年第12期|2901-2907|共7页
作者
仵博; 陈鑫; 郑红燕; 冯延蓬;
展开▼
作者单位

深圳职业技术学院教育技术与信息中心深圳 518055;

中南大学信息科学与工程学院长沙 410083;

先进控制与智能自动化湖南省工程实验室长沙 410083;

中南大学信息科学与工程学院长沙 410083;

先进控制与智能自动化湖南省工程实验室长沙 410083;

深圳职业技术学院教育技术与信息中心深圳 518055;

深圳职业技术学院教育技术与信息中心深圳 518055;

展开▼
原文格式 PDF
正文语种 chi
中图分类人工智能理论;
关键词
信息处理; 部分可观察马尔可夫决策过程; 信念状态空间; 非负矩阵分解; 值直接压缩; 维数灾;

相似文献

中文文献
外文文献
专利

1. 基于分组降维规则和遗传算法的人造板材矩形件优化下料方法 [J] . 张国梁 ,侯晓鹏 ,苗虎 . 林业科学 . 2014,第006期
2. 关联规则中基于降维的最大频繁模式挖掘算法 [J] . 钱雪忠 ,惠亮 . 计算机应用 . 2011,第005期
3. 基于分步降维HOG-LBP特征的行人头部分类算法 [J] . 李玲 ,王江涛 . 高师理科学刊 . 2016,第007期
4. 基于部分可观察马尔可夫决策过程的受控无线网络系统动态资源分配 [J] . 李萌 ,司鹏搏 ,孙恩昌 . 高技术通讯 . 2017,第003期
5. 基于部分可观察马尔可夫决策过程的机电装备动态可靠性评价方法 [J] . 张红旗 ,邵晓东 ,胡祥涛 . 中国机械工程 . 2016,第018期
6. 基于小车位置和速度信息降维重构起重机小车吊重系统状态空间 [C] . 马莉丽 ,程文明 ,钟斌 . 中国机械工程学会物流工程分会成立30周年纪念大会暨物流工程高峰论坛 . 2010
7. 基于FP-Tree的关联规则增量式更新算法——BIT算法 [A] . 崔冠男 . 2014

基于非负矩阵分解更新规则的部分可观察马尔可夫决策过程信念状态空间降维算法

摘要

著录项

相似文献

相关主题

期刊订阅