共查询到18条相似文献,搜索用时 64 毫秒
1.
对多Agent系统的Q值强化学习算法进行研究,将历史信息因素的影响添加到Q值学习中,提出了一个新的基于多Agent系统的Q值学习算法.该算法在保证多Agent系统利益达到相对最大化的同时,也有效降低了Agent之间的冲突率.最后,通过仿真测试验证了该算法的有效性. 相似文献
2.
3.
复杂环境中的多智能体强化学习 总被引:3,自引:0,他引:3
提出在机器人足球这样的复杂、动态的环境中使用强化学习的方式与问题 ,阐述了强化学习的实现及如何处理机器学习中的常见问题 ,即延迟奖赏、探索与利用、不完整信息等 ,同时探讨了减少复杂性的若干措施 . 相似文献
4.
在混合算法研究的基础上,提出了调度系统中算法集成的概念,建立了算法类库。以多智能体系统为实施平台,给出了一种新的具体实现框架。系统中智能体可分为构造型、改进型和决策型三类,且无主控智能体,各智能体间不直接通讯,而是通过共享内存进行合作。描述了单智能体的基本结构。考虑到领域专家知识在调度系统中的重要性,将调度员作为一个特殊的智能体引入调度系统,改善了决策过程。最后分析了系统的特点。 相似文献
5.
6.
探讨了智能体、多智能体系统(MAS)的体系结构,给出了一个多智能体系统的简单例子--智能招标投标管理系统.该系统建立在智能体模板JADE之上,通过该系统,一个企业可以向外发出招标信息,其他企业可对这个招标相应地发出投标请求,最后系统对各个投标进行比较筛选得出最优结果,并把结果发送回招标企业. 相似文献
7.
基于多智能体的人事管理系统研究 总被引:2,自引:0,他引:2
现代人事管理系统需要集成数据库、知识系统、决策支持等异构部件,本文提出了基于多智能体的人事管理系统,以实现人事管理任务的分布式协作求解,分别描述了任务智能体、人事管理系统的结构,并讨论其运行过程. 相似文献
8.
周燕艳 《四川理工学院学报(自然科学版)》2011,24(4):417-421
传统的Q学习已被有效地应用于处理RoboCup中传球策略问题,但是它仅能简单地离散化连续的状态、动作空间。文章提出一种改进的Q学习算法,提出将神经网络应用于Q学习,系统只需学习部分状态—动作的Q值,即可进行Q学习,有效的提高收敛的速度。最后在RoboCup环境中验证这个算法,对传球成功率有所提高。 相似文献
9.
深度Q神经网络(deep Q-network,DQN)算法在训练初期,由于动作选择随机性强,导致算法的训练时间过长。针对该问题,文章提出一种结合先验知识的深度Q神经网络(priori knowledge-DQN,PK-DQN)算法,将先验知识定义为特征状态与最优动作的映射,根据先验知识对动作选择过程的影响程度,将先验知识引入DQN算法,优化DQN算法的动作选择规则,降低其在探索过程中的动作选择随机性,并使用赛车游戏对算法进行训练。实验结果表明,PK-DQN算法能够更快收敛,有较高的学习效率,算法训练时长明显缩短。 相似文献
10.
在热工控制过程銎我智能体控制体系,硬件上实现化配置,可扩充,适用于性好,兼容性强,软件上将建立和管理复杂 的工作分解,以及智能体间的交互方式的统一规范,以达到安全可行经济合理的生产。 相似文献
11.
王浩 《合肥工业大学学报(自然科学版)》2005,28(9):1112-1116
影响图是决策问题的图形表示,它是在贝叶斯网络基础上增加了决策结点和效用结点。文章讨论了影响图理论在多Agent建模与决策方面的应用;提出了联合分层影响图和动态贝叶斯网络来实现多Agent的实时决策的方法,该方法已在Robcup球员建模和决策方面初步得到应用。 相似文献
12.
本文讨论了多智能体系统在受到外界扰动的无领导者系统的有限时间一致性问题.基于有限时间控制策略,本文设计了针对二阶智能体模型的连续分布式控制策略.首先针对二阶模型的多智能体系统,提出了有限时间一致性控制策略,并且通过设计了李雅普诺夫函数给出了完整的证明过程.其次,设计了仿真实验,并且在文中给出了仿真结果,验证了本文所提控制策略的有效性以及具有一定的抗扰动能力. 相似文献
13.
14.
从认知的和社会的角度分析了协同设计活动,提出了一种面向协同设计的多Agent系统结构和设计Agent的感知模型,以及多Agent协同强化学习的方法.该方法采用动态小生境技术对设计Agent进行分组,并选出每组中的最优设计Agent,使其通过与设计人员交互进行强化学习,然后和其他组选出的Agent协同学习,并把学到的知识在组内进行传播.以齿轮减速器设计为例,介绍了多Agent协同设计系统的协同设计及学习过程. 相似文献
15.
把一致性增益引入到一致性协议中,利用线性矩阵不等式(LMI)方法,给出了具有时变通信延迟的多智能体系统达到一致的充分条件.分析了当多智能体系统的网路拓扑是强连通平衡图且通信时延具有合适的上界时,带有有界时变延迟的多智体系统的平均一致性问题.证明了当在协议中引入一致性增益时,对于具有不同通信时延的多智能体系统,若时变通信时延的上界满足一定条件,则不论网络拓扑是不变的还是切换的,系统都能够达到平均一致,并且可通过求解线性矩阵不等式得到时变时延的上界.对于具有变时延的多智能体系统,存在相应的时延上界使得系统达到一致.所得结论对于具有时变拓扑网络的多智能体系统也成立. 相似文献
16.
李琳娜 《长春工程学院学报(自然科学版)》2009,10(4):81-83
对在动态学习的环境中的IGA算法做了研究,改进了梯度方向上的步长恒定不变的不足,引入了变学习率,并介绍了调节学习率的方法——WoLF原则,加速其收敛。最后根据该方法,对Q学习算法做了改进,并通过仿真试验证明了算法的有效性。 相似文献
17.
针对具有不同通信时延的多个体系统的一致性问题,提出了一种引入自身时延的一致性协议.根据广义Nyquist判据与Gerschgorin圆盘定理,得到了系统渐近收敛一致的充分条件.在多个体系统的有向连接拓扑含有一个全局可达节点的条件下,一致收敛的充分条件仅与个体的自身时延、以及个体与邻居个体的连接权值有关.在提出的协议中,引入自身时延能够加速具有通信时延的多个体系统的收敛速度,而通信时延并不影响系统的收敛,但其可以延长收敛时间.此外,得到了系统最终收敛的一致状态的求解方法.仿真结果证明了结论的正确性. 相似文献
18.
对机器人足球球员如何实现复杂任务中的行为学习理论、方法、技术和应用进行评述,指出其存在的局限性,以及在机器人足球领域的学习策略.机器人足球系统作为多智能体系统研究的测试床,许多研究者从不同的侧面对该项技术进行了研究并取得了一定的成果.对机器人足球系统的研究,目前包括足球机器人体系结构、多机器人的协作、动态环境下的推理和行动、传感器数据融合、复杂任务中的行为学习、对手建模等内容. 相似文献

