reinforcement learning

参考周莫烦的视频课程


强化学习是非监督学习的例子 ,只给行为打分,机器自己想办法提高分数


机器自动学习避开低分区 

强化学习需要自己学习获得标签,,然后类似非监督学习了

以下是强化学习的一些算法



强化学习分类:

1、理不理解所在的环境

2、基于概率和基于价值

3、回合更新与单步更新

4、在线学习与离线学习

理解环境后就去炸虚拟环境,而不是自己生存的地球

按照理不理解分算法



model free 只能根据现实发生的一步一步的走,

model -based 可以根据想象虚拟来选择最好的,alpha go 使用这种,提前算。


离散的动作,,基于价值的动作确定,选择价值高的。

连续的动作,,基于价值的无能为力,基于概率的有优势。

具体的算法分类:


Actor-Critic 结合了基于概率和基于价值的优势,,表现更加强大。



回合更新必须一局完成后总结经验,而单步更新每一步都会总结。



离线学习是过往的经验,以及可以学习别人的经验,,看着别人玩,自己也学会了。

也可以白天储存记忆,晚上回来学习。

最后编辑于
©著作权归作者所有,转载或内容合作请联系作者
【社区内容提示】社区部分内容疑似由AI辅助生成,浏览时请结合常识与多方信息审慎甄别。
平台声明:文章内容(如有图片或视频亦包括在内)由作者上传并发布,文章内容仅代表作者本人观点,简书系信息发布平台,仅提供信息存储服务。

相关阅读更多精彩内容

友情链接更多精彩内容