2018-05-10

靠....AI课小测又没去。。

高级计算机网络也是水课,水特喵的。

但是课还是挺有意思的。还有老师假扮黑客交流终端安全,以及美国某教授来我们这儿划水

老师挺可爱的

//////////////////////////////////////////////////////////////////////////////////////////////////////////

第四章提到了迭代方程:

首先是贝尔曼方程:


然后是迭代方程:


一开始看着两个公式的时候我是一脸懵逼的。。为什么式子完全相同,但是上面的是策略Vπ没有变,而下面的是Vk+1和Vk

经过讨论,大致的结果是,上面的式子应该是全探索情况下(感觉基本等同于收敛)的式子,但是实际上全探索是很难实现的,所以我们的策略是在不断更新迭代的,也就是下面的K+1和K这其实也是黎叔说的数学上的式子和CS上的式子----我们用的是下面的(先这么理解吧,结合实例可能能理解的更透彻)


这个就是DP算法的更新过程~(现在看起来很简单)

△那个是一开始初始化为0

v = V(s)这个就是全备份,下面那个就是对V(s)的更新

终止条件其实就是Vk+1和Vk之间的差距足够小就OK~

一个简单但是有效的例子:


具体解题步骤写在书上了。

最后编辑于
©著作权归作者所有,转载或内容合作请联系作者
【社区内容提示】社区部分内容疑似由AI辅助生成,浏览时请结合常识与多方信息审慎甄别。
平台声明:文章内容(如有图片或视频亦包括在内)由作者上传并发布,文章内容仅代表作者本人观点,简书系信息发布平台,仅提供信息存储服务。

相关阅读更多精彩内容

  • 人脸检测是目前所有目标检测子方向中被研究的最充分的问题之一,它在安防监控,人证比对,人机交互,社交和娱乐等方面有很...
    玲小喵阅读 497评论 0 0
  • 怎样快速学游泳? 游泳,是一项很时尚的运动,长期坚持游泳对身体很有好处,因为游泳运动量可大可小,控制起来比较容易,...
    六点泳池7782阅读 286评论 0 0
  • 【今日头条】深圳研发中心招聘信息(动态更新) 头条简介 “今日头条”是一款基于数据挖掘的推荐引擎产品,是国内移动互...
    字节跳动_深圳阅读 516评论 1 2
  • 一. 增强学习简介 1.1 什么是增强学习? 机器学习的算法可以分为三类:监督学习,非监督学习和增强学习。 增强学...
    阿阿阿阿毛阅读 31,743评论 0 25

友情链接更多精彩内容