Description
篇幅有限,蒙特卡洛没讲
参考资料:
https://www.youtube.com/watch?v=D-VULoe0IPI
https://www.youtube.com/watch?v=4feeUJnrrYg
https://www.youtube.com/watch?v=g80wiWvOtvI
https://www.youtube.com/watch?v=e6rGgZVgasE
https://www.youtube.com/watch?v=9_PepvnqIfU
https://www.youtube.com/watch?v=n40MmsHmYrwhttps://www.youtube.com/watch?v=NvfK1TkXmOQ
#Neuronlike Adaptive Elements That Can Solve Difficult Learning Control Problems
https://github.com/david78k/pendulum/blob/master/c/anderson/Neuronlike%20Adaptive%20Elements%20That%20Can%20Solve%20Difficult%20Learning%20Control%20Problems%20Barto1983.pdf
#Learning to predict by the methods of temporal differences
https://link.springer.com/article/10.1007/BF00115009
#The Bitter Lesson
http://www.incompleteideas.net/IncIdeas/BitterLesson.html
#Q learning
https://link.springer.com/article/10.1007/BF00992698
#DQN
https://arxiv.org/abs/1312.5602
Comments
强化学习就好像高级动态规划
♥ 106 ↩ 6
强化学习可以简单说是经验的监督学习……但强化学习的难点是设计环境,这个太麻烦,导致deepmind只在游戏中有突破[吃瓜]
♥ 49
分享一个大佬的看法: 监督学习优化的是 非参分布下的含参loss function 强化学习优化的是 含参分布下的非参loss (cost/reward) function
♥ 19 ↩ 1
那只猫猫现在还活着吗[大哭]
♥ 15 ↩ 8
贪吃蛇都玩不赢的强化学习,都是科学家的玩笑
♥ 12 ↩ 2
强化学习如同养蛊[doge]
♥ 8 ↩ 1
可惜强化学习到现在相比监督学习受到的关注还是小太多 独立的成果也太少
♥ 6
如果up讲一下utilitarianism就更好了,毕竟谈到奖励与享乐主义就不能避开utilitarianism[给心心]
♥ 5
学会学习如何学习学会学习如何学习学会学习如何学习的无限递归方法很重要
♥ 5 ↩ 1
制作精良哦
♥ 4
做的好棒啊
♥ 4 ↩ 1
我把那个越狱的发给deepseek他给我发了一段英文,用微信翻译就是这样了
♥ 2
哈哈,像是看了一篇论文[笑哭]
♥ 2
那不努力岂不是就不用当牛马[呲牙]
♥ 2
今天刚入门,其实没看懂视屏里TD和Q learning在干啥。我想到一个例子,从前,三只小猪离开家独自生活。猪老大用稻草盖房,狼一口气就吹倒了。它逃到老二家。猪老二用木头盖房,狼两口气吹倒了。它们逃到老三家。猪老三用砖头盖房,狼吹不垮,就从烟囱爬进去。小猪在壁炉烧了一锅开水,狼掉进去烫得嗷嗷叫,再也不敢来了。从此,三只小猪安全地住在砖房里。
♥ 1
视频做的非常棒 通俗易懂
♥ 1
说人坏的,不用猫把你关进去好不好[呲牙]
♥ 1
生物,物质能量时间有限,但机器不会
♥ 1
通俗易懂,很明白[星星眼][星星眼]
♥ 1