深度强化学习实践 pdf下载
限时特惠
00:00:00
活动结束后恢复原价
纸质书参考价
¥23
电子版限时价
¥5.99
省 18 元
选择版本
内容简介
本篇主要提供深度强化学习实践电子书的pdf版本下载,本电子书下载方式为百度网盘方式,点击以上按钮下单完成后即会通过邮件和网页的方式发货,有问题请联系邮箱ebook666@outlook.com
内容简介
《深度强化学习实践(原书第2版)》包括新的强化学习工具和技术,介绍了强化学习的基础知识,以及如何动手编写智能体以执行一系列实际任务。
《深度强化学习实践(原书第2版)》较上一版新增6章,专门介绍了强化学习的新发展,包括离散优化(解决魔方问题)、多智能体方法、Microsoft的TextWorld环境、高级探索技术等。
学完《深度强化学习实践(原书第2版)》,你将对这个新兴领域的前沿技术有深刻的理解。
此外,你将获得对深度Q-network、策略梯度方法、连续控制问题以及高度可扩展的非梯度方法等领域的可行洞见,还将学会如何构建经过强化学习训练、价格低廉的真实硬件机器人,并通过逐步代码优化在短短30分钟的训练后解决Pong环境问题。
简而言之,《深度强化学习实践(原书第2版)》将帮助你探索强化学习中令人兴奋的复杂主题,让你通过实例获得经验和知识。
通过阅读《深度强化学习实践(原书第2版)》,你将:
了解强化学习的深度学习上下文并实现复杂的深度学习模型。
学会评估强化学习的方法,包括交叉熵、DQN、actor-critic、TRPO、PPO、DDPG、D4PG等。
学会构建经过强化学习方法训练的、价格低廉的硬件机器人。
研究Microsoft的TextWorld环境,这是一个文字冒险游戏平台。
学会在强化学习中使用离散优化来解决魔方问题。
学会教你的智能体使用AlphaGo Zero玩四子连横棋。
探索有关AI聊天机器人等主题的较新深度强化学习技术。
研究先进的探索技术,包括噪声网络和网络蒸馏技术。
《深度强化学习实践(原书第2版)》较上一版新增6章,专门介绍了强化学习的新发展,包括离散优化(解决魔方问题)、多智能体方法、Microsoft的TextWorld环境、高级探索技术等。
学完《深度强化学习实践(原书第2版)》,你将对这个新兴领域的前沿技术有深刻的理解。
此外,你将获得对深度Q-network、策略梯度方法、连续控制问题以及高度可扩展的非梯度方法等领域的可行洞见,还将学会如何构建经过强化学习训练、价格低廉的真实硬件机器人,并通过逐步代码优化在短短30分钟的训练后解决Pong环境问题。
简而言之,《深度强化学习实践(原书第2版)》将帮助你探索强化学习中令人兴奋的复杂主题,让你通过实例获得经验和知识。
通过阅读《深度强化学习实践(原书第2版)》,你将:
了解强化学习的深度学习上下文并实现复杂的深度学习模型。
学会评估强化学习的方法,包括交叉熵、DQN、actor-critic、TRPO、PPO、DDPG、D4PG等。
学会构建经过强化学习方法训练的、价格低廉的硬件机器人。
研究Microsoft的TextWorld环境,这是一个文字冒险游戏平台。
学会在强化学习中使用离散优化来解决魔方问题。
学会教你的智能体使用AlphaGo Zero玩四子连横棋。
探索有关AI聊天机器人等主题的较新深度强化学习技术。
研究先进的探索技术,包括噪声网络和网络蒸馏技术。
作者简介
马克西姆·拉潘(Maxim Lapan),一位深度学习爱好者和独立研究者。他拥有15年软件开发和系统架构经验,涵盖从低级Linux内核驱动程序开发到性能优化以及在数千台服务器上工作的分布式应用程序设计的方方面面。他在大数据、机器学习以及大型并行分布式HPC和非HPC系统方面拥有丰富的工作经验,他能够使用简单的词汇和生动的示例来解释复杂的事物。他当前感兴趣的领域包括深度学习的实际应用,例如,深度自然语言处理和深度强化学习。
林然,在2016年加入Thoughtworks之后,主要担任全栈软件开发工程师、TechLead、算法工程师等。在技术领域,他特别擅长全栈软件开发、端到端交付、面向对象设计、测试驱动开发、持续交付、领域驱动设计(DDD),熟悉整洁架构、微服务、DevOps、Scrum、Kanban、深度强化学习、Hadoop生态等技术和方法论。当前他在精进以重构、测试驱动开发和持续交付为核心的软件工程能力的基础上,正深耕于以领域驱动设计为代表的数字化架构能力、数据中台的架构能力以及以深度强化学习为代表的机器学习解决方案。同时,他曾参与翻译《Python机器学习手册》。
王薇,北京邮电大学硕士,现任Thoughtworks数据分析师。有金融、通信、医疗、娱乐等不同行业的数据类项目经验,精通多种数据挖掘算法,擅长将算法与业务相结合进行数据挖掘和分析。
林然,在2016年加入Thoughtworks之后,主要担任全栈软件开发工程师、TechLead、算法工程师等。在技术领域,他特别擅长全栈软件开发、端到端交付、面向对象设计、测试驱动开发、持续交付、领域驱动设计(DDD),熟悉整洁架构、微服务、DevOps、Scrum、Kanban、深度强化学习、Hadoop生态等技术和方法论。当前他在精进以重构、测试驱动开发和持续交付为核心的软件工程能力的基础上,正深耕于以领域驱动设计为代表的数字化架构能力、数据中台的架构能力以及以深度强化学习为代表的机器学习解决方案。同时,他曾参与翻译《Python机器学习手册》。
王薇,北京邮电大学硕士,现任Thoughtworks数据分析师。有金融、通信、医疗、娱乐等不同行业的数据类项目经验,精通多种数据挖掘算法,擅长将算法与业务相结合进行数据挖掘和分析。
精彩书评
★强化学习是一个令人兴奋的领域,它为新的可能性开辟了道路。Maxim Lapan写了一本关于强化学习的优秀指南,它不仅解释了这些概念,而且向我们展示了如何使用RL来开发我们自己的程序。
——Marco Wiering博士,Groningen大学人工智能助理教授
★我刚刚读完Maxim Lapan写的《深度强化学习实践》第2版。这本书写得非常好,内容丰富,发人深省,见解深刻。
——Tristan Behrens博士,AI公会创始成员和独立深度学习实践顾问
——Marco Wiering博士,Groningen大学人工智能助理教授
★我刚刚读完Maxim Lapan写的《深度强化学习实践》第2版。这本书写得非常好,内容丰富,发人深省,见解深刻。
——Tristan Behrens博士,AI公会创始成员和独立深度学习实践顾问
前言/序言
我最早于2018年接触强化学习这一令人兴奋的技术,在深入了解后,感觉打开了一扇新世界的大门。使用强化学习,我不仅可以享受编程的乐趣,也可以享受玩游戏的乐趣。同时,强化学习也在一定程度上给了我一些生活上的启示,从前的我是容易陷入“局部最优性”的人:我之前只要在食堂遇到一种喜欢吃的食物,就会天天吃,直到吃腻为止;回家的路,只会走那条最熟悉的(即使可能有近路,但是害怕走错还是不会选择那条可能的近路)。强化学习对于探索的需求是很强烈的,对于未见过的观察,智能体必须要有强烈的探索欲望,经历过各种场景,最终得到的策略才会更优。在探索强化学习的同时,我自身也更接纳“探索”了:多尝试以前没有吃过的菜,多探索几条新的回家的路。这种不需要后续步骤、可以立即得到确定性状态价值的探索非常高效,必须要好好利用。
在接触本书后,我发现,如果在啃Sutton的《强化学习(第2版)》前,能先好好学习一下本书,那该多么幸福!本书从理论和实践两个角度对强化学习进行了解释和演示,如果想快速上手强化学习并开始实践,那么本书就是目前的不二之选了。
由于译者水平有限,书中出现错误与不妥之处在所难免,恳请读者批评指正。如果有强化学习相关的问题想和译者进行探讨,可发邮件。
最后,感谢本书的策划编辑王春华的耐心和悉心指导。当然,还要感谢我的女朋友王薇,在她的支持和协助下,这本书才得以翻译完成,并呈现在大家面前。感谢每一位读者,你的潜心研习与融会贯通将会令本书更有价值。
在接触本书后,我发现,如果在啃Sutton的《强化学习(第2版)》前,能先好好学习一下本书,那该多么幸福!本书从理论和实践两个角度对强化学习进行了解释和演示,如果想快速上手强化学习并开始实践,那么本书就是目前的不二之选了。
由于译者水平有限,书中出现错误与不妥之处在所难免,恳请读者批评指正。如果有强化学习相关的问题想和译者进行探讨,可发邮件。
最后,感谢本书的策划编辑王春华的耐心和悉心指导。当然,还要感谢我的女朋友王薇,在她的支持和协助下,这本书才得以翻译完成,并呈现在大家面前。感谢每一位读者,你的潜心研习与融会贯通将会令本书更有价值。