《:Spark实时大数据分析——基于SparkStreaming框架祖贝尔·纳比,王胜夏,景》[88M]百度网盘|pdf下载|亲测有效
《:Spark实时大数据分析——基于SparkStreaming框架祖贝尔·纳比,王胜夏,景》[88M]百度网盘|pdf下载|亲测有效

:Spark实时大数据分析——基于SparkStreaming框架祖贝尔·纳比,王胜夏,景 pdf下载

出版社 万泽惠远图书专营店
出版年 2018-11
页数 390页
装帧 精装
评分 9.4(豆瓣)
限时特惠 00:00:00
活动结束后恢复原价
纸质书参考价 ¥23
电子版限时价 ¥5.99 省 18 元

选择版本

不满意全额退款
发货失败双倍赔偿
邮箱即时发送

内容简介

本篇主要提供:Spark实时大数据分析——基于SparkStreaming框架祖贝尔·纳比,王胜夏,景电子书的pdf版本下载,本电子书下载方式为百度网盘方式,点击以上按钮下单完成后即会通过邮件和网页的方式发货,有问题请联系邮箱ebook666@outlook.com

基本信息

书名:Spark实时大数据分析——基于Spark Streaming框架

定价:89.00元

作者: 祖贝尔·纳比,王胜夏,景玉

出版社:清华大学出版社

出版日期:2018-11-01

ISBN:9787302511878

字数:

页码:241

版次:1

装帧:平装

开本:16

商品重量:0.4kg

编辑推荐


每天有100万次优步打车,每月有100亿小时的Netflix视频,每年有1万亿美元花在电子商务网站上——我们今天的生活何尝不是如此呢?。这些服务的成功得益于大数据和日益增长的实时分析。这些服务的成功也应引起我们足够的重视!这也是我们学习实时大数据分析的1佳时机!学习它,掌握它,使用它!本书采取用例为先的方法:每1章都专门针对某一特定垂直行业,并通过实例、代码、图标进行分析——真实的示例、真实的应用程序、真实的数据和真实的代码。

内容提要


本书详细阐述了与Spark实时大数据分析以及Spark Streaming框架相关的基本解决方案,主要包括大数据漫游指南,实时RDD,高速流:链接外部数据源,边界效应,实时ETL和分析技术,大规模机器学习,云、Lambda及Python等内容。此外,本书还提供了丰富的示例以及代码,以帮助读者进一步理解相关方案的实现过程。 n
本书适合作为高等院校计算机及相关专业的教材和教学参考书,也可作为相关开发人员的自学教材和参考手册。 n
n
n
n
n

目录


目 录 n
章 大数据漫游指南 1 n
1.1 Spark前传 1 n
1.1.1 Web 2.0时代 2 n
1.1.2 无处不在的传感器 7 n
1.2 Spark Streaming:MapReduce和CEP的交集 9 n
第2章 Spark简介 10 n
2.1 安装 11 n
2.2 执行 12 n
2.2.1 独立集群模式(Standalone Cluster) 12 n
2.2.2 YARN模式 13 n
2.3 个应用程序 13 n
2.3.1 构建 16 n
2.3.2 执行 17 n
2.4 SparkContext 19 n
2.4.1 RDDs创建 19 n
2.4.2 处理依赖关系 20 n
2.4.3 创建共享变量 21 n
2.4.4 作业执行 22 n
2.5 RDD 22 n
2.5.1 持久化 23 n
2.5.2 转换 24 n
2.5.3 行动(Action) 28 n
小结 29 n
第3章 实时RDD:DStream 30 n
3.1 从连续流到离散流 30 n
3.2 个Spark Streaming应用程序 31 n
3.2.1 构建和执行 34 n
3.2.2 Streaming Context 34 n
3.3 DStreams 36 n
3.3.1 Spark Streaming应用程序剖析 38 n
3.3.2 转换 42 n
小结 52 n
第4章 高速流:并行化及其他 54 n
4.1 流数据的一大飞跃 54 n
4.2 并行化 56 n
4.2.1 Worker 56 n
4.2.2 执行器(Executor) 57 n
4.2.3 任务(Task) 59 n
4.3 批处理间隔 62 n
4.4 调度 64 n
4.4.1 应用程序间调度 64 n
4.4.2 批处理调度 64 n
4.4.3 作业间调度 65 n
4.4.4 一个行动,一个作业 65 n
4.5 内存 66 n
4.5.1 序列化 67 n
4.5.2 压缩(Compression) 70 n
4.5.3 垃圾收集 70 n
4.6 Shuffle 70 n
4.6.1 早期投影和过滤 70 n
4.6.2 经常使用组合器 70 n
4.6.3 大量运用平行化 70 n
4.6.4 文件合并(File Consolidation) 71 n
4.6.5 更多内存 71 n
小结 71 n
第5章 链接外部数据源 72 n
5.1 智慧城市,智慧地球,一切更智慧 72 n
5.2 ReceiverInputDStream 74 n
5.3 套接字 76 n
5.4 MQTT 85 n
5.5 Flume 89 n
5.5.1 基于推模式的Flume数据摄取 91 n
5.5.2 基于拉模式的Flume数据摄取 92 n
5.6 Kafka 92 n
5.6.1 基于接收器的Kafka消费者 95 n
5.6.2 直接Kafka消费者 98 n
5.7 Twitter 99 n
5.8 块间隔 100 n
5.9 自定义接收器 100 n
小结 104 n
第6章 边界效应 106 n
6.1 盘点股市 106 n
6.2 foreachRDD 108 n
6.2.1 为每条记录创建一个连接 110 n
6.2.2 为每个分区创建一个连接 111 n
6.2.3 静态连接 112 n
6.2.4 惰性静态连接 113 n
6.2.5 静态连接池 114 n
6.3 可扩展流存储 116 n
6.3.1 HBase 117 n
6.3.2 股市控制台(Dashboard) 118 n
6.3.3 SparkOnHBase 120 n
6.3.4 Cassandra 122 n
6.3.5 Spark Cassandra连接器 124 n
6.4 全局状态(Global State) 126 n
6.4.1 静态变量 126 n
6.4.2 updateStateByKey 128 n
6.4.3 累加器 129 n
6.4.4 外部解决方案 131 n
小结 133 n
第7章 充分准备 134 n
7.1 每个点击都异乎重要 134 n
7.2 Tachyon(Alluo) 135 n
7.3 Spark Web UI 138 n
7.3.1 历史分析 151 n
7.3.2 RESTful度量 152 n
7.4 日志记录 153 n
7.5 外部度量 154 n
7.6 系统度量 156 n
7.7 监控和报警 157 n
小结 159 n
第8章 实时ETL和分析技术 160 n
8.1 交易数据记录的强大功能 160 n
8.2 个流式Spark SQL应用程序 162 n
8.3 SQLContext 165 n
8.3.1 创建数据框 165 n
8.3.2 执行SQL 168 n
8.3.3 配置 169 n
8.3.4 用户自定义函数 169 n
8.3.5 Catalyst:查询执行和优化 171 n
8.3.6 HiveContext 171 n
8.4 数据框(Data Frame) 173 n
8.4.1 类型 173 n
8.4.2 查询转换 173 n
8.4.3 行动 180 n
8.4.4 RDD操作 182 n
8.4.5 持久化 182 n
8.4.6 佳做法 183 n
8.5 SparkR 183 n
8.6 个SparkR应用程序 184 n
8.6.1 执行 185 n
8.6.2 流式SparkR 185 n
小结 188 n
n
第9章 大规模机器学习 189 n
9.1 传感器数据风暴 189 n
9.2 流式MLlib应用程序 191 n
9.3 MLlib 194 n
9.3.1 数据类型 194 n
9.3.2 统计分析 197 n
9.3.3 预处理 198 n
9.4 特征选择和提取 199 n
9.4.1 卡方选择 199 n
9.4.2 主成分分析 200 n
9.5 学习算法 201 n
9.5.1 分类 202 n
9.5.2 聚类 202 n
9.5.3 推荐系统 204 n
9.5.4 频繁模式挖掘 207 n
9.6 流式ML管道应用程序 208 n
9.7 ML 211 n
9.8 管道交叉验证 212 n
小结 213 n
0章 云、Lambda及Pytho215 n
10.1 一条好评胜过一千个广告 216 n
10.2 Google Dataproc 217 n
10.3 基于Dataproc应用程序创建的个Spark 220 n
10.4 PySpark 227 n
10.5 Lambda架构 229 n
10.6 流式图分析 238 n
总结 241 n
n
n

作者介绍


文摘


序言