00:00
讲的时间是晚上的九点半,那么咱们就开始今天晚上的学习,嗯,今天晚上呢,咱们来学习一下啊这个10SPARK,那么这个10SPA呢,它是属于大数据体系当中的离线计算引擎,我们在10SPARK里面执行的所有计算都是离线计算,那么什么是离线计算呢?稍后呢会来给大家进行解释,那么反过来去说,它里面并不存在真正的实时计算,因此呢,我们不能够把这个10SPARK呢用于实时场景非常高的情况,那么希望咱们通过今天晚上的学习,能够让大家对我们的大数据体系,尤其是对18课呢,能够有一个进一步的了解,为大家后续的深入学习哈奠定一个基础,如果说大家哈之前都听过赵老师的课程,那应该都知道,那么赵老师呢,在。
01:00
上课的过程当中,会给大家记录一个课堂的笔记,通过记录课堂笔记的这种方式,我们会把今天晚上比较重要的内容给大家记录下来,因此呢,今天晚上咱们着重的给大家介绍两个方面的问题,首先咱们需要对大数据的一些基本知识要有一个基本了解,因为呢,在整个大数据的体系当中,它包含很多的组件,这些组件的功能和作用各不相同,那如果呢,咱们没有一个基本了解的话,那么是不利于咱们后面的进一步学习,有了基本了解以后,重点讨论一下我们的10SPARK,那么通过刚刚的介绍咱们提到,那这个10SPARK呢,它是属于大数据的体系当中的离线计算引擎,我们在18课里面执行的所有计算都是离线计算,好,这个呢,咱们放到稍后来给大。
02:00
大家进行详细的介绍,好,咱们现在呢,咱们就按照这样的一个顺序来给大家进行相关的说明,那首先咱们讨论一下大数据的一些基本知识,因为我们在大数据体系当中,它包含很多的组件,那么通过使用大数据的组件,咱们最终的目的是干嘛呢?是去构建我们的数据仓库,而我们在数据仓库里面通常只会执行我们的查询语句,而数据仓库呢,它又是我们的OAAP的什么具体实现,那么关于数据仓库还有我们的么?OLAAP呢?赵老师呢,在昨天晚上给大家讲这个MYCQ的时候,都给大家进行了相关的说明,那么我们可以把整个大数据体系当中,那么这组件呢,主要划分成是两大类型,首先大数据体系当中,它的组件的第一大类型呢,主要是完成什么?
03:00
数据的存储好,第二个方面呢,是你完成什么数据的计算,那如果说你把握住了数据存储,或者说把握住了数据的计算,那么怎么了就把握住了整个大数据体系当中,那么最核心的一个部分,首先看一下数据存储部分,对那数据存储的话,如果你使用传储的方式要存储数据,比如说你可以把数据呢,存储在我们的什么Oracle里面,或者呢,存储在我们的MYSQL里面,通过使用这样的关系型数据库来实现我们的什么数据仓库,那么这个呢是可以的,但是呢,你把数据存储在这个里面呢,它会带来一些问题,哪些问题呢?首先第一个问题是这个数据库啊,Or mysq呢?他们都是属于关系型数据库,咱们只能够存储结构化数据,那么如果。
04:00
说你要存储半结构化或者是非结构化数据,很明显那里不能够使用传统的关系型数据库,那这个呢,是使用传统关系型数据库嘛,构建数据仓库的时候,它所存在的第一个问题,那么它所存在的第二个问题是什呢?不管是你的Oracle也好,还是MYSQL也好,那么他们都是什么数据库呢?都是一种集中式存储数据库么?什么叫集中式存储呢?就是说在你的Oracle里面,MYSQL里面本身不能够支持我们的分布是存储,你要去实现分库和分表的话,需要借助我们的数据库的中间件,因此呢,它就并不适合存储海量的大数据,那么我们在大数据的体系当中,就需要有一种新的方式来去解决海量数据的什么存储问题,而这种新的数据存储方式。
05:00
就是我们的什么分布式存储,那如何去理解什么是分布式存储呢?简单来说就是当一台服务器解决不了数据存储问题,那么咱们就多搞几台服务器,他们共同搭建起一个分布式的集群,共同来存储数据。因此呢,我们在大数据体系当中都是分布式集群,而你在存储数据的时候,它主要呢,能够存储两种不同类型的数据,首先第一种数据是我们的什么存储离线数据,通过存储离线数据来去构建离线数据仓库,而大数据存储的第二个方向,那就是呢,它能够存储我们的什么实时数据,通过存储实时数据拿去构建实时数仓,那么咱们这地方解释一下什么叫离线数据,什么是实时数据啊,那。
06:00
那么离线数据它表示已经存在的历史数据,比如说我们的交易数据,我们的订单数据,当你订单交易完成以后,数据已经产生了,我们把这种已经存在的历史数据统称叫做离线数据,它可以是结构化的,也可以是非结构化的。那么什么叫实时数据呢?实时数据大家注意一下,它是一个什么?它是一个相对概念,那么它相对我们的计算任务而言,目前还不存在的,未来有可能会产生的数据,它叫做什么呢?实时数据,比如说我们想每隔两个小时统计过去一个小时交易的订单,那这个呢,就是非常典型的一个什么实时计算当中的什么窗口计算,它处理的是我们的实时的什么数据。
07:00
当然它也可以是结构化的,也可以是非结构化的,那么了解到了这些知识以后,那么赵老师呢,就需要问大家一个问题,大家能不能够告诉一下赵老师,我们在大数据的体系当中可以使用哪些组件来存储离线数据?你能够把这些组件的名字发送到咱们的公屏之上吗?那么如果说大家都知道,就请积极回答小赵老师的问题哈,如果说大家不了解呢,就请在咱们的公屏之上回复一个0,或者给赵老师呢点一个赞啊,我们接着往下。来给大家进行相关的介绍,但这些知识都是希望大家在深深入学习大数据体系之前需要了解的内容,这样子呢,是非常有助于我们后面的进一步的学习。好我们讨论一下存储离线数据呢,主要使用哈do普生态圈体系,对,那比如说哈都普当中的话,HM d fsm h basem, 还有have的,那么这三个组件它们主要存储离线数据,首先大家需要知道这三个组件都是属于哈多体系,因此呢,我们在学习哈杜的时候,需要去学习HDFS,需要去学习h base, 需要去学习have。好,我们简单解释下每个组件的功能和作用分别是什么啊?首先第一个是我们的什么呢?HD.
08:42
还是,那么什么是HTFS呢?它是属于哈杜的分布式文件系统,那你把它看成是一个网盘就可以,比如说你的百度网盘,它也是一个什么呢?分布式文件系统,它能够以文件的方式。
09:01
解决海量离线数据的存储问题,因此呢,它适合构建我们的离线输仓,稍后呢,咱们通过DEMO演示会用到咱们的HFS,对,它是哈都里面非常重要的一个组件,大家学习哈都op的时候,第一步呢,就需要去学习到底什么是HDFS,好再来讨论一下我们的第二个就是我们的h base, 首先大家需要知道啊,这个h base呢,它是一个什么呢?它是一个low cql数据库,那么我们可以把low cql数据库,比如说你的h base是约是mango DB, 我们可以把low cql数据库划归到大数据体系当中,因此呢,后续大家如果要系统去学习大数据的话,需要去学习我们的lowc口数据库,那简单介绍一下HPHP呢,首先第一点它是什么呢?基于HDFS之上。
10:01
那既然h base基于HDFS之上,那么你在h base里面创建一张表,表中的数据,最终它将以目录和文件的形式存储在HDFS当中,那么有了这个关系以后,后续呢,你的安装部署的时候,就需要先安装好部署我们的HDFS,然后呢,基于HDFS,再来部们的h base, 好,这呢是h base它的第一层含义,它的第二层含义是什么呢?它是一个什么呢?列式存储数据库,那么列式存储数据库呢,非常适合执行我们的查询语句,因此呢,目前构建数据仓库呢,都是使用劣势存储,H base呢,是一个,包括你的什么呢?MP数据库也是属于劣势存储的,好再来看一下我们的第三个哈,我们的第三个,那就是我们的嘛,Haveve haveve呢,它也。
11:01
是属于它都不体系,它是什么呢?基于HDFS之上的一个什么呢?离线数据仓库,它支持使用标准的什么C口语G来处理数据,既然have支持C口语dream,它又是基于HDFS之上,那么你在haveb里面通过使用c com创建一张表,那么表中的数据那最终也将会以目录和文件的形式存储在HFS当中。因此呢,安装部署的时候跟HP一样,先安装部署好HDFS,再来部署我们的have,那么have呢,它是C口语句,那么它在默认的情况之下,大家需要知道,那么have呢,会把C口语转换成是我们的my producedu, 也就是说默认执行方式是什呢?是Have什么呢?Have on my producedu. 那么这个。
12:01
哈produce呢是哈多op当中的啊离线计算引擎,那么还有呢,会把这条CQL语句转换成是一个my produce任务呢,运行在哈的亚马集群之上,那尽管咱们讲目前哈目前你在这个大数据的体系当中,很少会在直接的去开发我们的map produce程序,更多的是开发我们的10SPARK克还有flink程序,但是呢,Map producedu什么思想和原因非常的重要,而这种思想和原因也被借鉴到了我们的斯巴克还有弗Li克当中,因此呢,很重要的一点是什么呢?大家后续你在学习大数据的时候,第一步呢,还是需要好好的去学习一下,到底什么是我们的map producedu是,那由于map producedu执行效率呢比较的低,那么就导致了have执行C口语句的效率也比较的低。
13:01
因此呢,我们在实际使用当中用的更多的一种方式是什么呢?是Have on Spark, 那什么叫have on10spark呢?就是呢,把have的执行引擎由我们的map productiondu换成我们的10SPARK,那于10SPARK呢,它是基于内存的方式进行计算,因此呢,执行效率呢比马Du要快很多,它就会把一条C口L语句转换成是一个10巴克任务呢,运行在斯巴克基定之上,这种方式是我们目前使用have的时候最常用的一种使用方式,因此讨论到这地方的时候呢,那么整个我们在大数据体系当中可以使用哪些方式来存储离线数据,那么就给大家介绍到这个地方,好问一下各位直播间同学,那么还能不能够跟得上张老师的节奏,如果说大家都还能够。
14:01
跟得上呢,就请给赵老师呢回复一个1,或者呢给赵老师呢点个赞,好,咱们接着往下来给大家进行相关的介绍,那讨论完了离线数据以后,那我们在大数据的体系当中可以使用什么呢?可以使用咱们的卡夫卡来存储我们的实时数据,那卡夫卡呢,它是一个什么呢?它是一个消息系统,并且呢,它只支持啊,只支持我们的topic啊,只支持什么topic广播类型的什么消息,那这个呢,主要用来存储我们的实时数据,通过它来构建我们的实时数仓,好数据存储的部分,那么咱们讨论完了,那如何进行数据的计算呢?那么数据量非常的庞大,咱们依然呢需要使用什么?依然需要使用分布式计算的方式来解决。
15:01
大数据的计算问题,因此呢,我们在大数据体系当中都是采用分布式集群来进行数据存储,包括数据的计算。那么由于数据存储。它分为离线,分为实时,那数据计算呢,也需要分开来进行讨论,那首先咱们讲大数据计算的第一个方向,那叫做什么呢?叫做离线计算,离线计算呢,也叫做P处理计算,通过它来处理离线数据,从而呢构建我们的离线数仓,这个呢,是整个大数据体系当中计算的第一个方向,那么的第二个方向是什么呢?就是我们的什么实时计算,实时计算也可以叫做理由处理计算,通过它来处理实时数据,从而构建我们的实时数仓。好咱们接着往下面去讨论,那问一下各位直播间同学,那么你能不能够把整个大数据的体系当中,哪些计算引擎,他们是离线计算引擎,你能够把这些计算引擎的名字发送到。
16:14
我们的公屏之上吗?那么如果说大家都知道呢,就请积极回答一下赵老师的问题啊,如果说大家不了解呢,就请在咱们的公屏之上回复一个0,或者给赵老师呢点个赞哈,让赵老师呢能够知道,大家呢都还能够跟得上赵老师的节奏,好,咱们接着呢往下面去讲,那我把这些离线计算引擎的名字先给大家写一下来,首先第一个呢,就是咱们刚刚提到的什么呢?这个Ma producedu哈,然后刚第二个呢,就是我们在10SPA克里面的嘛,10SPA克com,还有我们在什么这个flink里面的什呢,Flink的datatime set, 那这三个呢,是我们在大数据体系当中可以处理离线数据的离线计算引擎,简单做一个解释,首先咱们解释一下,第一个就是我们的什么这个market produce.
17:14
注意啊,My produce本身它只是一个什么,只是一个计算模型,是谷歌最早提出的一个计算模型,那通过使用这个计算模型,它能够去解决什么,解决推进rank的什么呢?网页排名问题,那既然它是一个什么技术模型,它跟我们的编程语言就没有关系,只不过呢,我们在哈杜普当中使用了Java编程语言实现了mapdu,因此呢,你在哈杜里面开发出来的mapdu程序将会是一个Java程序,但是呢,我刚刚说过,它本身只是一个计算模型,跟编程语言无关,比如说在里的mango DB啊,这个low c code的什么数据库当中,它也支持map,就是,但是呢,它所使用的编程语言是我们的Jason javascript. 那刚刚说到尽管。
18:14
我们目前在大数据体系当中,很少会在直接开发map producedu、程讯,但是他的思想和原理非常的重要,那么这种思想和原理也被借借用到了我们的10巴克,还有这个弗林克当中,因此呢,再强调一遍,大家后续如果说你要系统深入全面的去学习大数据的知识,第一步呢,还是需要好好的去学习一下,到底什么是我们的啊。到底什么是我们的map producedu, 好,讨论完了map producedu以后,那么再看一下我们的Spark com, 那么这个Spark com呢,它是什么?它是整个18g里面最核心也是最重要的一个部分,它是18g的什么呢?执行引擎,那么我们在18课里面的计算,所有计算从本质上去说都是18g克的离线计算,那么这句话呢,很重要,我再重复一遍,那么这个10SPARK克呢,是整个我们在10SPARK里面它的执行引擎,它是一个离线执行引擎,你在18g里面的所有计算,从本质上去算都是18g号的离线计算,因此呢,我们在8g体系当中不存在真正的实时计算,所有10SPA克计算都是离线计算。好,再来看一下我们的弗林克,那么我们在弗林里面。
19:48
他提供了一套apim,叫做data set, 那你去开发你的加va程序,或者开发你的SC拉程序,利用这一套API当中的算子,我们就能够进行离线操作,离线计算,但是呢,需要注意一下,那斯Spark呢偏向离线,Flink呢偏向实时,你在弗link里面的计算都是属于真正的实时计算,因此呢,这两种计算引擎是目前我们在大数据的体系当中最主要的两种计算引擎,一个偏向离线,一个呢偏向实时。那么讨论完了离线计算引擎以后,再来讨论一下我们的什么实时计算引擎,哪一些是呢?比如说我们什么我们的S段啊S多,还有我们的18课当中什么18坑,我们的streaming,还有我们在弗Li课当中什么datatime streaming, 那首先给大家。
20:48
那说明一下,就是说你的什么,你的这个storm跟你的什么呢?Flink的data stream这两个呢,他们是属于真正的实时计算,他们可以用于实时场景非常高的情况,对不对?好,这个地方我们单独讨论一下,我们的这个什么10SPARK dream, 那么通过刚刚的介绍,咱们不是说到了吗?你在这个10SPARK里面的所有计算,那么从本质上去说都是这个什么18扣的离线计算,因此从本质上去讲,这个18个dreaming依然是一个什么离线计算,它采用这种小P的处理方式,近似代替一个什么呢?实时计算它不能够。
21:38
不能够哈,用于实时场景非常高的情况,那么一般来讲啊,这个不绝对啊,一般是这样子的,一般用于什么?一般用于我们的秒级,那什么叫秒级呢?比如说如果说你希望3秒钟出理一次数据,你希望5秒钟处理次数据,如果使用秒级的情况,那你能够使用这个8STREAM面去实现,但是呢,如果是秒级以下呢,比如说我希望300ms,或者说我希望400ms处理数据,在实时场景非常高的情况之下,不能够使用什么么?Dream, 你本质上它是一个什么,它是一个离线计算,那那因此讨论到这个地方的时候,那我就把整个大数据的体系当中,那涉及到的核心的些组件都给大家做了什么详细的介绍,哪些可以用于存储,哪些可以用于计算。
22:38
哪些用于实时,哪些用于离线,对还因此讲到这个地方的时候呢,问一下各位直播间同学,关于今天晚上的第一个小节,大家是不是都听明白了哈,如果说这个部分,嗯。如果说这个部分大家都听明白了呢,就请在咱们的公屏之上,请给赵老师呢回复一个666,或者呢给赵老师呢点个赞,好,咱们接着呢讨论今天晚上呢第二个部分,重点讨论一下我们的离线计算引擎,讨论一下我们的18课,强调一下你在18课里面的所有计算都是离线计算,好进入到我们的第二小节学型,那到底什么是什么是我们的10巴克呢?首先我们可以到10巴克的官方的网站上看下,那么在官方的网站上它是如何介绍的我们的18g的,打开浏览器访问一下什么18g,点阿帕琴,点R进看官方的网站上是如何介绍的,那么我们在官方网站上面的呢,第一句话,他就告诉了我们,到底什么是我们的18g what次。
23:56
嗯,阿帕奇18课,好,我们一起来阅读下,从这句话里面我们能够获取到哪些相关的信息,首先他说什么呢?他说这个10SPA克是一个什么呢?它是一个multi推language engine, 它是一个多语言引擎,那什么叫多语言引擎呢?就是说我们在10SPARK里面支持使用多种编程语言,比如说它里面呢,支持使用我们的scva,也支持使用我们的什么Java,也支持使用Python,或者支持使用我们的C口语dream,对,那当然斯巴克官方推荐使用什么?推荐使用咱们的斯GALA,那简单介绍一下,什么是我们的斯LA在哪?你可以去百度去搜一下啊,什么是我们的什么斯GALA的编程语言看一下,那什么是我们的什么石GALA编编程啊,编程语言呢?那它这个什么,它是基于JDK,它是。
24:56
啊,怎么就要写不对啊,看这scam好他什么,他说这个呢,SC呢,它是什么?它是基于Java语言之上的一个什编程语言,换句话去说,你要去使用scla之前,首先需要安装好Java的什么JDK,并且呢,它还是一种什么呢?它还是一种多方式编程语言,那我们在SC拉里面呢,既支持我们的变相对象编程,也支持我们的函数式编程,稍后呢,咱们来给大家举个例子,既然斯SKY拉本身基于Java语言之上,对,那么我们在10SPARK里面呢,也能够直接开发我们的Java程序,当然10SPARK呢,提供我们的10SPA c com, 通过模块是Spark ccom, 支持使用标准的C口L语dream来去处理我们的大数据,这些内容呢,稍后呢,咱们都会通过DEMO的演示你让大家呢,都能够有一个感性的认识,你好,回到咱们的官方。
25:56
的网站上面来看一下马,你使用这样的一个什么多元引擎能够干嘛呢?能够执行data engineering数据工程,对他science,数据科学以及我们的machine learning, 简单来说就是执行我们的数据的处理,并且呢,这个多元引擎它能够部署在什么单节点之上,也能够部署在集群之上,当然你的生集群之上,当然你的生产环境里面呢,通常是把10SPARK呢部署在集群之上,而你部署在集群上的时候,那就常用的一种部署方式就是什么呢?就是我们的Spark on yam, 那什么叫Spark on yam呢?首先你需要知道什么是我们的yam em呢?它是属于什么哈,多普2.0版本以后。
26:51
提供的一个什么呢?资源任务调度的平台,这种onmm的方式是目前我们在大数据体系当中运行计算任务的主要调度方式,比如说你的map produceduce on ya, 你的Spark on ya, 你的flink on ya, 当你部署好了哈多普以后,自然而然的就部署好了咱们的亚M环境啊,重复一遍这个10巴rk on样它是什么呢?目前我们在生产环境当中运行18g的什么主要方式,当然你的18g呢,也能够独立运行,稍后呢,咱们也是的势力呢,就是呢把我们的斯巴克运行在独立的模式之上,对好有了这些基本的知识以后,现在呢,咱们能不能够去启动一下我们的斯巴克集群,看一下它长什么样子呢?当然是可以的,切换到咱们命令行的工具当中,好,这个呢,是咱们斯SPA克的什么安装。
27:51
的路径,那么当你安装好了10SPARK以后,对直接的去执行下面的什么使到all的脚本,那通过这脚本呢,就能够启动我们的10SPARK集群,那那打印输出的信息咱们呢,可以看到,首先它启动了一个什么,启动了一个master的一个什么主节点,在启动一个worker的什么重节点,那么它是种什么架构,它是一种主从式架构,那么我们在这个大数据的体系当构,那么这些核心的组件都是主从式架构,既然是如此的话,问大家一个问题,主从式架构它所存在的最主要问题是什么呢?如果说大家知道,那就把答案呢发送到咱们的公屏之上,如果说大家不了解呢,就请在公屏之上。
28:51
回复一个0,或者给赵老师呢点一个赞,好赵老师呢,重复一下,嗯,重复一下刚刚的问题啊,就是说在大数据的体系当中,那么这些核心的组件,比如你的18g弗Li克h base HD FS一样,都是一种主从式加构,那主从式加构它所存在的最主要问题是什么?如果说大家知道了,就请告诉一下赵老师,如果说大家不了解呢,就请在公屏之上回复一个0,或者给赵老师呢点个赞哈,好,咱们接着呢往下来给大家进行相关的介绍,单独写个我们的课堂的笔记本,好写的这个什么样?好,我们讲这种什么这种主从,是啊是啊,这种主存架构,它所存在的最主要问题是什么?是我们的单点故障问题单。
29:51
D指的是我们集群当中的主节点,如果说整个集群当中它只存在一个主节点,当它死掉以后,它会造成整个的集群无法正常工作,这个呢就属于单点故障,因此呢,我们在生产的环境当中就需要去实现高可用的什么ha,那什么叫ha呢?全称是我们的high ability high ability就高可用功能,而你在大数据的体系当中,你要去实现高可用的话,需要借助什么?借助我们的猪keepper,那猪keep呢,是整个大数据体系里面比较重要的一个组件,它是属于哈多普当中提供的分布式协调服务,利用zoo keep的监听和选举机制,我们能够解决大数据体系里面主从架构的单点故障问题,从而实现高可用的ha。
30:51
但这个里面呢,涉及到的更加系统,更加详细的知识,当然了都会被包含在我们的什么系统的课程当中,好,既然你把这个环境启动成功的,它的启动完了48个集群以后,它提供的什么基于网页的什么图形化的工具端口号是我们的什么8080,因此呢,打开咱们的浏览器访问一下输主就是什么呢?呃,输主机的我们的8080端口,那么你就能够打开18个什么仪表盘工具,通过这样的一个仪表盘的图形化的工具,那我们呢,就能够去监控我们的18个的集群,如果说你有计算任务呢,运行在集群之上,通过这样的一个仪表盘的工具,你也能够监控到任务的执行的状态,对那整个环境准备好以后。
31:51
那整个十巴克生态圈体系当中,它的组成部分都已经被集成好了,因此呢,咱们需要去了解一下十巴克到底为我们提供了哪些组件,那这些组件它们的功能和作用分别又是什么?好,咱们看一下这个地方的这张图片,那那这张图片就给大家详细的去描述一下我们在18g生态圈体系当中,5。
32:20
包含有哪些组成部分,首先你在10SPARK里面最核心也是最重要的部分就是我们的什么这个10SPARK com, 那这个10SPARKRK呢,刚刚提到过,它是属于呢,10SPARK里面最重要的一个什么组成部分,它是10SPARK的什么执行引擎,所有18g的计算最终都是由它,都是由我们的18个com它去完成,对并且呢,它还是一个什么呢?它是一个离线计算引擎,因此呢,我们在18g里面所有计算从本质上去讲都是18RK克的离线计算,因此呢,它就不存在真正的实时计算,它执行引擎有了以后,我们在18RK里面提供了我们的数dream分析引擎,18C口,通过使用标准的什么C口语,它能够把一套C口语dream转换成是。
33:20
底层的18GCODE的计算任务呢,运行在我们的8g的集群之上,稍后呢,我们来给大家举个例子,并且呢,它提供一个什么流处的引擎,那那18追命,那这个18追名呢,严格意义上去讲,只能够叫做流处的计算,它不能够叫做实时计算,与为本质上它依然是一个18RKOR的离线计算,那么咱们讲这三个部分,我们的10SPARK com, 我们的sparkcyle,我们的斯Spark dream, 这三块儿都是属于大数据的计算的部分,因此呢,我们在学习大数据的时候,需要去学习这三部分的内容,那这个地方的什么机器学习和图计算这两块呢,严格上来说呢,它属于我们的算法,算法呢是我们学习我们的AI,学习人工智能的基础,严格上就是说并不。
34:20
属于我们的大数据,因此呢,我们的大数具体性名呢,只讨论我们的18RK com, 我们的8RK c com, 还有我们的么?这个是8个dream,好有了这些基本知识以后,当然刚刚呢什么环境集中起来了,那把环境集中起来以后呢,在它的什么仪表盘的工具的上方,有一个非常重要的地址,是在当前主机的吗?7077的端口之上,所以这个地址呢,是整个18g集群主节点地址,主节点负责接收任务请求,因此呢,后续你通过使用18个客户端连接到48个基之上,当你要把任务的提交到基上的时候,就需要指定主基点,它在哪里?好有了这些知识以后,首先呢,咱通过开发我们的S嘎达程序,调用我们的s com执行一个离线。
35:20
计算来执行一个什么单词计数,统计每个单词它所出现的频率,那为了也是方便呢,那么需要去把我们的HDFSM启动起来的,那通过刚刚的介上,那怎么知道呢?HMDFSM它是属于哈杜普当中的分布式的文件系统,它能够以文件的方式解决海量离线数据的存储问题,因此呢,它适合构建我们的离线输上。好,我把HDFS启动起来以后呢,事先我在HDFS之上放了一个文本文件,看一下文件的内容啊,它这个文本文件我放到了什么了?放到了我的input下面有一个贝塔点test文件,那这个文件里面。
36:09
包含有三句话,那么哪三句话呢?分别是I love Beijing I love China Beijing京capital of China, 那通过观察咱们会发现这三句话里面呢,有一些单词它是重复的,现在呢,咱们就想跑个18靠的程序,把每个当时人它所出现的频率呢统计出来,好,那么直接进到10SPA克的什么命令行工具上,直接开发我们的SC拉程序,对好我么进的好执行并下面什么我们的Spark秀SPA通过什么什么杠杠master指定集群主节点的位置,主件呢,它逐点就在当前主机的什么那家刚刚都看到了,对7.7器端口之上,因为呢,你需要把你的任务请求提交到主节点上,那么有主节点分配给重。
37:10
给点去执行好,进入到命令行的工具上面来以后呢,你就能够去开发我们的SC拉程序,那通过刚刚的介绍,嗯。咱们知道啊,那这个斯呢,它是个什么?这个斯伽呢,它是一个多方式编程语言,它既支持面向对象,也支持函数式编程,当然斯嘎LA最大的特点就是它能够使用函数式编程,那什么叫函数式编程呢?通过使用函数式编程,我们能够去开发我们的高阶函数,它能够大大简化我们的代码量,那我用很少几行代码就能够去实现一个非常强大的功能进来,是是scla函数是编成一个什么一个特点,对好,现在进入到命令行的什么工具上面来以后呢,我就去开发一个SC拉程序,直接的去读取HDFS,把数据读取进来以后,进行一个单词计术,统计完以后呢,把结果打印输出在我们的屏幕之上,那好们Spark contest通过下面算。
38:21
子text fire呢读取HDFS,所以呢,需要去写上HDFS的全路径,HDFS冒号我们的9000那果。Input目录下面呢,有一个data塔,点开文件,对,那输入呢,可以是文件,也可以是目录,如果是目录的话,将会读取目录下面的所有文件,那数据读取进来以后呢,我需要进行分词,每个单词记一次数,把相同的单词做一个求和操作,好们使用我们的SC嘛,函数式的编程,首先叫什么flat map, 嗯,进行一个我们的分词操作,下划线代表呢,上一步的什么输入入的每个元素,分完单词以后,它叫什么map,算值,把每一个单词呢记一次数,记一次数以后呢,再把相同的单词做一个什么,做一个求和操作,Reduceing by k下划线加下划线,最后呢,把结果呢,直接输出在我们的屏幕之上,因此呢,现在咱们就使用了我们。
39:37
的嘎拉语言开发了一个什么,还开发了一个什么单词技术程序,我仅仅写了一行代码呢,就能够去完成这样的功能,好咱们执行一下子个程序,程序执行完成以后呢,他就会把输出结果直接打印输出在屏幕之上,并且还有一点是什么这个这个程序,那么这任务呢,它运行在集群之上,既然它运行在集群之上,那么咱们能不能够在集群之上看到整个任务的执行过程呢?当然它执行完成以后,结果将会什么直接出在咱们的这个地方,每个单词它出现了多少次,比如说我们的北京出现两次,Capital不头上出现一次,直接呢把输出在屏幕之上,当然我们也能够在集群之上看到整个任务的什么执行的状态,好咱们去刷新一下。
40:37
刚刚的什么呢?这图形化的工具,对,那因为你刚刚的这种呢,是运行在咱们的命令行的工具当中,因此呢,怎么去点击这个地方呢,什么我们的18个项的连接,那所有你在命令行工具上面执行的任务呢,都能够通过点击的个连接,都能够看到整个任务的执行的过程,对他被划分成了几个阶段去执行,他们点击我们的这个连接,对刚刚执行过我们这个一个任务,那么这个任务ID号是我们零号ID,他点击这个描述当中的连接,进到任务的什么详细信息上,你就可以看到刚刚咱们开发的单词技术程序,它被划分成了两个阶段,这些呢,更加深入知识当然都会被包含在直播间下方的什么系统的课程当中,因此呢,通。
41:37
通过这样的一个非常简单的事例,那么就演示一下如何我们在10SPARK里面通过使用我们的10SPARK com开发一个离线计算程序来去处理我们的离线的数据,好,问一下各位直播间同学,关于张老师刚刚演示的这个事例,大家是不是都看明白了?如果说刚刚的事例大家都看明白了呢?就请在咱们的公屏之上回复一个1,或者给赵老师呢,点一个赞,好,大家看明白了吗?
42:18
好,看明白了没有,刚刚演示过的这个事例,好咱们接着呢往下面呢,来给大家介绍,好这里演示一下,介绍一下我们的嘛,我们的这个10SPARK ccom, 那这个Spark cle呢,是我们在10SPARK里面呢,提供的数据分析引擎,它支持使用标准的C口L语dream来去处理我们的数据,它能够读取结构化数据,创建一张表,然后呢,就能够使用标准的嘛C口,并且这个部分呢,它已经被集成在了18g的什么安装包里面,换句话说,当你把18g安装部署好以后,就能够直接使用我们的18C com, 通过使用标准的C口L语句拿去分析我们的大数据,我们也来给大家演示一个示例啊,首先我单开启一个新,我新开一个什么啊,我新开一个命令行的窗口,先看一下咱。
43:19
咱们即将要用到的什么测试的数据,好连接到我们的虚拟机上,对好测试数据呢,很简单,它就是个什么,就是这样一个什么接受文件,那接收文件来看你面的文件的内容是什么的,它里面呢包含了什么三个人的信息,比如说人的名字,你的年龄等等,这个呢是一个什么,它是一个结构化数据,好我就把这个结构化数据通过使用我们的18C口读取进来,读成一张表,然后呢,你就能够通过使用标准的C口L语句来去处理咱们的数据的,如何使用它呢?演示一下我们的team,它还是在我们刚刚的那行上,那直接创建一张表叫P,对,通过使用什么10SPARK克下面的什么瑞的方法,直接读取一个TS文件,当然,这个文件可以是本地文件,也可以是HDFS文件,那好写上文件的全路。
44:19
途径在root下面呢,有个什么p pomp点点什么TS文件好读取进来以后呢,它就直接是一张表,那么因为它自动会做个转换,既然它是一张表,我们能不能够看到表的结构呢?调用一下P叫什么print,什么skima的方法,通过这个方法呢,能看到表结构呢,包含两个name,一个是名字,它是一个字符串,连龄A,它是个长整形,既然它本身是这张表,注意我们在18卡CQL里面默认它是不是我们的吧,我们的DSL语句来处理数据,当然也能够使用CQ啊,注以在我们的18C口L里面默认使用DSL句,当然也能够使用C口语句,现在那们首先使用d SL dream能不能够去查看这张表的数据呢?当然是可以的啊,直接调用什么p po p呢?
45:19
PPP下面的么点秀方法的,通过DSL去呢,就能够查询这种表中的数据,当然如果说你只想查询这一张表中姓名这个列呢,好你就可以样加上一个选项,我们的什么S类对吧,查询一下我们的什么这个姓名的的这列,他现在的什么这种方式,那就是使用咱们的DSL就查询18CQL表中的数据,当然我们更习惯的是什么直接使用CQL语句,如果说你想在18C口里面直接使CQL语句的话,需要把这张表注册成是一个视图才可以的,我们把这张表呢,调下面的一个方法,P下面的create什么我们的什么看下tap键,那好补齐一下,补齐一下可以什么turn,我们的view创建成。
46:19
是个视图,比如视图名字叫table,音为个视图以后,你就能够通过使用标准的C口L语句来去操作这一张表中的数据,好通过什么么18g下面CQL算值执行我们的CQ什么查询,那CQL查询呢,就是我们标准的C口,因此有这种方式以后呢,你在这个18g斯里面呢,就能够通过使用标准的C口句来去处理我们的结构化数据,当然他会把这条C口语句。依然转换成是底层的一个18扣的一个任务呢,运行在我们的18g的集群之上,那因此演示到这个地方的时候,我们就把整个10SPARK里面哪两个部分给大家介绍完呢?一个是我们的什么底层的这个是8个扣,一个呢是我们的数据分析引擎18C扣。好问一下各位直播间同学,关于这两个部分刚刚演示的事例大家是不是都看明白了啊,如果说这两个部分大家都看明白了呢?请给赵老师呢?回复一个1,或者给赵老师呢点个赞,那么最后呢,这来演示一下我们的嘛,这个是8DREAM,好,刚刚的例子大家都看明白了吗?看明白以后呢,请给赵老师呢?回复一个1,或者给赵老师呢点个赞,好,怎么还有一点。
47:55
时间啊,嗯,还有一点时间来给大家演示一下什么是我们的这个,什么是8个dream,那么通过我们刚刚的介绍啊,怎们知道啊,这个是8追命,本质上去说它依然是一个什么呢?离线计算,但是呢,它可以处理实时的流失数据,只不过呢,不要把它用于实时场景非常高的情况,那一般来说呢,就是我们的秒级,比如说如果说你希望3秒钟出理次数据,你希望5秒钟出理数据,那如果是秒级的这种单位,你能够使用咱们的18罪命,但是呢,如果是秒级以下呢,可能呢,咱们咱们呢就不能够使用我们的18个追命了,好,现在呢,咱们就使用它们也来执行一个单词技术程序,我从网络上发送一条消息数据过来,接收到消息数据以后,实时统计。这。
48:55
这一条消息数据当中每个单词它所出现的频率分别是多少?那为了演示方便呢?好,咱们这个地方呢,需要开启个会画的什么窗口,好首先我开两个会画窗口,我在什么下面的什么窗口当中,也依然登录到咱们的服务器上,我需要启动一个什么消息服务器的工具,叫做什么叫做我们的nat cut, 那什么叫nat cut呢?那这个not cut做像它什么,它是Linux上面的一个网络测试工具,当你安装好Linux以后呢,就能够直接使用它,那我们可以把它当成是什么,当成是一个消息服务器去使用,那它发送消息,消息发送出去以后呢,被我们上面的什么这个时报告罪面程序捕获到,一旦捕获到以后,实时统计这个消息数据里面每个单。
49:55
成它所出现的频率,你这边发什么,我这边实时统计什么,那这个呢,就是一个非常典型的一个什么实时计算的一个场景,好先去把我们的nott卡特消息服务器去给它启动起来哈,对,好直接在命令行敲下面窗口啊NC简写NC,杠L呢表示我们以监听模式启动它,杠P呢表示你把它运行启动在哪一个端口之上,1234端口之上,好它启动起来以后,我再把上面的什么这个是八个碎面程序也给它启动起来啊,直实接进行定下面的什么我们的RA,一个example,我执行是dreaming,下面的什么呢?点Let walk我们的么,我看着我从网络上接收一个消息数据,实时统计这个消息数据当中每个单词它的频率。
50:55
那我需要从当前主机nocom host的什么1234端口上接收数据,那一旦我把它跑起来以后呢,大家注意观察一下效果,它会是一个什么样的效果,好,我下边还没有发消息,没发消息,但是呢,上面的程序已经启动起来了,对,好注意观察一下,启动起来以后,它所打印输出日志,通过打印输出日志你会发现呢,基本上是每隔1000ms处理的数据,那也就是说你下面发送完消息以后呢,它可能会延时一秒钟才会被我们上面的这个18个罪名程序捕获到,因为它本质依然是一个什么离线计算,它不能够用于实用于实时场景非常高的情况,好程序跑起来以后呢,好,我在下面呢,我来发送我的消息的什么数据,发送一个什么。
51:55
啊I love什么I love我的什么北京,I love, 我的北京and呢love,我什么China,一旦这句话他被发送出去以后,它就会被上面的程序捕获到,实时统计这句话当中每个单词它出现的频率,注意我把下面这句话发送出去以后,大家注意一下上面的民银行窗口会不会发生什么样的变化,注意观察一下,那它发送出去他这个这这个地方可能会比较快就过去了,那它发那好像我呀controll c终止一下上面的程序啊,终止一下,否则他很快就刷屏就刷过去了,对好,我下面的把消息发送出去看看,那么上面就往上们去看,对发一下平安,他就实时捕获这个消息,数据统计这一句话里面每个单词频率是多少的,你下边发什么,我上边呢,我就统。
52:55
就什么这个就是一个非常典型的一个什么实时计算,但是大家注意啊,你在10SPARK里面,你所使用的字么,这个10SPARK dream本质上依然是一个离线计算,它不能够用实时场景非常高的情况,这个呢一定需要大家注意一下,那因此呢,咱们讲到这个地方的时候。
53:18
就把整个我们在大数据10SPARK体系当中,涉及到有关计算的三个部分,哪三个部分呢,一个是我们的什么这个18GCOM,一个是我们的什么这个18个C口,一个呢是我们的呢18岁,那这三块呢,都是属于大数据的计算的这个部分,因此呢,刚刚呢,每个部分都给大家演示一个事例,好问一下大家刚刚演示过的这三个事例,大家是不是,嗯。是不是都看明白了,如果说这三个事例大家都看明白呢啊跟刚刚一样,就请大家呢,在公屏之上,请给赵老师呢回复一个1,或者呢给赵老师呢点个赞啊那好,大家都看明白了吗?这三部分都属于大数据的计算,因此呢后续重复一遍,大家如果你要系统的去学习有关18课的知识,就需要重点学习这三个部分,当然你的这个机器学习,你的你的这个机器学习ML内呢和图计算呢,这两个部分并不属于大数据的什么计算的部分,那只是呢,我们在10SPARK里面支持这样的功能,对因你在10SPARK里面,10SPARK里面包括你这样哈都普里面,包括你在这个什么弗利克里呢,各个大数据的组件都支持我们的机器学习的算法,这个呢,大家了。
54:57
好几下,那么就可以了,每一层介绍到这个地方的时候呢,整个我们在18课里面涉及到了一些核心内容呢,都给大家做了一个非常详细的介绍,当然了,顺便说一下啊,如果说大家后续你要去重点去学习18课的话,重点就需要去学习它底层的这这个什么18个扣,那这个18课呢,是整个我们在18g里面最核心也是最重要的一个部分,而我们的诗back com, 它的核心又是什么?又是我们的RDRDDM,那简单说一下,什么是我们的RDDRDD,它是我们10SPARK code的数据模型,它是整个10SPARK里面最核心也是最重要的一个部分。好吧,刚刚讲的呢,稍微梳理一下啊,8g核心什么呢?18g的核心是我们的18g扣,而这个。
55:57
斯巴克Co的核心是我们的RDD,因此这个呢就决定了RDDM,它是整个10巴克里面最重要的一个部分,把它的作文含义写在咱们的课堂笔记上,到底什么是我们的RDD啊,对RDD写下,写下大家了解一下,再RDDM是什么?R写下RRDDM,它是我们的弹性分布式数据集,布是数据集,它是什么?18个课的什么数据模型,那就决定了什么,它是整个18个里面最核心也是最重要的部分。后续大家深入学习18的时候,重点就需要深入学习,到底什么是RDD,当这些更加深入知识呢,仅仅靠直播的一个小时是远远不够的,那更加详细内容呢,都被包含。
56:57
大家的直播间下方的什么系统课程当中好一成讲到这个地方的时候,基本上今天晚上由赵老师要给大家分享的知识呢,大概就剩这么多,好咱们现在的时间是晚上的,什么10:27,赵老师呢?10:35下播啊,10:35下播,剩下的什么呢?时间答疑音或者呢,大家去拍一下什么课程啊,拍完课程的同学请通过私信把你的联系方式发送给赵老师,赵老师呢,下播以后会单独联系你的。好要问问题的同学请把问题发送到公屏之上啊,要派课的同学呢,直接点击直播间下方的链接,新进的同学啊,点点关注赵老师呢?
57:57
10:35下播,呃,AI对大数据的冲击如何啊,AI呢,怎么说呢,AI和大数据呢,他们两个是不同领域,那目前我们在大数据体系里面呢,好像还没有对AI进行很好的这个这个支持啊,因此咱们各是各的领域啊,啊这个大家了解一下。
58:20
啊好,看一下大家有没有什么问题没有啊。赵老师刚10:35啊下播。嗯。嘘。
59:00
好,新进来的同学哈,点点关注啊赵老师呢,稍后就下播了。好。那个要问问题的同学呢,请把问题发送到公屏之上,要拍课的同学呢,直接点击直播间的链接,拍了课以后呢,请通过私信把你的联系方式发送给赵老师啊,新进来的同学啊,点点关注赵老师呢,10:35啊,下播啊。
我来说两句