我正在浏览微软的文档:
https://docs.microsoft.com/en-us/azure/data-lake-store/data-lake-store-overview
我刚接触过Azure Data lake和HDInsight。URL中有一条语句告诉您
"Azure Data Lake Store can be accessed from Hadoop (available with HDInsight cluster) using the WebHDFS-compatible REST APIs."根据我的初步理解,数据湖存储是一个可以存储任何类型的数据的存储。我认为,HDInsight也做了同样的事情。
我的问题是,Azure Data lake和Azure HDInsight之间的区别是什么?如果HDInsight可以用于文件存储或任何类型的存储,那么为什么要使用数据湖?如果有人能详细说明这一点,那就太好了。谢谢。
发布于 2018-06-11 17:25:06
想一想数据湖最简单的方式就是想像这个大型容器,它就像一个真正的湖,有河流流入你永远不知道这些河流来自哪里(或者是什么“类型”的河流)。引入Azure Data Lake是为了让开发人员、数据科学家和分析师能够轻松地存储任何大小的数据。它消除了接收和存储所有数据的复杂性,同时使大数据的启动和运行速度更快。数据湖能够存储海量不同类型的数据(结构化数据、非结构化数据、日志文件、实时、图像等)并将它们混合在一起,将许多不同的数据类型关联起来。这里的关键是我们正在从传统方式转向现代工具(如Hadoop、Cassandra、NoSQL DB等)。Azure Data Lake包括三项服务:
HDInsight,一个完全托管的云

Azure Data Lake Store就像一个基于云的文件服务或文件系统,其大小几乎没有限制。我们可以在该存储中的数据之上运行服务。因此,您可以在HDInsight集群中使用Hadoop或Spark ,或者您可以使用Azure Data Lake分析服务,它是对Azure Data Lake Store的补充。该服务将允许您运行有效地查询您在Azure data Lake存储中存储的数据并生成输出结果的作业。
发布于 2018-11-02 03:26:29
简而言之,
Hdinsight is a managed hadoop service (to provide compute support)
Azure Data lake(ADL) is a managed storage service (to provide large amount of storage support)(除了ADL,您还可以选择在HDinsight中使用Blobs,但Blobs有一些限制(例如不支持通过hdinsight集群向存储设备传输文件)
下面是来自文档的定义(如下所示):
Azure使用“分解的硬件方法”
您可以将HDinsight关联或假设为Hadoop集群,将Azure Data lake (ADL)假设为HDFS。但它们是分离的。
如果你想与亚马逊网络服务联系起来,HDInsight等同于电子病历,ADL相当于EMRFS或S3。
如果终止群集,ADL存储将保留其中存储的文件。你可以使用其他服务或工具(如Azure data bricks)直接访问存储,也可以在数据之上创建另一个hdinsight集群。
Hdinsight使用adl://访问
,并且hdinsight从不将文件块存储在节点中(就像Hadoop那样),而是具有到存储服务的映射。
发布于 2018-06-04 23:33:38
Azure Data Lake Store,只是一个数据存储。HDInsight也可以在您启动的集群中执行此操作。但是,当您停止该集群时,数据也会消失。
客户通常使用Azure data Lake Store或Azure存储来提供与用于处理数据的集群(计算)分开的永久存储。
盖伊
https://stackoverflow.com/questions/50679909
复制相似问题