问:谁能帮我找到一个不使用Azure blob存储的情况下,将azure数据工厂中的数据摄取到雪花表中的解决方案?
要求:我们将一组客户id存储在snowflake表中,now.We希望迭代每个客户id,并使用WebAPI从亚马逊S3获取所有客户详细信息,然后将其写回snowflake表。当前的系统使用Azure Databricks(PySpark)来发布客户id,并使用WebAPI从S3获取相关的json数据,解析json来提取我们需要的信息并将其写回snowflake。但是对于单个记录,这个过程至少需要3秒,我们不能花费那么多时间来摄取数据,因为我们有大量的数据量要处理,并且长时间运行ADB集群的成本更高。我们想的解决方案不是使用python Web API,而是使用azure数据工厂从s3存储桶中获取数据,并将其摄取到雪花表中。由于数据是客户数据,我们不应该在将其写入snowflake之前将其存储在azure blob存储中,因为隐私rules.Do我们有任何其他方法可以用于直接从s3或通过ADF将其写入snowflake表,而无需使用blob存储。
发布于 2020-06-10 20:56:11
您可以创建一个databricks笔记本,从s3读取所有数据,并出于临时目的将数据存储在dbfs上,该数据将在集群终止时立即销毁。
ADF -> Databricks Notebook
Databricks
Read from s3 -> create a pyspark dataframe -> filter the data based on your condition -> write to snowflake发布于 2020-06-10 22:16:35
好的,如果你的数据已经在S3上了,你可以使用COPY INTO命令。https://docs.snowflake.com/en/user-guide/data-load-s3.html
https://stackoverflow.com/questions/62304031
复制相似问题