在AWS作业中,为了从DB或S3检索数据,我们可以使用2种方法。1)使用Crawler 2)直接连接到DB或S3。
所以,,我的问题是:与直接连接数据库和检索数据相比,爬虫如何更好?
发布于 2020-08-26 11:57:01
AWS Glue Crawler将不会检索实际的数据。爬虫访问数据存储,并通过优先排序的分类器列表来提取数据和其他统计信息的架构,然后使用此元数据填充Glue数据目录。爬虫可以定期运行,以检测新数据的可用性以及对现有数据的更改,包括数据爬虫所做的表定义更改。爬虫会自动添加新表、新分区到现有表和新版本的表定义。
AWS Glue Data Catalog成为亚马逊雅典娜、亚马逊红移谱、亚马逊S3之间常见的元数据存储库。AWS Glue Crawler帮助构建这个元数据存储库。
https://stackoverflow.com/questions/63592030
复制相似问题