首页
学习
活动
专区
圈层
工具
发布
社区首页 >问答首页 >爬虫如何比直接连接到数据库和提取数据要好得多?

爬虫如何比直接连接到数据库和提取数据要好得多?
EN

Stack Overflow用户
提问于 2020-08-26 06:50:31
回答 1查看 103关注 0票数 1

在AWS作业中,为了从DB或S3检索数据,我们可以使用2种方法。1)使用Crawler 2)直接连接到DB或S3。

所以,,我的问题是:与直接连接数据库和检索数据相比,爬虫如何更好?

EN

回答 1

Stack Overflow用户

发布于 2020-08-26 11:57:01

AWS Glue Crawler将不会检索实际的数据。爬虫访问数据存储,并通过优先排序的分类器列表来提取数据和其他统计信息的架构,然后使用此元数据填充Glue数据目录。爬虫可以定期运行,以检测新数据的可用性以及对现有数据的更改,包括数据爬虫所做的表定义更改。爬虫会自动添加新表、新分区到现有表和新版本的表定义。

AWS Glue Data Catalog成为亚马逊雅典娜、亚马逊红移谱、亚马逊S3之间常见的元数据存储库。AWS Glue Crawler帮助构建这个元数据存储库。

票数 2
EN
页面原文内容由Stack Overflow提供。腾讯云小微IT领域专用引擎提供翻译支持
原文链接:

https://stackoverflow.com/questions/63592030

复制
相关文章

相似问题

领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档