当查询一个月时,我希望Spark只将一个月的数据加载到内存中。但是,我的集群内存使用量看起来像是加载了整整一年1.7TB的数据。val lakeDF = spark.sqlContext.read.parquet("s3://mybucket/mylake.parquet")lakeDF.registerTempTable("sightings")
S
我试图通过在spark dataframe上添加ignite来提高它的性能。下面的代码是我们当前读取数据帧的方式我通过这里的示例成功地保存并加载了ignite中的spark(像select a,b,c from table where x)在ignite数据帧上工作,但性能比单独的spark慢得多(即没有ignite,直接查询spark DF ),