spark的缓存提升本质以及分区数量和task执行时间的先后

文章目录

        • 示例代码
        • 缓存效果分析
        • 第1次 user.count
        • 第2次 user.count——这里解释了spark缓存提升的本质原因
        • 关于分区数量和task数量以及task的执行流程
        • 有多少个分区就有多少线程task并发执行
        • 不同分区数量对计算效率的提升
示例代码
importorg.apache.spark.storage.StorageLevelvalpath="file:///home/hadoop/sogouoneday.txt"valinput=sc.textFile(path).map(x=>x.split("\t")).map(x=>(x(1