当前位置：首页 > news >正文

在sheel中运行Spark

news 2025/11/4 12:50:41

RDD基本概念

Resilient Distributed Dataset 叫做弹性分布式数据集，是Spark中最基本的数据抽象，是分布式计算的实现载体，代表一个不可变，可分区，里面的元素并行计算的集合。

Dataset：一个数据集合，用来存放数据的。之前我们学习的Scala中，Array, Set等也叫数据集。

Distributed: 分布式存储的，表示数据是存放在不同的机器上的。这就和我们前面学习数据结构就不同了。

Resilient: 数据可以保存在内存或者磁盘中。

不可变的：immutable。类比理解scala中的不可变集合或者是使用val修饰的变量。

可分区的：集合的数据课划分成为很多部分，每部分称为分区：Partition

并行计算：集合中的数据可以被并行的计算处理，每个分区数据被一个Task任务处理。

RDD的创建

从集合内存中创建

可以通过将本地集合（如数组、列表等）传递给 SparkContext 的 parallelize 方法来创建 RDD。

/ 创建 SparkConf 和 SparkContextval conf = new SparkConf().setAppName("RDDFromCollection").setMaster("local[*]")val sc = new SparkContext(conf)// 创建一个本地集合val data = Array(1, 2, 3, 4, 5)// 通过 parallelize 方法将本地集合转换为 RDDval distData = sc.parallelize(data, 2) // 第二个参数是分区数

从外部存储中创建。例如，读入外部的文件。

// 创建 SparkConf 和 SparkContextval conf = new SparkConf().setAppName("RDDFromHDFS").setMaster("local[*]")val sc = new SparkContext(conf)// 从 HDFS 加载文本文件val hdfsRDD = sc.textFile("hdfs://namenode:8020/path/to/your/file.txt")
// 获取并打印分区数val partitionCount = hdfsRDD.getNumPartitions
println(s"The number of partitions is: $partitionCount")

parkConf 和 SparkContext

SparkConf 类用于配置 Spark 应用程序的各种参数。通过 SparkConf 类，你可以设置应用程序的名称、运行模式（如本地模式、集群模式）、资源分配（如内存、CPU 核心数）等。

主要作用配置应用程序参数：可以设置 Spark 应用程序的各种属性，如应用程序名称、主节点地址等。

管理配置信息：将配置信息封装在一个对象中，方便在应用程序中传递和使用。

SparkContext 是 Spark 应用程序的入口点，它代表了与 Spark 集群的连接。通过 SparkContext，你可以创建 RDD（弹性分布式数据集）、累加器、广播变量等，还可以与外部数据源进行交互。

在shell中运行RDD程序

案例：启动hdfs集群，打开hadoop100:9870，在wcinput目录下上传一个包含很多个单词的文本文件。

启动之后在spark-shell中写代码。

// 读取文件，得到RDDval rdd1 = sc.textFile("hdfs://hadoop100:8020/wcinput/words.txt")// 将单词进行切割，得到一个存储全部单词的RDDval rdd2= fileRDD.flatMap(line => line.split(" "))// 将单词转换为元组对象，key是单词，value是数字1val rdd3= wordsRDD.map(word => (word, 1))// 将元组的value按照key来分组，对所有的value执行聚合操作(相加)val rdd4= wordsWithOneRDD.reduceByKey((a, b) => a + b)// 收集RDD的数据并打印输出结果rdd4.collect().foreach(println)