当前位置: 首页 > news >正文

如何在Idea中编写Spark程序并运行

启动条件

下载好关于所需要的空间,配置好相应的环境,例如Scala,jdk

设置maven依赖项。修改pom.xml文件,添加如下:

    <properties>

        <maven.compiler.source>8</maven.compiler.source>

        <maven.compiler.target>8</maven.compiler.target>

        <project.build.sourceEncoding>UTF-8</project.build.sourceEncoding>

    </properties>

    <!--    声明并引入共有的依赖-->

    <dependencies>

        <!--   scala-library-->

        <dependency>

            <groupId>org.scala-lang</groupId>

            <artifactId>scala-library</artifactId>

            <version>2.12.15</version>

        </dependency>

        <dependency>

            <groupId>org.apache.spark</groupId>

            <artifactId>spark-core_2.12</artifactId>

            <version>3.2.2</version>

        </dependency>

    </dependencies>

</project>

编写代码如下

它的功能是wordcount的功能:从指定的文件夹中去读取文件,并做词频统计。

import org.apache.spark.{SparkConf, SparkContext}

object WordCount{

  def main(args: Array[String]): Unit = {

    // 配置 Spark 应用程序

    val conf = new SparkConf().setAppName("WordCount").setMaster("local[*]")

    // 创建 SparkContext 对象

    val sc = new SparkContext(conf)

    // 读取目录下的所有文本文件

    val textFiles = sc.wholeTextFiles("input")

    // 提取文本内容并执行 WordCount 操作

    val counts = textFiles.flatMap { case (_, content) => content.split("\\s+") }.map(word => (word, 1)).reduceByKey(_ + _)

    // 将所有分区的数据合并成一个分区

    val singlePartitionCounts = counts.coalesce(1)

    // 保存结果到文件

    singlePartitionCounts.saveAsTextFile("output")

    // 停止 SparkContext

    sc.stop()

  }

}

最后准备待统计的词频文件。在项目根目录下建立文件夹input,并创建两个文本文件:word1.txt, word2.txt并运行就可以了

相关文章:

  • 缓存雪崩:高并发系统中的隐形杀手与应对策略
  • XSS 攻击:深入剖析“暗藏在网页中的脚本“与防御之道
  • 代码随想录算法训练营 Day39 动态规划Ⅶ 打家劫舍
  • ChromaDB调用BGE模型的两种实践方式
  • vscode 安装插件
  • java算法的核心思想及考察的解题思路
  • 制作一款打飞机游戏39:鼠标控制
  • 【大模型系列】使用fastapi为langchain应用快速对外提供restful api
  • 学习Linux的第四天
  • nginx 上传文件,413 request entity too large
  • 使用Milvus向量数据库构建具有长期记忆的对话机器人
  • 从人脸扫描到实时驱动,超写实数字分身技术解析
  • Java学习手册:数据库事务相关知识
  • Web 架构之动静分离:原理、实践与优化
  • SSL/TLS 证书与数字签名:构建互联网信任的详解
  • spark转换算子
  • 【Java项目脚手架系列】第三篇:Spring MVC基础项目脚手架
  • Excel处理控件Aspose.Cells教程:压缩Excel文件完整指南
  • arXiv论文 MALOnt: An Ontology for Malware Threat Intelligence
  • Laravel 12 实现验证码功能
  • 保利42.41亿元竞得上海杨浦东外滩一地块,成交楼面单价超8万元
  • 国家主席习近平同普京总统举行大范围会谈
  • 印方称若巴方决定升级局势,印方已做好反击准备
  • 阿曼宣布美国与胡塞武装达成停火协议
  • 超导电路新设计有望提升量子处理器速度
  • 经济日报头版刊文:为什么贸易战没有出路