当前位置：首页 > news >正文

Spark，在shell中运行RDD程序

news 2025/11/1 15:37:23

在hdfs中/wcinput中创建一个文件：word2.txt在里面写几个单词

启动hdfs集群

[root@hadoop100 ~]# myhadoop start

[root@hadoop100 ~]# cd /opt/module/spark-yarn/bin

[root@hadoop100 ~]# ./spark-shell

写个1+1测试一下

按住ctrl+D退出

进入环境：spark-shell --master yarn

逐个写代码：

    // 读取文件，得到RDDval rdd1 = sc.textFile("hdfs://hadoop100:8020/wcinput/word2.txt")// 将单词进行切割，得到一个存储全部单词的RDDval rdd2= rdd1.flatMap(line => line.split(" "))// 将单词转换为元组对象，key是单词，value是数字1val rdd3= rdd2.map(word => (word, 1))// 将元组的value按照key来分组，对所有的value执行聚合操作(相加)val rdd4= rdd3.reduceByKey((num1, num2) => num1 + num2)// 收集RDD的数据并打印输出结果rdd4.collect().foreach(println)// 将结果储存在out111中rdd.saveAsTextFile("hdfs://hadoop100:8020/out111")

在根目录下可见out111文件，文件打开后可以看到，word2.txt文件内单词被拆分

RDD的执行过程

http://www.dtcms.com/a/180772.html

相关文章：

数据结构（1）复杂度

Git回顾

关于VScode的调试

DVWA靶场保姆级通关教程--07SQL注入（上）

JVM之内存管理（一）

Servlet、HttpServlet 和 DispatcherServlet 区别与关系

鸿蒙开发：dialog库做了一些优化

htmlUnit和Selenium的区别以及使用BrowserMobProxy捕获网络请求

住宅IP的深度解析与合理运用

聊聊Spring AI autoconfigure模块的拆分

在线工具源码_字典查询_汉语词典_成语查询_择吉黄历等255个工具数百万数据养站神器，安装教程

DeepSeek“智”造：解锁旅游行业新玩法

stm32F103芯片实现PID算法控制温度例程

AI文旅|暴雨打造旅游新体验

PostgreSQL技术内幕30：Heap Only Tuple(HOT）原理解析

五一旅游潮涌：数字化如何驱动智慧旅游升级

HiklQQBot开源程序基于python的轻量qq官方机器人框架快速部署启动官方QQ机器人插件编写简单易懂支持小白AI一键生成插件

乌班图安装docker

XML Forms Data Format (XFDF) 工作原理、数据结构、使用场景以及与缓冲区的交互方式

FPGA实战项目2———多协议通信控制器

UG471 之 SelectIO 逻辑资源

高频微服务面试题总结

19、HashTable（哈希）、位图的实现和布隆过滤器的介绍

【Go底层】http标准库服务端实现原理

A* （AStar）寻路

MySQL 的事务（Transaction）

使用pyTorch 自然语言处理（NLP）知识库创建

第十七章，反病毒---防病毒网管

Ubuntu 第11章网络管理_常用的网络配置命令

AT9880B北斗单模卫星定位SOC芯片