当前位置: 首页 > news >正文

基于spark的奥运会奖牌变化数据分析

基于spark的奥运会奖牌变化数据分析

项目概况

[👇👇👇👇👇👇👇👇]
点这里,查看所有项目
[👆👆👆👆👆👆👆👆]

数据类型

奥运会奖牌数据

开发环境

centos7

软件版本

python3.8.18、hadoop3.2.0、spark3.1.2、mysql5.7.38、scala2.12.18、jdk8

开发语言

python、Scala

开发流程

数据上传(hdfs)->数据分析(spark)->数据存储(mysql)->后端(flask)->前端(html+js+css)

可视化图表

在这里插入图片描述
在这里插入图片描述
在这里插入图片描述
在这里插入图片描述

操作步骤

python安装包


pip3 install pandas==2.0.3 -i https://mirrors.aliyun.com/pypi/simple/
pip3 install flask==3.0.0 -i https://mirrors.aliyun.com/pypi/simple/
pip3 install flask-cors==4.0.1 -i https://mirrors.aliyun.com/pypi/simple/
pip3 install pymysql==1.1.0 -i https://mirrors.aliyun.com/pypi/simple/
pip3 install pyecharts==2.0.4 -i https://pypi.tuna.tsinghua.edu.cn/simple

启动MySQL


# 查看mysql是否启动 启动命令: systemctl start mysqld.service
systemctl status mysqld.service
# 进入mysql终端
# MySQL的用户名:root 密码:123456
# MySQL的用户名:root 密码:123456
# MySQL的用户名:root 密码:123456
mysql -uroot -p123456

创建MySQL库


CREATE DATABASE IF NOT EXISTS echarts CHARACTER SET utf8mb4 COLLATE utf8mb4_unicode_ci;

启动Hadoop


# 离开安全模式: hdfs dfsadmin -safemode leave
# 启动hadoop
bash /export/software/hadoop-3.2.0/sbin/start-hadoop.sh

准备目录


mkdir -p /data/jobs/project/
cd /data/jobs/project/# 上传 "project-spark-olympic-gold-medals-analysis" 整个文件夹 到 "/data/jobs/project/" 目录

上传文件到hdfs


cd /data/jobs/project/project-spark-olympic-gold-medals-analysis/datahdfs dfs -mkdir -p /data/input/
hdfs dfs -rm -r /data/input/*
hdfs dfs -put summer.csv /data/input/hdfs dfs -ls /data/input/

程序打包


cd /data/jobs/project/# 对 项目 "project-spark-olympic-gold-medals-analysis" 进行打包
# 打包命令: mvn clean package -Dmaven.test.skip=true
# yes | cp /data/jobs/project/project-spark-olympic-gold-medals-analysis/target/project-spark-olympic-gold-medals-analysis-jar-with-dependencies.jar /data/jobs/project/# 上传 "project-spark-olympic-gold-medals-analysis/target/" 目录下的 "project-spark-olympic-gold-medals-analysis-jar-with-dependencies.jar" 文件 到 "/data/jobs/project/" 目录

spark数据分析


cd /data/jobs/project/spark-submit \
--master local[*] \
--class org.example.demo.CleanCsv \
/data/jobs/project/project-spark-olympic-gold-medals-analysis-jar-with-dependencies.jar /data/input/ /data/output/

启动可视化


cd /data/jobs/project/project-spark-olympic-gold-medals-analysis/可视化/flaskProject/# windows本地运行: python app.py
python3 app.py pro
http://www.dtcms.com/a/267337.html

相关文章:

  • mysql的备份与恢复(使用mysqldump)
  • MyChrome.exe与Selenium联动避坑指南:User Data目录冲突解决方案
  • 爬虫-web请求全过程
  • 数据结构:数组:二分查找(Binary Search)
  • C#使用开源框架NetronLight绘制流程图
  • Hinge×亚矩云手机:以“深度连接”为名,重构云端社交的“真实感”
  • AI 正在深度重构软件开发的底层逻辑和全生命周期,从技术演进、流程重构和未来趋势三个维度进行系统性分析
  • Jedis 原生之道:Redis 命令 Java 实现指南(二)
  • SpringAI与智能体入门
  • 探索 Ubuntu 上 MongoDB 的安装过程
  • NX二次开发常用函数——获取边对应的面 UF_MODL_ask_edge_faces
  • 使用 C++/Faiss 加速海量 MFCC 特征的相似性搜索
  • 电脑休眠设置
  • 【网络与爬虫 13】智能伪装:Scrapy-Fake-UserAgent反检测技术实战指南
  • springboot中使用线程池
  • 【Elasticsearch】检索排序 分页
  • 20. 有效的括号
  • BUUCTF在线评测-练习场-WebCTF习题[网鼎杯 2020 青龙组]AreUSerialz1-flag获取、解析
  • 【Flask】flask中get方法和post方法区别
  • CMake基础:条件判断详解
  • openai和chatgpt什么关系
  • 单用户模式、紧急模式、救援模式有什么区别
  • 动手学深度学习-学习笔记【二】(基础知识)
  • 若 VSCode 添加到文件夹内右键菜单中显示(通过reg文件方式)
  • 在 Windows 上安装和运行 Apache Kafka
  • Android Input 系列专题【事件的读取与分发】
  • 在SSM+vue项目中上传表单数据和文件
  • android开发中的 AndroidX 版本的查看 及 constraintLayout的简单用法
  • 【性能优化】程序性能优化:疏通胜于堵塞
  • 【Elasticsearch】检索高亮