当前位置：首页 > news >正文

基于spark的奥运会奖牌变化数据分析

news 2025/7/6 9:01:26

基于spark的奥运会奖牌变化数据分析

项目概况

[👇👇👇👇👇👇👇👇]
点这里,查看所有项目
[👆👆👆👆👆👆👆👆]

数据类型

奥运会奖牌数据

开发环境

centos7

软件版本

python3.8.18、hadoop3.2.0、spark3.1.2、mysql5.7.38、scala2.12.18、jdk8

开发语言

python、Scala

开发流程

数据上传(hdfs)->数据分析(spark)->数据存储(mysql)->后端(flask)->前端(html+js+css)

可视化图表

在这里插入图片描述

操作步骤

python安装包


pip3 install pandas==2.0.3 -i https://mirrors.aliyun.com/pypi/simple/
pip3 install flask==3.0.0 -i https://mirrors.aliyun.com/pypi/simple/
pip3 install flask-cors==4.0.1 -i https://mirrors.aliyun.com/pypi/simple/
pip3 install pymysql==1.1.0 -i https://mirrors.aliyun.com/pypi/simple/
pip3 install pyecharts==2.0.4 -i https://pypi.tuna.tsinghua.edu.cn/simple

启动MySQL


# 查看mysql是否启动 启动命令: systemctl start mysqld.service
systemctl status mysqld.service
# 进入mysql终端
# MySQL的用户名:root 密码:123456
# MySQL的用户名:root 密码:123456
# MySQL的用户名:root 密码:123456
mysql -uroot -p123456

创建MySQL库


CREATE DATABASE IF NOT EXISTS echarts CHARACTER SET utf8mb4 COLLATE utf8mb4_unicode_ci;

启动Hadoop


# 离开安全模式: hdfs dfsadmin -safemode leave
# 启动hadoop
bash /export/software/hadoop-3.2.0/sbin/start-hadoop.sh

准备目录


mkdir -p /data/jobs/project/
cd /data/jobs/project/# 上传 "project-spark-olympic-gold-medals-analysis" 整个文件夹 到 "/data/jobs/project/" 目录

上传文件到hdfs


cd /data/jobs/project/project-spark-olympic-gold-medals-analysis/datahdfs dfs -mkdir -p /data/input/
hdfs dfs -rm -r /data/input/*
hdfs dfs -put summer.csv /data/input/hdfs dfs -ls /data/input/

程序打包


cd /data/jobs/project/# 对 项目 "project-spark-olympic-gold-medals-analysis" 进行打包
# 打包命令: mvn clean package -Dmaven.test.skip=true
# yes | cp /data/jobs/project/project-spark-olympic-gold-medals-analysis/target/project-spark-olympic-gold-medals-analysis-jar-with-dependencies.jar /data/jobs/project/# 上传 "project-spark-olympic-gold-medals-analysis/target/" 目录下的 "project-spark-olympic-gold-medals-analysis-jar-with-dependencies.jar" 文件 到 "/data/jobs/project/" 目录

spark数据分析


cd /data/jobs/project/spark-submit \
--master local[*] \
--class org.example.demo.CleanCsv \
/data/jobs/project/project-spark-olympic-gold-medals-analysis-jar-with-dependencies.jar /data/input/ /data/output/

启动可视化


cd /data/jobs/project/project-spark-olympic-gold-medals-analysis/可视化/flaskProject/# windows本地运行: python app.py
python3 app.py pro

查看全文

http://www.dtcms.com/a/267337.html

mysql的备份与恢复（使用mysqldump）

MyChrome.exe与Selenium联动避坑指南：User Data目录冲突解决方案

爬虫-web请求全过程

数据结构：数组：二分查找（Binary Search）

C#使用开源框架NetronLight绘制流程图

Hinge×亚矩云手机：以“深度连接”为名，重构云端社交的“真实感”

AI 正在深度重构软件开发的底层逻辑和全生命周期，从技术演进、流程重构和未来趋势三个维度进行系统性分析

Jedis 原生之道：Redis 命令 Java 实现指南（二）

SpringAI与智能体入门

探索 Ubuntu 上 MongoDB 的安装过程

NX二次开发常用函数——获取边对应的面 UF_MODL_ask_edge_faces

使用 C++/Faiss 加速海量 MFCC 特征的相似性搜索

电脑休眠设置

【网络与爬虫 13】智能伪装：Scrapy-Fake-UserAgent反检测技术实战指南

springboot中使用线程池

【Elasticsearch】检索排序分页

20. 有效的括号

BUUCTF在线评测-练习场-WebCTF习题[网鼎杯 2020 青龙组]AreUSerialz1-flag获取、解析

【Flask】flask中get方法和post方法区别

CMake基础：条件判断详解

openai和chatgpt什么关系

单用户模式、紧急模式、救援模式有什么区别

动手学深度学习-学习笔记【二】（基础知识）

若 VSCode 添加到文件夹内右键菜单中显示（通过reg文件方式）

在 Windows 上安装和运行 Apache Kafka

Android Input 系列专题【事件的读取与分发】

在SSM+vue项目中上传表单数据和文件

android开发中的 AndroidX 版本的查看及 constraintLayout的简单用法

【性能优化】程序性能优化：疏通胜于堵塞

【Elasticsearch】检索高亮