当前位置: 首页 > news >正文

基于spark的抖音短视频数据分析及可视化

抖音短视频数据分析及可视化

项目概况

[👇👇👇👇👇👇👇👇]
点这里,查看所有项目
[👆👆👆👆👆👆👆👆]

数据类型

抖音短视频数据

开发环境

centos7

软件版本

python3.8.18、hadoop3.2.0、spark3.1.2、mysql5.7.38、scala2.12.18、jdk8

开发语言

python、Scala、Java

开发流程

数据预处理(python)->数据上传(hdfs)->数据清洗(mapreduce)->数据分析(spark)->数据存储(mysql)->后端(flask)->前端(html+js+css)

可视化图表

在这里插入图片描述
在这里插入图片描述
在这里插入图片描述
在这里插入图片描述
在这里插入图片描述
在这里插入图片描述
在这里插入图片描述
在这里插入图片描述
在这里插入图片描述
在这里插入图片描述
在这里插入图片描述
在这里插入图片描述

操作步骤

python安装包


pip3 install pandas==2.0.3 -i https://mirrors.aliyun.com/pypi/simple/
pip3 install flask==3.0.0 -i https://mirrors.aliyun.com/pypi/simple/
pip3 install flask-cors==4.0.1 -i https://mirrors.aliyun.com/pypi/simple/
pip3 install pymysql==1.1.0 -i https://mirrors.aliyun.com/pypi/simple/
pip3 install pyecharts==2.0.4 -i https://pypi.tuna.tsinghua.edu.cn/simple

启动MySQL


# 查看mysql是否启动 启动命令: systemctl start mysqld.service
systemctl status mysqld.service
# 进入mysql终端
# MySQL的用户名:root 密码:123456
# MySQL的用户名:root 密码:123456
# MySQL的用户名:root 密码:123456
mysql -uroot -p123456

创建MySQL库


CREATE DATABASE IF NOT EXISTS echarts CHARACTER SET utf8mb4 COLLATE utf8mb4_unicode_ci;

启动Hadoop


# 离开安全模式: hdfs dfsadmin -safemode leave
# 启动hadoop
bash /export/software/hadoop-3.2.0/sbin/start-hadoop.sh

准备目录


mkdir -p /data/jobs/project/
cd /data/jobs/project/# 解压 "data" 目录下的 "data.7z" 文件
# 上传 "data" 目录下的 "所有" 文件到 "/data/jobs/project/" 目录# douyin.csv
# douyin.txt

数据预处理


cd /data/jobs/project/# 上传 "数据预处理" 目录下的 "data_preprocess.py" 文件到 "/data/jobs/project/" 目录
# 为避免分隔符导致错位问题,重新生成一个分隔符文件
python3 data_preprocess.pyls -l douyin.txt
head -5 douyin.txt

上传文件到hdfs


cd /data/jobs/project/hdfs dfs -mkdir -p /data/input/
hdfs dfs -rm -r /data/input/*
hdfs dfs -put douyin.txt /data/input/
hdfs dfs -ls /data/input/

程序打包


cd /data/jobs/project/# 对 "数据清洗" 目录下的项目 "mapreduce-job" 进行打包
# 打包命令: mvn clean package -Dmaven.test.skip=true# 上传 "mapreduce-job/target/" 目录下的 "mapreduce-job-jar-with-dependencies.jar" 文件 到 "/data/jobs/project/" 目录

mapreduce数据清洗


cd /data/jobs/project/hadoop jar mapreduce-job-jar-with-dependencies.jar /data/input/ /data/output/# 查看结果
hdfs dfs -ls /data/output/

spark数据分析


cd /data/jobs/project/# 对 "spark" 目录下的项目 "spark-job" 进行打包
# 打包命令: mvn clean package -Dmaven.test.skip=true# 上传 "spark-job/target/" 目录下的 "spark-job-jar-with-dependencies.jar" 文件 到 "/data/jobs/project/" 目录spark-submit \
--master local[*] \
--class com.exam.SparkApp \
/data/jobs/project/spark-job-jar-with-dependencies.jar

启动可视化


mkdir -p /data/jobs/project/myapp/
cd /data/jobs/project/myapp/# 上传 "可视化" 目录下的 "所有" 文件和文件夹 到 "/data/jobs/project/" 目录# windows本地运行: python app.py
python3 app.py pro
# 登录名/密码 随便输入
http://www.dtcms.com/a/479394.html

相关文章:

  • wordpress导航网站模板邢台网站建设好蜘蛛
  • 欧美(美股、加拿大股票、墨西哥股票)股票数据接口文档
  • 做网站的分析报告案例网站用cms
  • 四川省建设厅官方培训网站江苏建设教育网官网入口
  • 国内永久免费crm系统网站推荐有哪些网页设计作业讲解
  • 上海免费网站建设服务广告推广平台哪个好
  • 深圳市龙岗区住房和建设局官方网站莱西建设局官方网站
  • 彩票系统网站开发自己做的网站如何链接到百度
  • langsmith进行agent评估的方法
  • 手机微信网站怎么做的百度js转wordpress
  • 网站开发报价范围城乡企业建设部网站
  • 9、C/C++ 内存管理详解:从基础到面试题
  • 筑巢网站建设怎么样建站工具介绍
  • 为什么自己做的网站打开是乱码效果图网站有哪些
  • 分布式计算框架:从批处理到流处理的演进
  • 静态方法没有独立的实例
  • Qt基础:查找数据容器中的最大和最小值
  • 木兰宽松许可证(Mulan PSL v2)简介vsApache2.0对比分析
  • 怎样开网站卖东西深圳网站建设与制作公司
  • NeurIPS2025 |MSFT:多尺度建模融入 TSFM 微调,制服时序模型微调的 “混杂因子”!
  • Hudi系列:Hudi核心概念之时间轴(TimeLine)
  • 专业做甜点的网站宁波网站建设公司在哪里
  • 旅游公司网站开发与实现深圳市知名广告公司
  • 精品下载站电子商务网站建设课程性质
  • RAID等级全解析:从RAID 0到RAID 10的架构与原理
  • (MyBatis-Plus) LambdaQueryWrapper 应用
  • 深圳建设培训中心网站网站建设的技术团队
  • 免费vi模板网站九易建网站的建站模板
  • 今天我们学习mysql数据库的恢复与备份
  • 激光东莞网站建设广州建设公司