当前位置：首页 > news >正文

深度学习打卡第N7周：调用Gensim库训练Word2Vec模型

news 2025/9/27 8:41:57

🍨 本文为🔗365天深度学习训练营中的学习记录博客
🍖 原作者：K同学啊

一、准备工作

import jiebajieba.suggest_freq('沙瑞金',True)#加入一些词，使得jieba分词准确率更高
jieba.suggest_freq('田国富',True)
jieba.suggest_freq('高育良',True)
jieba.suggest_freq('侯亮平',True)
jieba.suggest_freq('钟小艾',True)
jieba.suggest_freq('陈岩石',True)
jieba.suggest_freq('欧阳菁',True)
jieba.suggest_freq('易学习',True)
jieba.suggest_freq('王大路',True)
jieba.suggest_freq('蔡成功',True)
jieba.suggest_freq('孙连城',True)
jieba.suggest_freq('季昌明',True)
jieba.suggest_freq('丁义珍',True)
jieba.suggest_freq('郑西坡',True)
jieba.suggest_freq('赵东来',True)
jieba.suggest_freq('高小琴',True)
jieba.suggest_freq('赵瑞龙',True)
jieba.suggest_freq('林华华',True)
jieba.suggest_freq('陆亦可',True)
jieba.suggest_freq('刘新建',True)
jieba.suggest_freq('刘庆祝',True)
jieba.suggest_freq('赵德汉',True)with open('./data/in_the_name_of_people.txt',encoding='utf-8') as f:result_cut = []lines = f.readlines()for line in lines:result_cut.append(jieba.lcut(line))f.close()result_cut

# 添加自定义停用词
stopwords_list = ["，","。","\n","\u3000"," ","：","！","？","…"] # \u3000 是 Unicode 编码中的全角空格（也称为 “全角空白符”），是中文排版中常用的空格形式。def remove_stopwords(ls):  # 去除停用词return [word for word in ls if word not in stopwords_list]result_stop=[remove_stopwords(x) for x in result_cut if remove_stopwords(x)]result_stop

print(result_stop[100:103])

二、训练Word2Vec模型

from gensim.models import Word2Vecmodel = Word2Vec(result_stop,     # 用于训练的语料数据vector_size=100, # 是指特征向量的维度，默认为100。window=5,        # 一个句子中当前单词和被预测单词的最大距离。min_count=1)     # 可以对字典做截断，词频少于min_count次数的单词会被丢弃掉, 默认值为5。

三、模型应用

3.1 计算词汇相似性

# 计算两个词的相似度
print(model.wv.similarity('沙瑞金', '季昌明'))
print(model.wv.similarity('沙瑞金', '田国富'))

# 选出最相似的5个词
for e in model.wv.most_similar(positive=['沙瑞金'], topn=5):print(e[0], e[1])

3.2 找出不匹配的词汇

odd_word = model.wv.doesnt_match(["苹果", "香蕉", "橙子", "书"])
print(f"在这组词汇中不匹配的词汇：{odd_word}")

3.2 计算词汇的词频

word_frequency = model.wv.get_vecattr("沙瑞金", "count")
print(f"沙瑞金：{word_frequency}")

总结

本次打卡学习了word2vec模型的调用和使用，了解到了其在文本任务中的作用和便利性。

查看全文

http://www.dtcms.com/a/410952.html

18软件测试用例设计方法-错误推测

我市精神文明建设的门户网站是学校网站建设代码

IBM开源轻量多模态文档处理模型：Granite-Docling 258M，能执行OCR、文档QA

基于OCR的验证码识别与算术运算解析实践

网站开发网络工程哪个好朝天门户网

从零开始WebRTC(一)

K230基础-RTC时钟介绍及使用

机器人定位器市场报告：2025-2031 年行业增长逻辑与投资机遇解析

CTFHub RCE通关笔记3：文件包含 php://input

北京做网站建设有发展吗使用wordpress编辑器

我的第一个AI Agent

郑州网站建设公司哪家好做购物网站需要什么资质

【序列晋升】46 Spring Security Kerberos 如何衔接 Boot 自动配置与 RBAC 权限？

哪家做网站的公司大连网络推广公司推荐

苏州高端网站建设设计wordpress自助

社区网站建设费用视频网站怎么做可以播放电视剧

重庆网站建设合肥公司智能建站免费

PAT乙级_1041 考试座位号_Python_AC解法_无疑难点

vscode使用arcpy-选择arcgis带的python+运行错误解决

呼和浩特市城乡建设网站wordpress 当前主题目录

做暧暧视频免费网站怎么做网约车

docker常用命令记录

《伤寒论9》-何时选用汤剂散剂丸剂

锤子助手插件功能七十八：语音复读

TypeScript严格模式（Strict Mode）介绍（null和undefined、any和unknown）

2025年渗透测试面试题总结-89（题目+回答）

Webpack5 第三节

【编号112】IPCC AR5全球气候模式模拟的中国日平均降水精度评价数据集（1996-2005）

中山制作网站的公司横沥镇网站建设

怎么做卡蜜网站郑州做网站推广资讯