zoukankan html css js c++ java

Python 读取docx/txt根据词频生成云图

#!/usr/bin/env python
# -*- coding: utf-8 -*-
from wordcloud import WordCloud, STOPWORDS
from imageio import imread
from sklearn.feature_extraction.text import CountVectorizer
import jieba
import csv
import docx2txt

# 读docx文档
# text = docx2txt.process("file.docx")
# contents = text
# outFile = open("file.txt", "w", encoding='utf-8') 
# outFile.write(text)


# 获取文章内容
with open("djstl.txt",encoding='utf-8') as f:
    contents = f.read()
print("contents变量的类型：", type(contents))

# 使用jieba分词，获取词的列表
contents_cut = jieba.cut(contents)
print("contents_cut变量的类型：", type(contents_cut))
contents_list = " ".join(contents_cut)
print("contents_list变量的类型：", type(contents_list))

# 制作词云图，collocations避免词云图中词的重复，mask定义词云图的形状，图片要有背景色
wc = WordCloud(stopwords=STOPWORDS.add("一个"), collocations=False,
               background_color="white",
               font_path=r"C:WindowsFontssimhei.ttf",
               width=400, height=300, random_state=42,
               mask=imread('timg.jpg',pilmode="RGB"))
wc.generate(contents_list)
wc.to_file("ciyun.png")

# 使用CountVectorizer统计词频
cv = CountVectorizer()
contents_count = cv.fit_transform([contents_list])
# 词有哪些
list1 = cv.get_feature_names()
# 词的频率
list2 = contents_count.toarray().tolist()[0]
# 将词与频率一一对应
contents_dict = dict(zip(list1, list2))
# 输出csv文件,newline=""，解决输出的csv隔行问题
with open("caifu_output.csv", 'w', newline="") as f:
    writer = csv.writer(f)
    for key, value in contents_dict.items():
        writer.writerow([key, value])

查看全文

相关阅读:
wordpress程序打开太慢的解决方案（一步搞定）
Emeditor代码编辑器常见的正则表达式总结
 网站关键词排名突然消失的原因正在努力侦破
 如何禁止百度对网站进行转码
 【web前端开发】浏览器兼容性处理大全
 导航悬浮于顶部代码学习
 用最简单的代码写出banner图轮播效果
 这段时间大量网站被k的原因分析
 Python的lambda学习
 随机数生成验证码

原文地址：https://www.cnblogs.com/ouzai/p/13784407.html