用QQ聊天记录生成一个词云

ustbclearwang

2020-01-18

QQ的聊天记录可以通过消息管理器，选中联系人，右键导出为 .txt 格式。由于是中文，需要分词，本文的分词工具采用的是 jieba 分词。

用QQ聊天记录生成一个词云

不知道这个“福”能不能扫出来。

假设你已经导出与某人的聊天记录，接下来需要先过滤再分词生成词云。

1. 过滤掉图片和表情，以及聊天记录的时间和qq名称

newtext = []

for word in open(‘lr.txt‘, ‘r‘, encoding=‘utf-8‘):
    tmp = word[0:4]
    if (tmp == "2019" or tmp == "2020"or tmp == "2017" or tmp == "我"):  # 过滤掉聊天记录的时间和qq名称
        continue
    tmp = word[0:2]
    if (tmp[0] == ‘[‘ or tmp[0] == ‘/‘or tmp[0] == ‘@‘):  # 过滤掉图片和表情，例如[图片]，/滑稽
        continue
    newtext.append(word)
# 将过滤后的文本存到lr2.txt中
with open(‘lr2.txt‘, ‘w‘, encoding=‘utf-8‘) as f:
    for i in newtext:
        f.write(i)

当然，可以用正则过滤（但是正则我不怎么熟）

2. 利用jieba分词，wordcloud生成词云。

在此之前需要准备一张背景图和一份中文字体，这是我随便找的一个字体 STFangSong.ttf。

import jieba
from wordcloud import WordCloud, ImageColorGenerator
import matplotlib.pyplot as plt
import numpy as np
import PIL.Image as Image


def jieba_cloud(file_name):
    with open(file_name,‘r‘,encoding=‘utf8‘) as f:
        word_list = jieba.cut(f.read())
        result = " ".join(word_list)    #分词用空格隔开
    
        bg_pic = np.array(Image.open("福.jpg"))  #导入词云背景
        #必须加中文字体，否则格式错误
           wordcloud = WordCloud(mask=bg_pic, background_color=‘white‘, scale=1.5, font_path=‘./STFangSong.ttf‘, width=2000,height=1200,font_step=4,).generate(result)
        wordcloud.to_file(file_name.split(‘.‘)[0] + ‘.png‘)                #未上色版 

        image_colors = ImageColorGenerator(bg_pic)
        wordcloud.recolor(color_func=image_colors)
        wordcloud.to_file(file_name.split(‘.‘)[0] + ‘_color‘ +  ‘.png‘)    #上色版


if __name__ == "__main__":
    file_name = ‘lr2.txt‘  # 使用前面过滤好的文本
    jieba_cloud(file_name)

参考链接：

1. 电脑版QQ聊天记录怎么导出并查看

2. https://www.jianshu.com/p/542fbff4ace4

3. https://blog.csdn.net/qq_40855366/article/details/81177213

4. https://baiyue.one/archives/1533.html

分词 qq tmp jieba 科技新闻

ustbclearwang

0 关注 0 粉丝 0 动态

相关推荐

Python常用功能函数系列总结（二）

return ‘ ‘.join([i for i in jieba.cut(sentence) if. i.strip() and i not in self.stopwords and len > 1 and i in self.word_list

kikaylee 2020-07-05

jieba.lcut方法

cut_all参数为真表示采用全模式分词，为假表示采用精确模式分词，默认值为假；

ustbclearwang 2020-07-05

Python之酒店评论分词、词性标注、TF-IDF、词频统计、词云

利用pandas读取csv文件中的酒店客户评论，并创建3个新列用来存放分词结果、词性标注结果、分词+词性标注结果。columns_name=[‘mysql_id‘,‘hotelname‘,‘customername‘,‘reviewtime‘,‘check

zooozx 2020-06-27

jieba分词

学英语啊，学英语。中文分词是中文NLP的第一步，一个优秀的分词系统取决于足够的语料和完善的模型，很多机构和公司也都会开发和维护自己的分词系统，虽然jieba分词的性能并不是最优秀的，但它开源免费、使用简单、功能丰富，并且支持多种编程语言实现。jieba.d

xiaocao0 2020-06-25

jieba库的使用

jieba是python的第三方库，使用jieba库需要先安装。jieba是一个中文分词库，可以根据所给的中文句子，提取出可能的词组。利用中文词库，确定汉字之间的关联概率。概率大的组成词组，形成分词效果。除了分词，用户还可以添加自定义的词组。搜索引擎模式，

fkyyly 2020-05-31

基于Python实现词云制作

精确模式，试图将句子最精确地切开，适合文本分析；全模式，把句子中所有的可以成词的词语都扫描出来, 速度非常快，但是不能解决歧义；搜索引擎模式，在精确模式的基础上，对长词再次切分，提高召回率，适合用于搜索引擎分词。HMM 参数用来控制是否使用 HMM 模型。

chongtianfeiyu 2020-04-10

jieba库

counts[word] = counts.get + 1 # 遍历所有词语，每出现一次其对应的值加 1. items.sort # 根据词语出现的次数进行从大到小排序。统计了次数对多前十五个名词，曹操不愧是一代枭雄，第一名当之无愧，但是我们会

fkyyly 2020-04-07

Python jieba 库的使用说明

counts[word] = counts.get + 1 # 遍历所有词语，每出现一次其对应的值加 1. items.sort # 根据词语出现的次数进行从大到小排序。统计了次数对多前十五个名词，曹操不愧是一代枭雄，第一名当之无愧，但是我们会

chouliqingke 2020-04-07

08 信息化领域热词分类分析及解释第二步将爬取的数据使用jieba分词处理并清洗

# seg2 = jieba.cut("好好学学python，有用。然后就可以得到上述数据。

cqulun 2020-02-10

jieba库

jieba库：利用一个中文词库，确定中文字符之间的关联概率中文字符间概率大的组成词组，形成分词结果jieba库分词的三种模式：精确模式、全模式、搜索引擎模式精确模式：把文本精确的切分开，不存在冗余单词全模式：把文本中所有可能的词语都扫描出来，有冗余搜索引擎

fkyyly 2020-01-28

python同义词替换的实现（jieba分词）

年休假年假年休。回家场景我回来了。# 1读取同义词表，并生成一个字典。# synonymWords.txt是同义词表，每行是一系列同义词，用空格分割。# 2提升某些词的词频，使其能够被jieba识别出来。# 3将语句切分成单词。# 4返回同义词替换后

tmaczt 2020-01-21

用python给女朋友做一个歌曲词云图

今天咋们来看看网易云赵雷的歌曲歌词，并做一个词云图。这篇文章可以学习到什么是词云，爬虫的基本流程，简单的可视化操作。可视化有很多种，好的数据可视化，可以使得数据分析的结果更加通俗易通。"词云"属于可视化的一种，它会根据关键词的出现频率生

wyqwilliam 2020-01-12

NLP系列1：NER

　　NER即命名实体识别是信息提取的一个子任务，但究其本质就是序列标注任务。　　NER是一个基础问题，不会不行，但是也是一个非常重要的问题，下面将按照实现过程中碰到的问题依次进行阐述。首先的明白NER是一个分类任务，也叫序列标注，其实就是对文本的不同实体标

xiaocao0 2019-12-06

docker 安装solr8.6.2 配置中文分词器的方法

docker run --name blog-solr -d -p 8983:8983 solr // blog-solr这个可用自行命名。docker exec -it --user=solr blog-solr bin/solr create_core

spylyt 2020-09-11

NLP小白入门篇：莫愁前路，一文读懂语料预处理

自然语言处理是 AI 皇冠上的明珠，而语料预处理是自然语言处理的基础。如今，NLP 技术可以充当人类和机器之间沟通的桥梁。环顾周围的生活，我们随时可以享受到 NLP 技术带来的便利，语音识别、机器翻译、问答系统等等。现在你可以跟随本文，初探 NLP 技术的

天才幻想家 2020-08-03

Elasticsearch实战 | match_phrase搜不出来，怎么办？

title=公路局正在治理解放大道路面积水问题。实际应用中可能需要： 1）检索关键词”理解”、”解放”、”道路”、“理解放大”，都能搜出这篇文档。标准分析仪是默认分析仪，如果没有指定，则默认使用该分词器。但，会出现冗余数据非常多。针对要求2），排除matc

AFei00 2020-08-03

ElasticSearch的下载、安装使用

下载ik中文分词器。浏览器访问是否启动成功。安装ik中文分词插件。解压分词插件包—->放到es的plugins目录下—->重新启动es即可

sifeimeng 2020-08-01

DockerFile构建ElasticSearch镜像安装IK中文分词器插件

为什么要安装IK中文分词器？ES提供的分词是英文分词，对中文做分词时会拆成单字而不是词语，非常不好，因此索引信息含中文时需要使用中文分词器插件。# 下载IK插件文件。docker run -d -p 9200:9200 -p 9300:9300 -e &q

vtnews 2020-07-29

基于词典的中文分词算法3：最大概率法

最大概率法分词是在最大匹配分词算法上的改进。在某些语句切分时，按最大长度切分词语可能并不是最优切分。

troysps 2020-07-04

es中中文分词器的使用

　　es整体都整理好了，进行补充没有实现的一些es知识点。　　本文终止在线安装，从第5开始线下安装。

IceStreamLab 2020-05-03

ustbclearwang

W3CSchool教程: HTML 教程; CSS 教程; Bootstrap 教程; Javascript 教程; jQuery 教程

后端教程: C 教程; Java 教程; PHP 教程; Python 教程; Go 教程

移动开发: Android 教程; Swift 教程; Kotlin 教程; jQuery Mobile 教程; ionic 教程

关于我们: 新闻动态; 联系方式; 招聘英才; 安科实验室; 帮助与反馈

安科网(Ancii)，中国第一极客网

Copyright © 2013 - 2019 Ancii.com

京ICP备18063983号京公网安备11010802014868号