简述:总的分析思路图
BlogID: [Py08]
简述:总的分析思路图
BlogID: [Py08]
简述:按照前述处理得到的关键词、人名、地名等字段,获取一个集合的对应词集,计算共现矩阵,并通过Gephi绘制网络关系图。
BlogID: [Py09061]
简述:在DP06中绘制的是词频前200的词云、词频图。而且用的不是TF-IDF算法得到的关键词。这里是TF-IDF得到的关键词,绘制的是全部的词云、词频图。
BlogID: [Py09031]
简述:用多进程处理每个集合(每小时数据),获取每个集合在每个小时的关键词字段,并统计词频。这里的关键词是基于TF-IDF关键词提取算法获得的,处理程序@BlogID: [Py08281]。
BlogID: [Py09021]
简述:希望客观掌握目前顶级刊物的研究热点,同时为了找到与目前处理的数据相关的刊物,写了这个处理过程,以此提高后续工作效率。
BlogID: [Py08301]
简述:Python的多线程不像Java那样,无法同时处理多任务,耗时很久。然而处理数据的过程会不断产生新想法,随即需要进行批处理。考虑后期处理数据的效率问题,所以采用多进程处理思路。程序获取的关键词数据基于TF-IDF,人名、地名数据基于jieba的词性标注功能。
BlogID: [Py08281]
简述:从统计出的高频词变量中,依次按时间走向读取数据,绘制词频图和词云图。(词频图进行了粗略的展示,后期会针对性地美化)。
BlogID: [Py08181]
简述:从每个小时的发文内容,统计出top200的高频词,统一生成一个字典并保存,方便后续读取和进一步操作
BlogID: [Py08178]
简述:有时候产生的中间变量比较重要/比较大,避免重复执行程序,可以考虑保存变量到文件的方式。(写了两种:以原类型保存 vs 以字符串保存)
BlogID: [Py08177]
简述:使用多线程自动化提取24个集合内的每条记录的各种词汇,并且存入对应记录的指定字段中(全自动执行,可以在未来更高效地更改字段/执行程序)
BlogID: [Py08176]
简述:如果批量处理程序的时候,一个程序跑着,在那里干瞪眼等待,非常低效的。所以需要用多线程,在一个时段同时处理多个集合(比如给多个集合提取关键词)
BlogID: [Py08175]
简述:本次文本处理需要用到的提取话题、提取用户、提取数字、删除对应内容等正则表达式记录
BlogID: [Py08174]
简述:如果批量处理程序的时候,需要使用循环语句,而循环的对象一般是字符串或者单个对象,无法循环某条固定的语句,所以exec()提供了这样的一个功能
BlogID: [Py08173]
简述:将24个小时的博文数据按照时间段(1小时/段)划分为24个集合,并统计出每个时段的博文数量,绘制简图初步观察(内附:自动化处理程序简单演示)
BlogID: [Py08172]
简述:使用Python将.csv文件导入到MongoDB中(内附:①新建字段的感受,②检索问题的收获)
BlogID: [Py08171]
[简述:]
BlogID: [Pyxxxx1]