DP09. 获取所有kWords字段并统计词频

简述:用多进程处理每个集合(每小时数据),获取每个集合在每个小时的关键词字段,并统计词频。这里的关键词是基于TF-IDF关键词提取算法获得的,处理程序@BlogID: [Py08281]。

BlogID: [Py09021]

DP07. 多进程处理程序(替换多线程 - DP04)

简述:Python的多线程不像Java那样,无法同时处理多任务,耗时很久。然而处理数据的过程会不断产生新想法,随即需要进行批处理。考虑后期处理数据的效率问题,所以采用多进程处理思路。程序获取的关键词数据基于TF-IDF,人名、地名数据基于jieba的词性标注功能。

BlogID: [Py08281]

LearnExp. 工具函数 - 变量的保存与读取

简述:有时候产生的中间变量比较重要/比较大,避免重复执行程序,可以考虑保存变量到文件的方式。(写了两种:以原类型保存 vs 以字符串保存)

BlogID: [Py08177]

LearnExp. 多线程和两种实现方法(实例)

简述:如果批量处理程序的时候,一个程序跑着,在那里干瞪眼等待,非常低效的。所以需要用多线程,在一个时段同时处理多个集合(比如给多个集合提取关键词)

BlogID: [Py08175]

DP02. 按时段划分集合

简述:将24个小时的博文数据按照时间段(1小时/段)划分为24个集合,并统计出每个时段的博文数量,绘制简图初步观察(内附:自动化处理程序简单演示)

BlogID: [Py08172]