作业四
作业要求 | https://edu.cnblogs.com/campus/jssf/infor_computation17-31/homework/10534 |
---|---|
课程目标 | 代码规范复审和两人合作结对编程 |
实现目标 | 代码运行,寻找bug |
参考文献 | https://blog.csdn.net/weixin_43936464/article/details/84779924 |
评论
评论的博客链接
https://www.cnblogs.com/yjh1128/p/12451503.html
https://www.cnblogs.com/yangqiuyan/p/12434874.html
https://www.cnblogs.com/17074211zh/p/12454354.html
https://www.cnblogs.com/yaj1116/p/12455606.html
https://www.cnblogs.com/chengang17074213/p/12455055.html
https://www.cnblogs.com/limin123/p/12455500.html
https://www.cnblogs.com/xinxiyujisuan/p/12461586.html
https://www.cnblogs.com/hxf98/p/12483784.html
两人自由组队进行结对编程
参考结对编程的方法、过程(https://www.cnblogs.com/xinz/archive/2011/08/07/2130332.html)开展两人合作完成本项目
针对小说《红楼梦》要求能分析得出各个人物在每一个章回中各自出现的次数,将这些统计结果能写入到一个csv格式的文件。实现一个简单而完整的软件工具(中文文本文件人物统计程序):
进行单元测试、回归测试、效能测试,在实现上述程序的过程中使用相关的工具。
进行个人软件过程(PSP)的实践,逐步记录自己在每个软件工程环节花费的时间。
使用源代码管理系统 (GitHub, Gitee, Coding.net, 等);
针对上述形成的软件程序,对于新的文本小说《水浒传》分析各个章节人物出现次数,来考察代码。
将上述程序开发结对编程过程记录到新的博客中,尤其是需要通过各种形式展现结对编程过程,并将程序获得的《红楼梦》与《水浒传》各个章节人物出现次数与全本人物出现总次数,通过柱状图、饼图、表格等形式展现。
《红楼梦》与《水浒传》的文本小说将会发到群里。
注意,要求能够分章节自动获得人物出现次数
通过网上查阅资料了解到进行词频统计需安装jieba第三方库:
jieba库是优秀的中文分词库,它能够将句子分成词语。
结对人链接:https://www.cnblogs.com/yaj1116/p/12622474.html
代码
import jieba import re f=open('红楼梦.txt',encoding='utf-8') txt=f.read() f.close() txt1=re.sub('奶奶','贾母',txt) #替换词组 txt2=re.sub('老太太','贾母',txt1) txt3=re.sub('林黛玉','黛玉',txt2) txt4=re.sub('凤姐儿','凤姐',txt3) segs=jieba.lcut(txt4) segments={} for seg in segs: if len(seg)==1: continue else: segments[seg]=segments.get(seg,0)+1 #print(segments) stopwords={'什么','一个','我们','那里','你们','如今','说道','起来','这里','知道','他们','众人','姑娘','一面','自己','只见','太太','不是','没有','两个','怎么','出来','不知','这个','听见','这样','进来','咱们','告诉','就是','东西','回来','只是','大家','老爷','只得','丫头','这些','不敢','出去','所以'} for word in stopwords: del(segments[word]) #删除停用词 #print(segments) alies1={'黛玉','林姑娘','林妹妹'} for e in alies1: for seg in segments: if e==seg: segments[seg]=segments[seg]+segments.get(e) alies2={'袭人','花袭人'} for e in alies2: for seg in segments: if e==seg: segments[seg]=segments[seg]+segments.get(e) alies3={'凤姐','王熙凤','辣妹子 ','熙凤'} for e in alies3: for seg in segments: if e==seg: segments[seg]=segments[seg]+segments.get(e) items=list(segments.items()) items.sort(key=lambda x:x[1],reverse=True) for i in range(10): word,segment=items[i] print('{0:<10}{1:>5}'.format(word,segment))
运行结果示意:
柱状图、饼图、表格等形式展现
来源:https://www.cnblogs.com/wangyan1067/p/12637374.html