zoukankan      html  css  js  c++  java
  • 计算与软件工程 作业四

    作业要求 (https://edu.cnblogs.com/campus/jssf/infor_computation17-31/homework/10534)
    课程目标 代码复审 结对编程
    此作业在哪个具体方面帮我实现目标 接触并掌握新的软件功能

    作业一

    每个人针对之前两次作业所写的代码,针对要求,并按照代码规范(风格规范、设计规范)要求评判其他学生的程序,同时进行代码复审(按照代码复审核表 https://www.cnblogs.com/xinz/archive/2011/11/20/2255971.html),要求评价数目不少于8人次,
    评价内容直接放在你被评价的作业后面评论中
    同时另建立一个博客,将你作的评论的截图或者链接,放在博客中,并在你的博客中谈谈自己的总体看法
    写博客仍然按照之前格式要求处理

    作业二

    参考结对编程的方法、过程(https://www.cnblogs.com/xinz/archive/2011/08/07/2130332.html)开展两人合作完成本项目
    实现一个简单而完整的软件工具(中文文本文件人物统计程序):针对小说《红楼梦》要求能分析得出各个人物在每一个章回中各自出现的次数,将这些统计结果能写入到一个csv格式的文件。
    进行单元测试、回归测试、效能测试,在实现上述程序的过程中使用相关的工具。
    进行个人软件过程(PSP)的实践,逐步记录自己在每个软件工程环节花费的时间。
    使用源代码管理系统 (GitHub, Gitee, Coding.net, 等);
    针对上述形成的软件程序,对于新的文本小说《水浒传》分析各个章节人物出现次数,来考察代码。
    将上述程序开发结对编程过程记录到新的博客中,尤其是需要通过各种形式展现结对编程过程,并将程序获得的《红楼梦》与《水浒传》各个章节人物出现次数与全本人物出现总次数,通过柱状图、饼图、表格等形式展现。
    《红楼梦》与《水浒传》的文本小说将会发到群里。
    注意,要求能够分章节自动获得人物出现次数

    import jieba
    import re 
    
    f=open('红楼梦.txt',encoding='utf-8')
    txt=f.read()
    f.close()
    
    txt1=re.sub('奶奶','贾母',txt)    
    txt2=re.sub('老太太','贾母',txt1)
    txt3=re.sub('林黛玉','黛玉',txt2)
    txt4=re.sub('凤姐儿','凤姐',txt3)
    
    segs=jieba.lcut(txt4)
    
    segments={}
    for seg in segs:
        if len(seg)==1:
            continue
        else:
            segments[seg]=segments.get(seg,0)+1
    
           
    
    #print(segments)
           
    
    stopwords={'什么','一个','我们','那里','你们','如今','说道','起来','这里','知道','他们','众人','姑娘','一面','自己','只见','太太','不是','没有','两个','怎么','出来','不知','这个','听见','这样','进来','咱们','告诉','就是','东西','回来','只是','大家','老爷','只得','丫头','这些','不敢','出去','所以'}
    
    for word in stopwords:
        del(segments[word])          #删除停用词
         
    #print(segments)
    
    alies1={'黛玉','林姑娘','林妹妹'}
    for e in alies1:
        for seg in segments:
            if e==seg:
                segments[seg]=segments[seg]+segments.get(e)
    
    alies2={'袭人','花袭人'}
    for e in alies2:
        for seg in segments:
            if e==seg:
                segments[seg]=segments[seg]+segments.get(e)            
              
    alies3={'凤姐','王熙凤','辣妹子 ','熙凤'}
    for e in alies3:
        for seg in segments:
            if e==seg:
                segments[seg]=segments[seg]+segments.get(e)
               
    items=list(segments.items())
    items.sort(key=lambda x:x[1],reverse=True)
    for i in range(10):
        word,segment=items[i]
    print('{0:<10}{1:>5}'.format(word,segment))
    

    遇到的困难

    因为是第一次接触Python和jieba,在网上摸索了好久,操作比较生疏,往后我还会慢慢摸索这种新的语言,使自己更加的熟练 运用

  • 相关阅读:
    【转】正则基础之——/b 单词边界
    【转】空格变成问号的怪问题
    【转】正则基础之——NFA引擎匹配原理
    【转】 .NET正则基础之——平衡组
    【转】正则基础之——环视
    【转】正则应用之——日期正则表达式
    【转】正则基础之——小数点
    【转】[ ] 字符组(Character Classes)
    【转】正则表达式30分钟入教程
    【转】正则基础之——非捕获组
  • 原文地址:https://www.cnblogs.com/zwx1998-1221/p/12637464.html
Copyright © 2011-2022 走看看