Python 实现文言文词频统计

前言

Github 链接

本文旨在对开发过程中出现的若干问题作记录。因为开发本身过程大多采用参考代码,不完全原始开发,因此不涉及具体的python语法记录,只对搭建环境及需求分析作统一的记述。

需求描述

目的

旨在开发一个词频统计工具。统计某个文件夹下所有的.txt,.docx,.doc文件中出现的所有单个字出现的次数。

区别于现代文和英文(现代文设计组词分词,英文则是根据空格区分单词),文言文的基本释义是一字一义。因此,我们的统计可以适用于遍历所有的汉字,然后作统计。

选用 python 的目的

本次的需求实际上是一个桌面端应用的开发。当前能够使用的桌面端开发工具有许多。

  • Windows 平台下的桌面端仍然是微软提供的 MFC 开发,采用 C++语言
  • Mac 平台下和iOS 相同,采用Objective-CSwift配合Xcode IDE

本次的工具旨在开发一款跨平台的桌面端应用(在Windows, MacOSX)下通用。目前我个人已知的跨平台开发库除了Python相关的库外,就是JavaScript世界中的几个跨院库:Electron等。

跨平台开发本质上意味着牺牲一部分的性能以及包大小。简单来说就是各个平台本身有一套根据自身硬件性能和平台 api 特性设计的开发方案。跨平台的开发工具先用自身的开发逻辑实现了所有的业务,最后通过解释器生成原生使用的机器语言。

简单的解释,好比你带了一个翻译出国旅行。虽然也可以算得上畅行无阻,但是交流起来毕竟隔了一层。

本次的需求本身而言并不复杂,选用python的原因主要还是因为他的简单易用性。而electron,还需要熟悉更多额外的内容。

设计思路

文言文统计流程图

开发环境及搭建

  • python环境 —— python 2.7

    • Windows需要额外安装,下载这个链接中的Windows x86-64 MSI installer,安装时记得勾选最后一个add python.exe to Path(这一步是添加python 到环境变量,如果不勾选,回头还要手动作,很麻烦)
      图片
    • mac 下因为自带了python 2.7不需要额外安装
  • python IDE 这没啥好说的,就是使用JetBrains他们家的Pycharm.
    这里额外说明一下,用过pycharm的同学可以直接跳过。
    Pycharm的优点在于:

    • 良好的包管理工具 —— 开发者不需要像很多教程中提到的,使用命令行进行pip的手动安装,直接搜索库中已有的第三方库。直接可视化操作。

    • 默认安装了虚拟环境 —— 安装虚拟环境的目的:通常地,创建一个python项目,如果有用到第三方库,我们都是直接安装在本地目录下。

      这样造成的一个结果就是,每当我新建一个工程,也许都存在一个不相干的共享的python库在其中。

      虚拟环境的搭建,旨在针对每一个新建的python工程,都有一个干净的python库在其中。下面是在pycharm中建立虚拟环境 virtualEnv(virtual environment)

      示意图1

      示意图2

  • 使用到的第三方库:

    • xlwt 生成/写入excel文件的库
    • python-docx 读取Word文档的第三方库
    • zhon 处理汉字标点符号
    • langconv 处理简繁体转化
    • Tkinter 这个是python自带的桌面GUI 开发工具,比较轻量级。最后的效果大概如下
      mac 端的视图

遇到的问题

业务逻辑上的问题

除了上面提到的程序上的问题外,业务本身还存在几个开发过程中需要解决的痛点。这里一一罗列:

  • 标点符号 —— 我们统计词频的时候,需要做的事就是“掐头去尾”,即,遍历每一行的字符串内容,去掉其中的所有标点符号(包括中英文),然后作下一步操作

  • 简繁转化 —— 简体字和繁体字并不是一一对应的关系。比如繁体字的"麵條"和“面對”,对应简体字都是“面”,繁转简还好说,简转繁的时候,究竟对应哪个面,也许就不得而知了。
    目前的做法是统一转化成简体。但是一些特殊情况也会出问题,比如“乾隆”和“乾坤”,转成简体字,会变成“干隆”和“干坤”。

    之前使用的简繁转换库叫做opencc,之后发现打包后运行时,会报转化失败的错误。故而改用一个引入源码的库langconv.py

  • 读取 .txt.docx/.doc的区别
    Word相对于记事本,是支持富文本的。因此在文件的读取上也有很多的不同。这里专门使用了一个pythonWord读取库叫做python-docx作读取操作。

开发中遇到的问题

  • 不同平台下的若干问题
    • 打包问题 —— 使用什么打包工具
      网上有很多的文章,提到了windows 平台使用py2exe等等的库,mac 平台使用py2app.实际情况是,这些库都不尽如人意,存在许许多多的问题。不是打包失败,就是打包成功后运行失败,且无法定位问题。

      闲话少叙,这里使用的是叫做Pyinstaller的打包工具。

      这里也有一个小坑:首次安装pyinstaller后,在虚拟环境中执行终端的打包指令是会报无法识别pyinstaller的。这时候必须要将整个pycharm重启。当看到终端指令前面出现(venv)的字样,才能执行。

      示意图3

    打包mac 下的 app,那么要在 mac 下运行。打包 Windows 的.exe 文件,那么工程必须运行在 Windows 下。也就是说,我在 A 平台的时候,不能打包 B 平台下的包。这个其实也蛮麻烦的,等于我在两个平台都要安装一遍程序。
    
* 打开文件/文件夹,mac 和 windows 下的命令不同,代码要做兼容
完成统计后,我们理想的状态是打开生成的`excel`和它所在的文件夹。
    * mac 底下用的是`open ./desExcel.xls`,
    * windows 底下的命令是`./desExcel.xls`

    针对这点,需要作区别处理完成兼容
  • 调试过程中可以正常使用,打包后无法运行。—— 涉及打包后如何定位问题
    mac平台,打包后在dist文件夹下会生成两个文件,一个是.app,一个是一个终端文件,直接拖曳进入终端后可以执行,且会出现打印日志,方便定位运行失败问题。

    示意图4

  • 异常处理 —— 对于Word会生成隐藏的临时文件,当临时文件为空时,python中的读取会报错。
    这里可以使用try except语法忽略空文件。因为涉及语法,不赘述。

以上。

最后编辑于
©著作权归作者所有,转载或内容合作请联系作者
  • 序言:七十年代末,一起剥皮案震惊了整个滨河市,随后出现的几起案子,更是在滨河造成了极大的恐慌,老刑警刘岩,带你破解...
    沈念sama阅读 221,198评论 6 514
  • 序言:滨河连续发生了三起死亡事件,死亡现场离奇诡异,居然都是意外死亡,警方通过查阅死者的电脑和手机,发现死者居然都...
    沈念sama阅读 94,334评论 3 398
  • 文/潘晓璐 我一进店门,熙熙楼的掌柜王于贵愁眉苦脸地迎上来,“玉大人,你说我怎么就摊上这事。” “怎么了?”我有些...
    开封第一讲书人阅读 167,643评论 0 360
  • 文/不坏的土叔 我叫张陵,是天一观的道长。 经常有香客问我,道长,这世上最难降的妖魔是什么? 我笑而不...
    开封第一讲书人阅读 59,495评论 1 296
  • 正文 为了忘掉前任,我火速办了婚礼,结果婚礼上,老公的妹妹穿的比我还像新娘。我一直安慰自己,他们只是感情好,可当我...
    茶点故事阅读 68,502评论 6 397
  • 文/花漫 我一把揭开白布。 她就那样静静地躺着,像睡着了一般。 火红的嫁衣衬着肌肤如雪。 梳的纹丝不乱的头发上,一...
    开封第一讲书人阅读 52,156评论 1 308
  • 那天,我揣着相机与录音,去河边找鬼。 笑死,一个胖子当着我的面吹牛,可吹牛的内容都是我干的。 我是一名探鬼主播,决...
    沈念sama阅读 40,743评论 3 421
  • 文/苍兰香墨 我猛地睁开眼,长吁一口气:“原来是场噩梦啊……” “哼!你这毒妇竟也来了?” 一声冷哼从身侧响起,我...
    开封第一讲书人阅读 39,659评论 0 276
  • 序言:老挝万荣一对情侣失踪,失踪者是张志新(化名)和其女友刘颖,没想到半个月后,有当地人在树林里发现了一具尸体,经...
    沈念sama阅读 46,200评论 1 319
  • 正文 独居荒郊野岭守林人离奇死亡,尸身上长有42处带血的脓包…… 初始之章·张勋 以下内容为张勋视角 年9月15日...
    茶点故事阅读 38,282评论 3 340
  • 正文 我和宋清朗相恋三年,在试婚纱的时候发现自己被绿了。 大学时的朋友给我发了我未婚夫和他白月光在一起吃饭的照片。...
    茶点故事阅读 40,424评论 1 352
  • 序言:一个原本活蹦乱跳的男人离奇死亡,死状恐怖,灵堂内的尸体忽然破棺而出,到底是诈尸还是另有隐情,我是刑警宁泽,带...
    沈念sama阅读 36,107评论 5 349
  • 正文 年R本政府宣布,位于F岛的核电站,受9级特大地震影响,放射性物质发生泄漏。R本人自食恶果不足惜,却给世界环境...
    茶点故事阅读 41,789评论 3 333
  • 文/蒙蒙 一、第九天 我趴在偏房一处隐蔽的房顶上张望。 院中可真热闹,春花似锦、人声如沸。这庄子的主人今日做“春日...
    开封第一讲书人阅读 32,264评论 0 23
  • 文/苍兰香墨 我抬头看了看天上的太阳。三九已至,却和暖如春,着一层夹袄步出监牢的瞬间,已是汗流浃背。 一阵脚步声响...
    开封第一讲书人阅读 33,390评论 1 271
  • 我被黑心中介骗来泰国打工, 没想到刚下飞机就差点儿被人妖公主榨干…… 1. 我叫王不留,地道东北人。 一个月前我还...
    沈念sama阅读 48,798评论 3 376
  • 正文 我出身青楼,却偏偏与公主长得像,于是被迫代替她去往敌国和亲。 传闻我的和亲对象是个残疾皇子,可洞房花烛夜当晚...
    茶点故事阅读 45,435评论 2 359

推荐阅读更多精彩内容

  • # Python 资源大全中文版 我想很多程序员应该记得 GitHub 上有一个 Awesome - XXX 系列...
    小迈克阅读 2,995评论 1 3
  • # Python 资源大全中文版 我想很多程序员应该记得 GitHub 上有一个 Awesome - XXX 系列...
    aimaile阅读 26,496评论 6 427
  • 你自以为的利他 却是自我感动 结果 你忘了初心,忘了自己 路 愈是遥远
    高小多阅读 128评论 0 1
  • 蝉鸣渐远,眼见要过了炽热的夏,见夕阳还未落,却也有了丝丝凉意。日子,缄默无声,总是在潺潺流水般的节奏里逐渐的...
    Deaf丶阅读 875评论 3 7
  • 有幸在全国虐狗日参观了中英金融科技孵化器 感触颇多 这是一场堪比互联网革命的新科技革命 这是一次消除不...
    小闯超人不会飞阅读 120评论 0 0