zoukankan      html  css  js  c++  java
  • NLP常用工具

    1、统计类工具:可参见【统计学习常用Python扩展包

    2、linux自带工具:可参见【【整理】Linux常用文本处理命令

    3、简繁转换工具:opencc

      Open Chinese Convert(OpenCC)是一個中文簡繁轉換開源項目,提供高質量的簡繁轉換詞庫和可供調用的函數庫(libopencc)。還提供命令行簡繁轉換工具,人工校對工具,詞典生成程序,以及圖形用戶界面。(https://code.google.com/p/opencc/wiki/Introduction)

    特點

    • 嚴格區分「一簡對多繁」、「一簡對多異」和「地域用詞差別」。

    • 支持異體字轉換,兼容陸港澳臺等不同地區用字差別。

    • 嚴格審校一簡對多繁詞條,原則爲「能分則不合」,用戶可自定義合併。

    • 支持中國大陸、臺灣、香港異體字和地區習慣用詞轉換,如「裏」「裡」、「鼠標」「滑鼠」。

    • 詞庫和函數庫完全分離,可以自由修改、導入、擴展。

    • 支持C,C++,Python,PHP等多種語言調用,命令行直接調用,以及圖形界面。

    • 兼容Windows、Linux等多種平臺。

    進展

    • 2011年12月,支持地區異體字和習慣用詞轉換。

    • 2011年7月,圖形版本發佈。

    • OpenCC創立於2009年,初期一直在蒐集整理詞庫,2010年6月正式對外發佈。

    • 已經用於ibus-pinyin、fcitx的繁體模式輸入。U

    Ubuntu 下安装如下:

    上面的安装只是作为shell的命令调用,如果要在python中import 的话,可以使用下面方法安装:

    参考:OpenCC 0.1

    使用pip或者easy_install从pip源中下载并安装,如下:以easy_install为例

    使用如下:

    zhs2zhtw_p.ini
    zhs2zhtw_v.ini
    zhs2zhtw_vp.ini
    zht2zhtw_p.ini
    zht2zhtw_v.ini
    zht2zhtw_vp.ini
    zhtw2zhs.ini
    zhtw2zht.ini
    zhtw2zhcn_s.ini
    zhtw2zhcn_t.ini
    zhs2zht.ini:简体转繁体
    zht2zhs.ini:繁体转简体

  • 相关阅读:
    open_basedir restriction in effect的错误及其解决办法
    SNMP-网络管理协议
    安装cacti监控系统
    并发时-修改Linux系统下的最大文件描述符限制
    js new date()说明
    阿里云ECS环境部署 centos 6.5
    sysbench
    http_load
    LeetCode: Spiral Matrix
    LeetCode:Length of Last Word
  • 原文地址:https://www.cnblogs.com/mo-wang/p/5102117.html
Copyright © 2011-2022 走看看