ADSL拨号VPS包含了中国大陆（联通，移动，电信，）

中国香港，国外拨号VPS。

当前位置：云主机 > python >

电信ADSL拨号VPS

上饶电信拨号VPS

洛阳电信拨号VPS

威海电信拨号VPS

济南电信拨号VPS

九江电信拨号VPS

厦门电信拨号VPS

邢台电信拨号VPS

湖州电信拨号VPS

绍兴电信拨号VPS

宁波电信拨号VPS

温州电信拨号VPS

杭州电信拨号VPS

郑州电信拨号VPS

铜陵电信拨号VPS

池州电信拨号VPS

黄山电信拨号VPS

十堰电信拨号VPS

荆门电信拨号VPS

莆田电信拨号VPS

三明电信拨号VPS

永州电信拨号VPS

张家界电信拨号VPS

常德电信拨号VPS

昆明电信拨号VPS

丽江电信拨号VPS

马鞍山电信拨号VPS

宣城电信拨号VPS

合肥电信拨号VPS

淮北电信拨号VPS

泰州电信拨号VPS

南通电信拨号VPS

南京电信拨号VPS

扬州电信拨号VPS

宿迁电信拨号VPS

镇江电信拨号VPS

苏州电信拨号VPS

淮安电信拨号VPS

盐城电信拨号VPS

包头电信拨号VPS

海口电信拨号VPS

江门电信拨号VPS

眉山电信拨号VPS

德阳电信拨号VPS

衢州电信拨号VPS

上海电信拨号VPS

桂林电信拨号VPS

成都电信拨号VPS

鞍山电信拨号VPS

福州电信拨号VPS

柳州电信拨号VPS

无锡电信拨号VPS

乌兰察布电信拨号VPS

深圳电信拨号VPS

河源电信拨号VPS

秦皇岛电信拨号VPS

徐州电信拨号VPS

台州电信拨号VPS

芜湖电信拨号VPS

蚌埠电信拨号VPS

潮州电信拨号VPS

重庆电信拨号VPS

连云港电信拨号VPS

绵阳电信拨号VPS

泰安电信拨号VPS

晋城电信拨号VPS

广州电信拨号VPS

联通ADSL拨号VPS

北京联通拨号VPS

滨州联通拨号VPS

莱芜联通拨号VPS

鞍山联通拨号VPS

连云港联通拨号VPS

海口联通拨号VPS

徐州联通拨号VPS

重庆联通拨号VPS

上海联通拨号VPS

西昌联通拨号VPS

南充联通拨号VPS

枣庄联通拨号VPS

抚顺联通拨号VPS

唐山联通拨号VPS

保定联通拨号VPS

廊坊联通拨号VPS

武汉联通拨号VPS

泰安联通拨号VPS

雅安联通拨号VPS

盘锦联通拨号VPS

泰州联通拨号VPS

移动ADSL拨号VPS

盐城移动拨号VPS

莱芜移动拨号VPS

python实现中文分词FMM算法实例

时间:2021-12-08 14:53 作者:admin

本文实例讲述了python/' target='_blank'>python实现中文分词FMM算法。分享给大家供大家参考。具体分析如下：

FMM算法的最简单思想是使用贪心算法向前找n个，如果这n个组成的词在词典中出现，就ok，如果没有出现，那么找n-1个...然后继续下去。假如n个词在词典中出现，那么从n+1位置继续找下去，直到句子结束。

import re  def PreProcess(sentence,edcode="utf-8"):    sentence = sentence.decode(edcode)    sentence=re.sub(u"[。，,！……!《》<>\"':：？\?、\|“”‘'；]"," ",sentence)    return sentence  def FMM(sentence,diction,result = [],maxwordLength = 4,edcode="utf-8"):  i = 0   sentence = PreProcess(sentence,edcode)    length = len(sentence)    while i < length:     # find the ascii word      tempi=i      tok=sentence[i:i+1]      while re.search("[0-9A-Za-z\-\+#@_\.]{1}",tok)<>None:        i= i+1       tok=sentence[i:i+1]      if i-tempi>0:        result.append(sentence[tempi:i].lower().encode(edcode))     # find chinese word      left = len(sentence[i:])      if left == 1:        """go to 4 step over the FMM"""       """should we add the last one? Yes, if not blank"""       if sentence[i:] <> " ":          result.append(sentence[i:].encode(edcode))        return result      m = min(left,maxwordLength)      for j in xrange(m,0,-1):        leftword = sentence[i:j+i].encode(edcode)      #  print leftword.decode(edcode)        if LookUp(leftword,diction):         # find the left word in dictionary         # it's the right one          i = j+i          result.append(leftword)          break       elif j == 1:          """only one word, add into result, if not blank"""         if leftword.decode(edcode) <> " ":            result.append(leftword)          i = i+1       else:          continue   return result  def LookUp(word,dictionary):    if dictionary.has_key(word):      return True   return False def ConvertGBKtoUTF(sentence):    return sentence.decode('gbk').encode('utf-8')dictions = {}  dictions["ab"] = 1 dictions["cd"] = 2 dictions["abc"] = 1 dictions["ss"] = 1 dictions[ConvertGBKtoUTF("好的")] = 1 dictions[ConvertGBKtoUTF("真的")] = 1 sentence = "asdfa好的是这样吗vasdiw呀真的daf dasfiw asid是吗？" s = FMM(ConvertGBKtoUTF(sentence),dictions)  for i in s:    print i.decode("utf-8")test = open("test.txt","r")  for line in test:    s = FMM(CovertGBKtoUTF(line),dictions)    for i in s:      print i.decode("utf-8")

运行结果如下：

asdfa
好的
是
这
样
吗
vasdiw
呀
真的
daf
dasfiw
asid
是
吗
？

希望本文所述对大家的Python程序设计有所帮助。

(责任编辑：admin)

上一篇：python字符串对其居中显示的方法
下一篇：Python多线程下载文件的方法

帮助中心: 会员注册; 找回密码; 新闻中心

快捷通道: 域名登录面板; 虚机登录面板; 云主机登录面板

关于我们: 关于我们; 联系我们

联系方式: 售前咨询：17830004266(重庆移动); 企业QQ：383546523

《中华人民共和国工业和信息化部》编号：ICP备00012341号

Copyright © 2002 -2018 香港云主机版权所有
声明：香港云主机品牌标志、品牌吉祥物均已注册商标，版权所有，窃用必究

云官方微信

在线客服

企业QQ:
技术支持：383546523

公司总台电话：17830004266(重庆移动)
售前咨询热线：17830004266(重庆移动)