玩蛇网提供最新Python编程技术信息以及Python资源下载!
您现在的位置: 玩蛇网首页 > Python问题解答 > 正文内容

用Python方法将搜狗词库转换成可读文件的思路是什么

我找到这个文章, 我只是好奇作者是如何找到这种方法的,我cat path/to/sogou-dict的结果是乱码,我希望知道这种思路,自己转转其他离线词典(某些linux小众离线词典文件)

update:
主要是下面的代码不懂思路

# 搜狗的scel词库就是保存的文本的unicode编码,每两个字节一个字符(中文汉字或者英文字母)
# 找出其每部分的偏移位置即可

def byte2str(data):
    '''将原始字节码转为字符串'''
    i = 0;
    length = len(data)
    ret = u''
    while i < length:
        x = data[i] + data[i + 1]
        t = unichr(struct.unpack('H', x)[0])
        if t == u'\r':
            ret += u'\n'
        elif t != u' ':
            ret += t
        i += 2
    return ret

这规律是如何找出来的,难道是内部消息?

玩蛇网文章,转载请注明出处和文章网址:http://www.iplaypy.com/wenda/wd18523.html

相关文章 Recommend

玩蛇网Python互助QQ群,欢迎加入-->: 106381465 玩蛇网Python新手群
修订日期:2017年06月07日 - 18时36分59秒 发布自玩蛇网

我要分享到:

必知PYTHON教程 Must Know PYTHON Tutorials

必知PYTHON模块 Must Know PYTHON Modules