使用kenlm工具训练统计语言模型_kenlm训练语言模型

作者：笔触狂放9 | 2024-04-04 02:33:03

踩

kenlm训练语言模型

使用kenlm工具训练统计语言模型

统计语言模型工具有比较多的选择，目前使用比较好的有srilm及kenlm，其中kenlm比srilm晚出来，训练速度也更快，而且支持单机大数据的训练。现在介绍一下kenlm的使用方法。

工具主页：http://kheafield.com/code/kenlm/
工具包的下载地址：http://kheafield.com/code/kenlm.tar.gz
使用。该工具在linux环境下使用方便，windows下使用需要用cygwin 64模拟linux环境使用。先确保linux环境已经按照1.36.0的Boost和zlib，

boost:
yum install boost
yum install boost-devel

zlib:
yum install zlib
yum install zlib-devel
1
2
3
4
5
6
7

然后gcc版本需要是4.8.2及以上。kenlm.tar.gz工具包下载，解压，进入子目录运行 ./bjam 进行编译。
也可以参考官方编译方法：

wget -O - https://kheafield.com/code/kenlm.tar.gz |tar xz
mkdir kenlm/build
cd kenlm/build
cmake ..
make -j4
1
2
3
4
5

build/bin/lmplz -o 3 --verbose_header --text people2014corpus_words.txt --arpa result/people2014corpus_words.arps
1

其中，
1）people2014corpus_words.txt文件必须是分词以后的文件。
2）-o后面的3表示的是3-gram,一般取到3即可，但可以结合自己实际情况判断。

build/bin/build_binary ./result/people2014corpus_words.arps ./result/people2014corpus_words.klm
1

声明：本文内容由网友自发贡献，不代表【wpsshop博客】立场，版权归原作者所有，本站不承担相应法律责任。如您发现有侵权的内容，请联系我们。转载请注明出处：https://www.wpsshop.cn/w/笔触狂放9/article/detail/357104?site