我请求您的善意帮助和帮助,以解决“Java命令失败”的错误,当我尝试标记大小为2 MB的阿拉伯语语料库时,该错误会持续发生。我已经搜索了网站和stanford POS tagger邮件列表。但是,我没有找到解决方案。我阅读了一些关于类似问题的帖子,并建议使用内存。我不确定这一点。我仍然拥有19GB的可用内存。我尝试了所有可能的解决方案,但同样的错误不断显示。Java命令在NLTK Stanford POS Tagger中失败
我有Python的平均命令和Linux上的良好命令。我为阿拉伯语使用LinuxMint17 KDE 64位,Python3.4,NLTK alpha和Stanford POS tagger模型。这是我的代码:
import nltk
from nltk.tag.stanford import POSTagger
arabic_postagger = POSTagger("/home/mohammed/postagger/models/arabic.tagger", "/home/mohammed/postagger/stanford-postagger.jar", encoding='utf-8')
print("Executing tag_corpus.py...\n")
# Import corpus file
print("Importing data...\n")
file = open("test.txt", 'r', encoding='utf-8').read()
text = file.strip()
print("Tagging the corpus. Please wait...\n")
tagged_corpus = arabic_postagger.tag(nltk.word_tokenize(text))
如果语句大小小于1MB(= 100,000个单词),则不会有错误。但是当我尝试要标记2MB语料库,那么下面的错误信息显示:
Traceback (most recent call last):
File "/home/mohammed/experiments/current/tag_corpus2.py", line 17, in <module>
tagged_lst = arabic_postagger.tag(nltk.word_tokenize(text))
File "/usr/local/lib/python3.4/dist-packages/nltk-3.0a3-py3.4.egg/nltk/tag/stanford.py", line 59, in tag
return self.batch_tag([tokens])[0]
File "/usr/local/lib/python3.4/dist-packages/nltk-3.0a3-py3.4.egg/nltk/tag/stanford.py", line 81, in batch_tag
stdout=PIPE, stderr=PIPE)
File "/usr/local/lib/python3.4/dist-packages/nltk-3.0a3-py3.4.egg/nltk/internals.py", line 171, in java
raise OSError('Java command failed!')
OSError: Java command failed!
我打算标签300万个字我的博士使用研究项目。如果我一次标记10万字,我将不得不重复3000次。它会杀了我!
我真的很感谢你的帮助。
顺便说一句,你过于贪婪地为300多万句子做标记和POS标记。我会分批完成它。尝试每次通话100万次,然后只运行300次。 – alvas 2014-11-25 01:09:01
@alvas感谢您的评论。事实上,我会做你的建议。但是我忘了在问题中清楚地说明。 – Mohammed 2014-11-25 01:17:04