「前処理データの整合性」エラー ←形態素解析の不調に起因 ←辞書編集に起因? #1372
Replies: 11 comments 15 replies
|
まずWindowsを再起動してください。終了+起動ではだめで、必ず「再起動」をクリックしてください。それから、漱石『こころ』のプロジェクトを作成して、前処理を実行してみてください。正常に前処理が終了しますか? また抽出語リストは、このようになりますか? https://speakerdeck.com/koichih/kh-codertiyutoriaru-suraidoban?slide=13 |
|
「プロジェクト」「開く」画面で、漱石『こころ』のプロジェクトを選択し一度削除してください。 そして、もう一度、漱石『こころ』のプロジェクトを作成していただけますか。その際に、この画面で それから「前処理の実行」をして、抽出語リストを見てみるといかがでしょう? 1文字ずつになっていますか? |
|
C:/khcoder3/config/khc73というフォルダの中に、「_ch.txt」で終わる名前のテキストファイルがあると思います。 これはChaSenによる形態素解析の結果が入っているファイルですが、その冒頭のスクリーンショットか、あるいは内容を貼り付けていただけますか? ChaSenによる形態素解析が上手くいっていないのか、形態素解析は上手くいっているけれど、そのあとがいけないのかという手がかりがえられると思います。 |
|
樋口先生 恐れ入ります。 |
|
[khc74_ch.txt](https://github.com/user-attachments/files/24366259/khc74_ch.txt 樋口先生 |
|
樋口先生 残念ながら改善しませんでした。 申し訳ございません。 |
|
樋口先生 MeCabはOKでした。 |
|
ChaSenを直すよりは、MeCabで分析するのが楽かもしれません。 整合性エラーが出ていたプロジェクトは、MeCabなら前処理が正常に完了しますか? |
|
樋口先生 >ChaSenを直すよりは、MeCabで分析するのが楽かもしれません。 >整合性エラーが出ていたプロジェクトは、MeCabなら前処理が正常に完了しますか? はい。ただ、最近の語は未知語などとなり、うまくいきません。 Chasenを直す場合、どのような方法が考えられますか。 |





ここで重要なのは、いったんChaSenをフォルダごと削除するというステップです。まるごと削除してから、バックアップを戻すことで、復旧を狙うという趣旨で書きました。もちろん辞書編集の内容は完全に消えるはずです。
現状の形態素解析の結果を見ると、未知語が非常に多く、わずかな言葉しか辞書に入っていないようです。辞書のコンパイルが途中でエラーになって中断してしまったことが疑われます。辞書のコンパイル時には、コマンドプロンプトの表示をよく確認してください。