人名轻一点,陀氏仍然复杂。
陀氏轻读是一套陀思妥耶夫斯基中文人名减负阅读库:把同一人物的全名、父称、 昵称和旧式转写统一成一个稳定称呼。项目以 已经处理好的 TXT 为主,上传工具和构建脚本为辅。
library/zh/ 内置五本可直接阅读的简体中文 TXT:
想一次拿走全部内容,下载
陀氏轻读-中文五部经典.zip。
| 作品 | 译者 | 成品 |
|---|---|---|
| 《罪与罚》 | 岳麟 | crime-and-punishment.txt |
| 《卡拉马佐夫兄弟》 | 荣如德 | brothers-karamazov.txt |
| 《白痴》 | 荣如德 | the-idiot.txt |
| 《群魔》(底本名《鬼》) | 娄自良 | demons.txt |
| 《死屋手记》 | 娄自良 | the-house-of-the-dead.txt |
每个成品顶部都写明译者、来源页、底本和 ISBN。正文只处理人物称呼,不做翻译、摘要或 句子改写。
python -m pip install -r requirements.txt
streamlit run app.py首页先展示成品书库和下载按钮;「处理自己的 TXT」是第二入口,同时支持:
- 按五本成品逐本核对的中文映射
- 原仓库
data/books.json的十本中文映射
中文底本来自一套上海译文九卷合集。需要复现时,先拆出五本,再构建成品:
python scripts/extract_chinese_sources.py /path/to/陀思妥耶夫斯基作品集.zip
python scripts/build_library.py脚本会生成 library/manifest.json,记录译者、字数、人名命中次数、底本与成品的
SHA-256。已经生成好的 TXT 直接放在仓库里,普通读者不需要运行脚本。
只生成一本:
python scripts/build_library.py --book crime-and-punishment处理自己的本地文件:
python main.py my-book.txt --book crime-and-punishmentdata/library.json:五本中文成品的来源、译者、人物全名、原文变体与统一称呼data/library-en.json:早期英文映射,作为可选资料保留data/books.json:旧版中文映射,保留兼容library/manifest.json:成品校验与处理统计
替换引擎使用单次正则扫描并优先匹配长名称。它不会先把全名的一部分换掉,也不会让 替换后的名称再次参与替换。《群魔》中两个不同的玛丽娅也分别建模,没有合并成一人。
python -m unittest discover -s tests中文底本索引见
ebook-treasure-chest 文学目录,
电子书内标注上海译文出版社、译者和 ISBN;这些信息也保留在每个成品 TXT 的开头。
原来的 Project Gutenberg 英文构建器保留为 scripts/build_library_en.py。