-
Notifications
You must be signed in to change notification settings - Fork 0
Expand file tree
/
Copy pathjp_media_mining_refactored.py
More file actions
2130 lines (1767 loc) · 79.1 KB
/
Copy pathjp_media_mining_refactored.py
File metadata and controls
2130 lines (1767 loc) · 79.1 KB
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
67
68
69
70
71
72
73
74
75
76
77
78
79
80
81
82
83
84
85
86
87
88
89
90
91
92
93
94
95
96
97
98
99
100
101
102
103
104
105
106
107
108
109
110
111
112
113
114
115
116
117
118
119
120
121
122
123
124
125
126
127
128
129
130
131
132
133
134
135
136
137
138
139
140
141
142
143
144
145
146
147
148
149
150
151
152
153
154
155
156
157
158
159
160
161
162
163
164
165
166
167
168
169
170
171
172
173
174
175
176
177
178
179
180
181
182
183
184
185
186
187
188
189
190
191
192
193
194
195
196
197
198
199
200
201
202
203
204
205
206
207
208
209
210
211
212
213
214
215
216
217
218
219
220
221
222
223
224
225
226
227
228
229
230
231
232
233
234
235
236
237
238
239
240
241
242
243
244
245
246
247
248
249
250
251
252
253
254
255
256
257
258
259
260
261
262
263
264
265
266
267
268
269
270
271
272
273
274
275
276
277
278
279
280
281
282
283
284
285
286
287
288
289
290
291
292
293
294
295
296
297
298
299
300
301
302
303
304
305
306
307
308
309
310
311
312
313
314
315
316
317
318
319
320
321
322
323
324
325
326
327
328
329
330
331
332
333
334
335
336
337
338
339
340
341
342
343
344
345
346
347
348
349
350
351
352
353
354
355
356
357
358
359
360
361
362
363
364
365
366
367
368
369
370
371
372
373
374
375
376
377
378
379
380
381
382
383
384
385
386
387
388
389
390
391
392
393
394
395
396
397
398
399
400
401
402
403
404
405
406
407
408
409
410
411
412
413
414
415
416
417
418
419
420
421
422
423
424
425
426
427
428
429
430
431
432
433
434
435
436
437
438
439
440
441
442
443
444
445
446
447
448
449
450
451
452
453
454
455
456
457
458
459
460
461
462
463
464
465
466
467
468
469
470
471
472
473
474
475
476
477
478
479
480
481
482
483
484
485
486
487
488
489
490
491
492
493
494
495
496
497
498
499
500
501
502
503
504
505
506
507
508
509
510
511
512
513
514
515
516
517
518
519
520
521
522
523
524
525
526
527
528
529
530
531
532
533
534
535
536
537
538
539
540
541
542
543
544
545
546
547
548
549
550
551
552
553
554
555
556
557
558
559
560
561
562
563
564
565
566
567
568
569
570
571
572
573
574
575
576
577
578
579
580
581
582
583
584
585
586
587
588
589
590
591
592
593
594
595
596
597
598
599
600
601
602
603
604
605
606
607
608
609
610
611
612
613
614
615
616
617
618
619
620
621
622
623
624
625
626
627
628
629
630
631
632
633
634
635
636
637
638
639
640
641
642
643
644
645
646
647
648
649
650
651
652
653
654
655
656
657
658
659
660
661
662
663
664
665
666
667
668
669
670
671
672
673
674
675
676
677
678
679
680
681
682
683
684
685
686
687
688
689
690
691
692
693
694
695
696
697
698
699
700
701
702
703
704
705
706
707
708
709
710
711
712
713
714
715
716
717
718
719
720
721
722
723
724
725
726
727
728
729
730
731
732
733
734
735
736
737
738
739
740
741
742
743
744
745
746
747
748
749
750
751
752
753
754
755
756
757
758
759
760
761
762
763
764
765
766
767
768
769
770
771
772
773
774
775
776
777
778
779
780
781
782
783
784
785
786
787
788
789
790
791
792
793
794
795
796
797
798
799
800
801
802
803
804
805
806
807
808
809
810
811
812
813
814
815
816
817
818
819
820
821
822
823
824
825
826
827
828
829
830
831
832
833
834
835
836
837
838
839
840
841
842
843
844
845
846
847
848
849
850
851
852
853
854
855
856
857
858
859
860
861
862
863
864
865
866
867
868
869
870
871
872
873
874
875
876
877
878
879
880
881
882
883
884
885
886
887
888
889
890
891
892
893
894
895
896
897
898
899
900
901
902
903
904
905
906
907
908
909
910
911
912
913
914
915
916
917
918
919
920
921
922
923
924
925
926
927
928
929
930
931
932
933
934
935
936
937
938
939
940
941
942
943
944
945
946
947
948
949
950
951
952
953
954
955
956
957
958
959
960
961
962
963
964
965
966
967
968
969
970
971
972
973
974
975
976
977
978
979
980
981
982
983
984
985
986
987
988
989
990
991
992
993
994
995
996
997
998
999
1000
#!/usr/bin/env python3
# -*- coding: utf-8 -*-
"""
JP Media Mining → Anki Cards (重构版)
重构改进:
1. 使用 mdx_utils.MeaningsLookup 进行多词典释义查询 (Yomitan格式)
2. 使用 mdx_utils.AudioLookup 获取音频和音调信息 (支持 Fugashi 智能匹配)
3. 优化代码结构,提高可维护性
4. 集成 AnkiConnect API,一键推送到 Anki
依赖安装:
pip install pysubs2 fugashi[unidic-lite] requests pandas
使用示例 (生成 CSV):
python jp_media_mining_refactored.py \
--video "episodes/Ep01.mp4" \
--subs "subs/Ep01.ja.srt" \
--words "unknown/Ep01_words.txt" \
--primary-mdx "dicts/primary_mdx_dir" \
--secondary-mdx "dicts/secondary_mdx_dir" \
--tertiary-mdx "dicts/tertiary_mdx_dir" \
--nhk-old "dicts/NHK_Old" \
--nhk-new "dicts/NHK_New" \
--djs "dicts/DJS" \
--freq "dicts/term_meta_bank_1.json" \
--outdir "out/Ep01" \
--csv "out/Ep01/cards.csv"
使用示例 (一键推送到 Anki):
python jp_media_mining_refactored.py \
--video "episodes/Ep01.mp4" \
--subs "subs/Ep01.ja.srt" \
--words "unknown/Ep01_words.txt" \
--primary-mdx "dicts/primary" \
--nhk-old "dicts/NHK_Old" \
--nhk-new "dicts/NHK_New" \
--djs "dicts/DJS" \
--freq "dicts/term_meta_bank_1.json" \
--outdir "out/Ep01" \
--csv "out/Ep01/cards.csv" \
--anki \
--anki-deck "Japanese::Kimetsu_no_Yaiba" \
--anki-tags anime kimetsu S01E01
注意事项:
- 使用 --anki 参数需要先安装 AnkiConnect 插件 (代码: 2055492159)
- 确保 Anki 正在运行
- 笔记类型 (--anki-model) 必须包含以下字段:
word, sentence, sentenceFurigana, sentenceEng, reading, sentenceCard,
audioCard, notes, picture, wordAudio, sentenceAudio, selectionText,
definition, glossary, pitchPosition, pitch, frequency, freqSort,
miscInfo, dictionaryPreference
"""
import argparse
import base64
import csv
import json
import re
import subprocess
import zipfile
from dataclasses import dataclass, asdict
from datetime import timedelta
from pathlib import Path
from typing import List, Optional, Tuple, Dict, Any
import pysubs2
import requests
from fugashi import Tagger
try:
import jaconv
except ImportError:
jaconv = None
print("⚠️ jaconv 未安装,将使用简单的片假名转换。建议运行: pip install jaconv")
try:
import pandas as pd
except ImportError:
pd = None
# 导入 mdx_utils 模块
from mdx_utils import MeaningsLookup, AudioLookup, get_all_audio_info_from_mdx
# ----------------------- AnkiConnect API -----------------------
class AnkiConnect:
"""AnkiConnect API 封装"""
def __init__(self, url: str = "http://localhost:8765"):
self.url = url
def invoke(self, action: str, **params) -> Any:
"""调用 AnkiConnect API"""
payload = {
"action": action,
"version": 6,
"params": params
}
response = requests.post(self.url, json=payload)
response.raise_for_status()
result = response.json()
if len(result) != 2:
raise Exception('AnkiConnect 响应格式错误')
if result['error'] is not None:
raise Exception(f'AnkiConnect 错误: {result["error"]}')
return result['result']
def check_connection(self) -> bool:
"""检查 AnkiConnect 是否可用"""
try:
version = self.invoke('version')
print(f" ✅ AnkiConnect 已连接 (版本: {version})")
return True
except Exception as e:
print(f" ❌ AnkiConnect 连接失败: {e}")
print(" 请确保 Anki 正在运行且已安装 AnkiConnect 插件")
return False
def create_deck(self, deck_name: str) -> None:
"""创建牌组 (如果不存在)"""
self.invoke('createDeck', deck=deck_name)
def add_note(self, note: Dict[str, Any]) -> int:
"""添加笔记,返回笔记 ID"""
return self.invoke('addNote', note=note)
def store_media_file(self, filename: str, data: str) -> str:
"""
存储媒体文件到 Anki
Args:
filename: 文件名
data: Base64 编码的数据 (不需要 data URI 前缀)
Returns:
文件名 (用于 [sound:...] 或 <img> 标签)
"""
self.invoke('storeMediaFile', filename=filename, data=data)
return filename
def format_time_hhmmss(seconds: float) -> str:
"""
将秒数格式化为 (h:)mm:ss
示例:
- 65.5 → "01:05"
- 3665.5 → "1:01:05"
"""
if not seconds or seconds < 0:
return "00:00"
td = timedelta(seconds=seconds)
total_seconds = int(td.total_seconds())
hours = total_seconds // 3600
minutes = (total_seconds % 3600) // 60
secs = total_seconds % 60
if hours > 0:
return f"{hours}:{minutes:02d}:{secs:02d}"
else:
return f"{minutes:02d}:{secs:02d}"
# ----------------------- Data Types -----------------------
@dataclass
class CardData:
"""Anki 卡片数据"""
# 基础字段
word: str # 目标单词
sentence: str # 原句
sentence_furigana: str # 带假名的原句
# 释义
definition: str # HTML 格式释义 (Yomitan)
# 音调信息
reading: str # 假名读音 (带上划线标记)
pitch_position: str # 音调位置 [0], [1], [2] 等
pitch_type: str # 音调类型 (平板式/頭高型/中高型/尾高型)
pitch_source: str # 音调来源词典
# 音频 (Base64)
sentence_audio_base64: str # 句子音频 Base64
word_audio_base64: str # 单词音频 Base64
word_audio_source: str # 单词音频来源
# 图片 (Base64)
picture_base64: str # 截图 Base64
# 频率
bccwj_frequency: str # 频率显示值
bccwj_freq_sort: str # 频率排序值
# 媒体信息
anime_name: str # 动漫名称
episode: str # 集数 (如 S01E05)
# 时间信息
start_time: float # 字幕开始时间
end_time: float # 字幕结束时间
end_time: float # 字幕结束时间
# 额外信息
lemma: str # 词元
all_readings: str # 所有候选读音 (JSON)
# ----------------------- 音调类型转换 -----------------------
def count_kana_length(text: str) -> int:
"""
计算假名的拍数(モーラ数)
Args:
text: 假名文本 (平假名或片假名)
Returns:
拍数
规则:
- 普通假名: 1拍 (あ、か、さ...)
- 小写假名: 0拍,与前面的假名组成1拍 (ゃ、ゅ、ょ、ァ、ィ、ゥ...)
- 促音(っ/ッ): 1拍
- 长音(ー): 1拍
"""
if not text:
return 0
# 小写假名(拗音、小写片假名)
small_kana = set('ぁぃぅぇぉゃゅょゎァィゥェォヵヶャュョヮ')
count = 0
for char in text:
# 小写假名不单独计数
if char in small_kana:
continue
# 假名范围: 平假名(0x3040-0x309F) 或 片假名(0x30A0-0x30FF)
code = ord(char)
if (0x3040 <= code <= 0x309F) or (0x30A0 <= code <= 0x30FF):
count += 1
return count
def pitch_position_to_type(pitch_position: str, reading: str = "") -> str:
"""
将音调位置转换为日语声调类型名称
Args:
pitch_position: 音调位置,如 "[0]", "[1]", "[2]" 等
reading: 假名读音 (用于计算拍数)
Returns:
声调类型: 平板式/頭高型/中高型/尾高型
规则:
- [0]: 平板式 (へいばんしき) - 第一拍低,后续高且不降
- [1]: 頭高型 (あたまだかがた) - 第一拍高,第二拍降
- [2]~[N-1]: 中高型 (なかだかがた) - 中间某处降调
- [N]: 尾高型 (おだかがた) - 最后一拍高,助词处降
示例:
- にぐるま [2], 拍数=4 → 中高型 (2 < 4)
- そら [2], 拍数=2 → 尾高型 (2 == 2)
- そらもよう [0], 拍数=5 → 平板式
"""
if not pitch_position:
return ""
# 提取数字
import re
match = re.search(r'\[(\d+)\]', pitch_position)
if not match:
return ""
pos = int(match.group(1))
if pos == 0:
return "平板式"
elif pos == 1:
return "頭高型"
else:
# 需要根据假名长度判断是中高型还是尾高型
if reading:
# 去除 HTML 标签和上划线标记
clean_reading = re.sub(r'<[^>]+>', '', reading)
mora_count = count_kana_length(clean_reading)
if mora_count > 0 and pos == mora_count:
return "尾高型"
return "中高型"
def generate_pitch_html(reading: str, pitch_position: int, pitch_type: str) -> str:
"""
生成带音调标记的 HTML (Yomitan 风格)
Args:
reading: 假名读音 (如 "ほたる", "せいれい")
pitch_position: 音调位置数字 (如 0, 1, 2, 3)
pitch_type: 音调类型 ("平板式", "頭高型", "中高型", "尾高型")
Returns:
HTML 字符串,包含音调标记和对应颜色
颜色规则:
- 頭高型 (1型): 红色 (#f54360 或 red)
- 平板式 (0型): 蓝色 (#39c1ff 或 blue)
- 中高型/尾高型: 绿色 (#93c47d 或 green)
示例:
- ほたる [1]: 红色, 第一拍后下降
- せいれい [0]: 蓝色, 第一拍低后续高
- にぐるま [2]: 绿色, 第二拍后下降
"""
if not reading:
return ""
# 确定颜色 (使用 match-case 语法, Python 3.10+)
match pitch_type:
case "頭高型":
color = "#f54360" # 红色 (atamadaka)
case "平板式":
color = "#39c1ff" # 蓝色 (heiban)
case "中高型":
color = "#fca311" # 橙色 (nakadaka)
case "尾高型":
color = "#40D4A6" # 青绿色 (odaka)
case _:
color = "#afa2ff" # 默认绿色
# 拆分假名为单个字符(处理小写假名)
chars = list(reading)
# 生成每个假名的 HTML
spans = []
for i, char in enumerate(chars):
mora_index = i + 1 # 拍数从 1 开始
# 基础样式
char_html = f'<span style="display:inline;">{char}</span>'
# 判断是否需要上划线和下降标记
has_overline = False
has_drop = False
if pitch_position == 0:
# 平板式: 第一拍无线,第二拍开始有上划线
if mora_index > 1:
has_overline = True
elif pitch_position == 1:
# 頭高型: 第一拍有上划线+下降标记,后续无线
if mora_index == 1:
has_overline = True
has_drop = True
else:
# 中高型/尾高型: 第二拍到下降位置有上划线,下降位置有标记
if 2 <= mora_index <= pitch_position:
has_overline = True
if mora_index == pitch_position:
has_drop = True
# 构建标记 HTML
mark_style_parts = [
f'border-color:{color}',
]
if has_overline or has_drop:
mark_style_parts.extend([
'display:block',
'user-select:none',
'pointer-events:none',
'position:absolute',
'top:0.1em',
'left:0',
'right:0',
'height:0',
'border-top-width:0.1em',
'border-top-style:solid',
])
if has_drop:
# 下降标记: 右侧竖线
mark_style_parts.extend([
'right:-0.1em',
'height:0.4em',
'border-right-width:0.1em',
'border-right-style:solid',
])
mark_html = f'<span style="{";".join(mark_style_parts)};"></span>'
# 包装容器
container_style_parts = [
'display:inline-block',
'position:relative',
]
if has_drop:
# 下降位置需要右边距和内边距
container_style_parts.extend([
'padding-right:0.1em',
'margin-right:0.1em',
])
container_html = f'<span style="{";".join(container_style_parts)};">{char_html}{mark_html}</span>'
spans.append(container_html)
# 组合所有假名
full_html = '<span style="display:inline;">' + ''.join(spans) + '</span>'
return full_html
def file_to_base64(file_path: Path) -> str:
"""
将文件转换为 Base64 编码字符串
Args:
file_path: 文件路径
Returns:
Base64 编码的字符串,如果文件不存在返回空字符串
"""
import base64
if not file_path or not file_path.exists():
return ""
try:
with open(file_path, 'rb') as f:
data = f.read()
b64 = base64.b64encode(data).decode('utf-8')
# 添加 data URI scheme
ext = file_path.suffix.lower()
if ext in ['.png', '.jpg', '.jpeg', '.gif', '.webp']:
mime_type = f"image/{ext[1:]}"
if ext == '.jpg':
mime_type = "image/jpeg"
return f"data:{mime_type};base64,{b64}"
elif ext in ['.mp3', '.m4a', '.ogg', '.wav']:
mime_type = f"audio/{ext[1:]}"
if ext == '.m4a':
mime_type = "audio/mp4"
return f"data:{mime_type};base64,{b64}"
else:
return f"data:application/octet-stream;base64,{b64}"
except Exception as e:
print(f" ⚠️ 读取文件失败 {file_path}: {e}")
return ""
# ----------------------- FFmpeg 辅助函数 -----------------------
def ms_to_s(ms: int) -> float:
"""毫秒转秒"""
return ms / 1000.0
def ensure_dir(p: Path) -> None:
"""确保目录存在"""
p.mkdir(parents=True, exist_ok=True)
def run_ffmpeg(cmd: List[str]) -> None:
"""执行 FFmpeg 命令"""
proc = subprocess.run(cmd, stdout=subprocess.PIPE, stderr=subprocess.PIPE)
if proc.returncode != 0:
raise RuntimeError(
f"FFmpeg failed: {' '.join(cmd)}\n{proc.stderr.decode('utf-8', 'ignore')}"
)
def screenshot(video: Path, t: float, out_jpg: Path, vf: Optional[str] = None) -> None:
"""截取视频帧并保存为 JPG (95% 质量)"""
cmd = ["ffmpeg", "-y", "-ss", f"{t:.3f}", "-i", str(video)]
if vf:
cmd += ["-vf", vf]
# 使用 JPEG 编码器,qscale:v 2 约等于 95% 质量
# qscale:v 范围: 2-31, 2=最高质量, 31=最低质量
cmd += ["-vframes", "1", "-c:v", "mjpeg", "-q:v", "2", str(out_jpg)]
run_ffmpeg(cmd)
def cut_audio(video: Path, start: float, end: float, out_audio: Path) -> None:
"""裁剪音频片段"""
dur = max(0.01, end - start)
cmd = [
"ffmpeg", "-y", "-ss", f"{start:.3f}", "-t", f"{dur:.3f}",
"-i", str(video), "-vn", "-ac", "2", "-ar", "48000",
"-c:a", "aac", "-b:a", "192k", str(out_audio)
]
run_ffmpeg(cmd)
# ----------------------- 字幕和文本处理 -----------------------
def katakana_to_hiragana(text: str) -> str:
"""将片假名转换为平假名
优先使用 jaconv 库 (更准确),如果未安装则使用简单转换
"""
if not text:
return ""
# 如果 jaconv 可用,使用它 (更准确、更完整)
if jaconv:
return jaconv.kata2hira(text)
# 降级方案: 简单的 Unicode 转换
result = []
for char in text:
code = ord(char)
# 片假名范围: 0x30A0-0x30FF
# 平假名范围: 0x3040-0x309F
# 偏移量: 0x60
if 0x30A1 <= code <= 0x30F6: # カ-ヶ
result.append(chr(code - 0x60))
else:
result.append(char)
return ''.join(result)
def is_all_katakana(text: str) -> bool:
"""检测文本是否全是片假名(允许长音符、促音等)
Args:
text: 要检测的文本
Returns:
True 如果全是片假名字符
Example:
>>> is_all_katakana("コーヒー")
True
>>> is_all_katakana("コーヒーを飲む")
False
"""
if not text:
return False
# 片假名范围: ァ-ヶ (0x30A1-0x30F6) + 长音符 ー (0x30FC) + 中点 ・ (0x30FB)
for char in text:
code = ord(char)
if not (0x30A1 <= code <= 0x30F6 or code == 0x30FC or code == 0x30FB):
return False
return True
def expand_long_vowel(text: str) -> str:
"""展开长音符(ー)为完整假名
Args:
text: 平假名文本 (可能包含长音符)
Returns:
展开后的平假名 (无长音符)
规则:
- あー → あa
- いー → いi
- うー → うu
- えー → ええ/えい (根据前字判断)
- おー → うo (お段长音通常用 う)
Example:
>>> expand_long_vowel("こーひー")
"こうひい"
>>> expand_long_vowel("せんせー")
"せんせい"
"""
if not text or 'ー' not in text:
return text
# 母音映射 (平假名行的代表字符)
vowel_map = {
'あ': 'あ', 'か': 'あ', 'さ': 'あ', 'た': 'あ', 'な': 'あ',
'は': 'あ', 'ま': 'あ', 'や': 'あ', 'ら': 'あ', 'わ': 'あ', 'が': 'あ', 'ざ': 'あ', 'だ': 'あ', 'ば': 'あ', 'ぱ': 'あ',
'い': 'い', 'き': 'い', 'し': 'い', 'ち': 'い', 'に': 'い',
'ひ': 'い', 'み': 'い', 'り': 'い', 'ゐ': 'い', 'ぎ': 'い', 'じ': 'い', 'ぢ': 'い', 'び': 'い', 'ぴ': 'い',
'う': 'う', 'く': 'う', 'す': 'う', 'つ': 'う', 'ぬ': 'う',
'ふ': 'う', 'む': 'う', 'ゆ': 'う', 'る': 'う', 'ぐ': 'う', 'ず': 'う', 'づ': 'う', 'ぶ': 'う', 'ぷ': 'う',
'え': 'い', 'け': 'い', 'せ': 'い', 'て': 'い', 'ね': 'い',
'へ': 'い', 'め': 'い', 'れ': 'い', 'ゑ': 'い', 'げ': 'い', 'ぜ': 'い', 'で': 'い', 'べ': 'い', 'ぺ': 'い',
'お': 'う', 'こ': 'う', 'そ': 'う', 'と': 'う', 'の': 'う',
'ほ': 'う', 'も': 'う', 'よ': 'う', 'ろ': 'う', 'を': 'う', 'ご': 'う', 'ぞ': 'う', 'ど': 'う', 'ぼ': 'う', 'ぽ': 'う',
'ん': 'ん',
}
result = []
for i, char in enumerate(text):
if char == 'ー' and i > 0:
# 长音符: 重复前一个字符的母音
prev_char = result[-1] if result else 'あ'
vowel = vowel_map.get(prev_char, 'う') # 默认 u 音
result.append(vowel)
else:
result.append(char)
return ''.join(result)
def normalize_sub_text(s: str) -> str:
"""标准化字幕文本,去除样式标签"""
if not s:
return ""
s = re.sub(r"\{[^}]*\}", "", s) # ASS 标签
s = re.sub(r"<[^>]+>", "", s) # HTML 标签
s = s.replace("\\N", "\n") # ASS 换行标记 -> 真实换行
s = s.replace("\u3000", " ") # 全角空格
s = re.sub(r"\s+", " ", s).strip()
return s
def extract_episode_info(video_path: Path, words_path: Path) -> tuple[str, str]:
"""从文件名提取动漫名和集数信息
Args:
video_path: 视频文件路径
words_path: 单词文件路径
Returns:
(anime_name, episode): 动漫名和集数 (如 "鬼灭之刃", "S01E05")
"""
# 从视频文件名提取动漫名 (去掉扩展名和集数信息)
video_stem = video_path.stem # 例如: "[BeanSub&FZSD&VCB-Studio] Kimetsu no Yaiba [01][Ma10p 1080p][x265 flac aac]"
# 从单词文件名提取集数 (匹配 S_E 或 SE 格式)
words_stem = words_path.stem # 例如: "S1_E2_words" 或 "S01E05_words"
# 尝试多种格式匹配
episode_code = None
# 1. 匹配 Sx_Ex 格式 (S1_E2, S01_E05 等,用下划线分隔)
episode_match = re.search(r'S(\d+)_E(\d+)', words_stem, re.IGNORECASE)
if episode_match:
season = episode_match.group(1)
episode = episode_match.group(2)
episode_code = f"S{season.zfill(2)}E{episode.zfill(2)}"
# 2. 匹配 SxEx 格式 (S1E2, S01E05 等,无下划线)
if not episode_code:
episode_match = re.search(r'S(\d+)E(\d+)', words_stem, re.IGNORECASE)
if episode_match:
season = episode_match.group(1)
episode = episode_match.group(2)
episode_code = f"S{season.zfill(2)}E{episode.zfill(2)}"
# 3. 如果没找到,尝试匹配 Ep01 格式
if not episode_code:
ep_match = re.search(r'Ep(\d+)', words_stem, re.IGNORECASE)
if ep_match:
episode_code = f"S01E{ep_match.group(1).zfill(2)}"
# 4. 如果还是没找到,尝试从视频文件名提取
if not episode_code:
video_episode_match = re.search(r'S(\d+)E(\d+)', video_stem, re.IGNORECASE)
if video_episode_match:
season = video_episode_match.group(1)
episode = video_episode_match.group(2)
episode_code = f"S{season.zfill(2)}E{episode.zfill(2)}"
else:
# 尝试匹配方括号中的数字 [01]
bracket_match = re.search(r'\[(\d{1,2})\]', video_stem)
if bracket_match:
episode_code = f"S01E{bracket_match.group(1).zfill(2)}"
else:
episode_code = "S01E01" # 默认值
# 从视频文件名提取动漫名
# 1. 移除所有方括号及其内容 (如 [BeanSub&FZSD&VCB-Studio], [01], [Ma10p 1080p] 等)
anime_name = re.sub(r'\[[^\]]*\]', '', video_stem)
# 2. 移除集数部分 (S01E05 或 Ep01 格式)
anime_name = re.sub(r'[_\s]*S\d+E\d+.*', '', anime_name, flags=re.IGNORECASE)
anime_name = re.sub(r'[_\s]*Ep\d+.*', '', anime_name, flags=re.IGNORECASE)
# 3. 下划线转空格,清理多余空白
anime_name = anime_name.replace('_', ' ').strip()
anime_name = re.sub(r'\s+', ' ', anime_name) # 多个空格合并为一个
if not anime_name:
anime_name = video_stem # 如果提取失败,使用完整文件名
return anime_name, episode_code
def load_words(path: Path) -> List[Tuple[str, Optional[str], Optional[str]]]:
"""从文件加载目标单词列表
支持格式:
- 普通单词: 精霊
- 单圆括号指定读音: 精霊(せいれい)
- 单方括号指定查词形态: 食べた[食べる] 或 狂い咲く[狂い咲き]
- 同时指定读音和查词形态: 食べた(たべた)[食べる]
语法规则:
- () 圆括号 = 强制读音
- [] 方括号 = 强制查词形态
Returns:
List[Tuple[str, Optional[str], Optional[str]]]: [(单词, 读音或None, 查词形态或None), ...]
"""
txt = path.read_text(encoding='utf-8')
words_with_reading = []
for w in re.split(r"[\n,\t]", txt):
w = w.strip()
if not w:
continue
lookup_form = None
reading = None
original_w = w
# 检查方括号(查词形态): 食べた[食べる]
dict_match = re.search(r'\[([^\]]+)\]', w)
if dict_match:
lookup_form = dict_match.group(1).strip()
# 移除方括号部分
w = w.replace(dict_match.group(0), '')
# 检查圆括号(读音): 精霊(せいれい)
reading_match = re.search(r'\(([^\)]+)\)', w)
if reading_match:
reading = reading_match.group(1).strip()
# 移除圆括号部分
w = w.replace(reading_match.group(0), '')
# 剩下的就是单词本身
word = w.strip()
words_with_reading.append((word, reading, lookup_form))
return words_with_reading
def tokens_furigana(text: str, tagger: Tagger) -> str:
"""为文本添加假名注音(平假名)
格式规则:
- 有汉字的词添加假名标注: 間違[まちが]
- 送り仮名不包含在方括号内: 間違[まちが]い (不是 間違い[まちがい])
- 从第二个token开始,每个token前加空格: 間違[まちが]い 今[いま]は
示例:
間違[まちが]い 今[いま]は 重度[じゅうど]の 飢餓[きが]状態[じょうたい]
"""
if not text:
return ""
out = []
for t in tagger(text):
surf = t.surface
# 获取读音(片假名) - 使用 lForm (发音形式)
yomi = None
if hasattr(t.feature, 'lForm') and t.feature.lForm is not None:
# lForm 是 UniDic 的标准读音字段 (片假名)
yomi = t.feature.lForm
elif hasattr(t.feature, 'kana') and t.feature.kana is not None:
# 备选: kana 字段 (某些词典格式)
yomi = t.feature.kana
elif hasattr(t, 'feature') and len(t.feature) > 7:
# 备选: IPADic 数组格式 (索引 7 是读音)
yomi = t.feature[7]
# 转换为平假名 (使用 jaconv 或降级方案)
if yomi:
yomi = katakana_to_hiragana(yomi)
# 如果有汉字且读音不同,添加假名
if yomi and yomi != surf and re.search(r"[一-龯々〆ヵヶ]", surf):
# 分离汉字部分和送り仮名
# 找到最后一个汉字的位置
kanji_end = 0
for i, char in enumerate(surf):
if re.match(r"[一-龯々〆ヵヶ]", char):
kanji_end = i + 1
if kanji_end < len(surf):
# 有送り仮名: 間違い -> 間違[まちが]い
kanji_part = surf[:kanji_end]
okurigana = surf[kanji_end:]
# 假名也要对应截取(去掉送り仮名对应的部分)
# 简单处理: 假设送り仮名的假名就是它本身
yomi_kanji = yomi
if okurigana and yomi.endswith(okurigana):
yomi_kanji = yomi[:-len(okurigana)]
out.append(f"{kanji_part}[{yomi_kanji}]{okurigana}")
else:
# 全是汉字: 間違 -> 間違[まちがい]
out.append(f"{surf}[{yomi}]")
else:
out.append(surf)
# 从第二个token开始,每个前面加空格
return ' '.join(out)
def lemmatize(text: str, tagger: Tagger) -> List[str]:
"""获取文本中所有词的词元形式"""
if not text:
return []
lemmas = []
for t in tagger(text):
# 尝试多种方式获取词元
lemma = None
if hasattr(t.feature, 'lemma'):
lemma = t.feature.lemma
elif hasattr(t, 'feature') and len(t.feature) > 6:
lemma = t.feature[6] # IPADic 格式
lemmas.append(lemma or t.surface)
return lemmas
# ----------------------- 频率索引 -----------------------
class FrequencyIndex:
"""频率数据索引 (支持 CSV/TSV/JSON 格式)"""
def __init__(self, path: Optional[Path] = None):
self.idx: Dict[str, Tuple[str, float]] = {}
if not path:
return
try:
if path.suffix.lower() == '.json':
self._load_from_json(path)
elif path.suffix.lower() == '.zip':
self._load_from_zip(path)
else:
self._load_from_file(path)
except Exception as e:
print(f"⚠️ 加载频率数据失败: {e}")
import traceback
traceback.print_exc()
def _load_from_json(self, path: Path):
"""从 Yomichan term_meta_bank JSON 文件加载
格式示例:
["具体的検討", "freq", {"reading": "ぐたいてきけんとう", "frequency": {"value": 108366, "displayValue": "10万"}}]
或简单格式:
["単語", "freq", 数值]
["単語", "freq", {"value": 数值, "displayValue": "显示"}]
"""
import json
with open(path, 'r', encoding='utf-8') as f:
data = json.load(f)
if not isinstance(data, list):
print(f" ⚠️ JSON 格式不正确,期望列表")
return
loaded = 0
for entry in data:
if not isinstance(entry, list) or len(entry) < 3:
continue
term = entry[0] # 单词
meta_type = entry[1] # 通常是 "freq"
meta_value = entry[2] # 频率值或对象
# 只处理频率数据
if meta_type != "freq":
continue
# 提取数值
rank = None
display = None
if isinstance(meta_value, (int, float)):
# 简单数值格式
rank = float(meta_value)
display = f"{int(rank)}"
elif isinstance(meta_value, dict):
# 对象格式 - 检查是否有嵌套的 frequency 字段
if 'frequency' in meta_value and isinstance(meta_value['frequency'], dict):
# 嵌套格式: {"reading": "...", "frequency": {"value": ..., "displayValue": "..."}}
freq_obj = meta_value['frequency']
rank = float(freq_obj.get('value', 0))
display = f"{freq_obj.get('displayValue', str(int(rank)))}"
elif 'value' in meta_value:
# 直接格式: {"value": ..., "displayValue": "..."}
rank = float(meta_value.get('value', 0))
display = f"{meta_value.get('displayValue', str(int(rank)))}"
else:
continue
else:
continue
if rank is not None and display:
# 存储: term -> (display_string, numeric_rank)
self.idx.setdefault(term, (display, rank))
loaded += 1
if loaded > 0:
print(f" ✅ 加载频率数据: {loaded} 条")
else:
print(f" ⚠️ 未找到任何频率数据")
def _load_from_zip(self, path: Path):
"""从 ZIP 文件加载"""
if pd is None:
return
with zipfile.ZipFile(path) as z:
cand = [n for n in z.namelist()
if n.lower().endswith(('.csv', '.tsv'))]
if not cand:
return
with z.open(cand[0]) as f:
sep = ',' if cand[0].lower().endswith('.csv') else '\t'
df = pd.read_csv(f, sep=sep)
self._load_dataframe(df)
def _load_from_file(self, path: Path):
"""从 CSV/TSV 文件加载"""
if pd is None:
return
sep = ',' if path.suffix.lower() == '.csv' else '\t'
df = pd.read_csv(path, sep=sep)
self._load_dataframe(df)
def _load_dataframe(self, df: pd.DataFrame):
"""从 DataFrame 加载数据"""
cols = {c.lower(): c for c in df.columns}
# 查找词条列
term_c = next((cols[k] for k in ['term', 'lemma', 'word', '表記', '語彙', '語']
if k in cols), None)
# 查找频率列
rank_c = next((cols[k] for k in ['rank', 'freq_rank', 'harmonic_rank',
'frequency', '頻度', '出現度']
if k in cols), None)
if term_c is None or rank_c is None:
return
for _, row in df[[term_c, rank_c]].dropna().iterrows():
term = str(row[term_c])
try:
rank = float(row[rank_c])
self.idx.setdefault(term, (str(rank), rank))
except (ValueError, TypeError):
continue
def lookup(self, key: str) -> Tuple[Optional[str], Optional[float]]:
"""查询词的频率"""
return self.idx.get(key, (None, None))
# ----------------------- 核心处理逻辑 -----------------------
def find_hits(
words: List[Tuple[str, Optional[str]]], # 修改: 现在包含可选读音
subs: pysubs2.SSAFile,
tagger: Tagger,
video: Path,
outdir: Path,
meanings_lookup: MeaningsLookup,
audio_lookup: AudioLookup,
freq_index: FrequencyIndex,
anime_name: str = "",
episode: str = "",
dicts_dir: Optional[Path] = None,
pad: float = 0.0,
vf: Optional[str] = None,
verbose: bool = True
) -> List[CardData]:
"""
查找字幕中的目标单词并生成卡片数据
Args:
words: 目标单词列表 (单词, 可选读音)
subs: 字幕文件
tagger: Fugashi 分词器
video: 视频文件路径
outdir: 输出目录
meanings_lookup: 释义查询对象
audio_lookup: 音频查询对象
freq_index: 频率索引
anime_name: 动漫名称
episode: 集数信息 (如 S01E05)
dicts_dir: 词典目录路径 (用于 DJS_N 备选音频)