-
Notifications
You must be signed in to change notification settings - Fork 24
Expand file tree
/
Copy pathexample.py
More file actions
84 lines (65 loc) · 3.83 KB
/
Copy pathexample.py
File metadata and controls
84 lines (65 loc) · 3.83 KB
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
67
68
69
70
71
72
73
74
75
76
77
78
79
80
81
82
83
84
import LangSegment
if __name__ == "__main__":
# 输入示例:(包含日文,中文,韩语,英文)
text = "你的名字叫<ja>佐々木?<ja>吗?韩语中的안녕 오빠读什么呢?あなたの体育の先生は誰ですか? 此次发布会带来了四款iPhone 15系列机型和三款Apple Watch等一系列新品,这次的iPad Air采用了LCD屏幕"
# 进行分词:(接入TTS项目仅需一行代码调用)
langlist = LangSegment.getTexts(text)
print("\n\n===================【打印结果】===================")
for line in langlist:
print(line)
print("==================================================\n")
# 分词输出:lang=语言,text=内容
# ===================【打印结果】===================
# {'lang': 'zh', 'text': '你的名字叫'}
# {'lang': 'ja', 'text': '佐々木?'}
# {'lang': 'zh', 'text': '吗?韩语中的'}
# {'lang': 'ko', 'text': '안녕 오빠'}
# {'lang': 'zh', 'text': '读什么呢?'}
# {'lang': 'ja', 'text': 'あなたの体育の先生は誰ですか?'}
# {'lang': 'zh', 'text': ' 此次发布会带来了四款'}
# {'lang': 'en', 'text': 'i Phone '}
# {'lang': 'zh', 'text': '15系列机型和三款'}
# {'lang': 'en', 'text': 'Apple Watch'}
# {'lang': 'zh', 'text': '等一系列新品,这次的'}
# {'lang': 'en', 'text': 'i Pad Air'}
# {'lang': 'zh', 'text': '采用了'}
# {'lang': 'en', 'text': 'L C D'}
# {'lang': 'zh', 'text': '屏幕'}
# ===================【语种统计】===================
# 功能二,语种统计:
print("\n===================【语种统计】===================")
# 获取所有语种数组结果,根据内容字数降序排列
langCounts = LangSegment.getCounts()
print(langCounts , "\n")
# 根据结果获取内容的主要语种 (语言,字数含标点)
lang , count = langCounts[0]
print(f"输入内容的主要语言为 = {lang} ,字数 = {count}")
print("==================================================\n")
# ===================【语种统计】===================
# [('zh', 51), ('en', 33), ('ja', 19), ('ko', 5)]
# 输入内容的主要语言为 = zh ,字数 = 51
# ==================================================
# 过滤器测试:
text = "English中文"
LangSegment.setfilters(["en"]) # 仅输出英文
print(LangSegment.getTexts(text))
# [{'lang': 'en', 'text': 'English '}]
LangSegment.setfilters(["zh"]) # 仅输出中文
print(LangSegment.getTexts(text))
# [{'lang': 'zh', 'text': '中文'}]
text = "ある\"予言\"の中だけに登場する伝説上の聖騎士,English,中文输入"
LangSegment.setfilters(["zh-en-ja-ko"]) # 仅输出:中英日韩
print(LangSegment.getfilters(),LangSegment.getTexts(text))
# ['all'] [{'lang': 'ja', 'text': 'ある"予言"の中だけに登場する伝説上の聖騎士,'}, {'lang': 'en', 'text': 'English, '}, {'lang': 'zh', 'text': '中文输入'}]
LangSegment.setfilters(["en"]) # 仅输出英文=en
print(LangSegment.getfilters(),LangSegment.getTexts(text))
# ['en'] [{'lang': 'en', 'text': 'English, '}]
LangSegment.setfilters(["zh"]) # 仅输出中文=zh
print(LangSegment.getfilters(),LangSegment.getTexts(text))
# ['zh'] [{'lang': 'zh', 'text': '中文输入'}]
LangSegment.setfilters(["ja"]) # 仅输出日文=ja
print(LangSegment.getfilters(),LangSegment.getTexts(text))
# ['ja'] [{'lang': 'ja', 'text': 'ある"予言"の中だけに登場する伝説上の聖騎士,'}]
LangSegment.setfilters(["zh-en"]) # 仅输出中文=zh,英文=en
print(LangSegment.getfilters(),LangSegment.getTexts(text))
# ['zh-en'] [{'lang': 'en', 'text': 'English, '}, {'lang': 'zh', 'text': '中文输入'}]