-
Notifications
You must be signed in to change notification settings - Fork 0
Expand file tree
/
Copy pathvalidators.py
More file actions
52 lines (46 loc) · 2.08 KB
/
Copy pathvalidators.py
File metadata and controls
52 lines (46 loc) · 2.08 KB
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
import re
PREDEFINED_TAGS = [
"стих", "скороговорка", "пословица", "вопрос", "число",
"фонетика", "приветствие", "команда", "диалог", "описание",
"эмоция", "семья", "еда", "погода", "учёба"
]
def validate_avar_text(text: str) -> bool:
"""Проверка аварского текста на наличие обязательных символов (опционально) и отсутствие мусора."""
if not text.strip():
return False
# Аварский алфавит + специфический символ ӏ (U+04CF)
# Здесь можно добавить более строгую проверку, если нужно.
return True
def count_words(text: str) -> int:
"""Подсчет слов в фразе."""
return len(re.findall(r'\w+', text))
def get_category_by_tags(tags: list, word_count: int) -> str:
"""Автоклассификация по тегам и количеству слов."""
if "стих" in tags:
return "poems"
if "скороговорка" in tags:
return "tongue_twisters"
if "пословица" in tags:
return "proverbs"
if "вопрос" in tags:
return "questions"
if "число" in tags:
return "numbers"
if "фонетика" in tags:
return "phonetic"
if 1 <= word_count <= 4:
return "short"
elif 5 <= word_count <= 8:
return "medium"
else:
return "long"
def extract_phonetic_features(text: str) -> list:
"""Извлечение специфических аварских символов из текста."""
# Символ ӏ (U+04CF) и сочетания с ним
features = []
if 'ӏ' in text:
features.append('ӏ')
# Можно добавить другие сочетания: кӏ, пӏ, тӏ, цӏ, чӏ и т.д.
matches = re.findall(r'[кптцч]ӏ', text, re.IGNORECASE)
features.extend(list(set(matches)))
return sorted(list(set(features)))