Structured dataset of Valmiki Ramayana 📜 | Sanskrit Shlokas, Translations, & Explanations for AI & NLP🚀 Contributions welcome!
-
Updated
Jun 22, 2026 - Python
Structured dataset of Valmiki Ramayana 📜 | Sanskrit Shlokas, Translations, & Explanations for AI & NLP🚀 Contributions welcome!
This repository provides a character-level model for Sanskrit text classification, predicting whether each character in a word is part of a Sandhi point (SP) or not (NSP). It includes preprocessing, training with an MLP model, and APIs (FastAPI) and a Telegram bot for easy predictions.
SageGPT: A ~7.2M parameter Sanskrit-only decoder-only Transformer SLM trained from scratch on a 139 MB tokenized Sanskrit corpus containing 72.8M SentencePiece model-token IDs, derived from a 105.2M-character purified Sanskrit text corpus using NVIDIA DGX Spark. Architecture: 6 layers, 8 attention heads, 256 embedding dim, 1024 context, 8K vocab.
DAL-GAN-PS: A dual-adversarial low-resource NLP framework for Sanskrit text generation using GANs, cross-lingual transfer, and PhonoScript linguistic constraints.
Sanskrit Karaka Calling Convention: Semantic-Role Argument Binding for Logic Programming, via Paninian Grammar
To associate your repository with the sanskrit-nlp topic, visit your repo's landing page and select "manage topics."