Skip to content

Repository files navigation

Construcción experimental de modelos de lenguaje pequeños

Unidad ejecutable del Semillero GIDSYC para estudiar, mediante notebooks reproducibles, cómo se construye y entrena un modelo de lenguaje autoregresivo pequeño.

El curso tiene propósito formativo y experimental. No busca producir un modelo competitivo, ni reemplaza cursos sobre ChatGPT, prompting, RAG, LoRA, QLoRA o adaptación de modelos grandes.

Flujo autoregresivo de un modelo de lenguaje

Un modelo de lenguaje pequeño aprende una distribución sobre el siguiente token dado un contexto anterior.

Inicio rápido

Abra esta carpeta como raíz del proyecto:

courses/construccion_experimental_modelos_lenguaje_pequenos/

Instale las dependencias:

pip install -r requirements.txt

Abra JupyterLab desde la raíz del curso:

jupyter lab

Luego ejecute los notebooks en orden, seleccionando el kernel de Python configurado para el curso.

Documentos principales

  • syllabus.pdf: propósito académico, resultados de aprendizaje, módulos y evaluación sugerida.
  • guia_configuracion_curso/guia_configuracion_curso.pdf: instalación del entorno, datasets, checkpoint y verificaciones operativas.
  • docs/ruta_notebooks.pdf: secuencia conceptual de notebooks.
  • assets/audio/presentacion_curso.mp3: audio breve de presentación del curso.

Estructura de la carpeta

notebooks/                  Cuadernos ejecutables del curso
materiales/                 Notas técnicas públicas por notebook
guia_configuracion_curso/   Guía operativa del entorno
assets/                     Branding, figuras y recursos de apoyo
data/                       Corpus y datasets usados por los notebooks
models/                     Checkpoint pequeño del mini modelo
src/                        Utilidades de Python usadas por notebooks
docs/                       Documentación auxiliar para estudiantes

Ruta de notebooks

00_introduccion_tecnica_modelos_lenguaje.ipynb
01_tokenizacion_y_representacion_texto.ipynb
02_preparacion_corpus_y_dataset.ipynb
03_modelo_bigramas_y_prediccion_simple.ipynb
04_embeddings_y_representacion_distribuida.ipynb
05_atencion_causal.ipynb
06_bloque_transformer_decoder.ipynb
07_entrenamiento_autoregresivo_mini_modelo.ipynb
08_generacion_texto_y_muestreo.ipynb
09_experimentos_controlados.ipynb
10_analisis_errores_y_limites.ipynb
11_proyecto_final.ipynb

Datos y checkpoint

El curso incluye los archivos necesarios para ejecutar la ruta estándar:

data/raw/
data/processed/
models/mini_transformer_tinystories_es.pt

La guía de configuración explica cómo verificar esos archivos. El checkpoint permite ejecutar los notebooks de generación y análisis sin repetir entrenamiento completo.

Entorno

Se recomienda Python 3.10 o superior, JupyterLab, NumPy, Pandas, Matplotlib, PyTorch y tqdm. Los notebooks usan GPU cuando torch.cuda.is_available() es verdadero, pero varias secciones conceptuales pueden ejecutarse en CPU.

En el entorno local de desarrollo se usó Python (dl-env). En otra máquina puede usarse cualquier kernel equivalente que tenga instaladas las dependencias de requirements.txt.

Materiales de estudio

Cada notebook cerrado tiene una nota técnica en:

materiales/<nn_slug_notebook>/nota_tecnica.pdf

Use esas notas como lectura de apoyo antes o después de ejecutar el notebook correspondiente.

About

Curso formativo y experimental para construir, entrenar y analizar modelos de lenguaje autoregresivos pequeños.

Topics

Resources

Stars

0 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages