Skip to content

LLM - LARGE LANGUAGE MODEL BAHASA INDONESIA

INTISARI adalah proyek riset dan pengembangan model bahasa Indonesia yang dibangun from scratch, dengan fokus pada model kecil yang tetap mampu menghasilkan bahasa yang natural dan koheren.

Pendekatan INTISARI bukan mengejar dataset sebesar mungkin, tetapi tiny, high-quality dataset yang dirancang dan dikurasi secara ketat. Data yang lebih terkontrol membantu menjaga konsistensi pola bahasa, konteks, dan perilaku model, sehingga kualitas dapat ditingkatkan tanpa harus terus memperbesar ukuran dataset.

Preview

https://intisari.flatseek.io

Model

  • Base — mempelajari fondasi dan pola bahasa Indonesia dari awal.
  • Instruct — mengembangkan Base agar mampu memahami dan mengikuti instruksi.
  • Chat — mengoptimalkan kemampuan percakapan yang natural, koheren, dan kontekstual.

Pengembangan

INTISARI mengeksplorasi:

  • Tiny high-quality datasets — memprioritaskan kualitas dan konsistensi data dibanding jumlah.
  • Synthetic data — menghasilkan data terkontrol untuk target kemampuan tertentu.
  • Data curation — menjaga kualitas, variasi, dan koherensi dataset.
  • Pretraining — membangun kemampuan bahasa dari nol.
  • Instruction & conversational tuning — mengembangkan Base menjadi Instruct dan Chat.
  • Iterative evaluation — menguji dataset dan strategi training secara berulang.
  • Efficient inference — mempertahankan model agar tetap praktis dijalankan dengan sumber daya terbatas.

Small data. Small models. High quality.

Indonesian language intelligence, built from scratch.

Popular repositories Loading

  1. intisari-base-v1 intisari-base-v1 Public

    Eksperimen LLM Bahasa Indonesia tiny yang dilatih dari scratch dengan ~10M parameter. Base model untuk mempelajari pola bahasa, kosakata, struktur kalimat, dan text continuation Bahasa Indonesia.

  2. .github .github Public

Repositories

Showing 2 of 2 repositories

Top languages

Loading…

Most used topics

Loading…