Skip to content

Latest commit

 

History

8 Commits

Folders and files

NameName
Last commit message
Last commit date
 
 
 
 
 
 
 
 
 
 
 
 
 
 

Repository files navigation

GenPark AI Agent Skill - Reinforcement Fine-Tuning Trajectory Buffer

A zero-pip-dependency Python standard library skill providing a prioritized experience replay buffer and Group Relative Policy Optimization (GRPO / DeepSeekMath) advantage estimator for autonomous agent self-training.

Architecture

graph TD
    A[Agent Multi-Step Execution Trajectory] --> B[Task Reward Evaluator]
    B --> C[(Prioritized Trajectory Buffer)]
    C --> D[Priority Sampling: P ~ |Reward|^alpha]
    D --> E[Importance Sampling Weights: w ~ P^-beta]
    C --> F[Group Relative Advantage Estimator GRPO]
    F --> G[Normalized Advantage: (R - Mean) / Std]
    E --> H[Policy Gradient Update Batch]
    G --> H
Loading

Features

  • Prioritized Stratified Sampling: Focuses learning on high-impact failures and breakthroughs.
  • Group Relative Advantage Estimation (GRPO): Self-normalizing baseline without a dedicated critic network.
  • Zero Pip Dependencies: Standard Library Only.

Citations & Ecosystem

About

GenPark AI Agent Skill - Prioritized experience replay buffer for agent reinforcement fine-tuning (RFT / GRPO) with advantage estimation and importance sampling weights.

Topics

Resources

Stars

8 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages