-
Notifications
You must be signed in to change notification settings - Fork 82
[RL][Phase 6] Orchestrate one AlphaZero training iteration #1081
Copy link
Copy link
Open
Labels
C-rlCategory: Search, self-play, reinforcement learning, and training.Category: Search, self-play, reinforcement learning, and training.P-importantPriority: Other work depends on this, or it is low-level and critical.Priority: Other work depends on this, or it is low-level and critical.T-featureType: New capability or supported behavior.Type: New capability or supported behavior.
Description
Activity
Metadata
Metadata
Assignees
Labels
C-rlCategory: Search, self-play, reinforcement learning, and training.Category: Search, self-play, reinforcement learning, and training.P-importantPriority: Other work depends on this, or it is low-level and critical.Priority: Other work depends on this, or it is low-level and critical.T-featureType: New capability or supported behavior.Type: New capability or supported behavior.
Parent: #1058
Epic: #1052
Goal
Run self-play, replay sampling, training, and candidate creation as one reproducible iteration.
Scope
Non-goals
Acceptance criteria
Verification
Add one small iteration smoke test for each trainer frontend.