Skip to content

Missing Feature – Model Evaluation Pipeline #7

Description

@Codex-Crusader

Currently, new checkpoints are trained but not evaluated against previous versions.

Problem:

  1. Cannot confirm if a new checkpoint is stronger
  2. AlphaZero requires model replacement only if a new network wins in evaluation matches

Impact:
Risk of model regression (worse networks replacing better ones)

Recommendation:

  1. Implement evaluation function:
  2. New model plays N games vs previous best
  3. Replace only if win-rate crosses threshold (e.g., 55–60%)

Metadata

Metadata

Assignees

No one assigned

    Labels

    Projects

    No projects

    Milestone

    No milestone

    Relationships

    None yet

    Development

    No branches or pull requests

    Issue actions