Skip to content

feat(training): 新增 reward 评分端点 /admin/api/fine-tune/reward/score (Phase1→Phase2 闭环) #431

Description

@dahai80

需求

RLSL 两阶段流水线的闭环缺一个 reward 评分端点。

缺口:Phase 1 训出的 reward adapter 没有任何 HTTP 端点把它作为评分服务暴露出来。现有 /admin/api/fine-tune/logprob 返回的是 policy 的 sum log p(completion|prompt),不是 reward model 的标量分数。因此 Phase 2 的 reward_endpoint 无处可指,两阶段无法闭环。

需求

新增 POST /admin/api/fine-tune/reward/score

请求: {model_id, adapter_name, prompt, completions: [str]}
响应: {rewards: [float], model_id, adapter_name}

语义:加载 model_id + 已训练的 reward adapter_name(value head),对每个 (prompt, completion) 算标量 reward(RewardTrainer._score 的非可微推理版本:前向取 last-token hidden → value_head 投影),逐项返回。len(rewards) == len(completions)

验收

  • Phase 1 训完 reward adapter 后,调用本端点可拿到逐 completion 的标量 reward,score(chosen) > score(rejected) 与训练目标一致。
  • 把本端点 URL 作为 reward_endpoint 传给 GRPO 作业,GRPO 能跑通真实 reward-guided 策略更新(非 length fallback)。
  • fusion-trainer RLSL 流水线 Phase1→Phase2 闭环可跑通真实集成测试。

关联

Metadata

Metadata

Assignees

No one assigned

    Labels

    enhancementNew feature or request

    Projects

    No projects

    Milestone

    No milestone

    Relationships

    None yet

    Development

    No branches or pull requests

    Issue actions