Skip to content

任务:应用评估接口 #1

Description

@Protocol-zero-0

任务 :应用评估接口

一句话目标

https://github.com/Protocol-zero-0/evolution-kernel 准备应用侧评估接口:先让 Token-Ignition evaluator 成为第一个可进化目标,同时为 ClawOSS 写出后续接入规范。

背景

最终项目会收敛成三类成果:

本任务不负责做通用内核,只负责定义应用中“什么叫变好”,并输出 K 可调用的评估结果。

Part 1:Token-Ignition evaluator suite

https://github.com/Protocol-zero-0/token-ignition-backend 建立一套 evaluator cases 和评估脚本。

参考:

必须覆盖这些协议点:

  • R7 ablation
  • baseline log
  • evolution axes
  • long-horizon scaffold
  • reproducible micro-run

必须实现

  1. 建立 cases 文件,例如:
adapters/token_ignition/evaluator_cases.json
  1. 建立评估脚本,例如:
adapters/token_ignition/evaluate_cases.py
  1. 输出 K 可消费的 JSON report:
{
  "hard_gates_passed": true,
  "recommendation": "accept",
  "metrics": {
    "total": 20,
    "correct": 18,
    "golden_accuracy": 0.9,
    "adversarial_accuracy": 0.875,
    "false_positive_count": 1,
    "false_negative_count": 1
  },
  "failures": [],
  "risks": []
}

cases 要求

至少 20 个 cases,其中至少 8 个 adversarial cases,至少 3 个“真实但粗糙,应 conditional / accept”的 cases。

必须覆盖:

  • prompt-only wrapper
  • non-reproducible demo
  • fake ablation
  • hardcoded benchmark
  • cherry-picked logs
  • endpoint prompt injection
  • over-complex agent swarm
  • baseline better than scaffold
  • real but rough high-potential system
  • strong minimal evolution system

Part 2:ClawOSS adapter spec

为 ClawOSS 写一个接入规范文档,例如:

docs/clawoss-evolution-adapter.md

本阶段只写 spec,不要求完整接入。

参考:

文档必须定义:

  1. ClawOSS 的 evidence schema
  2. ClawOSS 的 score report schema
  3. hard reject rules
  4. 允许 K 修改的文件范围
  5. 禁止 K 修改的文件范围

ClawOSS 必须 hard reject 的行为

  • 绕过 budget pause
  • 降低 blocklist / avoidRepos 保护
  • 鼓励 spam PR
  • 只优化 PR 数量
  • 忽视 maintainer negative feedback
  • 自动扩大权限
  • 引入新 secret
  • pauseAgent=true 时继续工作

必须明确指出一个风险:

HEARTBEAT.md 强调 NEVER idle / ALWAYS work,但 budget pause 要求 agent 停止。

修正原则:

dashboard pause / budget exhausted 的优先级必须高于 heartbeat work loop。

不要做

  • 不做完整红队平台
  • 不做自动 case 生成器
  • 不做 ClawOSS 自动进化
  • 不做 dashboard 大改
  • 不做多模型共识重构
  • 不做复杂数学指标
  • 不做线上部署
  • 不做前端视觉改版

评估脚本核心代码建议控制在 500 行以内,cases 数据不计入。

验收标准

必须证明:

  1. evaluate_cases.py 能读取 cases 并输出 report。
python3 adapters/token_ignition/evaluate_cases.py \
  --cases adapters/token_ignition/evaluator_cases.json \
  --output /tmp/report.json
  1. /tmp/report.json 包含:
hard_gates_passed
recommendation
metrics
failures
risks
  1. cases 数量达标:
  • total >= 20
  • adversarial >= 8
  • real-but-rough >= 3
  1. report 能统计:
  • false_positive_count
  • false_negative_count
  • adversarial_accuracy
  • golden_accuracy
  1. ClawOSS adapter 文档完整包含:
  • evidence schema
  • score report schema
  • hard reject rules
  • allowed mutation scope
  • forbidden mutation scope
  • pauseAgent=true 最高优先级说明

交付物

PR 描述必须写清:

  • 实现了什么
  • 没有实现什么
  • 如何验收
  • 当前限制
  • Future Work

成功定义

不是做复杂应用系统,而是让应用暴露清晰、可复现、可对抗测试、可被 K 调用的评估接口。

Metadata

Metadata

Assignees

No one assigned

    Labels

    No labels
    No labels

    Projects

    No projects

    Milestone

    No milestone

    Relationships

    None yet

    Development

    No branches or pull requests

    Issue actions