任务 :应用评估接口
一句话目标
为 https://github.com/Protocol-zero-0/evolution-kernel 准备应用侧评估接口:先让 Token-Ignition evaluator 成为第一个可进化目标,同时为 ClawOSS 写出后续接入规范。
背景
最终项目会收敛成三类成果:
本任务不负责做通用内核,只负责定义应用中“什么叫变好”,并输出 K 可调用的评估结果。
Part 1:Token-Ignition evaluator suite
为 https://github.com/Protocol-zero-0/token-ignition-backend 建立一套 evaluator cases 和评估脚本。
参考:
必须覆盖这些协议点:
- R7 ablation
- baseline log
- evolution axes
- long-horizon scaffold
- reproducible micro-run
必须实现
- 建立 cases 文件,例如:
adapters/token_ignition/evaluator_cases.json
- 建立评估脚本,例如:
adapters/token_ignition/evaluate_cases.py
- 输出 K 可消费的 JSON report:
{
"hard_gates_passed": true,
"recommendation": "accept",
"metrics": {
"total": 20,
"correct": 18,
"golden_accuracy": 0.9,
"adversarial_accuracy": 0.875,
"false_positive_count": 1,
"false_negative_count": 1
},
"failures": [],
"risks": []
}
cases 要求
至少 20 个 cases,其中至少 8 个 adversarial cases,至少 3 个“真实但粗糙,应 conditional / accept”的 cases。
必须覆盖:
- prompt-only wrapper
- non-reproducible demo
- fake ablation
- hardcoded benchmark
- cherry-picked logs
- endpoint prompt injection
- over-complex agent swarm
- baseline better than scaffold
- real but rough high-potential system
- strong minimal evolution system
Part 2:ClawOSS adapter spec
为 ClawOSS 写一个接入规范文档,例如:
docs/clawoss-evolution-adapter.md
本阶段只写 spec,不要求完整接入。
参考:
文档必须定义:
- ClawOSS 的 evidence schema
- ClawOSS 的 score report schema
- hard reject rules
- 允许 K 修改的文件范围
- 禁止 K 修改的文件范围
ClawOSS 必须 hard reject 的行为
- 绕过 budget pause
- 降低 blocklist / avoidRepos 保护
- 鼓励 spam PR
- 只优化 PR 数量
- 忽视 maintainer negative feedback
- 自动扩大权限
- 引入新 secret
pauseAgent=true 时继续工作
必须明确指出一个风险:
HEARTBEAT.md 强调 NEVER idle / ALWAYS work,但 budget pause 要求 agent 停止。
修正原则:
dashboard pause / budget exhausted 的优先级必须高于 heartbeat work loop。
不要做
- 不做完整红队平台
- 不做自动 case 生成器
- 不做 ClawOSS 自动进化
- 不做 dashboard 大改
- 不做多模型共识重构
- 不做复杂数学指标
- 不做线上部署
- 不做前端视觉改版
评估脚本核心代码建议控制在 500 行以内,cases 数据不计入。
验收标准
必须证明:
evaluate_cases.py 能读取 cases 并输出 report。
python3 adapters/token_ignition/evaluate_cases.py \
--cases adapters/token_ignition/evaluator_cases.json \
--output /tmp/report.json
/tmp/report.json 包含:
hard_gates_passed
recommendation
metrics
failures
risks
- cases 数量达标:
- total >= 20
- adversarial >= 8
- real-but-rough >= 3
- report 能统计:
- false_positive_count
- false_negative_count
- adversarial_accuracy
- golden_accuracy
- ClawOSS adapter 文档完整包含:
- evidence schema
- score report schema
- hard reject rules
- allowed mutation scope
- forbidden mutation scope
pauseAgent=true 最高优先级说明
交付物
PR 描述必须写清:
- 实现了什么
- 没有实现什么
- 如何验收
- 当前限制
- Future Work
成功定义
不是做复杂应用系统,而是让应用暴露清晰、可复现、可对抗测试、可被 K 调用的评估接口。
任务 :应用评估接口
一句话目标
为 https://github.com/Protocol-zero-0/evolution-kernel 准备应用侧评估接口:先让 Token-Ignition evaluator 成为第一个可进化目标,同时为 ClawOSS 写出后续接入规范。
背景
最终项目会收敛成三类成果:
Token-Ignition:人才筛选应用本任务不负责做通用内核,只负责定义应用中“什么叫变好”,并输出 K 可调用的评估结果。
Part 1:Token-Ignition evaluator suite
为 https://github.com/Protocol-zero-0/token-ignition-backend 建立一套 evaluator cases 和评估脚本。
参考:
必须覆盖这些协议点:
必须实现
{ "hard_gates_passed": true, "recommendation": "accept", "metrics": { "total": 20, "correct": 18, "golden_accuracy": 0.9, "adversarial_accuracy": 0.875, "false_positive_count": 1, "false_negative_count": 1 }, "failures": [], "risks": [] }cases 要求
至少 20 个 cases,其中至少 8 个 adversarial cases,至少 3 个“真实但粗糙,应 conditional / accept”的 cases。
必须覆盖:
Part 2:ClawOSS adapter spec
为 ClawOSS 写一个接入规范文档,例如:
本阶段只写 spec,不要求完整接入。
参考:
文档必须定义:
ClawOSS 必须 hard reject 的行为
pauseAgent=true时继续工作必须明确指出一个风险:
修正原则:
不要做
评估脚本核心代码建议控制在 500 行以内,cases 数据不计入。
验收标准
必须证明:
evaluate_cases.py能读取 cases 并输出 report。/tmp/report.json包含:pauseAgent=true最高优先级说明交付物
evaluator_cases.jsonevaluate_cases.pyexample_score_report.jsondocs/clawoss-evolution-adapter.mdPR 描述必须写清:
成功定义
不是做复杂应用系统,而是让应用暴露清晰、可复现、可对抗测试、可被 K 调用的评估接口。