Skip to content

重构创造性 Agent Loop 评测、来源审计与离线执行框架 - #1

Draft
sherlock0717 wants to merge 132 commits into
mainfrom
agent/rebuild-creative-agent-loop-eval
Draft

重构创造性 Agent Loop 评测、来源审计与离线执行框架#1
sherlock0717 wants to merge 132 commits into
mainfrom
agent/rebuild-creative-agent-loop-eval

Conversation

@sherlock0717

@sherlock0717 sherlock0717 commented Jul 13, 2026

Copy link
Copy Markdown
Owner

当前重构范围

  • 清理旧版办公任务、旧结果文件、冲突README和无关实现;
  • 重写GitHub Pages,展示研究问题、四类Suite、四种Loop和36个Case;
  • 每题包含题面、局部工具环境、结构化Gold、Rubric锚点和通过/边界/失败样例;
  • 补充资料筛选、来源审计、评测协议、Rubric手册、后训练诊断、离线管线、扰动协议和局限说明。

数据来源状态

  • 36题均为项目试测题;
  • 四类Suite和来源家族在逐题生成前确定;
  • 题面、工具环境、Gold、Rubric和边界样例均由AI助手生成首稿;
  • 直接复制公开Benchmark题目:0;
  • 用户逐题审定:0;
  • 独立专家验证:0;
  • adapted_parallel:27题;
  • original_diagnostic:9题。

公开研究用于方法、任务结构、构念和错误分类参考,当前数据不标记为公开Benchmark原题。CI会导出完整36题人工审阅包和逐题决策表。

数据与评测合同

  • Case:36,四个Suite各9题;
  • Pilot题面:36;
  • Rubric Criterion:171;
  • 边界样例:108;
  • 声明工具:132;
  • 可生成基线fixture:36题、132个工具入口全部覆盖;
  • 手工Case级fixture:B04作为首个精确实现;
  • 自动检查:173项。

自动检查能力分类:

  • 确定性规则:56;
  • 结构化输出检查:55;
  • Trace依赖:18;
  • Case fixture依赖:31;
  • 语义判断:13。

当前边界回归:

  • supported:45;
  • underdetermined:63;
  • contradicted:0。

已完成的执行能力

  • L0单次生成、L1批评修订、L2发散收敛、L3工具验证;
  • Scripted Provider离线干跑;
  • DeepSeek V4 Provider与单Case手动API入口;
  • Trace记录候选、批评、修订、工具调用、失败、重试、重新验证和停止决策;
  • 可恢复工具异常注入与重试;
  • 输出Oracle、Trace Oracle和Criterion级评分;
  • 运行账本、断点续跑、失败上限;
  • 默认离线矩阵:36 Case × 4 Loop × 3标签,共432个Run;
  • 可靠性变体:每题6类,共216个Variant Spec;
  • CI生成fixture、审计报告、实验计划、变体计划、Trace、评分、完整审阅包和摘要Artifact;
  • 62项待人工定义条件已导出:31项fixture、18项Trace、13项语义判断。

最新线上校验

GitHub Actions Run #88完整通过:

  • 注册表校验;
  • 36题fixture生成;
  • 评测合同审计;
  • 432次离线实验计划;
  • 216个变体计划;
  • 36题完整审阅包与62项判据清单导出;
  • 25 passed
  • L0—L3干跑;
  • 36次离线回归样本;
  • 页面JavaScript和仓库清理检查;
  • Artifact上传。

离线样本只验证工程管线,不代表模型能力。

Actions通知问题处理

  • 验证工作流只监听main推送和PR事件,功能分支不再同时触发重复push检查;
  • 增加并发取消,旧运行会在新同步到来时停止;
  • API冒烟工作流在缺少DEEPSEEK_API_KEY时正常结束且不发送请求;
  • pytest完整输出写入Artifact,后续失败可以直接定位。

当前边界

  • 尚未使用真实DeepSeek API生成正式评测数据;
  • API入口当前只覆盖L0单Case冒烟测试;
  • 36题尚待用户逐题决定保留、修改、移除或重做;
  • 31项Case fixture依赖等待精确物理、关系或状态定义;
  • 18项Trace依赖等待事件和恢复判据确认;
  • 13项语义判断等待Judge与人工校准;
  • 等价措辞和输出表面变体尚未冻结;
  • GitHub Pages公开地址仍由main分支部署,合并前不会切换新版页面。

@sherlock0717
sherlock0717 force-pushed the agent/rebuild-creative-agent-loop-eval branch from 484e99a to bad0bd9 Compare July 13, 2026 12:49
@sherlock0717 sherlock0717 changed the title 重构创造性 Agent Loop 评测页面与可执行框架 重构创造性 Agent Loop 评测与离线执行框架 Jul 13, 2026

Copy link
Copy Markdown
Owner Author

Actions失败记录与处理

本轮核查到的失败均发生在重构过程的中间提交,当前Head已经通过完整校验。

  • 早期验证工作流同时监听功能分支pushpull_request,同一同步可能出现两次运行与重复邮件;现已改为只检查main推送和PR事件,并加入并发取消。
  • API冒烟工作流原先在未配置DEEPSEEK_API_KEY时主动退出失败;现改为提示并正常结束,不发送请求。
  • Run #77:评分模块错误导入不存在的summary_oracles,导致CLI启动失败;已修正。
  • Run #83:新增显式stop_decision后,旧Trace测试仍要求原事件列表;已更新测试合同。
  • Run #84/#85:离线样本前12个Run没有Trace依赖检查,测试却要求Trace判定数必须大于0;已改为验证字段结构,并由专用工具恢复测试验证Trace判定。
  • Run #86:完整成功,24项测试通过,fixture、审计、实验计划、变体计划、四类Loop干跑、离线样本、页面检查和Artifact上传全部通过。

当前PR仍为Draft,尚未合并,也没有调用真实DeepSeek API。

@sherlock0717 sherlock0717 changed the title 重构创造性 Agent Loop 评测与离线执行框架 重构创造性 Agent Loop 评测、来源审计与离线执行框架 Jul 13, 2026
Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Labels

None yet

Projects

None yet

Development

Successfully merging this pull request may close these issues.

1 participant