Skip to content

Latest commit

 

History

History
125 lines (86 loc) · 5.21 KB

File metadata and controls

125 lines (86 loc) · 5.21 KB

Loop 提效验证实验报告

把"纸面价值"变成"数据支撑的落地价值"。用真实 LLM(中转 deepseek-v4 + qwen3.7)在已知 bug 金标准上验证 loop 提效是否真实。


一、实验结论(TL;DR)

loop 提效真实有效,达决策门标准

维度 结果 决策门 判定
审查召回率 100% (10/10) ≥70% ✅ 达标
审查精度(增强) 71% 假阳性≤30% ✅ 达标(裸36%→增强71%)
修复正确率 100% (5/5) ≥70% ✅ 达标
修根因率(非症状) 100% (5/5) ✅ 超预期

核心发现:方法论注入的价值在精度(过滤假阳性)和根因修复,而非召回(强模型本身能发现 bug)。


二、组 A:方法论价值(裸 vs 增强 reviewer)

对 10 个已知 bug,分别用裸 prompt 和增强 prompt(注入对抗验证 + 置信度≥80 + 9 安全模式)审查。

指标 增强 变化
召回率 100% (10/10) 100% (10/10) 持平
总报数 28 14 -50%
假阳性数 18 4 -78%
精度 36% 71% +35pp

解读

  • deepseek-v4 足够强,10 个 bug 都能发现(召回不是瓶颈)
  • 但裸 reviewer 报太多(28 条,18 假阳性)→ review 者时间浪费在筛假阳性
  • 增强 reviewer 克制精准(14 条,仅 4 假阳性)→ 对抗验证 + 置信度门槛生效
  • 价值 = 过滤假阳性:精度 +35pp,假阳性 -78%

三、组 B:闭环修复价值(bug-fixer + LLM-judge)

挑 5 个 bug(安全/正确性/边界 × 易中难),bug-fixer(注入 bug-hunting 根因五步法)修复,LLM-judge 验证。

Bug 难度 修复正确 修根因 根因修复
B01 SQL注入 easy 参数化查询(非转义过滤)
B04 null easy 入口显式校验抛 ValueError
B06 折扣逻辑 medium 加改减(逻辑根因)
B08 竞态 hard 双重检查锁定 DCL 消除竞态
B10 除零 easy 分母检查(非 try 掩盖)

结果:修复正确率 100%,修根因率 100%。bug-hunting 根因法注入有效——包括 hard 级竞态也修对且修根因。


四、实验暴露的工程问题(验证的真实价值)

这些不真跑不可能发现,已修复并沉淀:

问题 现象 根因 修复
reasoning 模型 thinking block 调用返回空 text content[0] 是 thinking 非text;max_tokens 被思考吃光 解析跳过 thinking 取 text block;max_tokens 调大 4096
中英关键词不匹配 召回初跑 50%(假漏报) 模型中文回答"空值",expected 英文"null" 判定加中英同义词映射
中转 auth 方式未知 认证失败 x-api-key vs Bearer Step0 冒烟确认 x-api-key

这些是生产接入必踩的坑,已沉淀进 experiment/llm_call.py——团队接入真实模型时直接受益。


五、成本

总调用数 ~50 次(组A 40 + 组B 10)
模型 deepseek-v4(review/fix)+ qwen3.7(judge)
单次最慢 ~30s(reasoning 模型 thinking)
发现 reasoning 模型贵于普通,但审查/修复质量对得起

六、决策门判定

指标 阈值 实际 判定
召回率 ≥70% 100% ✅ 通过
假阳性率(增强) ≤30% 28% ✅ 通过
修复正确率 ≥70% 100% ✅ 通过
修根因率 100% ✅ 超预期

结论:loop 当前配置(方法论注入 + deepseek-v4)提效真实有效,达推广标准


七、最终判断(回应用户的评估问题)

"当前项目对 AI 编程提效是否有价值?"

有,且现在有数据支撑(不再是纸面):

  1. 方法论层:bug-hunting 根因法、对抗验证、置信度门槛——实测有效(精度 +35pp、根因率 100%)
  2. 自动化闭环层:review→fix→test 的 loop——实测能正确修复(含 hard 级竞态)
  3. 工程经验层:reasoning 模型适配、判定口径——已沉淀

确定性价值:方法论 + 架构 + 工程经验(这次验证产出)。 待扩展:真实 PR 规模验证、多模型对比、CI 集成观测。

对企业数字人平台(回原评估)

  • 引擎层(agent 编排/fallback/hook)有沉淀复用价值——本次验证的 reasoning 模型适配正是通用工程经验
  • 应用层(研发 loop/编程 skills)是编程专属,不直接迁移数字人——结论不变

附:实验资产

experiment/
├── bug_seeds.py      # 10个已知bug金标准 (易中难/安全正确性边界)
├── llm_call.py       # LLM调用层 (urllib直调中转, reasoning模型适配)
├── run_group_a.py    # 组A: 裸vs增强reviewer对比
└── run_group_b.py    # 组B: fix+judge闭环验证

可复跑:cd experiment && python run_group_a.py && python run_group_b.py


验证完成:纸面价值 → 数据支撑的落地价值。loop 提效真实有效,达推广标准。