把"纸面价值"变成"数据支撑的落地价值"。用真实 LLM(中转 deepseek-v4 + qwen3.7)在已知 bug 金标准上验证 loop 提效是否真实。
loop 提效真实有效,达决策门标准:
| 维度 | 结果 | 决策门 | 判定 |
|---|---|---|---|
| 审查召回率 | 100% (10/10) | ≥70% | ✅ 达标 |
| 审查精度(增强) | 71% | 假阳性≤30% | ✅ 达标(裸36%→增强71%) |
| 修复正确率 | 100% (5/5) | ≥70% | ✅ 达标 |
| 修根因率(非症状) | 100% (5/5) | — | ✅ 超预期 |
核心发现:方法论注入的价值在精度(过滤假阳性)和根因修复,而非召回(强模型本身能发现 bug)。
对 10 个已知 bug,分别用裸 prompt 和增强 prompt(注入对抗验证 + 置信度≥80 + 9 安全模式)审查。
| 指标 | 裸 | 增强 | 变化 |
|---|---|---|---|
| 召回率 | 100% (10/10) | 100% (10/10) | 持平 |
| 总报数 | 28 | 14 | -50% |
| 假阳性数 | 18 | 4 | -78% ⭐ |
| 精度 | 36% | 71% | +35pp ⭐ |
解读:
- deepseek-v4 足够强,10 个 bug 都能发现(召回不是瓶颈)
- 但裸 reviewer 报太多(28 条,18 假阳性)→ review 者时间浪费在筛假阳性
- 增强 reviewer 克制精准(14 条,仅 4 假阳性)→ 对抗验证 + 置信度门槛生效
- 价值 = 过滤假阳性:精度 +35pp,假阳性 -78%
挑 5 个 bug(安全/正确性/边界 × 易中难),bug-fixer(注入 bug-hunting 根因五步法)修复,LLM-judge 验证。
| Bug | 难度 | 修复正确 | 修根因 | 根因修复 |
|---|---|---|---|---|
| B01 SQL注入 | easy | ✓ | ✓ | 参数化查询(非转义过滤) |
| B04 null | easy | ✓ | ✓ | 入口显式校验抛 ValueError |
| B06 折扣逻辑 | medium | ✓ | ✓ | 加改减(逻辑根因) |
| B08 竞态 | hard | ✓ | ✓ | 双重检查锁定 DCL 消除竞态 |
| B10 除零 | easy | ✓ | ✓ | 分母检查(非 try 掩盖) |
结果:修复正确率 100%,修根因率 100%。bug-hunting 根因法注入有效——包括 hard 级竞态也修对且修根因。
这些不真跑不可能发现,已修复并沉淀:
| 问题 | 现象 | 根因 | 修复 |
|---|---|---|---|
| reasoning 模型 thinking block | 调用返回空 text | content[0] 是 thinking 非text;max_tokens 被思考吃光 | 解析跳过 thinking 取 text block;max_tokens 调大 4096 |
| 中英关键词不匹配 | 召回初跑 50%(假漏报) | 模型中文回答"空值",expected 英文"null" | 判定加中英同义词映射 |
| 中转 auth 方式未知 | 认证失败 | x-api-key vs Bearer | Step0 冒烟确认 x-api-key |
这些是生产接入必踩的坑,已沉淀进
experiment/llm_call.py——团队接入真实模型时直接受益。
| 项 | 值 |
|---|---|
| 总调用数 | ~50 次(组A 40 + 组B 10) |
| 模型 | deepseek-v4(review/fix)+ qwen3.7(judge) |
| 单次最慢 | ~30s(reasoning 模型 thinking) |
| 发现 | reasoning 模型贵于普通,但审查/修复质量对得起 |
| 指标 | 阈值 | 实际 | 判定 |
|---|---|---|---|
| 召回率 | ≥70% | 100% | ✅ 通过 |
| 假阳性率(增强) | ≤30% | 28% | ✅ 通过 |
| 修复正确率 | ≥70% | 100% | ✅ 通过 |
| 修根因率 | — | 100% | ✅ 超预期 |
结论:loop 当前配置(方法论注入 + deepseek-v4)提效真实有效,达推广标准。
"当前项目对 AI 编程提效是否有价值?"
有,且现在有数据支撑(不再是纸面):
- 方法论层:bug-hunting 根因法、对抗验证、置信度门槛——实测有效(精度 +35pp、根因率 100%)
- 自动化闭环层:review→fix→test 的 loop——实测能正确修复(含 hard 级竞态)
- 工程经验层:reasoning 模型适配、判定口径——已沉淀
确定性价值:方法论 + 架构 + 工程经验(这次验证产出)。 待扩展:真实 PR 规模验证、多模型对比、CI 集成观测。
- 引擎层(agent 编排/fallback/hook)有沉淀复用价值——本次验证的 reasoning 模型适配正是通用工程经验
- 应用层(研发 loop/编程 skills)是编程专属,不直接迁移数字人——结论不变
experiment/
├── bug_seeds.py # 10个已知bug金标准 (易中难/安全正确性边界)
├── llm_call.py # LLM调用层 (urllib直调中转, reasoning模型适配)
├── run_group_a.py # 组A: 裸vs增强reviewer对比
└── run_group_b.py # 组B: fix+judge闭环验证
可复跑:cd experiment && python run_group_a.py && python run_group_b.py
验证完成:纸面价值 → 数据支撑的落地价值。loop 提效真实有效,达推广标准。