Agent Harness 全栈实践者
从并发调度 · 任务编译 · 执行引擎,到多 Agent 认知市场的完整 Harness 链路
主导了 NVIDIA SkillSpector 的并发批处理模块(9,100 行,含 164 个测试,已合入主仓库),同步实现 157 个 DeepSeek V4 Pro 模型 API 的并发调用,是绝对的 DeepSeek 深度用户。后续独立设计并交付 4 个 Agent 系统(14,000+ 行代码),覆盖从并发调度、任务编译、执行引擎到多 Agent 认知市场的完整 Harness 链路。
9,100 行 diff(2,900 生产 + 3,700 测试 + 2,500 文档) · 164 个测试 · NVIDIA 工程师审查通过
为 SkillSpector 贡献了一个完整的多语言并发批处理模块,零侵入上游代码:
- ⚡ 并发执行引擎 — ThreadPoolExecutor + ApiKeyPool 协同,10 个 Key 支撑 157 个 DeepSeek V4 Pro 并发调用,23 个 Skill 目录 50 秒内完成全量安全扫描
- 🔑 ApiKeyPool 多 Key 负载均衡 — least-loaded 调度 + 每 Key 5 槽位 + 429 指数退避(30s × 2ⁿ,上限 300s)。发现并修复 from-import 导致的双模块引用问题——仅 patch
llm_utils会让llm_analyzer_base的本地引用绕过池,导致 95% 的 LLM 调用失控。修复:双模块同时 patch - 🧩 DeepSeek 兼容层 — 7 个定向 monkey-patch,context manager 显式管理生命周期,支持嵌套与恢复。
_verify_patch_targets()守卫机制:上游签名变更时抛 RuntimeError 而非静默失败 - 🌏 语言检测 — Unicode script-ratio 启发式算法,支持中日韩多语言 Skill 目录
- 🔍 Gap-fill 分析器 — LLM 补偿 8 条静态规则无法覆盖的安全检查
- 📊 聚合报告 — Terminal / JSON / Markdown 三种输出,按风险评分排序
审查中 3 个 Critical 问题(死代码 Pool、侵入式 import-time patch、零测试覆盖)全部解决后获批合入。上游经历 130+ commits 大版本升级后,所有 7 个 patch 零冲突。
💡 这个 ApiKeyPool 后来被移植到我后续所有 Agent 项目(SkillForge / EoM2),成为整个 Agent 并发架构的基石。
消费 Skill 定义 → 并发执行 → 多视角批判 Loop → 收敛输出。一个完整的 Agent Harness 原型。
- Multi-Perspective Loop:N 个视角并发批判 → 汇总 → LLM 修改 → 再批判 → modified_summary 收敛判定(11 个中英双语停用词过滤)
- 有界并发 + 分层抽样:max_parallel_items=8 防线程爆炸,Global Context 对 200+ items 按严重度分层采样防 Token 爆炸,fail-soft 降级
- ApiKeyPool:从 SkillSpector 移植适配——threading.Condition 等待通知 + snapshot() 监控接口
- 三级容灾:30s 超时 → 重试 → 降级回复
- Skill 格式规范 v1.1:文件系统契约解耦编译器与执行引擎
自然语言 → 结构化 Agent 任务定义。三 Agent PEV 管线。
- 三 Agent 管线:Researcher(web_search 收集最佳实践)→ Designer(正交任务分解 + 批判视角推导)→ Auditor(PM 审查,五信号收敛 ≤3 轮)
- Robustness Loop:CRITICAL/MAJOR/MINOR 分级 + 过度工程检测 + 边际递减停止
- Anthropic SDK + DeepSeek 中继:流式响应 + web_search 工具集成
在学术多 Agent 经济框架(arXiv 2606.02859)之上,构建认知驱动的 Agent 协作市场。
- 认知向量系统:六维脑区模型(PFC/DMN/ACC/HPC/AMG/TMP)替代硬编码角色标签,Agent 通过认知偏置匹配任务。可塑性规则:成功增强 / 失败削弱 / 衰减回归基线
- 三层市场:Planning(5 人委员会)→ Matching(200 Agent × N 任务,5 因子加权 + 贪心互补,纯数学零 LLM)→ Execution(五步协作)
- ProjectArchitect:1v1 用户对话 → ProjectBlueprint → 投送规划团
Context Engineering 和 Memory 系统的工程实践。七段式 System Prompt 动态拼接 + Memory 系统(Claude Code 格式兼容)。双人格双通道设计(基于 SDT 和 Gross 情绪调节模型)。
| 方向 | 我的实践 |
|---|---|
| 上下文管理 | 七段式 System Prompt 拼接 + Global Context 分层抽样 |
| 长期记忆 | 三套格式演化(Claude Code 文件 → Agora 索引 → Cognee 知识图谱) |
| Subagent & Multi-Agent | 三 Agent PEV 管线 + 200 Agent 认知市场 + 两种协作模式 |
| 自进化 Agent | 认知向量可塑性 + EoM 拍卖-破产-遗传引擎 |
| 超长程任务 | Loop 收敛判定(五信号)+ ProjectBlueprint 拆解 + 五步执行协作 |
| Prompt / Context / Harness Engineering | 三层全经历,每阶段都有完整项目验证 |
不是一般的重度使用。 我在本地 Claude 环境搭建了一套图式 Agent 基础设施:
- 🕸 Cognee 知识图谱记忆 — 替代纯文件记忆。所有项目分析、学习笔记、面试材料存入 Cognee,通过图检索(GRAPH_COMPLETION / RAG / CHUNKS 多路由)召回,解决文件记忆的"隧道视野"问题
- 🗺 CodeGraph 代码智能图 — 为每个学习的开源项目建代码知识图谱索引,一次
codegraph_explore返回完整调用路径与符号依赖,分析速度提升一个数量级 - 🔀 多 Agent 工具链协同 — Claude Code(执行)+ CodeGraph(代码理解)+ Cognee(记忆持久化)三者互补,搭的是本地 Agent 协作基础设施,而非"用了一个 Agent 工具"
日常开发链路:DeepSeek V4 Pro(Anthropic Messages API + SDK)+ 本地 Claude。对模型行为有第一手判断力——web search 降幻觉的使用时机、Pro/Flash 模型的选择、本地记忆过量导致幻觉、Pro 模型无法跳过 thinking 模式的开发影响。
- NVIDIA SkillSpector 开源贡献(PR #100,9,100 行,164 测试,已合入主仓库)
- 所有项目文档、README、设计规范均英文撰写
- 11 份设计文档 + 19 篇学术论文引用的设计驱动开发方法论
- 代码总量 23,480+ 行(含测试与文档)
研发/工程 & 产品双方向 · SkillSpector 证明生产级代码交付能力 · 四个 Agent 项目证明 Harness 系统全链路实践
