eval and regression harness for elevenlabs voice agents: audio scoring, llm judges, baseline diffs, closed-loop prompt refinement, ship verdicts
typescript regression-testing bun conversational-ai voice-ai voice-agent elevenlabs llm-evaluation llm-as-judge barge-in audio-native
-
Updated
Jul 14, 2026 - TypeScript