Code for "Constrained Variational Policy Optimization for Safe Reinforcement Learning" (ICML 2022)
-
Updated
May 21, 2023 - Python
Code for "Constrained Variational Policy Optimization for Safe Reinforcement Learning" (ICML 2022)
🐀 Fuzz your verifier before an RL agent does. Static + dynamic LLM security auditor to detect reward-hacking in RL post-training environments (OpenEnv, verifiers-spec, Gymnasium).
Catch reward traps before training. Static analysis for RL reward functions.
To associate your repository with the rl-safety topic, visit your repo's landing page and select "manage topics."