banditml / offline-policy-evaluation Star 220 Code Issues Pull requests Discussions Implementations and examples of common offline policy evaluation methods in Python. importance-sampling counterfactual-learning off-policy-evaluation doubly-robust offline-policy-evaluation counterfactual-policy-evaluation Updated Feb 11, 2023 Python
PlaytikaOSS / pybandits Star 55 Code Issues Pull requests Discussions Python library for Multi-Armed Bandits reinforcement-learning neural-network personalization thompson-sampling recommendation-system recommender-system multi-armed-bandits multi-armed-bandit bayesian-neural-networks contextual-bandits mab multiarmed-bandits stochastic-bandit-algorithms numpyro stochastic-bandit contextual-bandit-algorithms neural-linear offline-policy-evaluation Updated Oct 9, 2026 Python
ReviveCoding / aix-page Star 0 Code Issues Pull requests Reproducible Search Ads research benchmark: 149.6M public KDD rows, GPU CTR modeling, 17M-session controlled experimentation, causal inference, and safe policy evaluation. data-science machine-learning pytorch statistical-inference xgboost experimentation advertising causal-inference search-ads duckdb offline-policy-evaluation ml-evaluation Updated Sep 5, 2026 Python
Sahil170595 / counterledger-ope Star 0 Code Issues Pull requests Patient-disjoint FQE and sequential doubly robust offline policy evaluation with reproducible synthetic fixtures. python reinforcement-learning synthetic-data doubly-robust offline-policy-evaluation fitted-q-evaluation Updated Oct 3, 2026 Python