When Better Means Less: Quantifying What Benchmarks Miss Between Model Generations. 2,310 controlled comparisons show GPT-5 series lost 6.7x creativity and gained 4.4x false refusals vs chatgpt-4o-latest — invisible to standard benchmarks.
ai-safety model-comparison gpt-5 llm-evaluation benchmark-evaluation chatgpt-4o-latest keep4o alignment-tax false-refusal-rate creativity-measurement
-
Updated
Feb 23, 2026 - Python