Data as of Jul 25, 2026 · Based on 2,718,867 AI responses across 9,511 prompts · See how Parse measures this
JailbreakBench provides a centralized benchmark to study jailbreak attacks and defenses against large language models. It maintains a repository of jailbreak artifacts for reproducibility, a standardized evaluation library with a defined threat model, prompts, and scoring, and leaderboards tracking attacker success and defense performance across open-source and closed-source models. Its JBB-Behaviors dataset includes 100 misuse behaviors (plus 100 benign behaviors) to evaluate model safety, and the project aims to accelerate safety training and adapt to advances in the field.
Parse Score