Data as of Jul 25, 2026 · Based on 2,718,867 AI responses across 9,511 prompts · See how Parse measures this
Double Bench is a large-scale, multilingual, and multimodal benchmark for evaluating document Retrieval Augmented Generation (RAG) systems. It comprises 3,276 documents, 72,880 pages, and 5,168 human-validated queries across six languages and four document types to assess each component of document RAG frameworks.
Parse Score