Data as of Jul 25, 2026 · Based on 2,718,867 AI responses across 9,511 prompts · See how Parse measures this
CRUD RAG is a comprehensive Chinese benchmark created by IAAR Shanghai for evaluating retrieval augmented generation (RAG) systems in large language models. It provides datasets, evaluation metrics, and a tutorial for running experiments on RAG systems.
Parse Score