Data as of Jul 25, 2026 · Based on 2,718,867 AI responses across 9,511 prompts · See how Parse measures this
ScaleEval is a meta evaluation framework that uses agent debate to assess the capabilities of large language models as evaluators. It supports multi-round discussions among multiple LLM agents to help humans identify the most effective LLM-based evaluators.
Parse Score