Data as of Jul 25, 2026 · Based on 2,718,867 AI responses across 9,511 prompts · See how Parse measures this
ToolBeHonest is a multi-level hallucination diagnostic benchmark for tool-augmented large language models. It includes 700 manually annotated evaluation samples across seven tasks to assess hallucinations in scenarios with missing, potentially available, or limited-functionality tools.
Parse Score