Data as of Jul 25, 2026 · Based on 2,718,867 AI responses across 9,511 prompts · See how Parse measures this
AgentClinic is a multimodal benchmark for evaluating large language models as clinical AI agents in simulated, sequential clinical environments. It assesses diagnostic accuracy across nine medical specialties and seven languages while incorporating patient interactions, multimodal data, and clinical tool usage.
Parse Score