Data as of Jul 25, 2026 · Based on 2,718,867 AI responses across 9,511 prompts · See how Parse measures this
Phare is an LLM benchmark ranking platform that evaluates and compares large language models across multiple performance metrics. It provides a leaderboard of models from providers like Anthropic, Meta, Google, and OpenAI, with scores for categories such as safety, accuracy, and reliability.
Parse Score