Data as of Jul 25, 2026 · Based on 2,718,867 AI responses across 9,511 prompts · See how Parse measures this
MM-R5 is a multimodal reasoning-enhanced re-ranker designed to improve document retrieval in complex multimodal settings by explicitly reasoning across textual, visual, and structural modalities. It trains in two stages—supervised fine-tuning to generate structured multimodal reasoning traces, followed by reinforcement learning with task-specific rewards to optimize ranking and output validity—yielding interpretable decision paths. The model is publicly available on Hugging Face and can be used via a QueryReranker interface to rerank candidates given a query and associated images, achieving state-of-the-art top-k retrieval on the MMDocIR benchmark.
Parse Score