Data as of Jul 25, 2026 · Based on 2,718,867 AI responses across 9,511 prompts · See how Parse measures this
Describe Anything Model (DAM) generates detailed descriptions for user-specified regions in images and videos, using points, boxes, scribbles, or masks. It introduces DLC Bench for evaluating such region-based captioning.
Parse Score