Data as of Jul 25, 2026 · Based on 2,718,867 AI responses across 9,511 prompts · See how Parse measures this
Vertex AI's multimodal embeddings model generates multi-dimensional vectors from image, text, and video inputs for tasks like image classification and video content moderation. The gemini-embedding-exp-2 model accepts interleaved inputs across multiple modalities and supports task-specific instructions to optimize embedding performance.
The market map
Embedding Model APIs and Services →Where AI ranks Google Multimodal Embeddings API