Find everything relevant. In every modality.
Unbounded
No video/audio duration cap.
36+
Languages for query and retrieval. Native, not translated.
512d
Embedding dimensions 6× smaller than other competitors.
30×
Faster than others at video indexing, while leading on accuracy.
Things only Marengo does.

512 dimensions. Same understanding.
Marengo encodes video, audio, image, text, and documents into 512-dimensional embeddings, cutting storage 6x versus competitors and speeding searches without losing accuracy.

An image plus a sentence, in one query.
Drop a player photo, add a sentence or two, and Marengo merges them into one embedding. Mix image, text, audio, and documents in a single query.

36 languages, one space.
Search across 36 languages in Marengo's unified vector space. No translation step, no accuracy loss between languages.

Search with fully composable queries.
Use an image query refined by text to find matching video moments.
From signup to first result in 5 minutes.
Faster, smaller, more accurate.

CAPABILITY
MARENGO 3.5
Gemini Embedding 2
Nova Multimodal embeddings
Embedding dimensions
512
3072 (default; 1536 / 768 via Matryoshka)
3072 (default; 1024 / 384 / 256 via Matryoshka)
Max video length
Unbounded (no duration cap)
120 sec per request
30 sec per segment (chunked)
Multimodal Composite Queries
Yes - video, audio, image, text, and documents composed in one query (16K-token sync endpoint))
No native composite query API
No native composite query API
Sports recognition
Leads by 12–38 pts vs. GE2 on sports/image-query/image+text search
Baseline
Trails Marengo 3.5 by 35–45 pts
Embedding uncertainty signal
Yes - optional uncertainty signal on every embedding
None
None


