Cohere a publié Embed 5, une nouvelle famille de modèles d'embedding comprenant deux niveaux : Embed 5 Pro pour une qualité de récupération maximale et Embed 5 Fast pour une latence et un coût réduits. Les deux modèles prennent en charge le texte, les images et les entrées fusionnées sur plus de 100 langues avec une fenêtre de contexte de 128K tokens.

  • La caractéristique architecturale clé est que Pro et Fast partagent un seul espace d'embedding, permettant aux utilisateurs d'indexer avec un modèle et d'interroger avec l'autre sans réindexation.
  • Embed 5 prend en charge des dimensions de sortie variables (de 2048 à 256) et des sorties de précision réduite (float32, int8, binaire), réduisant considérablement les exigences de stockage pour les déploiements à grande échelle.
  • Sur les benchmarks ViDoRe V3, Embed 5 Pro a obtenu une moyenne de 85,8 et Fast une moyenne de 84,5, surpassant Voyage 4 Large (83,7) et Gemini Embedding 2 (83,2).
  • Les modèles sont généralement disponibles via l'API Cohere, Model Vault, Microsoft Foundry et Amazon SageMaker.

La conception d'un espace d'embedding partagé vise à optimiser les charges de travail agentic en permettant une indexation de haute qualité avec Pro tout en maintenant des vitesses d'interrogation rapides avec Fast, réduisant la latence pour les agents émettant plusieurs recherches.