Le serveur llama.cpp prend désormais en charge les entrées de contenu typées (vision, audio, vidéo) pour le point de terminaison /v1/embeddings. Cette mise à jour permet des requêtes d'embedding multimodal en acceptant des tableaux de contenu enveloppés au format OpenAI, permettant ainsi de traiter ensemble les parties texte et image_url.
- Accepte le format de tableau de contenu enveloppé au style OpenAI pour les embeddings multimodaux.
- Les parties texte sont concaténées tandis que les parties image_url sont décodées via handle_media et intégrées avec process_mtmd_prompt.
- Les formats hérités (chaîne simple, tableaux de tokens, tableaux mixtes) continuent de fonctionner sans changement.
- Les tableaux de contenu bruts sont rejetés avec un message de migration.
- Désactive la réutilisation du préfixe KV pour les tâches d'embedding/rerank sans état afin d'éviter un partage incorrect du cache entre les requêtes.
Ce changement permet aux utilisateurs de générer des embeddings pour des entrées multimodales en utilisant le format standard de l'API OpenAI tout en garantissant que les entrées répétées ne partagent pas incorrectement les paires clé-valeur mises en cache.