Le projet llama.cpp a ajouté le support du modèle embeddingGemma2, qui gère les entrées textuelles, visuelles et audio. Cette mise à jour est implémentée via la pull request #30054.
llama.cpp ajoute le support des embeddings multimodaux d'embeddingGemma2
llama.cpp v0.6.0 ajoute l'API de lot étendu, le support GLM-5.3-Flash et les points de terminaison des modèles de décision
llama.cpp v0.6.0 introduit la nouvelle API de lot étendu llama_batch_ext pour les entrées mixtes de tokens et d'embeddings, ainsi que le support du modèle hybride GLM-5.3-Flash 320B et du modèle de décision Clef.
llama.cpp b11240 ajoute le support des entrées multimodales typées à /v1/embeddings
Le serveur llama.cpp prend désormais en charge les entrées de contenu typées (vision, audio, vidéo) pour le point de terminaison /v1/embeddings. Cette mise à jour permet des requêtes d'embedding multimodal en acceptant des tableaux de contenu enveloppés au format OpenAI, permettant ainsi de traiter ensemble les parties texte et image_url.
Liquid AI publie LFM2.5-VL-3B-DSpark, un ébaucheur spéculatif pour un décodage jusqu'à 3,13x plus rapide
Liquid AI a publié LFM2.5-VL-3B-DSpark, un modèle d'ébauche expérimental de décodage spéculatif pour son modèle vision-langue LFM2.5-VL-3B. L'ébaucheur ajoute environ 280M de paramètres et accélère la génération de tokens sans modifier la distribution de sortie du modèle.
Liquid AI publie LFM2.5-VL-DSpark pour accélérer l'inférence des modèles vision-langage
Liquid AI a publié le modèle brouillon LFM2.5-VL-DSpark, un drafter de décodage spéculatif conçu pour accélérer l'inférence du modèle vision-langage LFM2.5-VL-3B. Le drafter capture les états cachés des couches fixes du modèle cible pour générer des tokens candidats, n'ajoutant que 280M de paramètres (surcharge de 8,9 %) tout en maintenant une dimensionalité identique entre les modalités.
Liquid AI publie le modèle brouillon DSpark pour LFM2.5-VL-3B
Liquid AI a publié un modèle brouillon expérimental DSpark pour son modèle de vision-langage LFM2.5-VL-3B, permettant un décodage plus rapide sur les appareils edge et les GPU sans changer la qualité de sortie.