El proyecto llama.cpp ha añadido soporte para el modelo embeddingGemma2, que maneja entradas de texto, visión y audio. Esta actualización se implementa a través del pull request #30054.
llama.cpp añade soporte para embeddings multimodales de embeddingGemma2
llama.cpp v0.6.0 añade API de lotes extendida, soporte para GLM-5.3-Flash y puntos finales de modelos de decisión
llama.cpp v0.6.0 introduce la nueva API de lotes extendida llama_batch_ext para entradas mixtas de tokens y embeddings, junto con el soporte para el modelo híbrido GLM-5.3-Flash 320B y el modelo de decisión Clef.
llama.cpp b11240 añade soporte de entrada multimodal tipada a /v1/embeddings
El servidor llama.cpp ahora admite entradas de contenido tipado (visión, audio, vídeo) para el endpoint /v1/embeddings. Esta actualización permite solicitudes de incrustación multimodal aceptando matrices de contenido envueltas al estilo de OpenAI, lo que permite procesar conjuntamente las partes de texto y image_url.
Liquid AI lanza el draftspeculativo DSpark de LFM2.5-VL-3B-DSpark para una decodificación hasta 3,13 veces más rápida
Liquid AI ha lanzado LFM2.5-VL-3B-DSpark, un modelo de borrador experimental de decodificación especulativa para su modelo de visión y lenguaje LFM2.5-VL-3B. El draftspeculativo añade aproximadamente 280M de parámetros y acelera la generación de tokens sin alterar la distribución de salida del modelo.
Liquid AI lanza LFM2.5-VL-DSpark para acelerar la inferencia de modelos de visión y lenguaje
Liquid AI ha lanzado el modelo borrador LFM2.5-VL-DSpark, un generador de decodificación especulativa diseñado para acelerar la inferencia del modelo de visión y lenguaje LFM2.5-VL-3B. El generador captura estados ocultos de capas fijas del modelo objetivo para generar tokens candidatos, añadiendo solo 280M parámetros (un exceso del 8,9%) mientras mantiene una dimensionalidad idéntica entre modalidades.
Liquid AI lanza el modelo borrador DSpark para LFM2.5-VL-3B
Liquid AI ha lanzado un modelo borrador experimental DSpark para su modelo de lenguaje y visión LFM2.5-VL-3B, permitiendo una decodificación más rápida en dispositivos edge y GPUs sin cambiar la calidad de salida.