O projeto llama.cpp adicionou suporte ao modelo embeddingGemma2, que lida com entradas de texto, visão e áudio. Esta atualização é implementada por meio do pull request #30054.
llama.cpp adiciona suporte para embeddings multimodais do embeddingGemma2
llama.cpp v0.6.0 adiciona API de lote estendida, suporte a GLM-5.3-Flash e pontos finais de modelo de decisão
O llama.cpp v0.6.0 apresenta a nova API de lote estendido llama_batch_ext para entradas mistas de tokens e embeddings, além do suporte ao modelo híbrido GLM-5.3-Flash 320B e ao modelo de decisão Clef.
llama.cpp b11240 adiciona suporte a entrada multimodal tipada para /v1/embeddings
O servidor llama.cpp agora suporta entrada de conteúdo tipado (visão, áudio, vídeo) para o endpoint /v1/embeddings. Esta atualização permite solicitações de embedding multimodais ao aceitar arrays de conteúdo embrulhados no estilo OpenAI, permitindo que partes de texto e image_url sejam processadas juntas.
Liquid AI lança o draftspeculativo LFM2.5-VL-3B-DSpark para decodificação até 3,13x mais rápida
A Liquid AI lançou o LFM2.5-VL-3B-DSpark, um modelo de rascunho experimental para decodificação especulativa do seu modelo de visão e linguagem LFM2.5-VL-3B. O draftspeculator adiciona aproximadamente 280M parâmetros e acelera a geração de tokens sem alterar a distribuição de saída do modelo.
Liquid AI lança LFM2.5-VL-DSpark para acelerar a inferência de modelos de visão e linguagem
A Liquid AI lançou o modelo em rascunho LFM2.5-VL-DSpark, um drafter de decodificação especulativa projetado para acelerar a inferência do modelo de visão e linguagem LFM2.5-VL-3B. O drafter captura estados ocultos de camadas fixas do modelo alvo para gerar tokens candidatos, adicionando apenas 280M parâmetros (sobrecarga de 8,9%) enquanto mantém a dimensionalidade idêntica entre as modalidades.
Liquid AI lança modelo rascunho DSpark para LFM2.5-VL-3B
A Liquid AI lançou um modelo rascunho experimental DSpark para seu modelo de visão e linguagem LFM2.5-VL-3B, permitindo decodificação mais rápida em dispositivos edge e GPUs sem alterar a qualidade de saída.