Proyek llama.cpp telah menambahkan dukungan untuk model embeddingGemma2, yang menangani input teks, visi, dan audio. Pembaruan ini diimplementasikan melalui pull request #30054.
llama.cpp menambahkan dukungan untuk embedding multimodal embeddingGemma2
llama.cpp v0.6.0 menambahkan API batch ekstensi, dukungan GLM-5.3-Flash, dan endpoint model keputusan
llama.cpp v0.6.0 memperkenalkan API batch ekstensi llama_batch_ext baru untuk input token dan embedding campuran, serta dukungan untuk model hibrida GLM-5.3-Flash 320B dan model keputusan Clef.
llama.cpp b11240 menambahkan dukungan input multimodal bertipe ke /v1/embeddings
Server llama.cpp kini mendukung input konten bertipe (vision, audio, video) untuk endpoint /v1/embeddings. Pembaruan ini memungkinkan permintaan embedding multimodal dengan menerima array konten terbungkus bergaya OpenAI, sehingga bagian teks dan image_url dapat diproses bersama.
Liquid AI merilis LFM2.5-VL-3B-DSpark sebagai drafter spekulatif untuk dekoding hingga 3,13x lebih cepat
Liquid AI telah merilis LFM2.5-VL-3B-DSpark, model draf dekoding spekulatif eksperimental untuk model visi-bahasa LFM2.5-VL-3B-nya. Drafter ini menambahkan sekitar 280M parameter dan mempercepat generasi token tanpa mengubah distribusi keluaran model.
Liquid AI merilis LFM2.5-VL-DSpark untuk mempercepat inferensi model visi-bahasa
Liquid AI telah merilis model draf LFM2.5-VL-DSpark, sebuah drafter decoding spekulatif yang dirancang untuk mempercepat inferensi bagi model visi-bahasa LFM2.5-VL-3B. Drafter ini menangkap keadaan tersembunyi dari lapisan tetap pada model target untuk menghasilkan token kandidat, hanya menambahkan 280M parameter (overhead 8,9%) sambil mempertahankan dimensi yang identik di seluruh modalitas.
Liquid AI merilis model draf DSpark untuk LFM2.5-VL-3B
Liquid AI telah merilis model draf eksperimental DSpark untuk model visi-bahasanya LFM2.5-VL-3B, memungkinkan decoding yang lebih cepat pada perangkat edge dan GPU tanpa mengubah kualitas output.