Server llama.cpp kini mendukung input konten bertipe (vision, audio, video) untuk endpoint /v1/embeddings. Pembaruan ini memungkinkan permintaan embedding multimodal dengan menerima array konten terbungkus bergaya OpenAI, sehingga bagian teks dan image_url dapat diproses bersama.

  • Menerima format array konten terbungkus bergaya OpenAI untuk embedding multimodal.
  • Bagian teks digabungkan sementara bagian image_url didekode melalui handle_media dan disisipkan dengan process_mtmd_prompt.
  • Format lama (string polos, array token, array campuran) tetap berfungsi tanpa perubahan.
  • Array konten telanjang ditolak dengan pesan migrasi.
  • Menonaktifkan penggunaan ulang prefix KV untuk tugas embedding/rerank stateless guna mencegah berbagi cache yang salah antar permintaan.

Perubahan ini memungkinkan pengguna menghasilkan embedding untuk input multimodal menggunakan format API OpenAI standar sambil memastikan bahwa input berulang tidak secara keliru berbagi pasangan kunci-nilai yang di-cache.