El servidor llama.cpp ahora admite entradas de contenido tipado (visión, audio, vídeo) para el endpoint /v1/embeddings. Esta actualización permite solicitudes de incrustación multimodal aceptando matrices de contenido envueltas al estilo de OpenAI, lo que permite procesar conjuntamente las partes de texto y image_url.

  • Acepta el formato de matriz de contenido envuelta al estilo de OpenAI para incrustaciones multimodales.
  • Las partes de texto se concatenan mientras que las partes de image_url se decodifican mediante handle_media y se combinan con process_mtmd_prompt.
  • Los formatos heredados (cadena plana, matrices de tokens, matrices mixtas) siguen funcionando sin cambios.
  • Se rechazan las matrices de contenido desnudas con un mensaje de migración.
  • Desactiva la reutilización del prefijo KV para tareas de incrustación/reordenamiento sin estado para evitar el intercambio incorrecto de caché entre solicitudes.

Este cambio permite a los usuarios generar incrustaciones para entradas multimodales utilizando el formato estándar de la API de OpenAI, asegurando al mismo tiempo que las entradas repetidas no compartan incorrectamente pares clave-valor en caché.