O servidor llama.cpp agora suporta entrada de conteúdo tipado (visão, áudio, vídeo) para o endpoint /v1/embeddings. Esta atualização permite solicitações de embedding multimodais ao aceitar arrays de conteúdo embrulhados no estilo OpenAI, permitindo que partes de texto e image_url sejam processadas juntas.

  • Aceita formato de array de conteúdo embrulhado no estilo OpenAI para embeddings multimodais.
  • Partes de texto são concatenadas enquanto partes de image_url são decodificadas via handle_media e mescladas com process_mtmd_prompt.
  • Formatos legados (string simples, arrays de tokens, arrays mistos) continuam funcionando sem alterações.
  • Arrays de conteúdo desprotegidos são rejeitados com uma mensagem de migração.
  • Desativa a reutilização do prefixo KV para tarefas de embedding/rerank sem estado para evitar compartilhamento incorreto de cache entre solicitações.

Esta alteração permite que os usuários gerem embeddings para entradas multimodais usando o formato padrão da API OpenAI, garantindo ao mesmo tempo que entradas repetidas não compartilhem incorretamente pares de chave-valor em cache.