Сервер llama.cpp теперь поддерживает ввод типизированного контента (визуальный, аудио, видео) для конечной точки /v1/embeddings. Это обновление позволяет отправлять запросы на создание мультимодальных эмбеддингов, принимая массивы контента в обёртке в стиле OpenAI, что даёт возможность совместно обрабатывать текстовые части и части image_url.
- Принимает формат массива контента в обёртке в стиле OpenAI для мультимодальных эмбеддингов.
- Текстовые части объединяются, а части image_url декодируются через handle_media и вставляются с помощью process_mtmd_prompt.
- Устаревшие форматы (простая строка, массивы токенов, смешанные массивы) продолжают работать без изменений.
- Простые массивы контента отклоняются с сообщением о необходимости миграции.
- Отключает повторное использование префикса KV для бессостоятельных задач эмбеддинга/ранжирования, чтобы предотвратить некорректный общий доступ к кэшу между запросами.
Это изменение позволяет пользователям генерировать эмбеддинги для мультимодальных вводов с использованием стандартного формата API OpenAI, гарантируя, что повторяющиеся вводы не будут некорректно разделять закэшированные пары ключ-значение.