يدعم خادم llama.cpp الآن إدخال محتوى مtyped (رؤية، صوت، فيديو) لنقطة النهاية /v1/embeddings. يتيح هذا التحديث طلبات تضمين متعددة الوسائط عن طريق قبول مصفوفات المحتوى المغلفة على طراز OpenAI، مما يسمح بمعالجة أجزاء النص وimage_url معًا.

  • يقبل تنسيق مصفوفة المحتوى المغلفة على طراز OpenAI للتضمينات متعددة الوسائط.
  • يتم دمج أجزاء النص بينما تتم فك تشفير أجزاء image_url عبر handle_media وربطها مع process_mtmd_prompt.
  • تستمر الأشكال القديمة (سلسلة نصية عادية، مصفوفات الرموز، مصفوفات مختلطة) في العمل دون تغيير.
  • ترفض مصفوفات المحتوى العارية برسالة هجرة.
  • يعيد استخدام بادئة KV لمهام التضمين/إعادة الترتيب غير الحالة لمنع المشاركة غير الصحيحة للتخزين المؤقت بين الطلبات.

يتيح هذا التغيير للمستخدمين إنشاء تضمينات لإدخالات متعددة الوسائط باستخدام تنسيق واجهة برمجة التطبيقات القياسية لـ OpenAI مع ضمان عدم مشاركة أزواج المفاتيح والقيم المخزنة بشكل خاطئ عند تكرار المدخلات.