llama.cppサーバーは、/v1/embeddingsエンドポイントに対して型付きコンテンツ(ビジョン、オーディオ、ビデオ)の入力をサポートするようになりました。この更新により、OpenAIスタイルのラップされたコンテンツ配列を受け入れることで、マルチモーダル埋め込みリクエストが可能になり、textとimage_urlの部分を一緒に処理できます。
- マルチモーダル埋め込み用にOpenAIスタイルのラップされたコンテンツ配列形式を受け入れます。
- テキスト部分は連結され、image_urlの部分はhandle_mediaを介してデコードされ、process_mtmd_promptと結合されます。
- レガシー形式(プレーン文字列、トークン配列、混合配列)は変更なく引き続き動作します。
- 裸のコンテンツ配列は移行メッセージとともに拒否されます。
- リクエスト間でキャッシュが誤って共有されないよう、ステートレスな埋め込み/リランクタスクにおけるKVプレフィックスの再利用を無効にします。
この変更により、ユーザーは標準的なOpenAI API形式を使用してマルチモーダル入力からの埋め込みを生成でき、かつ繰り返しの入力がキャッシュされたキーバリューペアを誤って共有しないことが保証されます。