O projeto llama.cpp lançou a compilação b10584, abordando um problema crítico onde o tamanho do contexto de rascunho não correspondia ao contexto alvo, fazendo com que as solicitações do servidor falhassem com erros 500.

  • O servidor agora garante que o contexto de rascunho siga o tamanho do contexto alvo, prevenindo falhas de decodificação quando os slots são preenchidos além dos limites anteriores.
  • A reserva de memória para o modelo de rascunho é medida no maior contexto que o alvo pode aceitar, permitindo que contextos que compartilham células com o alvo abandonem a sobrescrita kv_size.
  • A função fit agora leva em conta um segundo modelo opcional, garantindo que sua memória seja medida sempre que o contexto principal mudar para manter o caminho reduce exato.

Esta atualização resolve problemas de estabilidade em implantações do servidor ao alinhar dinamicamente os tamanhos dos contextos de rascunho e alvo.