loo5x ha lanzado llama-modes v0.4.0, una bifurcación de llama.cpp que permite cargar un único modelo GGUF una vez para realizar múltiples modos de inferencia estructurada sin cambiar modelos ni añadir clasificadores.

  • El modo BOOLEAN puntúa directamente las respuestas Sí/No.
  • El modo CHOICE puntúa candidatos arbitrarios proporcionados, incluidas etiquetas de múltiples tokens.
  • El modo SCALE evalúa escalas ordinales o de intervalo, devolviendo distribuciones discretas y estadísticas derivadas como la mediana o el valor esperado.
  • El proyecto incluye una versión CUDA para Windows, una demostración local con React y documentación de la API.

Este enfoque permite a los desarrolladores reutilizar los mismos pesos del modelo en memoria para diferentes primitivas de inferencia, exponiendo la puntuación estructurada directamente desde modelos de lenguaje locales ordinarios.