loo5x ha lanzado llama-modes v0.4.0, una bifurcación de llama.cpp que permite cargar un único modelo GGUF una vez para realizar múltiples modos de inferencia estructurada sin cambiar modelos ni añadir clasificadores.
- El modo BOOLEAN puntúa directamente las respuestas Sí/No.
- El modo CHOICE puntúa candidatos arbitrarios proporcionados, incluidas etiquetas de múltiples tokens.
- El modo SCALE evalúa escalas ordinales o de intervalo, devolviendo distribuciones discretas y estadísticas derivadas como la mediana o el valor esperado.
- El proyecto incluye una versión CUDA para Windows, una demostración local con React y documentación de la API.
Este enfoque permite a los desarrolladores reutilizar los mismos pesos del modelo en memoria para diferentes primitivas de inferencia, exponiendo la puntuación estructurada directamente desde modelos de lenguaje locales ordinarios.