loo5x lançou o llama-modes v0.4.0, um fork do llama.cpp que permite carregar um único modelo GGUF uma vez para realizar múltiplos modos de inferência estruturada sem trocar modelos ou adicionar classificadores.
- O modo BOOLEAN pontua diretamente respostas Sim/Não.
- O modo CHOICE pontua candidatos arbitrários fornecidos, incluindo rótulos de múltiplos tokens.
- O modo SCALE avalia escalas ordinais ou de intervalo, retornando distribuições discretas e estatísticas derivadas como mediana ou valor esperado.
- O projeto inclui uma versão CUDA para Windows, uma demonstração local com React e documentação da API.
Essa abordagem permite que desenvolvedores reutilizem os mesmos pesos do modelo na memória para diferentes primitivas de inferência, expondo a pontuação estruturada diretamente de modelos de linguagem locais comuns.