loo5x lançou o llama-modes v0.4.0, um fork do llama.cpp que permite carregar um único modelo GGUF uma vez para realizar múltiplos modos de inferência estruturada sem trocar modelos ou adicionar classificadores.

  • O modo BOOLEAN pontua diretamente respostas Sim/Não.
  • O modo CHOICE pontua candidatos arbitrários fornecidos, incluindo rótulos de múltiplos tokens.
  • O modo SCALE avalia escalas ordinais ou de intervalo, retornando distribuições discretas e estatísticas derivadas como mediana ou valor esperado.
  • O projeto inclui uma versão CUDA para Windows, uma demonstração local com React e documentação da API.

Essa abordagem permite que desenvolvedores reutilizem os mesmos pesos do modelo na memória para diferentes primitivas de inferência, expondo a pontuação estruturada diretamente de modelos de linguagem locais comuns.