loo5x a lancé llama-modes v0.4.0, un fork de llama.cpp qui permet de charger un seul modèle GGUF une fois pour effectuer plusieurs modes d'inférence structurée sans changer de modèles ni ajouter de classificateurs.
- Le mode BOOLEAN note directement les réponses Oui/Non.
- Le mode CHOICE note des candidats arbitraires fournis, y compris des étiquettes multi-tokens.
- Le mode SCALE évalue des échelles ordinales ou d'intervalle, renvoyant des distributions discrètes et des statistiques dérivées comme la médiane ou la valeur attendue.
- Le projet inclut une version CUDA pour Windows, une démo locale avec React et la documentation de l'API.
Cette approche permet aux développeurs de réutiliser les mêmes poids de modèle en mémoire pour différentes primitives d'inférence, exposant directement la notation structurée depuis des modèles de langage locaux ordinaires.