loo5x выпустила llama-modes v0.4.0, форк llama.cpp, который позволяет загружать одну модель GGUF один раз для выполнения нескольких режимов структурированного вывода без замены моделей или добавления классификаторов.
- Режим BOOLEAN напрямую оценивает ответы Да/Нет.
- Режим CHOICE оценивает произвольные предоставленные кандидаты, включая многозначные метки.
- Режим SCALE оценивает порядковые или интервальные шкалы, возвращая дискретные распределения и производные статистики, такие как медиана или ожидаемое значение.
- Проект включает выпуск CUDA для Windows, локальное демо на React и документацию API.
Этот подход позволяет разработчикам повторно использовать одни и те же веса модели в памяти для различных примитивов вывода, обеспечивая прямой структурированный скоринг из обычных локальных языковых моделей.