В руководстве демонстрируется дообучение модели Liquid AI LFM2.5-350M с использованием групповой относительной оптимизации политики (GRPO) для улучшения генерации структурированного вывода. Процесс включает обучение на подмножестве набора данных NVIDIA Nemotron и оценку производительности по бенчмарку IFStruct.

  • Базовая оценка модели LFM2.5-350M показала уровень успешного прохождения 22,6% на бенчмарке IFStruct.
  • Обучение использовало около 500 образцов с аугментацией данных для соответствия распределению оценки.
  • Функции вознаграждения были объединены для оценки формата JSON, точности количества полей и валидации схемы.
  • Дообученная модель достигла общего уровня успешного прохождения 29,7%, что представляет собой значительное улучшение по сравнению с базовым уровнем.

Результаты показывают, что целевое дообучение меньших моделей может улучшить производительность и соответствовать уровню гораздо более крупных моделей.