Um guia demonstra o ajuste fino do modelo Liquid AI LFM2.5-350M usando Otimização Relativa de Política em Grupo (GRPO) para melhorar a geração de saída estruturada. O processo envolve treinar em um subconjunto do conjunto de dados NVIDIA Nemotron e avaliar o desempenho por meio da benchmark IFStruct.

  • A avaliação inicial do modelo base LFM2.5-350M resultou em uma taxa de aprovação de 22,6% na benchmark IFStruct.
  • O treinamento utilizou aproximadamente 500 amostras com aumento de dados para se alinhar à distribuição de avaliação.
  • As funções de recompensa foram combinadas para pontuar o formato JSON, a precisão da contagem de campos e a validação do esquema.
  • O modelo ajustado fino alcançou uma taxa de aprovação geral de 29,7%, representando uma melhoria significativa em relação à linha de base.

Os resultados mostram que o ajuste fino específico de tarefas para modelos menores pode melhorar o desempenho e igualar ao de modelos muito maiores.