Una guía demuestra el ajuste fino del modelo Liquid AI LFM2.5-350M utilizando la Optimización Relativa de Políticas en Grupo (GRPO) para mejorar la generación de salidas estructuradas. El proceso implica entrenar en un subconjunto del conjunto de datos NVIDIA Nemotron y evaluar el rendimiento a través de la benchmark IFStruct.

  • La evaluación inicial del modelo base LFM2.5-350M arrojó una tasa de aprobación del 22,6% en la benchmark IFStruct.
  • El entrenamiento utilizó aproximadamente 500 muestras con aumento de datos para alinearse con la distribución de evaluación.
  • Las funciones de recompensa se combinaron para puntuar el formato JSON, la precisión del conteo de campos y la validación del esquema.
  • El modelo ajustado fino alcanzó una tasa de aprobación general del 29,7%, lo que representa una mejora significativa en comparación con la línea base.

Los resultados muestran que el ajuste fino específico de tareas para modelos más pequeños puede mejorar el rendimiento y igualar al de modelos mucho más grandes.