Tema · Training methods
arxiv arXiv cs.CL · ahora mismo SWE-Lancer · 51.47% En vivo

SkillGym internaliza habilidades humanas en LLMs para la resolución de problemas del mundo real

Los investigadores presentan SkillGym, un marco que transforma las habilidades de agentes escritas por humanos en entornos de entrenamiento ejecutables y verificables para agentes de modelos de lenguaje grandes. El sistema utiliza una canalización de habilidad a tarea para instanciar tareas concretas y verificar resultados con verificadores basados en código.

lab Hugging Face Blog · hace 7 h · 7 vistas

NVIDIA Warp y MjWarp habilitan la simulación paralela de robótica acelerada por GPU

MuJoCo Warp (MJWarp), basado en NVIDIA Warp, permite que los modelos compatibles de MuJoCo se ejecuten a escala de GPU, posibilitando el avance de cientos o miles de mundos de simulación independientes en una sola llamada. Esta arquitectura desplaza el enfoque desde la minimización de la latencia para un solo entorno hacia la mejora del rendimiento agregado, lo cual favorece el aprendizaje por refuerzo y el muestreo a gran escala.

arxiv arXiv cs.LG · hace 2 d HealthBench · 50.1% · 11 vistas

Fathom-Vaidya mejora el razonamiento médico con recompensas basadas en rúbricas

Los autores presentan Fathom-Vaidya, un modelo de 30B parámetros que utiliza datos sintéticos y aprendizaje por refuerzo basado en rúbricas para mejorar el razonamiento diagnóstico y clínico en atención médica. El marco de entrenamiento primero aplica RL guiado por reglas a preguntas derivadas de MedBullets para el diagnóstico, luego utiliza 5.3k escenarios sintéticos multi-turno con rúbricas multidimensionales para tareas clínicas interactivas.

arxiv arXiv cs.AI · hace 2 d HealthBench · 50.1% · 14 vistas

Fathom-Vaidya mejora el razonamiento médico con recompensas basadas en rúbricas

Los autores presentan Fathom-Vaidya, un modelo de 30B parámetros que utiliza datos sintéticos y aprendizaje por refuerzo basado en rúbricas para mejorar tanto el razonamiento diagnóstico como el clínico en atención médica. El marco de entrenamiento primero se centra en la precisión diagnóstica utilizando preguntas derivadas de MedBullets y luego aborda interacciones clínicas multironda a través de 5.3k escenarios generados con rúbricas multidimensionales.

media Latent Space · hace 2 d · 14 vistas

TypeSafe AI presenta Jev, un modelo System One entrenado con Aprendizaje por Refuerzo para Decisiones Calibradas

TypeSafe AI ha lanzado Jev, una nueva clase de modelos "System One" diseñados para entornos de producción. El CEO de la empresa y coautor del artículo sobre InstructGPT, Diogo Almeida, argumenta que los modelos de vanguardia actuales han priorizado la alineación y las negaciones sobre la fiabilidad, lo que ha provocado problemas como alucinaciones y sycophancy.

media MarkTechPost · hace 7 d · 21 vistas

OpenAI lanza un marco de divulgación de desalineación de modelos con 3 vías de revisión

OpenAI ha introducido un nuevo marco para rastrear, investigar y divulgar la desalineación en sus modelos, acompañado de seis informes detallados de incidentes procedentes del entrenamiento por aprendizaje por refuerzo. El sistema establece criterios y plazos específicos para la divulgación pública, aplicándose incluso cuando el comportamiento no está completamente explicado o mitigado.

media Hugging Face Forums · hace 8 d · 20 vistas

ByteLex utiliza el mapa del tokenizador para predecir y corregir errores del modelo de bytes

Los investigadores de ByteLex construyeron un espacio de coordenadas a partir de 11 vocabularios de tokenizadores para predecir en qué palabras inventadas fallaría su modelo de lenguaje a nivel de bytes. El mapa logró una correlación de Spearman de -0.98 con la precisión por palabra medida del modelo, superando las estadísticas derivadas del corpus.

arxiv arXiv cs.LG · hace 8 d · 21 vistas

OpenAI lanza Open-1B con un entrenamiento completamente auditable

OpenAI ha lanzado Open-1B, un modelo de lenguaje entrenado bajo un régimen donde cada operación durante el entrenamiento es reproducible de forma independiente en hardware comercial heterogéneo con certeza a nivel de bits. Este enfoque aborda los problemas de reproducibilidad inherentes a los modelos de código abierto al imponer un orden definido sobre las fuentes de no determinismo, como las reducciones de kernels de GPU y el ordenamiento de lotes de datos.

lab Hugging Face Blog · hace 10 d · 16 vistas

TRL v1.14 AsyncGRPOTrainer permite sincronización solo con LoRA en Hugging Face Jobs

TRL v1.14 introduce soporte para LoRA en AsyncGRPOTrainer, permitiendo entrenar un adaptador de Low-Rank Adaptation y sincronizar únicamente ese pequeño archivo con los trabajadores de inferencia de vLLM. Esta arquitectura desacopla los trabajos de entrenamiento y generación en máquinas separadas mediante el uso de un Storage Bucket compartido como puente de sistema de archivos, eliminando la necesidad de NCCL o comunicación directa de red entre nodos.

media Hugging Face Forums · hace 11 d · 19 vistas

pop123-ux lanza 38 cuadernos ejecutables para aprender Hugging Face eliminando abstracciones

El usuario pop123-ux ha publicado un repositorio de aprendizaje que contiene 38 cuadernos ejecutables diseñados para ayudar a los usuarios a comprender la pila de Hugging Face eliminando progresivamente las abstracciones de alto nivel. La colección cubre un camino desde componentes centrales como transformers y tokenizers hasta el ajuste fino, PEFT, razonamiento/RL y trabajo en proyectos de extremo a extremo.