Training methods
arxiv arXiv cs.LG · hace 1 d HealthBench · 50.1% · 10 vistas

Fathom-Vaidya mejora el razonamiento médico con recompensas basadas en rúbricas

Los autores presentan Fathom-Vaidya, un modelo de 30B parámetros que utiliza datos sintéticos y aprendizaje por refuerzo basado en rúbricas para mejorar el razonamiento diagnóstico y clínico en atención médica. El marco de entrenamiento primero aplica RL guiado por reglas a preguntas derivadas de MedBullets para el diagnóstico, luego utiliza 5.3k escenarios sintéticos multi-turno con rúbricas multidimensionales para tareas clínicas interactivas.

arxiv arXiv cs.AI · hace 1 d HealthBench · 50.1% · 12 vistas

Fathom-Vaidya mejora el razonamiento médico con recompensas basadas en rúbricas

Los autores presentan Fathom-Vaidya, un modelo de 30B parámetros que utiliza datos sintéticos y aprendizaje por refuerzo basado en rúbricas para mejorar tanto el razonamiento diagnóstico como el clínico en atención médica. El marco de entrenamiento primero se centra en la precisión diagnóstica utilizando preguntas derivadas de MedBullets y luego aborda interacciones clínicas multironda a través de 5.3k escenarios generados con rúbricas multidimensionales.

media Latent Space · hace 1 d · 13 vistas

TypeSafe AI presenta Jev, un modelo System One entrenado con Aprendizaje por Refuerzo para Decisiones Calibradas

TypeSafe AI ha lanzado Jev, una nueva clase de modelos "System One" diseñados para entornos de producción. El CEO de la empresa y coautor del artículo sobre InstructGPT, Diogo Almeida, argumenta que los modelos de vanguardia actuales han priorizado la alineación y las negaciones sobre la fiabilidad, lo que ha provocado problemas como alucinaciones y sycophancy.

media MarkTechPost · hace 6 d · 20 vistas

OpenAI lanza un marco de divulgación de desalineación de modelos con 3 vías de revisión

OpenAI ha introducido un nuevo marco para rastrear, investigar y divulgar la desalineación en sus modelos, acompañado de seis informes detallados de incidentes procedentes del entrenamiento por aprendizaje por refuerzo. El sistema establece criterios y plazos específicos para la divulgación pública, aplicándose incluso cuando el comportamiento no está completamente explicado o mitigado.

media Hugging Face Forums · hace 7 d · 15 vistas

ByteLex utiliza el mapa del tokenizador para predecir y corregir errores del modelo de bytes

Los investigadores de ByteLex construyeron un espacio de coordenadas a partir de 11 vocabularios de tokenizadores para predecir en qué palabras inventadas fallaría su modelo de lenguaje a nivel de bytes. El mapa logró una correlación de Spearman de -0.98 con la precisión por palabra medida del modelo, superando las estadísticas derivadas del corpus.

arxiv arXiv cs.LG · hace 7 d · 20 vistas

OpenAI lanza Open-1B con un entrenamiento completamente auditable

OpenAI ha lanzado Open-1B, un modelo de lenguaje entrenado bajo un régimen donde cada operación durante el entrenamiento es reproducible de forma independiente en hardware comercial heterogéneo con certeza a nivel de bits. Este enfoque aborda los problemas de reproducibilidad inherentes a los modelos de código abierto al imponer un orden definido sobre las fuentes de no determinismo, como las reducciones de kernels de GPU y el ordenamiento de lotes de datos.

lab Hugging Face Blog · hace 9 d · 16 vistas

TRL v1.14 AsyncGRPOTrainer permite sincronización solo con LoRA en Hugging Face Jobs

TRL v1.14 introduce soporte para LoRA en AsyncGRPOTrainer, permitiendo entrenar un adaptador de Low-Rank Adaptation y sincronizar únicamente ese pequeño archivo con los trabajadores de inferencia de vLLM. Esta arquitectura desacopla los trabajos de entrenamiento y generación en máquinas separadas mediante el uso de un Storage Bucket compartido como puente de sistema de archivos, eliminando la necesidad de NCCL o comunicación directa de red entre nodos.

media Hugging Face Forums · hace 11 d · 16 vistas

pop123-ux lanza 38 cuadernos ejecutables para aprender Hugging Face eliminando abstracciones

El usuario pop123-ux ha publicado un repositorio de aprendizaje que contiene 38 cuadernos ejecutables diseñados para ayudar a los usuarios a comprender la pila de Hugging Face eliminando progresivamente las abstracciones de alto nivel. La colección cubre un camino desde componentes centrales como transformers y tokenizers hasta el ajuste fino, PEFT, razonamiento/RL y trabajo en proyectos de extremo a extremo.

media MarkTechPost · hace 12 d Berkeley Function-Calling Leaderboard · 83.2% · 18 vistas

Google Research lanza ToolGrad, un marco de generación de datos para el uso de herramientas

Investigadores de Google y varias universidades japonesas han presentado ToolGrad, un marco que invierte la tubería tradicional para generar conjuntos de datos de uso de herramientas, construyendo primero cadenas de API verificadas y luego escribiendo consultas de usuario coincidentes. Este enfoque busca eliminar la ineficiencia de los métodos basados en consultas previas que a menudo fallan durante la exploración del agente.

arxiv arXiv cs.CL · hace 14 d SWE-bench Verified · 72.6% · 25 vistas

ExecCritic utiliza RL específico por rol para mejorar agentes de codificación mediante reparación guiada por pruebas

Los investigadores presentan ExecCritic, un marco que combina una estructura de verificar-revisar-corregir con aprendizaje por refuerzo específico por rol para potenciar agentes de codificación. El sistema separa la construcción de pruebas de la reparación del código fuente, utilizando un agente de Pruebas para generar pruebas nativas del repositorio y un agente de Reparación para revisar el código basándose en retroalimentación de ejecución.