Los autores presentan iLLaDA, un modelo de lenguaje de difusión enmascarado de 8B parámetros entrenado desde cero utilizando atención totalmente bidireccional. Este enfoque contrasta con la factorización autoregresiva predominante y la atención causal utilizadas en los modernos modelos de lenguaje grandes. El pre-entrenamiento del modelo escaló a 12 billones de tokens, seguido de ajuste fino supervisado en un corpus de instrucciones de 25 mil millones de tokens durante 12 épocas. iLLaDA mantiene el objetivo de difusión enmascarada durante ambas fases de entrenamiento y emplea generación de longitud variable para eficiencia. También introduce puntuación basada en confianza para mejorar el rendimiento en tareas de evaluación de opción múltiple. Los resultados de los benchmarks muestran mejoras significativas sobre su predecesor, LLaDA, incluyendo ganancias de 21.6 puntos en BBH y 14.9 puntos en ARC-Challenge para el modelo base. La variante ajustada con instrucciones logró aumentos de 14.5 puntos en MATH y 16.5 puntos en HumanEval. A pesar de su naturaleza no autoregresiva, iLLaDA sigue siendo competitivo con Qwen2.5 7B en varias métricas.
iLLaDA: Un modelo de lenguaje de difusión enmascarado de 8B con atención totalmente bidireccional
Benchmarks
| Benchmark | Modelo | Puntuación |
|---|---|---|
| ARC-AGI 1 | iLLaDA-Base | 14.9pts |
| HumanEval+ | iLLaDA-Instruct | 16.5pts |
Fathom-Vaidya mejora el razonamiento médico con recompensas basadas en rúbricas
Los autores presentan Fathom-Vaidya, un modelo de 30B parámetros que utiliza datos sintéticos y aprendizaje por refuerzo basado en rúbricas para mejorar el razonamiento diagnóstico y clínico en atención médica. El marco de entrenamiento primero aplica RL guiado por reglas a preguntas derivadas de MedBullets para el diagnóstico, luego utiliza 5.3k escenarios sintéticos multi-turno con rúbricas multidimensionales para tareas clínicas interactivas.
Fathom-Vaidya mejora el razonamiento médico con recompensas basadas en rúbricas
Los autores presentan Fathom-Vaidya, un modelo de 30B parámetros que utiliza datos sintéticos y aprendizaje por refuerzo basado en rúbricas para mejorar tanto el razonamiento diagnóstico como el clínico en atención médica. El marco de entrenamiento primero se centra en la precisión diagnóstica utilizando preguntas derivadas de MedBullets y luego aborda interacciones clínicas multironda a través de 5.3k escenarios generados con rúbricas multidimensionales.
Fathom-Vaidya mejora el razonamiento médico con recompensas basadas en rúbricas
Los autores presentan Fathom-Vaidya, un modelo de 30B parámetros que utiliza datos sintéticos y aprendizaje por refuerzo basado en rúbricas para mejorar tanto el razonamiento diagnóstico como el clínico en el ámbito sanitario.
MB-Bidram comparte la arquitectura experimental WideNDepth que separa el razonamiento del conocimiento
MB-Bidram ha lanzado una arquitectura neuronal experimental llamada WideNDepth (WND) diseñada para separar las capacidades de razonamiento del almacenamiento de conocimientos. El modelo consta de una "parte ancha" que funciona como memoria y una "parte profunda" que actúa como el razonador.
Propuesta: Transferencia progresiva de conocimiento de Qwen 9B a 27B para un modelo fijo de 4B
Un usuario en los foros de Hugging Face propone un experimento de transferencia progresiva de conocimiento, donde un modelo estudiante de tamaño fijo (Qwen 4B) aprende secuencialmente de maestros cada vez más grandes en lugar de hacerlo directamente desde el más grande disponible.