Los autores proponen el Enrutamiento Consciente de Sí Mismo (SAS) para optimizar el orden de desenmascaramiento de tokens en modelos de lenguaje de difusión enmascarados, lo cual impacta significativamente la calidad de la generación. Derivan una cota superior manejable sobre la discrepancia de decodificación secuencial utilizando divergencia de Kullback-Leibler y verosimilitud logarítmica por trayectorias. Esta cota crea una recompensa densa y consciente de sí misma que enmarca la selección del orden como un problema de optimización de políticas con un denoiser congelado. SAS aprende una política de orden ligera mediante Optimización de Política Relativa por Grupos, soportando tanto decodificación de cualquier orden como semi-autoregresiva. En tareas de Sudoku usando un modelo de 1B parámetros, la precisión mejoró del 82.0% al 91.8%, alcanzando el 97.5% después del ajuste fino de segunda etapa. Para razonamiento matemático con LLaDA-8B, pass@1 en GSM8K aumentó del 64% al 76%. El método también elevó las puntuaciones de MBPP del 39.5% al 41%, igualando o superando consistentemente los horarios heurísticos a través de varios parámetros.
El Enrutamiento Consciente de Sí Mismo Aprende el Orden de Desenmascaramiento de Tokens en Modelos de Lenguaje de Difusión
Fathom-Vaidya mejora el razonamiento médico con recompensas basadas en rúbricas
Los autores presentan Fathom-Vaidya, un modelo de 30B parámetros que utiliza datos sintéticos y aprendizaje por refuerzo basado en rúbricas para mejorar el razonamiento diagnóstico y clínico en atención médica. El marco de entrenamiento primero aplica RL guiado por reglas a preguntas derivadas de MedBullets para el diagnóstico, luego utiliza 5.3k escenarios sintéticos multi-turno con rúbricas multidimensionales para tareas clínicas interactivas.
Fathom-Vaidya mejora el razonamiento médico con recompensas basadas en rúbricas
Los autores presentan Fathom-Vaidya, un modelo de 30B parámetros que utiliza datos sintéticos y aprendizaje por refuerzo basado en rúbricas para mejorar tanto el razonamiento diagnóstico como el clínico en atención médica. El marco de entrenamiento primero se centra en la precisión diagnóstica utilizando preguntas derivadas de MedBullets y luego aborda interacciones clínicas multironda a través de 5.3k escenarios generados con rúbricas multidimensionales.
Fathom-Vaidya mejora el razonamiento médico con recompensas basadas en rúbricas
Los autores presentan Fathom-Vaidya, un modelo de 30B parámetros que utiliza datos sintéticos y aprendizaje por refuerzo basado en rúbricas para mejorar tanto el razonamiento diagnóstico como el clínico en el ámbito sanitario.
MB-Bidram comparte la arquitectura experimental WideNDepth que separa el razonamiento del conocimiento
MB-Bidram ha lanzado una arquitectura neuronal experimental llamada WideNDepth (WND) diseñada para separar las capacidades de razonamiento del almacenamiento de conocimientos. El modelo consta de una "parte ancha" que funciona como memoria y una "parte profunda" que actúa como el razonador.
Propuesta: Transferencia progresiva de conocimiento de Qwen 9B a 27B para un modelo fijo de 4B
Un usuario en los foros de Hugging Face propone un experimento de transferencia progresiva de conocimiento, donde un modelo estudiante de tamaño fijo (Qwen 4B) aprende secuencialmente de maestros cada vez más grandes en lugar de hacerlo directamente desde el más grande disponible.