Spotlight habilita el post-entrenamiento RL de DiT aprovechando GPUs spot inactivas, reduciendo los costos entre 1.4 y 6.4 veces mientras se logra una calidad de imagen superior. Utiliza pesos de modelo desactualizados en la exploración y reconfigura el paralelismo de secuencias en tiempo real, permitiendo un uso eficiente de las GPUs sin interrumpir los pipelines de entrenamiento.
Destacado: Uso de GPUs Spot para acelerar el post-entrenamiento RL de DiT
Destacado: Uso de GPUs Spot para acelerar el post-entrenamiento RL de DiT
Spotlight permite el post-entrenamiento RL de DiT aprovechando GPUs spot inactivas, reduciendo los costos entre 1.4 y 6.4 veces mientras se logra una calidad de imagen superior. Utiliza pesos de modelo obsoletos en la exploración y reconfigura el paralelismo de secuencias sobre la marcha, permitiendo un uso eficiente de las GPUs sin interrumpir los pipelines de entrenamiento.
Se lanza el conjunto de datos ATT&CK-Labeled Multi-Source Cybersecurity Logs Dataset
Un nuevo conjunto de datos combina registros del sistema, de red y del navegador de 870 sesiones de Windows, que incluyen 70 ataques y 800 casos benignos. Proporciona etiquetas por evento con IDs de técnicas MITRE ATT&CK para 12 tácticas y 53 técnicas, utilizando herramientas de ataque reales como RAT y túneles C2. El ajuste fino de tres Modelos de Lenguaje Pequeños (SLMs) mediante LoRA mejoró la precisión de clasificación de fragmentos al 90–97% y logró hasta un 42% de precisión en coincidencia exacta en la identificación de técnicas, mostrando una fuerte captura de razonamiento a pesar de los desafíos.
OPD-Evolver: Destilación on-policy para la evolución holística de agentes
OPD-Evolver introduce un marco de co-evolución lento-rápido que permite a los agentes seleccionar, actuar y reutilizar experiencias mediante auto-destilación on-policy. Supera a los métodos existentes basados en memoria y entrenamiento hasta en un 11.5% y un 5.8% respectivamente, y demuestra capacidad para desafiar modelos a gran escala como Qwen3.5-397B-A17B y Step-3.5-Flash.
Desconfía de las distilaciones de Qwen/Claude: a menudo son peores que el modelo base
Las distilaciones de modelos Qwen y Claude, como Qwen 3.6 distilado con solo 4.000 muestras, rara vez mejoran el rendimiento y a menudo degradan la calidad. Estos modelos pueden exhibir un estilo más 'similar a Opus', pero fallan al transferir capacidad real, con algunos mostrando alucinaciones y tiempos de respuesta más lentos en comparación con los modelos base, según lo demostrado en pruebas y reportes de usuarios.
SocialRL entrena un modelo de 4B para igualar a GPT-5 en negociación mediante razonamiento social
Los investigadores presentan SocialRL, una receta de entrenamiento que refuerza directamente el razonamiento social en modelos de lenguaje pequeños para mejorar su rendimiento como negociadores estratégicos. Aplicado a un modelo de 4B en seis dominios, incluyendo Deal-or-No-Deal y Entrevista de trabajo, el enfoque permite al modelo igualar o superar el rendimiento de la familia GPT-5 en escenarios no vistos.