OPD-Evolver introduce un marco de co-evolución lento-rápido que permite a los agentes seleccionar, actuar y reutilizar experiencias mediante auto-destilación on-policy. Supera a los métodos existentes basados en memoria y entrenamiento hasta en un 11.5% y un 5.8% respectivamente, y demuestra capacidad para desafiar modelos a gran escala como Qwen3.5-397B-A17B y Step-3.5-Flash.
OPD-Evolver: Destilación on-policy para la evolución holística de agentes
Evaluación de referencia de modelos de lenguaje pequeños para PLN en árabe
Una evaluación de referencia con 240 elementos de prueba en árabe en ocho dominios y diez habilidades evalúa doce modelos de lenguaje pequeños en configuraciones zero-shot. Gemma 3 (12B) obtuvo la puntuación general más alta (4.548/5), seguido por Aya y C4AI Command Arabic, con un rendimiento vinculado más a la alineación con el árabe y al seguimiento de instrucciones que al tamaño del modelo. Los modos de fallo comunes incluyen filtración de prompt, alucinación y débil adherencia a la tarea.
Evaluación de referencia de modelos de lenguaje pequeños para PLN en árabe
Una evaluación de referencia de 240 elementos de prueba en árabe a través de ocho dominios y diez habilidades evalúa doce modelos de lenguaje pequeños en configuraciones zero-shot. Gemma 3 (12B) obtuvo la puntuación general más alta (4.548/5), seguido por Aya y C4AI Command Arabic, con un rendimiento vinculado más a la alineación en árabe y al seguimiento de instrucciones que al tamaño del modelo. Los modos de fallo comunes incluyen filtración de prompt, alucinación y débil adherencia a la tarea.
X+Slides: Benchmark para la Generación de Diapositivas Condicionada por Audiencia
X+Slides introduce un benchmark que evalúa la generación de diapositivas en función de las necesidades del público objetivo. Utiliza 8,133 sondas fundamentadas en la fuente a través de 113 temas y siete escenas para medir la Cobertura de Audiencia, Cobertura por Dominio, Eficiencia y Corrección, revelando que los sistemas actuales recuperan solo información parcial esencial para la audiencia, con DeepPresenter logrando 0.714 de Cobertura de Audiencia, SlideTailor 0.594 y NotebookLM ablation 0.853, destacando la necesidad de una evaluación fundamentada en la fuente.
Destacado: Uso de GPUs Spot para acelerar el post-entrenamiento RL de DiT
Spotlight permite el post-entrenamiento RL de DiT aprovechando GPUs spot inactivas, reduciendo los costos entre 1.4 y 6.4 veces mientras se logra una calidad de imagen superior. Utiliza pesos de modelo obsoletos en la exploración y reconfigura el paralelismo de secuencias sobre la marcha, permitiendo un uso eficiente de las GPUs sin interrumpir los pipelines de entrenamiento.
Se lanza el conjunto de datos ATT&CK-Labeled Multi-Source Cybersecurity Logs Dataset
Un nuevo conjunto de datos combina registros del sistema, de red y del navegador de 870 sesiones de Windows, que incluyen 70 ataques y 800 casos benignos. Proporciona etiquetas por evento con IDs de técnicas MITRE ATT&CK para 12 tácticas y 53 técnicas, utilizando herramientas de ataque reales como RAT y túneles C2. El ajuste fino de tres Modelos de Lenguaje Pequeños (SLMs) mediante LoRA mejoró la precisión de clasificación de fragmentos al 90–97% y logró hasta un 42% de precisión en coincidencia exacta en la identificación de técnicas, mostrando una fuerte captura de razonamiento a pesar de los desafíos.