Las distilaciones de modelos Qwen y Claude, como Qwen 3.6 distilado con solo 4.000 muestras, rara vez mejoran el rendimiento y a menudo degradan la calidad. Estos modelos pueden exhibir un estilo más 'similar a Opus', pero fallan al transferir capacidad real, con algunos mostrando alucinaciones y tiempos de respuesta más lentos en comparación con los modelos base, según lo demostrado en pruebas y reportes de usuarios.
Desconfía de las distilaciones de Qwen/Claude: a menudo son peores que el modelo base
Destacado: Uso de GPUs Spot para acelerar el post-entrenamiento RL de DiT
Spotlight permite el post-entrenamiento RL de DiT aprovechando GPUs spot inactivas, reduciendo los costos entre 1.4 y 6.4 veces mientras se logra una calidad de imagen superior. Utiliza pesos de modelo obsoletos en la exploración y reconfigura el paralelismo de secuencias sobre la marcha, permitiendo un uso eficiente de las GPUs sin interrumpir los pipelines de entrenamiento.
OPD-Evolver: Destilación on-policy para la evolución holística de agentes
OPD-Evolver introduce un marco de co-evolución lento-rápido que permite a los agentes seleccionar, actuar y reutilizar experiencias mediante auto-destilación on-policy. Supera a los métodos existentes basados en memoria y entrenamiento hasta en un 11.5% y un 5.8% respectivamente, y demuestra capacidad para desafiar modelos a gran escala como Qwen3.5-397B-A17B y Step-3.5-Flash.
Evaluación de referencia de modelos de lenguaje pequeños para PLN en árabe
Una evaluación de referencia con 240 elementos de prueba en árabe en ocho dominios y diez habilidades evalúa doce modelos de lenguaje pequeños en configuraciones zero-shot. Gemma 3 (12B) obtuvo la puntuación general más alta (4.548/5), seguido por Aya y C4AI Command Arabic, con un rendimiento vinculado más a la alineación con el árabe y al seguimiento de instrucciones que al tamaño del modelo. Los modos de fallo comunes incluyen filtración de prompt, alucinación y débil adherencia a la tarea.
Evaluación de referencia de modelos de lenguaje pequeños para PLN en árabe
Una evaluación de referencia de 240 elementos de prueba en árabe a través de ocho dominios y diez habilidades evalúa doce modelos de lenguaje pequeños en configuraciones zero-shot. Gemma 3 (12B) obtuvo la puntuación general más alta (4.548/5), seguido por Aya y C4AI Command Arabic, con un rendimiento vinculado más a la alineación en árabe y al seguimiento de instrucciones que al tamaño del modelo. Los modos de fallo comunes incluyen filtración de prompt, alucinación y débil adherencia a la tarea.
TxBench-PP: Rendimiento de Agentes de IA en Farmacología Preclínica
TxBench-PP es una benchmark verificable para farmacología preclínica de moléculas pequeñas, que prueba la capacidad de los agentes de IA para derivar conclusiones precisas a partir de datos de ensayos del mundo real. En 16 configuraciones de model-harness, ningún sistema tomó decisiones de farmacología preclínica correctas de manera confiable, con el mejor rendimiento en 59.3% (Claude Opus 4.8 / Pi) y 55.3% (GPT-5.5 / Pi) de intentos de punto final.