Un estudio desafía la suposición de que las señales de atención visual indican fiabilidad en los modelos de visión y lenguaje. Encuentra una correlación cercana a cero entre la atención espacial y la precisión, mostrando en cambio que la autoconsistencia a través de las rutas de razonamiento es un predictor más fuerte de la verdad. La fiabilidad se explica mejor por la dinámica de generación y las distribuciones del estado interno, no por los patrones de atención visual.
Las imágenes engañan, la consistencia habla: Desacoplar la atención espacial de la fiabilidad en modelos de visión y lenguaje
Evaluación de referencia de modelos de lenguaje pequeños para PLN en árabe
Una evaluación de referencia con 240 elementos de prueba en árabe en ocho dominios y diez habilidades evalúa doce modelos de lenguaje pequeños en configuraciones zero-shot. Gemma 3 (12B) obtuvo la puntuación general más alta (4.548/5), seguido por Aya y C4AI Command Arabic, con un rendimiento vinculado más a la alineación con el árabe y al seguimiento de instrucciones que al tamaño del modelo. Los modos de fallo comunes incluyen filtración de prompt, alucinación y débil adherencia a la tarea.
Evaluación de referencia de modelos de lenguaje pequeños para PLN en árabe
Una evaluación de referencia de 240 elementos de prueba en árabe a través de ocho dominios y diez habilidades evalúa doce modelos de lenguaje pequeños en configuraciones zero-shot. Gemma 3 (12B) obtuvo la puntuación general más alta (4.548/5), seguido por Aya y C4AI Command Arabic, con un rendimiento vinculado más a la alineación en árabe y al seguimiento de instrucciones que al tamaño del modelo. Los modos de fallo comunes incluyen filtración de prompt, alucinación y débil adherencia a la tarea.
Protocolo VLM-as-3D-Judge de-biased para Generación de Muebles
Un protocolo de juez basado en VLM de-biased especializa TRELLIS en la generación de muebles mediante adaptación ligera. El protocolo aborda modos de fallo como sobrecarga de imagen y ocultamiento de geometría, con calibración que muestra tasas de victoria de 0.83–1.0 y simetría base-vs-base en 0.5. Entre seis métodos de adaptación, la reparación del condicionador bajo degradación severa alcanza paridad con el modelo base, mientras que ningún método supera el objetivo de tasa de victoria del 65%.
Los LLM predicen demencia y depresión a partir del habla clínica
Un estudio utiliza modelos de lenguaje grandes de peso abierto para evaluar la gravedad de la demencia y la depresión a partir de entrevistas clínicas. Los LLM logran una predicción precisa de la depresión en zero-shot (MAE 0.60) y una evaluación mejorada de la demencia con extracción de características (MAE 0.78), reduciendo los errores hasta un 35%. Las transcripciones enriquecidas con pausas coinciden con las transcripciones humanas, apoyando los flujos de trabajo de detección automatizada para trastornos neuropsiquiátricos.
OPD-Evolver: Destilación on-policy para la evolución holística de agentes
OPD-Evolver introduce un marco de co-evolución lento-rápido que permite a los agentes seleccionar, actuar y reutilizar experiencias mediante auto-destilación on-policy. Supera a los métodos existentes basados en memoria y entrenamiento hasta en un 11.5% y un 5.8% respectivamente, y demuestra capacidad para desafiar modelos a gran escala como Qwen3.5-397B-A17B y Step-3.5-Flash.