DreamReasoner-8B es un modelo de difusión por bloques de código abierto que demuestra una sólida capacidad de razonamiento en cadenas largas de pensamiento. Un estudio sistemático muestra que los tamaños pequeños de bloques de entrenamiento preservan la efectividad del razonamiento, mientras que los tamaños grandes degradan el rendimiento. El aprendizaje de currículo por tamaño de bloque transita gradualmente el entrenamiento desde bloques finos hasta gruesos, permitiendo un razonamiento robusto y generalizable en diferentes configuraciones de inferencia, con resultados competitivos frente a Qwen3-8B en benchmarks matemáticos y de código.
DreamReasoner-8B: Aprendizaje de currículo por tamaño de bloque para razonamiento con difusión
La dirección en tiempo de prueba resuelve conflictos de hechos temporales en LLMs
Los investigadores identifican conflictos temporales paramétricos en modelos de lenguaje donde los hechos desactualizados persisten en los parámetros. Introducen la Dirección Atractora Temporal (TAS), un método en tiempo de prueba que resuelve del 29% al 57% de estos conflictos sin reentrenamiento, manteniendo una precisión del 85-99% en consultas sin conflicto y superando a una línea base en tres de cuatro modelos.
AgentFinVQA: QA de gráficos financieros auditable y en las instalaciones
AgentFinVQA introduce una canalización multi-agente para la respuesta a preguntas sobre gráficos financieros que garantiza la auditabilidad y la capacidad de implementación en las instalaciones sin una pérdida significativa de precisión. Supera a los modelos base en +7.68 pp utilizando un backbone propietario y en +4.84 pp con Qwen3.6-27B-FP8 de pesos abiertos, mientras proporciona una señal de confianza a través de la salida del verificador que mejora el enrutamiento de la revisión humana.
Ingeniería inversa de la atención en Transformers mediante programas ejecutables
Un nuevo método utiliza síntesis de programas para generar programas en Python que reproducen los patrones de atención en modelos Transformer. Estos programas logran más del 75% de similitud promedio Intersection-over-Union en datos no vistos y pueden reemplazar hasta el 25% de las cabezas de atención con impacto mínimo en el rendimiento del modelo, aumentando la perplexidad solo un 16% en promedio.
OmniAgent: Percepción activa nativa para comprensión omnimodal
OmniAgent introduce un ciclo iterativo Observación-Pensamiento-Acción basado en POMDP para la comprensión de video, permitiendo la ejecución de acciones bajo demanda para destilar selectivamente señales audiovisuales en memoria textual persistente. Alcanza rendimiento de vanguardia en diez benchmarks, con un agente de 7B superando a un modelo Qwen2.5-VL-72B 10× más grande en LVBench (50.5% vs. 47.3%).
Evaluación de referencia de LLMs de código abierto para clasificación multi-etiqueta de ATT&CK
Se construyó un conjunto de datos con verdad fundamental de 2,076 oraciones anotadas por humanos procedentes de 83 informes complejos de CTI y se asignaron a 114 técnicas de ATT&CK con \k{appa} = 0.68 de acuerdo entre anotadores. Se evaluaron siete LLMs de código abierto que oscilan entre 8B y 236B parámetros, alcanzando una puntuación F1 micro-promediada máxima de 0.22. El tamaño del parámetro mostró una correlación positiva estadísticamente significativa con la puntuación F1, mientras que la estrategia de prompt y la temperatura no produjeron mejoras significativas, lo que indica que los LLMs actuales de código abierto son insuficientes para la clasificación de ATT&CK de grado de producción.