IHUBERT es un modelo de lenguaje preentrenado monolingüe en persa, entrenado sobre un subconjunto curado de 45 GB de la colección Sepahr-Danesh. Utiliza deduplicación semántica basada en vectores y una canalización de preentrenamiento equilibrada por dominio para mejorar la calidad del corpus y reducir la redundancia, logrando un rendimiento destacado en respuesta a preguntas extractivas y resultados sólidos en NER y clasificación de temas, aunque la extracción de relaciones sigue siendo un desafío.
IHUBERT: Modelo preentrenado en persa con deduplicación semántica
CAT-Translate: Modelos compactos japonés-inglés superan a los multilingües en tareas del mundo real
CAT-Translate presenta una familia de modelos pequeños y de código abierto especializados en la traducción japonés-inglés. Mediante el uso de corpus paralelos sintéticos y un enfoque de ajuste fino en dos etapas, los modelos logran un rendimiento superior en benchmarks del mundo real en los ámbitos empresarial, legal, médico, financiero y de patentes, superando a los grandes modelos multilingües en aplicaciones prácticas.
Microsoft Research presenta el benchmark MindTopo para evaluar el razonamiento espacial de los VLM
Microsoft Research ha presentado MindTopo, un nuevo benchmark diseñado para evaluar si los modelos de lenguaje multimodales grandes poseen intuición topológica respecto a conectividad, contención, orden, separación y nudos.
NVIDIA presenta Spatial-IQ, un marco de diagnóstico jerárquico para el razonamiento espacial en modelos multimodales
Investigadores de NVIDIA han presentado Spatial-IQ, un marco de diagnóstico diseñado para descomponer la inteligencia espacial de los grandes modelos de lenguaje multimodales (MLLMs). A diferencia de las evaluaciones existentes que tratan a los modelos como cajas negras, este enfoque descompone el conteo de objetos en estructuras 3D apiladas en nueve sub-tareas perceptivas y cognitivas alineadas con las etapas del desarrollo humano.
Las pruebas de plugins para agentes de codificación muestran que el ahorro de tokens no equivale a reducciones de costo
Un análisis de tareas de agentes de codificación utilizando GPT-5.6-sol y Codex CLI 0.144.1 demuestra que reducir los tokens de contexto en un 90% no resulta en ahorros proporcionales del costo total de la tarea.
El conjunto de datos CSB revela que los MLLM eliminan la brecha en la precisión de la descripción de escenas de comportamiento social complejo
Este estudio presenta el conjunto de datos Complex Social Behavior (CSB), que contiene 100 imágenes de interacciones sociales complejas, para evaluar modelos de visión-lenguaje a lo largo de una década (2017-2025). La investigación analiza cinco tipos de errores visuo-cognitivos en cuatro Modelos de Lenguaje Grande Multimodales (MLLM) previos y cinco MLLM.