CAT-Translate presenta una familia de modelos pequeños y de código abierto especializados en la traducción japonés-inglés. Mediante el uso de corpus paralelos sintéticos y un enfoque de ajuste fino en dos etapas, los modelos logran un rendimiento superior en benchmarks del mundo real en los ámbitos empresarial, legal, médico, financiero y de patentes, superando a los grandes modelos multilingües en aplicaciones prácticas.
CAT-Translate: Modelos compactos japonés-inglés superan a los multilingües en tareas del mundo real
Beaver: Arnés de agente para curación científica a partir de fuentes multimodales
Beaver es un arnés de agente que extrae información estructurada de artículos científicos integrando herramientas de evidencia multimodal, andamiaje de tareas y autoresearch basado en artefactos. Alcanza 81.0 en la Puntuación de Atributos con Referencia Dorada, superando a agentes de vanguardia por más de 23 puntos, con ganancias clave en atributos de alto valor que requieren razonamiento cross-modal.
See-and-Reach: Navegación de visión-lenguaje para UAVs en el campo de visión
UAV-VLN-FOV aísla la etapa de ver-y-alcanzar para una evaluación precisa de la navegación de UAV. 3DG-VLN mejora la fundamentación visual y la alineación espacial utilizando pistas de dirección 3D dinámicas, logrando una mejora del 13.82% en la tasa de éxito sobre las líneas base y validado en pruebas del mundo real.
Evolución oculta del contexto visual disfrazado en VLMs
Los tokens visuales ingresan a los modelos de lenguaje grandes como señales crudas y no estructuradas. Su transformación e integración internas dependen de la arquitectura, ya sea como prompts in-context o inyectados en capas intermedias, lo que conduce a distintas trayectorias evolutivas en la representación visual y las características de frecuencia. Encontramos que la atención por sí sola es insuficiente; el rendimiento está impulsado por la calidad de las representaciones visuales en cada capa a través de diferentes paradigmas de integración.
IHUBERT: Modelo preentrenado en persa con deduplicación semántica
IHUBERT es un modelo de lenguaje preentrenado monolingüe en persa, entrenado sobre un subconjunto curado de 45 GB de la colección Sepahr-Danesh. Utiliza deduplicación semántica basada en vectores y una canalización de preentrenamiento equilibrada por dominio para mejorar la calidad del corpus y reducir la redundancia, logrando un rendimiento destacado en respuesta a preguntas extractivas y resultados sólidos en NER y clasificación de temas, aunque la extracción de relaciones sigue siendo un desafío.
JAMER: Conjunto de datos y benchmark de marco de código a nivel de proyecto
JAMER presenta JamSet y JamBench, el primer conjunto de datos y benchmark de código de juegos a nivel de proyecto en un motor de juegos profesional. Construido a partir de 8,133 proyectos verificados de Game Jam, permite una evaluación determinista y revela un abismo de capacidad en los modelos de IA a medida que aumenta la escala del proyecto, con tasas de aprobación en tiempo de ejecución que caen de 80.4% a 5.7%.