LoopCoder-v2, un modelo Transformer de bucles paralelos, alcanza un rendimiento superior en generación y razonamiento de código con dos bucles, mejorando SWE-bench Verified de 43.0 a 64.4 puntos y Multi-SWE de 14.0 a 31.0 puntos. Las variantes con tres o más bucles tienen un rendimiento peor, lo que indica un efecto no monótono del conteo de bucles debido al creciente desajuste posicional y rendimientos decrecientes.
LoopCoder-v2 logra el rendimiento óptimo en bucles anidados
Benchmarks
| Benchmark | Modelo | Puntuación |
|---|---|---|
| SWE-bench Verified | LoopCoder-v2 | 64.4% |
CAT-Translate: Modelos compactos japonés-inglés superan a los multilingües en tareas del mundo real
CAT-Translate presenta una familia de modelos pequeños y de código abierto especializados en la traducción japonés-inglés. Mediante el uso de corpus paralelos sintéticos y un enfoque de ajuste fino en dos etapas, los modelos logran un rendimiento superior en benchmarks del mundo real en los ámbitos empresarial, legal, médico, financiero y de patentes, superando a los grandes modelos multilingües en aplicaciones prácticas.
JAMER: Conjunto de datos y benchmark de marco de código a nivel de proyecto
JAMER presenta JamSet y JamBench, el primer conjunto de datos y benchmark de código de juegos a nivel de proyecto en un motor de juegos profesional. Construido a partir de 8,133 proyectos verificados de Game Jam, permite una evaluación determinista y revela un abismo de capacidad en los modelos de IA a medida que aumenta la escala del proyecto, con tasas de aprobación en tiempo de ejecución que caen de 80.4% a 5.7%.
Los Agentes de Inteligencia de Datos Habilitan la Consulta Autónoma de Datos
Los Agentes de Inteligencia de Datos (DIA) despliegan agentes de codificación autónomos para optimizar los flujos de trabajo de datos empresariales. El Generador de Consultas iguala o supera los mejores resultados publicados en siete benchmarks de SQL en cuatro dialectos, demostrando generalización a través de instrucciones en lenguaje natural y una arquitectura basada en ejecución.
CAPRA: Sistema de LLM multiagente para retroalimentación de arquitectura de software
CAPRA es un sistema de LLM multiagente que genera retroalimentación en LaTeX personalizada y conforme a plantillas sobre entregables de arquitectura de software. Utiliza agentes especializados, PyMuPDF y gpt-4o para extraer y analizar texto y diagramas UML, con anclaje de evidencia y gestión de consistencia para garantizar la fiabilidad. Una evaluación preliminar de 10 informes estudiantiles muestra que CAPRA cumplió el 88.8% de ocho criterios y logró un acuerdo moderado entre evaluadores (kappa = 0.582), con cada informe procesado en menos de 4 minutos.
Gradio lanza Workflow1111, reconstruyendo las funciones de AUTOMATIC1111 como un grafo de Gradio
Gradio ha lanzado Workflow1111, un proyecto que reconstruye la mayoría del conjunto de funciones de stable-diffusion-webui de AUTOMATIC1111 utilizando el framework gr.Workflow. La aplicación consiste en un único lienzo que contiene once pipelines multimedia construidos a partir de setenta y tres nodos, cubriendo tareas de texto a imagen, imagen a video y varias tareas de preprocesamiento.