JAMER presenta JamSet y JamBench, el primer conjunto de datos y benchmark de código de juegos a nivel de proyecto en un motor de juegos profesional. Construido a partir de 8,133 proyectos verificados de Game Jam, permite una evaluación determinista y revela un abismo de capacidad en los modelos de IA a medida que aumenta la escala del proyecto, con tasas de aprobación en tiempo de ejecución que caen de 80.4% a 5.7%.
JAMER: Conjunto de datos y benchmark de marco de código a nivel de proyecto
Estabilización de la intención de herramientas en RAG en streaming
Un estudio mide la estabilización de la intención de herramientas en RAG en streaming, definiendo cuándo las consultas de herramientas especulativas convergen a respuestas correctas. En el benchmark CRAG, el 73.9% de las consultas permiten ocultar latencia sustancial, con estabilización temprana observada en preguntas con evidencia recuperable literalmente. El tipo de pregunta predice significativamente la estabilización temprana frente a la tardía, informando cuándo los disparadores especulativos son efectivos.
Los Agentes de Inteligencia de Datos Habilitan la Consulta Autónoma de Datos
Los Agentes de Inteligencia de Datos (DIA) despliegan agentes de codificación autónomos para optimizar los flujos de trabajo de datos empresariales. El Generador de Consultas iguala o supera los mejores resultados publicados en siete benchmarks de SQL en cuatro dialectos, demostrando generalización a través de instrucciones en lenguaje natural y una arquitectura basada en ejecución.
CAPRA: Sistema de LLM multiagente para retroalimentación de arquitectura de software
CAPRA es un sistema de LLM multiagente que genera retroalimentación en LaTeX personalizada y conforme a plantillas sobre entregables de arquitectura de software. Utiliza agentes especializados, PyMuPDF y gpt-4o para extraer y analizar texto y diagramas UML, con anclaje de evidencia y gestión de consistencia para garantizar la fiabilidad. Una evaluación preliminar de 10 informes estudiantiles muestra que CAPRA cumplió el 88.8% de ocho criterios y logró un acuerdo moderado entre evaluadores (kappa = 0.582), con cada informe procesado en menos de 4 minutos.
SwiftTrans mejora la eficiencia de traducción de código en LLM
SwiftTrans aborda las brechas de eficiencia en tiempo de ejecución en la traducción de código basada en LLM mediante la introducción de Exploración Multi-Perspectiva y Selección Consciente de Diferencias. El marco extiende CodeNet, F2SBench e introduce SwiftBench para evaluar el rendimiento en tiempo de ejecución, mostrando mejoras consistentes tanto en corrección como en eficiencia a través de las pruebas.
CAT-Translate: Modelos compactos japonés-inglés superan a los multilingües en tareas del mundo real
CAT-Translate presenta una familia de modelos pequeños y de código abierto especializados en la traducción japonés-inglés. Mediante el uso de corpus paralelos sintéticos y un enfoque de ajuste fino en dos etapas, los modelos logran un rendimiento superior en benchmarks del mundo real en los ámbitos empresarial, legal, médico, financiero y de patentes, superando a los grandes modelos multilingües en aplicaciones prácticas.