RTSGameBench aborda las limitaciones de los benchmarks de RTS existentes ofreciendo una jugabilidad diversa, diagnóstico de competencias específicas y generación de escenarios autoevolutivos. Evalúa modelos de visión y lenguaje en el razonamiento estratégico bajo incertidumbre, revelando que los modelos de última generación tienen dificultades con la coordinación multiagente y tareas a gran escala.
RTSGameBench: Un benchmark de RTS para el razonamiento estratégico
Marco de doble agente para traducción verificada entre modelos
Un marco de doble agente convierte protocolos experimentales en lenguaje natural en comandos ejecutables para plataformas robóticas de laboratorio. Utiliza un Agente Analizador y un motor de mapeo basado en reglas para traducir los protocolos, con un Agente de Validación LLM heterogéneo que asegura la precisión e inicia la autocorrección. El marco permite con éxito la ejecución autónoma de extremo a extremo de experimentos basados en placas de microtitulación como el ensayo de Bradford.
OneCanvas: Comprensión de escenas 3D mediante reproyección panorámica
OneCanvas permite la comprensión de escenas 3D en Modelos Visión-Lenguaje agregando características de parches sobre un lienzo panorámico utilizando coordenadas del mundo 3D. Logra resultados de última generación en SQA3D y VSI-Bench, con una fuerte generalización en SPBench, utilizando significativamente menos recursos de entrenamiento que los métodos anteriores.
Turing-RL: Aprendizaje de simuladores de usuarios con recompensas de Turing
Turing-RL introduce un método de aprendizaje por refuerzo que utiliza un juez basado en LLM para evaluar qué tan indistinguibles son las respuestas generadas de las entradas reales del usuario. Supera a los métodos base tanto en evaluaciones con LLM como humanas en los dominios de chat y foros de Reddit, demostrando que optimizar la indistinguibilidad mejora el rendimiento del simulador de usuarios.
ViGOS: Desacoplar la percepción y el razonamiento en la auto-distilación multimodal de política activa
ViGOS introduce un marco de auto-distilación de política activa con fundamentos visuales para modelos de lenguaje grande multimodales. Desacopla la percepción y el razonamiento utilizando un maestro solo de imagen para descripciones visuales y un maestro de razonamiento para las salidas finales, reduciendo la dependencia de referencias solo de texto. Este enfoque mejora el rendimiento basado en imágenes en múltiples benchmarks de visión-lenguaje.
Desacoplar la búsqueda del razonamiento en agentes LLM
La fundamentación de búsqueda desacoplada (DSG) separa la funcionalidad de búsqueda de los modelos de razonamiento, permitiendo una fundamentación de búsqueda agnóstica al proveedor, ajustable y reutilizable. DSG logra una precisión casi nativa en SimpleQA con un costo de búsqueda 91% menor y una tasa de acierto en caché caliente del 99.4%, mientras reduce la latencia en un 68% y preserva los contratos de salida concisos.