Fuente · arXiv cs.AI
arxiv arXiv cs.AI · hace 4 d SWE-bench Pro · 78.0%

Argus: Un entorno de ejecución agénico de propósito general para razonamiento a largo plazo

Los investigadores presentan Argus, un entorno de ejecución agénico persistente y autoevolutivo diseñado para el razonamiento a largo plazo que separa la intención estable del usuario de los objetivos operativos. El sistema utiliza roles de Manager, Planner, Engineer y Reviewer para ejecutar misiones acotadas sobre un estado de proyecto duradero, permitiendo la ejecución autónoma entre puntos de escalación propiedad del operador.

arxiv arXiv cs.AI · hace 4 d

SciCode-Verified corrige defectos del benchmark para revelar la verdadera capacidad de codificación científica de los modelos

Los autores identifican que las puntuaciones estancadas en el benchmark SciCode provienen de defectos significativos en el instrumento de evaluación, más que de limitaciones en la capacidad del modelo. Una auditoría de expertos en el dominio de 65 problemas de prueba descubrió 263 defectos, con 192 que causaban que soluciones correctas fueran rechazadas erróneamente debido a problemas como respuestas doradas no reproducibles y tolerancias excesivamente ajustadas.

arxiv arXiv cs.AI · hace 5 d

Video-DeepResearch presenta un agente multimodal para flujos de video continuos

Los investigadores presentan Video-DeepResearch (Video-DR), un marco que extiende los agentes multimodales desde imágenes estáticas a flujos de video continuos, abordando el sesgo de modalidad y la fuga de conocimiento paramétrico. El sistema emplea una pipeline de percepción-exploración desacoplada con desbloqueo progresivo de herramientas para garantizar la fundamentación visual entre fotogramas antes de la recuperación web.

arxiv arXiv cs.AI · hace 10 d WebArena · 73.6% · 3 vistas

Qwen-UI-Agent establece el estado del arte en pruebas de uso móvil

El equipo de Qwen ha publicado un informe técnico para Qwen-UI-Agent, un agente GUI fundamental centrado en el mundo real diseñado para operar de forma fiable en entornos móviles, de uso en computadora, web y DeepSearch. El sistema combina diversos entornos de sandbox con una ejecución móvil a gran escala en dispositivos reales, intercalando operaciones GUI con ejecución CLI y apoyando tareas de largo alcance.

arxiv arXiv cs.AI · hace 13 d · 1 vista

ClinFusion presenta un MLLM centrado en la visión para una comprensión médica integral

Los investigadores presentan ClinFusion, un modelo de lenguaje grande multimodal centrado en la visión diseñado para abordar los desafíos de implementar IA en la práctica clínica al unificar la comprensión de imágenes médicas 2D y 3D. El sistema cuenta con un codificador visual en cascada composicional con un operador de fusión de localidad espacialmente consciente en cascada e incluye un nuevo marco de evaluación que comprende MedIF-Bench y métricas basadas en la región de interés.

arxiv arXiv cs.AI · hace 13 d

El Módulo de Elegibilidad de Aethis utiliza una arquitectura neuro-simbólica para corregir errores de evaluación de reglas en LLM

El artículo documenta una clase de fallo en modelos de lenguaje grandes de vanguardia llamada colapso de cadena de excepciones, donde los modelos evalúan incorrectamente reglas condicionales anidadas. Para abordar esto, los autores presentan el Módulo de Elegibilidad de Aethis, una arquitectura neuro-simbólica que combina reglas autoradas por LLM con una capa basada en SMT para ejecución determinista.

arxiv arXiv cs.AI · hace 17 d OSWorld · 37.7% · 5 vistas

OpenForgeRL permite el entrenamiento de extremo a extremo de agentes basados en arneses en cualquier entorno

OpenForgeRL es un marco de código abierto que permite a los investigadores entrenar agentes de IA basados en arneses de extremo a extremo utilizando pilas estándar de aprendizaje por refuerzo. Logra esto desacoplando el entrenamiento de la inferencia mediante un proxy ligero que registra las llamadas del modelo como datos y un orquestador de Kubernetes que gestiona el despliegue remoto de contenedores.

arxiv arXiv cs.AI · hace 17 d · 4 vistas

AREX presenta agentes de investigación profunda que se auto-mejoran recursivamente

Los investigadores presentan AREX, una familia de agentes de investigación profunda Recursivamente Auto-Mejorables (RSI) diseñados para abordar la asimetría entre descubrimiento y verificación en consultas complejas. AREX alterna entre un bucle interno que recopila evidencia y construye respuestas provisionales, y un bucle externo que audita restricciones para guiar el refinamiento dirigido.

arxiv arXiv cs.AI · hace 18 d · 4 vistas

SLAI T-Rex permite el entrenamiento posterior de todos los parámetros de DeepSeek-V4 en Ascend SuperPOD

SLAI presenta T-Rex, un marco de optimización de extremo a extremo para el entrenamiento posterior de todos los parámetros de modelos MoE a escala de billones de parámetros en Ascend NPU SuperPOD. Utilizando la familia de modelos DeepSeek-V4 como carga de trabajo objetivo, el sistema aborda la presión de memoria y la sobrecarga de comunicación mediante paralelismo jerárquico y optimizaciones de ejecución de kernels.

arxiv arXiv cs.AI · hace 18 d Humanity's Last Exam · 49.92% · 1 vista

PoTRE presenta un marco de agentes múltiples heterogéneo para el razonamiento en tiempo de prueba

Los autores presentan PoTRE (Poly-Topological Reasoning Ensembles), un marco diseñado para abordar las limitaciones del prompting estándar de flujo único en tareas de razonamiento complejas. PoTRE desacopla la inferencia en cuatro agentes distintos: un Agente de Refinamiento Adversarial, un Agente de Planificación Estratégica Jerárquica, un Agente de Búsqueda Espectral y un Agente de Cadena Directa.

arxiv arXiv cs.AI · hace 24 d

RoboTTT escala las políticas de robots a un contexto de 8K pasos de tiempo

NVIDIA presenta RoboTTT, un modelo base para robótica y una receta de entrenamiento que extiende el contexto visuomotor a 8.000 pasos de tiempo sin aumentar la latencia de inferencia. Al integrar el Entrenamiento en Tiempo de Prueba (Test-Time Training) en políticas Visión-Lenguaje-Acción, el sistema comprime el historial en el espacio de pesos mediante pesos rápidos actualizados por descenso de gradiente.

arxiv arXiv cs.AI · hace 24 d SWE-bench Pro · 63.2%

Xiaomi lanza U0, un modelo de 38B parámetros para síntesis corporal unificada

Xiaomi ha presentado Xiaomi-Robotics-U0, un modelo autoregresivo multimodal de 38 mil millones de parámetros diseñado para la síntesis corporal unificada. El modelo trata la generación corporal como una extensión de la generación de imágenes y video de base, optimizando conjuntamente la generación de texto a imagen, la edición de imágenes, la generación de escenas corporales, la transferencia corporal y la generación de video corporal.

arxiv arXiv cs.AI · hace 24 d · 1 vista

RAGU presenta un motor GraphRAG de múltiples pasos con el extractor compacto Meno-Lite-0.1

RAGU es un motor GraphRAG modular de código abierto que mejora la integración del conocimiento estructurado separando la extracción de entidades de su consolidación. Utiliza un proceso de extracción tipificado en dos etapas, deduplicación respaldada por DBSCAN, resumen con LLM y detección de comunidades Leiden para reducir el ruido y la fragilidad presentes en los sistemas de paso único.

arxiv arXiv cs.AI · hace 25 d

TerraZero permite el entrenamiento de auto-juego sin demostraciones a 1,3M pasos/seg

Los investigadores presentan TerraZero, un simulador de conducción procedural y una pila de entrenamiento de auto-juego diseñada para entrenar agentes robustos de conducción autónoma sin demostraciones humanas. El sistema ejecuta la simulación en la CPU y la inferencia de políticas en la GPU a través de un camino de copia cero, sosteniendo 1,3 millones de pasos de agente por segundo en una única GPU de grado servidor.

arxiv arXiv cs.AI · hace 24 d

HealthClaw: agente de código abierto con memoria autoevolutiva para la gestión longitudinal de la salud personal

Los investigadores desarrollaron HealthClaw, una arquitectura de agente de código abierto diseñada para actualizar el soporte a medida que cambian las rutinas, preferencias, mediciones y riesgos de una persona con el tiempo. Separa las reglas de seguridad compartidas y el conocimiento médico de la memoria longitudinal privada que contiene hechos del perfil, procedimientos reutilizables y rastros episódicos.

arxiv arXiv cs.AI · hace 24 d

El modelo DVM-HALL y la métrica NHAS abordan la lealtad en el comercio autónomo

El artículo presenta el modelo Dynamic Verifiable Multi-Agent Human Agentic Loyalty Loop (DVM-HALL) para abordar cómo los paradigmas tradicionales de lealtad del cliente fallan cuando los agentes de IA ejecutan decisiones de compra de forma autónoma. Propone un marco donde la elección de marca está determinada por la equidad emocional humana, la utilidad agéntica, la confianza calibrada y los riesgos de ejecución verificable en entornos de finanzas descentralizadas.

arxiv arXiv cs.AI · hace 25 d

Replanteamiento de las pruebas de penetración para sistemas de IA como evaluación conductual orientada a objetivos

Este artículo argumenta que las pruebas de penetración tradicionales son insuficientes para sistemas habilitados con IA, ya que los adversarios pueden alterar el comportamiento mediante prompts, datos o entradas de sensores sin comprometer la infraestructura. Replantea la práctica como una evaluación conductual orientada a objetivos, definiendo la penetración con IA como inducir un comportamiento que viole los objetivos operativos bajo un modelo de amenazas específico.