AI agents
arxiv arXiv cs.CL · hace 3 h

VHD-Play genera entornos de RL agéntico a partir de mecanismos resueltos

VHD-Play es una tubería que genera diversos entornos de aprendizaje por refuerzo agéntico muestreando y resolviendo modelos matemáticos antes de renderizar sus procesos de decisión como herramientas con estado. Este enfoque asegura que la dinámica ejecutable y las referencias de puntuación de trayectorias se hereden directamente del modelo resuelto, abordando los problemas de desalineación comunes en las tuberías de generación existentes.

arxiv arXiv cs.CL · hace 3 h SWE-Lancer · 51.47% · 1 vista

SkillGym internaliza habilidades humanas en LLMs para la resolución de problemas del mundo real

Los investigadores presentan SkillGym, un marco que transforma las habilidades de agentes escritas por humanos en entornos de entrenamiento ejecutables y verificables para agentes de modelos de lenguaje grandes. El sistema utiliza una canalización de habilidad a tarea para instanciar tareas concretas y verificar resultados con verificadores basados en código.

lab Claude Code Releases · hace 9 h · 5 vistas

Claude Code v2.1.281 añade funciones de puerta de enlace y corrige la estabilidad de las sesiones

La versión 2.1.281 de Claude Code introduce nuevas capacidades para la puerta de enlace de las aplicaciones Claude, incluido el soporte para claves más recientes de Claude Desktop en bloques de políticas, asunción de roles IAM en upstreams de Bedrock y guardrails configurables. La actualización también mejora la CLI con elicitation en modo URL de MCP para flujos basados en navegador y comprobaciones de validación para configuraciones de plugins.

lab Anthropic News · hace 11 h · 22 vistas

Claude de Anthropic descubre un nuevo sistema enzimático ART en bacteriófagos

Anthropic ha anunciado la creación de un nuevo grupo de investigación en ciencias de la vida dedicado a utilizar Claude para identificar familias de proteínas no caracterizadas y probar hipótesis mediante experimentos de laboratorio. En los primeros resultados, la IA descubrió de forma autónoma un nuevo sistema enzimático llamado transcriptasas inversas asociadas a matrices (ART) encontrado en bacteriófagos.

lab Google DeepMind Blog · hace 13 h · 21 vistas

Google actualiza Private AI Compute con memoria segura en el servidor

Google está actualizando su plataforma Private AI Compute para admitir memoria de IA persistente y entre dispositivos, manteniendo los estándares de privacidad en el dispositivo. Este cambio resuelve el dilema de proporcionar continuidad a largo plazo para asistentes de IA sin comprometer los estrictos límites de privacidad típicamente asociados con el procesamiento en el dispositivo.

media TLDR AI · hace 22 h · 15 vistas

Anthropic lanza Claude Projects v2; Google presenta un agente familiar

Anthropic ha lanzado Claude Projects v2, rediseñando la función desde una estructura basada en carpetas a una interfaz impulsada por conversaciones que gestiona compilaciones mediante delegación de tareas e hilos paralelos. Simultáneamente, Google está probando un agente familiar que opera en una computadora en la nube dedicada para coordinar actividades para hasta seis miembros del hogar.

media TLDR AI · hace 23 h · 12 vistas

Xiaomi abre el código fuente de los modelos MiMo-V2.6 Pro y Flash

Xiaomi ha abierto el código fuente de los modelos omnimodales MiMo-V2.6 Pro y Flash, diseñados para coordinar agentes en la construcción y prueba visual de escenas 3D interactivas. Estos modelos pueden generar activos de Blender, controlar brazos robóticos a partir de transmisiones de cámara, producir frontends y presentaciones, ensamblar videos y componer música como partituras y MIDI.

arxiv arXiv cs.AI · hace 1 d WebArena · 45.3% · 14 vistas

Growing Harness convierte el control recurrente de agentes en código reutilizable mediante entrenamiento guiado por fallos

Los autores presentan Growing Harness, un paradigma de entrenamiento que aprende la estructura de control de un agente a partir de la retroalimentación de la tarea, en lugar de depender de arneses estándar con gran carga contextual. Al convertir las decisiones de control recurrentes en código ejecutable y reservar las llamadas al LLM para el razonamiento semántico, el método busca crear agentes especialistas reutilizables.

arxiv arXiv cs.AI · hace 1 d · 15 vistas

CliffCompaction reduce los costos de los agentes de codificación en un 50 % mientras mantiene el rendimiento

Los investigadores presentan CliffCompaction, una técnica de autocompacción diseñada para reducir los costos de los agentes de codificación de largo alcance hasta en un 50 % bajo un contexto acotado. El método mantiene o mejora el rendimiento en Terminal-Bench y logra resultados de última generación en KernelBench al mantener la información compactada fiel mediante truncamiento en lugar de reformulación.

arxiv arXiv cs.LG · hace 1 d · 13 vistas

AIDE^2 permite la mejora recursiva de agentes de investigación con IA

Los investigadores presentan AIDE^2, un sistema que implementa un bucle de mejora recursiva para un agente de investigación con IA de vanguardia optimizando su propio código. El sistema propone cambios en su lógica interna, evalúa las versiones modificadas en tareas de I+D con IA y conserva únicamente aquellas actualizaciones que obtienen el mejor rendimiento en evaluaciones ocultas.

arxiv arXiv cs.LG · hace 1 d · 13 vistas

CliffCompaction reduce los costos de agentes de codificación de largo alcance hasta en un 50% mientras mantiene el rendimiento

Los investigadores presentan CliffCompaction, una técnica de autocompacción diseñada para agentes que manejan millones de tokens, la cual reduce los costos hasta en un 50% bajo contexto acotado. El método mantiene o mejora el rendimiento en Terminal-Bench y logra resultados de vanguardia en KernelBench al mantener la información fiel mediante truncamiento en lugar de reformulación.