Todos los artículos
arxiv arXiv cs.CL · ahora mismo En vivo

El benchmark WebMRE revela el refuerzo mutuo guía-acción en agentes web

Los autores presentan WebMRE, un benchmark offline de 541 tareas y 5.293 pasos derivados de trayectorias exitosas de WebArena, diseñado para proporcionar un protocolo determinista para puntuar puntos de control de agentes web sin deriva del entorno. Este marco empareja oraciones guía orientadas al humano con acciones fundamentadas para estudiar el efecto de refuerzo mutuo entre ellas.

arxiv arXiv cs.CL · ahora mismo SWE-Lancer · 51.47% En vivo

SkillGym internaliza habilidades humanas en LLMs para la resolución de problemas del mundo real

Los investigadores presentan SkillGym, un marco que transforma las habilidades de agentes escritas por humanos en entornos de entrenamiento ejecutables y verificables para agentes de modelos de lenguaje grandes. El sistema utiliza una canalización de habilidad a tarea para instanciar tareas concretas y verificar resultados con verificadores basados en código.

github llama.cpp · hace 4 h · 2 vistas

llama.cpp v0.5.0 añade soporte para HRM-Text, aceleración de conv2d en CUDA y enlace a múltiples direcciones

El proyecto llama.cpp ha lanzado la versión 0.5.0, centrada en el rendimiento del backend, una mayor cobertura de modelos y un funcionamiento del servidor más robusto. Esta actualización introduce soporte para nuevas arquitecturas como HRM-Text (DFM Mimir 1B) y MiMo-V2.6, mientras mejora significativamente la eficiencia computacional mediante optimizaciones de CUDA y Metal.

lab OpenAI News · hace 4 h · 1 vista

Sam Altman insta al Consejo de Seguridad de la ONU sobre seguridad de la IA y cooperación internacional

El CEO de OpenAI, Sam Altman, se dirigió al Consejo de Seguridad de las Naciones Unidas, exponiendo la postura de OpenAI sobre la seguridad de la inteligencia artificial y la necesidad de marcos de gobernanza global. Enfatizó que la IA debe permanecer bajo control humano para evitar la concentración de poder y garantizar la supervisión democrática.

lab OpenAI News · hace 5 h · 7 vistas

OpenAI lanza MentalHealthBench para evaluar las respuestas de IA en salud mental

OpenAI ha presentado MentalHealthBench, un benchmark abierto diseñado para evaluar cómo los sistemas de IA responden en conversaciones realistas sobre salud mental. Desarrollado con más de 80 expertos en salud mental licenciados de 22 países, el benchmark evalúa las capacidades del modelo en comportamientos clave como la seguridad, la búsqueda de contexto y la preservación de la agencia del usuario.

lab Claude Code Releases · hace 6 h · 5 vistas

Claude Code v2.1.281 añade funciones de puerta de enlace y corrige la estabilidad de las sesiones

La versión 2.1.281 de Claude Code introduce nuevas capacidades para la puerta de enlace de las aplicaciones Claude, incluido el soporte para claves más recientes de Claude Desktop en bloques de políticas, asunción de roles IAM en upstreams de Bedrock y guardrails configurables. La actualización también mejora la CLI con elicitation en modo URL de MCP para flujos basados en navegador y comprobaciones de validación para configuraciones de plugins.

lab Microsoft Research Blog · hace 6 h · 14 vistas

Microsoft Research muestra que la descarga de inferencia de IA física mejora el rendimiento y la vida útil de la batería de los robots

Microsoft Research desafía la suposición de que la inferencia de IA física debe ejecutarse exclusivamente en las GPUs a bordo del robot, demostrando que descargarla a infraestructura perimetral o en la nube mejora significativamente las cargas de trabajo de manipulación móvil. Su estudio sistemático de cargas de trabajo de robótica revela que depender del cálculo a bordo limita el rendimiento, la vida útil de la batería y la escalabilidad.

lab Hugging Face Blog · hace 7 h · 7 vistas

NVIDIA Warp y MjWarp habilitan la simulación paralela de robótica acelerada por GPU

MuJoCo Warp (MJWarp), basado en NVIDIA Warp, permite que los modelos compatibles de MuJoCo se ejecuten a escala de GPU, posibilitando el avance de cientos o miles de mundos de simulación independientes en una sola llamada. Esta arquitectura desplaza el enfoque desde la minimización de la latencia para un solo entorno hacia la mejora del rendimiento agregado, lo cual favorece el aprendizaje por refuerzo y el muestreo a gran escala.

lab Anthropic News · hace 8 h · 19 vistas

Claude de Anthropic descubre un nuevo sistema enzimático ART en bacteriófagos

Anthropic ha anunciado la creación de un nuevo grupo de investigación en ciencias de la vida dedicado a utilizar Claude para identificar familias de proteínas no caracterizadas y probar hipótesis mediante experimentos de laboratorio. En los primeros resultados, la IA descubrió de forma autónoma un nuevo sistema enzimático llamado transcriptasas inversas asociadas a matrices (ART) encontrado en bacteriófagos.