Artificial Analysis ha presentado un nuevo benchmark agéntico que evalúa la capacidad de los modelos de lenguaje grandes para planificar y ejecutar tareas. Claude Fable y GLM 5.2 lograron las primeras posiciones dentro de sus respectivos grupos, demostrando un fuerte rendimiento en este benchmark no saturado.
Nuevo Benchmark Agéntico Publicado
El agente auto-desarrollador Ouroboros establece nuevos récords con Opus 5
Ouroboros es un marco para agentes auto-desarrolladores donde las herramientas, los prompts y la implementación central mejoran a través de commits revisados que se convierten en el entorno de ejecución para el trabajo posterior. Opera mediante evolución libre recursiva o evolución del núcleo impulsada por la experiencia, activada por errores e ineficiencias encontrados durante su uso.
Anthropic lanza Claude Opus 5 como alternativa rentable a Fable
Anthropic ha lanzado Claude Opus 5, un modelo diseñado para igualar el rendimiento de Claude Fable 5 a aproximadamente la mitad del precio por token, mientras ofrece clasificadores de contenido más permisivos. Sirve como el nuevo modelo predeterminado en Claude Max y la opción más potente para usuarios de Claude Pro.
Kimi K3 se clasifica al mismo nivel que Opus pensando en Agent Arena
Según el tablero de clasificación de Agent Arena, Kimi K3 tiene un rendimiento comparable al de Opus en tareas no visuales. Aunque algunos usuarios señalan que Opus puede tener una ventaja en capacidades visuales, la clasificación indica igualdad para otros casos de uso.
SEA introduce certificados válidos en cualquier momento para agentes autoevolutivos
Los autores presentan SEA, una arquitectura que confina la automodificación a un adaptador de dirección y un arnés versionado alrededor de un modelo base congelado, admitiendo cambios solo a través de un filtro válido en cualquier momento que emite certificados auditables contra un presupuesto de error fijo.
Anthropic lanza Claude Opus 4.8 con razonamiento adaptativo y mayor honestidad
Anthropic ha lanzado Claude Opus 4.8, una actualización del modelo que encabeza el Índice de Inteligencia de Artificial Analysis e introduce el pensamiento adaptativo junto con flujos de trabajo de subagentes en paralelo. El lanzamiento también incluye modos de salida más rápidos y la capacidad de actualizar las instrucciones del sistema durante la conversación.