El equipo de Qwen ha lanzado el modelo Qwen3.8 27B, que supera a Opus 5 Medium en el Índice Agénico de Artificial Analysis.
- Qwen3.8 27B obtiene una puntuación más alta que Opus 5 Medium en la prueba del Índice Agénico de Artificial Analysis.
El equipo de Qwen ha lanzado el modelo Qwen3.8 27B, que supera a Opus 5 Medium en el Índice Agénico de Artificial Analysis.
Claude Opus 5.5 ya está disponible, liderando SimpleBench con una puntuación del 88,4 % y generando gran atención de la comunidad por su capacidad para producir vídeos explicativos de alta calidad.
Los investigadores presentan SkillGym, un marco que transforma las habilidades de agentes escritas por humanos en entornos de entrenamiento ejecutables y verificables para agentes de modelos de lenguaje grandes. El sistema utiliza una canalización de habilidad a tarea para instanciar tareas concretas y verificar resultados con verificadores basados en código.
Los desarrolladores de TrueForge, una herramienta de agentes modelo-neutral de código abierto, la compararon contra Claude Managed Agents utilizando DevRev Enterprise-Bench. La comparación reveló que TrueForge puede igualar la tasa de resolución de las plataformas gestionadas mientras reduce significativamente el consumo de recursos.
Anthropic ha lanzado Claude Fable 5.1 y Claude Mythos 5.1 como sus nuevos modelos insignia para codificación y trabajo de conocimiento, posicionándolos como los modelos más avanzados del mundo para tareas autónomas y multi-paso.
Ouroboros es un marco para agentes auto-desarrolladores donde las herramientas, los prompts y la implementación central mejoran a través de commits revisados que se convierten en el entorno de ejecución para el trabajo posterior. Opera mediante evolución libre recursiva o evolución del núcleo impulsada por la experiencia, activada por errores e ineficiencias encontrados durante su uso.
Usamos cookies para medir el tráfico y mejorar el sitio. Puedes aceptar o rechazar las cookies de analítica. Política de privacidad