Artificial Analysis ha presentado un nuevo benchmark agéntico que evalúa la capacidad de los modelos de lenguaje grandes para planificar y ejecutar tareas. Claude Fable y GLM 5.2 lograron las primeras posiciones dentro de sus respectivos grupos, demostrando un fuerte rendimiento en este benchmark no saturado.
Nuevo Benchmark Agéntico Publicado
Anthropic descubre que GLM-5.3 logra secuestros completos del flujo de control en ciberred teaming
El Frontier Red Team de Anthropic evaluó el modelo chino GLM-5.3 en 100 tareas de un benchmark interno de Binary Exploitation y descubrió que es capaz de desarrollar secuestros completos del flujo de control en el 4% de los ensayos.
Claude Opus 5.5 lidera SimpleBench con un 88,4 % y destaca en vídeos explicativos
Claude Opus 5.5 ya está disponible, liderando SimpleBench con una puntuación del 88,4 % y generando gran atención de la comunidad por su capacidad para producir vídeos explicativos de alta calidad.
TrueForge logra la misma precisión que Claude Managed Agents con hasta un 75% menos de costo
Los desarrolladores de TrueForge, una herramienta de agentes modelo-neutral de código abierto, la compararon contra Claude Managed Agents utilizando DevRev Enterprise-Bench. La comparación reveló que TrueForge puede igualar la tasa de resolución de las plataformas gestionadas mientras reduce significativamente el consumo de recursos.
Anthropic lanza Claude Fable y Mythos 5.1 con nuevos benchmarks SOTA
Anthropic ha lanzado Claude Fable 5.1 y Claude Mythos 5.1 como sus nuevos modelos insignia para codificación y trabajo de conocimiento, posicionándolos como los modelos más avanzados del mundo para tareas autónomas y multi-paso.
Z.ai ajusta finamente GLM-5.3 para obtener ventajas en ciberseguridad
Z.ai lanzó GLM-5.3, un modelo de 753 mil millones de parámetros que mejora las capacidades de codificación y agénticas mediante ajuste fino en lugar de entrenamiento desde cero. La actualización iguala al líder de pesos abiertos Kimi K3 en el índice de inteligencia de Artificial Analysis y alcanza las mejores puntuaciones en benchmarks de ciberseguridad.