Anthropic ha presentado Claude 3.5 Haiku y una versión mejorada de Claude 3.5 Sonnet, avanzando en capacidades de razonamiento, codificación y procesamiento visual. La adición más significativa al modelo Sonnet actualizado es su capacidad para interpretar capturas de pantalla de la GUI y generar llamadas a herramientas para realizar tareas de forma autónoma.
- El Claude 3.5 Sonnet actualizado logra una tasa de éxito promedio de vanguardia del 14,9% en el benchmark OSWorld utilizando únicamente entradas de captura de pantalla, aumentando al 22% con pasos de interacción incrementados.
- El nuevo modelo Claude 3.5 Haiku demuestra un rendimiento sólido en razonamiento y seguimiento de instrucciones, a menudo comparable al original Claude 3.5 Sonnet y Claude 3 Opus.
- Ambos modelos pasaron por evaluaciones de seguridad extensas, incluyendo pruebas de penetración multimodal para riesgos de uso de computadora, y pruebas conjuntas previas al despliegue por los Institutos de Seguridad de IA de EE. UU. y el Reino Unido.
- El límite de conocimiento para el Claude 3.5 Sonnet actualizado es abril de 2024, mientras que Claude 3.5 Haiku tiene un límite de julio de 2024.
Estas actualizaciones proporcionan a los usuarios capacidades mejoradas de automatización a través del uso de computadora y una mejor finalización de tareas agénticas, manteniendo rigurosos estándares de seguridad alineados con la Política de Escalamiento Responsable de Anthropic.