Anthropic ha lanzado Claude 3.7 Sonnet, un modelo diseñado para casos de uso empresarial y de desarrolladores en el mundo real, en lugar de solo optimización de benchmarks. El lanzamiento introduce la capacidad de cambiar dinámicamente entre modos de razonamiento estándar y avanzado, permitiendo a los usuarios controlar la cantidad de tokens asignados al "tiempo de pensamiento".
- El precio se establece en $3/M tokens de entrada y $15/M tokens de salida, posicionándolo entre o1 de OpenAI y DeepSeek R1.
- El modelo cuenta con una arquitectura híbrida que ofrece ~200 ms de latencia en modo estándar y hasta 15 segundos en modo de pensamiento extendido.
- Los benchmarks muestran un rendimiento sólido en razonamiento a nivel de posgrado (GPQA Diamond: 78.2% / 84.8%) y programación (SWE-bench: 62.3% / 70.3%), aunque tiene dificultades con las puntuaciones de competiciones de matemáticas de secundaria.
- Las evaluaciones independientes indican que ninguno de los modelos probados, incluido Claude 3.7 Sonnet, es confiable para problemas matemáticos complejos, con todos obteniendo puntuaciones similares al azar en preguntas estilo SAT.
El control configurable de latencia y presupuesto de tokens proporciona a los desarrolladores flexibilidad para equilibrar velocidad y precisión sin necesidad de modelos separados para diferentes tareas.