Anthropic ha publicado un apéndice a la Ficha del Modelo Claude 3 que detalla Claude 3.5 Sonnet, un nuevo modelo que supera a Claude 3 Opus en velocidad y costo, mientras ofrece capacidades mejoradas en codificación y procesamiento visual.
- Claude 3.5 Sonnet establece nuevos estándares de rendimiento en ciencia de nivel de posgrado (GPQA), razonamiento general (MMLU) y competencia en codificación (HumanEval).
- Logra resultados de vanguardia en cinco benchmarks de visión, incluyendo MathVista, ChartQA y DocVQA.
- En una evaluación interna de codificación agéntica, el modelo resuelve el 64% de los problemas en comparación con el 38% de Claude 3 Opus.
- Las evaluaciones con retroalimentación humana muestran tasas de victoria significativas sobre Claude 3 Opus en capacidades centrales como codificación, documentos y escritura creativa.
- El apéndice también reporta tasas de rechazo mejoradas en los conjuntos de datos Wildchat y XSTest, y una recuperación casi perfecta en las pruebas Needle In A Haystack hasta 200k tokens.