Anthropic ha publicado un apéndice a la Ficha del Modelo Claude 3 que detalla Claude 3.5 Sonnet, un nuevo modelo que supera a Claude 3 Opus en velocidad y costo, mientras ofrece capacidades mejoradas en codificación y procesamiento visual.

  • Claude 3.5 Sonnet establece nuevos estándares de rendimiento en ciencia de nivel de posgrado (GPQA), razonamiento general (MMLU) y competencia en codificación (HumanEval).
  • Logra resultados de vanguardia en cinco benchmarks de visión, incluyendo MathVista, ChartQA y DocVQA.
  • En una evaluación interna de codificación agéntica, el modelo resuelve el 64% de los problemas en comparación con el 38% de Claude 3 Opus.
  • Las evaluaciones con retroalimentación humana muestran tasas de victoria significativas sobre Claude 3 Opus en capacidades centrales como codificación, documentos y escritura creativa.
  • El apéndice también reporta tasas de rechazo mejoradas en los conjuntos de datos Wildchat y XSTest, y una recuperación casi perfecta en las pruebas Needle In A Haystack hasta 200k tokens.