Anthropic telah menerbitkan tambahan pada Kartu Model Claude yang merinci Claude 3.5 Sonnet, sebuah model baru yang mengungguli Claude 3 Opus dalam hal kecepatan dan biaya sambil menawarkan kemampuan yang lebih baik dalam pemrograman dan pemrosesan visual.
- Claude 3.5 Sonnet menetapkan standar kinerja baru pada sains tingkat pascasarjana (GPQA), penalaran umum (MMLU), dan keahlian pemrograman (HumanEval).
- Model ini mencapai hasil terbaik di lima benchmark visi, termasuk MathVista, ChartQA, dan DocVQA.
- Dalam evaluasi pemrograman agentic internal, model ini menyelesaikan 64% masalah dibandingkan dengan 38% untuk Claude 3 Opus.
- Evaluasi umpan balik manusia menunjukkan tingkat kemenangan yang signifikan atas Claude 3 Opus dalam kemampuan inti seperti pemrograman, dokumen, dan penulisan kreatif.
- Tambahan tersebut juga melaporkan peningkatan tingkat penolakan pada dataset Wildchat dan XSTest serta daya ingat hampir sempurna pada tes Needle In A Haystack hingga 200k token.