Benchmark · agentic
Berkeley Function-Calling Leaderboard
Berkeley's function/tool-calling accuracy leaderboard.
| Tanggal | Model | Skor | Sumber |
|---|---|---|---|
| 2026-08-13 | LFM2.5-VL-3B | 32.5% | Liquid AI merilis LFM2.5-VL-3B, model visi-bahasa 3B untuk perangkat dengan kemampuan pemanggilan alat |
| 2026-08-12 | LFM2.5-VL-3B | 32.5% | LFM2.5-VL-3B meningkatkan pemahaman layar dan pemanggilan fungsi untuk penyebaran di perangkat tepi |
| 2026-08-08 | Pokee-Isaac 28B | 70.94% | Pokee AI merilis Pokee-Isaac 28B, model konteks 10M-token untuk deployment dalam batas yang ditentukan |
| 2025-08-06 | GLM-4.5 | 90.6% | Zhipu AI merilis model GLM-4.5 yang setara dengan Claude dan DeepSeek |
| 2025-08-06 | GLM-4.5-Air | 76.4% | Zhipu AI merilis model GLM-4.5 yang setara dengan Claude dan DeepSeek |
| 2024-12-17 | Falcon3-10B-Instruct | 86.3% | Keluarga Falcon3 merilis lima model terbuka dengan kemampuan sains, matematika, dan kode yang lebih baik |