Benchmark · agentic
Berkeley Function-Calling Leaderboard
Berkeley's function/tool-calling accuracy leaderboard.
| Date | Modèle | Score | Source |
|---|---|---|---|
| 2026-08-13 | LFM2.5-VL-3B | 32.5% | Liquid AI publie LFM2.5-VL-3B, un modèle vision-langue de 3 milliards de paramètres pour le déploiement sur appareil avec appels d'outils |
| 2026-08-12 | LFM2.5-VL-3B | 32.5% | LFM2.5-VL-3B améliore la compréhension d'écran et l'appel de fonctions pour le déploiement en périphérie |
| 2026-08-08 | Pokee-Isaac 28B | 70.94% | Pokee AI publie Pokee-Isaac 28B, un modèle de contexte de 10M de tokens pour un déploiement en périmètre fermé |
| 2025-08-06 | GLM-4.5 | 90.6% | Zhipu AI publie les modèles GLM-4.5 rivalisant avec Claude et DeepSeek |
| 2025-08-06 | GLM-4.5-Air | 76.4% | Zhipu AI publie les modèles GLM-4.5 rivalisant avec Claude et DeepSeek |
| 2024-12-17 | Falcon3-10B-Instruct | 86.3% | La famille Falcon3 publie cinq modèles ouverts avec des capacités améliorées en sciences, mathématiques et code |