NVIDIA a publié deux modèles à poids ouverts, d1-3B et d1-omni-600M, dans le cadre de sa nouvelle famille de modèles de décision d1. Contrairement aux modèles génératifs qui produisent des tokens, ces modèles génèrent des réponses en un seul passage avant, permettant une inférence à très faible latence sur toute la pile NVIDIA, des centres de données aux appareils edge.
- d1-3B obtient un score de 48,57 sur la division publique Decision Index v0.2.1, surpassant tous les modèles de moins de 10B et égalant Decider 35B-A3B à une fraction de leur taille.
- d1-omni-600M est un checkpoint expérimental traitant des entrées texte, image et audio, avec un score de 15,95 sur le même index.
- d1-3B atteint des latences d'inférence de 8 ms sur NVIDIA GeForce RTX 4090, 16 ms sur Jetson AGX Thor et 26 ms sur Jetson AGX Orin.
- Les deux modèles sont compatibles dès le jour 1 avec llama.cpp et fonctionnent sur Apple M5 Pro, AMD MI325X et divers appareils NVIDIA Jetson.
Ces modèles à poids ouverts permettent aux utilisateurs de télécharger, d'affiner et de déployer des capacités de prise de décision structurée rapide pour des entrées multimodales sans restrictions.