A NVIDIA lançou dois modelos de pesos abertos, d1-3B e d1-omni-600M, como parte de sua nova família de modelos de decisão d1. Diferente dos modelos generativos que produzem tokens, esses modelos geram respostas em uma única passagem direta, permitindo inferência de latência extremamente baixa em toda a pilha da NVIDIA, desde data centers até dispositivos de borda.
- d1-3B obtém pontuação de 48.57 no split público do Decision Index v0.2.1, superando todos os modelos abaixo de 10B e igualando o Decider 35B-A3B com uma fração do tamanho.
- d1-omni-600M é um checkpoint experimental que lida com entradas de texto, imagem e áudio, obtendo pontuação de 15.95 no mesmo índice.
- d1-3B alcança latências de inferência de 8 ms na NVIDIA GeForce RTX 4090, 16 ms no Jetson AGX Thor e 26 ms no Jetson AGX Orin.
- Ambos os modelos suportam compatibilidade imediata com llama.cpp e rodam em Apple M5 Pro, AMD MI325X e vários dispositivos NVIDIA Jetson.
Esses modelos de pesos abertos permitem que os usuários baixem, ajustem e implantem capacidades rápidas de tomada de decisão estruturada para entradas multimodais sem restrições.