NVIDIA ha lanzado dos modelos de pesos abiertos, d1-3B y d1-omni-600M, como parte de su nueva familia de modelos de decisión d1. A diferencia de los modelos generativos que producen tokens, estos modelos generan respuestas en una sola pasada hacia adelante, permitiendo inferencia de latencia extremadamente baja en toda la pila de NVIDIA, desde centros de datos hasta dispositivos periféricos.

  • d1-3B obtiene 48.57 en la división pública del Índice de Decisión v0.2.1, superando a todos los modelos por debajo de 10B y igualando a Decider 35B-A3B con una fracción del tamaño.
  • d1-omni-600M es un punto de control experimental que maneja entradas de texto, imagen y audio, obteniendo 15.95 en el mismo índice.
  • d1-3B logra latencias de inferencia de 8 ms en NVIDIA GeForce RTX 4090, 16 ms en Jetson AGX Thor y 26 ms en Jetson AGX Orin.
  • Ambos modelos son compatibles desde el día uno con llama.cpp y funcionan en Apple M5 Pro, AMD MI325X y varios dispositivos NVIDIA Jetson.

Estos modelos de pesos abiertos permiten a los usuarios descargar, ajustar finamente e implementar capacidades rápidas de toma de decisiones estructuradas para entradas multimodales sin restricciones.