NVIDIA a publié Kumo Tabular, un modèle fondamental open source pour la classification et la régression tabulaires qui fonctionne par apprentissage in-context sans nécessiter d'entraînement ni d'ingénierie des fonctionnalités. Pré-entraîné exclusivement sur des données artificielles générées par des Modèles Causaux Structurels, le modèle est disponible en trois tailles allant de 28M à 215M paramètres.

  • Kumo Tabular se classe premier sur les benchmarks TabArena, BeyondArena, TALENT et ScoringBench, établissant un nouvel état de l'art sur le front de Pareto précision-efficacité.
  • L'architecture utilise l'attention par colonne, par ligne et in-context pour traiter les tables, permettant des prédictions pour de nouvelles lignes en un seul passage avant.
  • Il s'exécute via la bibliothèque open-source structured-data-models de NVIDIA sous licence OpenMDW-1.1 pour une utilisation commerciale.

Cette publication offre aux entreprises une alternative en zéro-shot aux arbres de gradient boosting, permettant une prédiction immédiate sur des tables étiquetées sans le cycle traditionnel de réglage des hyperparamètres et de validation.