NVIDIA выпустила Kumo Tabular, открытую базовую модель для табличной классификации и регрессии, работающую на основе обучения в контексте (in-context learning) без необходимости тренировки или инженерии признаков. Обученная исключительно на искусственных данных, сгенерированных структурными каузальными моделями, модель доступна в трёх размерах: от 28M до 215M параметров.

  • Kumo Tabular занимает первое место в бенчмарках TabArena, BeyondArena, TALENT и ScoringBench, устанавливая новый state of the art на парето-фронте точности и эффективности.
  • Архитектура использует attention по столбцам, строкам и в контексте для обработки таблиц, что позволяет делать прогнозы для новых строк за один прямой проход (forward pass).
  • Модель работает через библиотеку с открытым исходным кодом structured-data-models от NVIDIA под лицензией OpenMDW-1.1 для коммерческого использования.

Выпуск предоставляет предприятиям альтернативу градиентному бустингу деревьев в режиме zero-shot, позволяя немедленно делать прогнозы на размеченных таблицах без традиционного цикла настройки гиперпараметров и валидации.