Generalist AI a publié GEN-1.5, un modèle fondamental de robotique orienté recherche capable d'apprendre de nouvelles tâches de manipulation physique à partir d'une seule démonstration de 3 à 12 secondes via sa fenêtre de contexte de 30 secondes. Cette capacité, appelée « physical prompting », est apparue spontanément après plus de huit mois de pré-entraînement continu sur des données d'interaction physique plutôt que d'être explicitement conçue.

  • Le one-shot in-context prompting a atteint un taux de réussite moyen de 59 % sur 10 tâches diverses sans aucune mise à jour par gradient ni ajustement fin.
  • L'application de dix étapes de gradient sur cinq minutes de données par tâche a porté le taux de réussite à 83 %, avec des changements de poids inférieurs à 0,15 %.
  • Le modèle a démontré une généralisation compositionnelle, un transfert zero-shot sim-to-real et des capacités d'imitation humain-robot qui n'étaient pas explicitement entraînées.

Cette publication sert de signal de recherche concernant la mise à l'échelle du physical prompting, bien qu'elle ne soit pas encore déployable car aucun poids public, API ou produit en libre-service n'est disponible.