AbstractPhil a lancé Beatrix V3, un modèle de langage de niveau octet de 376 millions de paramètres qui utilise la "mémoire splat" dans chaque bloc d'attention. Le modèle dispose d'un vocabulaire de 256 et d'une fenêtre de contexte de 4 096 octets, entraîné sur 64,4 milliards d'octets sur deux cartes RTX 5090.

  • L'architecture atteint 0,9861 bit par octet sur du texte web retenu sans pics de perte.
  • Il comprend des adaptateurs détachables de 13,7 millions de paramètres après chaque bloc pour gérer des étapes spécifiques du curriculum.
  • Le modèle démontre de fortes capacités de codage de texte, égalant les performances de T5 dans ses blocs intermédiaires.
  • La mémoire splat montre des limitations dans la récupération à longue distance par rapport aux contrôles softmax, ce qui pousse à planifier une approche hybride.

Le lancement inclut les poids du modèle et la documentation technique, invitant aux commentaires sur les améliorations architecturales telles que les mécanismes d'attention hybride et les modules de mémoire oublieuse.