AbstractPhil telah merilis Beatrix V3, model bahasa byte-level dengan 376 juta parameter yang menggunakan "memori splat" di setiap blok perhatian. Model ini memiliki kosakata 256 dan jendela konteks 4.096 byte, dilatih pada 64,4 miliar byte di dua kartu RTX 5090.

  • Arsitektur mencapai 0,9861 bit per byte pada teks web yang ditahan tanpa lonjakan kerugian.
  • Ini termasuk adaptor yang dapat dilepas dengan 13,7 juta parameter setelah setiap blok untuk menangani tahap kurikulum tertentu.
  • Model ini menunjukkan kemampuan pengkodean teks yang kuat, menyamai kinerja T5 di blok tengahnya.
  • Memori splat menunjukkan keterbatasan dalam ingatan jarak jauh dibandingkan kontrol softmax, mendorong rencana pendekatan hibrida.

Rilis ini mencakup bobot model dan dokumentasi teknis, mengundang umpan balik tentang peningkatan arsitektur seperti mekanisme perhatian hibrida dan modul memori lupa.