AbstractPhil ha lanzado Beatrix V3, un modelo de lenguaje a nivel de byte de 376 millones de parámetros que utiliza "memoria splat" en cada bloque de atención. El modelo cuenta con un vocabulario de 256 y una ventana de contexto de 4.096 bytes, entrenado con 64.4 mil millones de bytes en dos tarjetas RTX 5090.

  • La arquitectura logra 0.9861 bits por byte en texto web retenido sin picos de pérdida.
  • Incluye adaptadores desmontables de 13.7 millones de parámetros después de cada bloque para manejar etapas específicas del currículo.
  • El modelo demuestra fuertes capacidades de codificación de texto, igualando el rendimiento de T5 en sus bloques medios.
  • La memoria splat muestra limitaciones en la recuperación a larga distancia en comparación con los controles softmax, lo que impulsa planes para un enfoque híbrido.

El lanzamiento incluye los pesos del modelo y documentación técnica, invitando a comentarios sobre mejoras arquitectónicas como mecanismos de atención híbrida y módulos de memoria olvidadiza.