AbstractPhil发布了Beatrix V3,这是一款拥有3.76亿参数的字节级语言模型,在每个注意力块中使用“splat memory”。该模型词汇表大小为256,上下文窗口为4096字节,在两张RTX 5090卡上使用644亿字节的数据进行训练。

  • 该架构在未见的网页文本上达到每字节0.9861比特,且无损失尖峰。
  • 它在每个块之后包含可拆卸的1370万参数适配器,以处理特定的课程阶段。
  • 该模型展示了强大的文本编码能力,在其中间块中与T5的性能相匹配。
  • 与softmax控制相比,splat内存在大距离回忆方面显示出局限性,促使计划采用混合方法。

发布内容包括模型权重和技术文档,邀请对架构改进(如混合注意力机制和遗忘内存模块)提供反馈。