Liquid AI 发布了两个新的编码器模型 LFM2.5-Encoder-230M 和 LFM2.5-Encoder-350M,旨在提供高质量的双向编码,并支持高效扩展至 8,192-token 的上下文长度。
- 基于 LFM2 混合架构构建,这些模型使用双向注意力掩码和非因果短卷积来处理完整上下文。
- 训练过程包括带有 30% 掩码率的掩码语言建模目标,随后进行长上下文适配以增强事实和多语言能力。
- 基准测试显示,LFM2.5-Encoder-350M 在 GLUE/SuperGLUE 任务中的 14 个模型中排名第四,而 230M 变体则优于 ModernBERT-base。
- 在 CPU 硬件上,230M 模型在 8,192 tokens 时的速度约为 ModernBERT-base 的 3.7 倍,使其适合边缘设备和受限环境。
这些开放权重模型允许开发者直接在 CPU 或低延迟 GPU 部署中对分类、意图路由和安全过滤进行微调。