webAI发布了TwIL-LM,这是一个包含两个模型的形式逻辑推理器系列,参数量分别为1.7B和3B,专为在本地硬件上进行自动形式化而设计。这些模型将英语翻译为一阶逻辑并检查结论的有效性,其中3B变体在域内形式逻辑任务上达到了0.4218的宏观门控得分。

  • TwIL-LM3 (3B) 是SmolLM3-3B的合并微调版本,而1.7B模型则是针对SmolLM2-1.7B-Instruct的PEFT LoRA适配器。
  • 这两个模型均可在本地运行,量化版大小分别为1.06 GB和1.78 GiB,仅需4 GB显存。
  • 训练过程包括LoRA监督微调、检查点融合、λ = 0.25时的WiSE-FT插值以及针对程序化验证器的MGPO。
  • TwIL-LM3在六个目标赛道上领先于所有其他模型直至LFM2.5-8B-A1B,但在六车道平均值上落后于gpt-oss-120b(0.4488对比0.5192)。
  • 该3B模型生成的序列最短,为482个token,每秒产生32.9个答案,而gpt-oss-120b仅为4.2。

此次发布使得在合规和法律运营等对数据敏感的环境中进行本地执行成为可能,在域内性能和保留能力之间取得了平衡。