media Hugging Face Forums · 17 天前 · 29 次浏览 研究识别出在通过隔离探针后仍无法进行上下文复制的脆弱标记 一项研究对“脆弱标记”进行了刻画,这些是开放权重语言模型中的词汇条目,它们在孤立时能够成功复制,但在嵌入周围文本时会表现出错误。该研究强调,标准隔离测试并不能保证字面身份的保留,因为标记在序列中可能会被删除、替换或截断。
lab Hugging Face Blog · 29 天前 · 34 次浏览 BenchMIRT通过分离安全和推理信号来审计LLM基准 研究人员推出了BenchMIRT,这是一种利用多维项目反应理论(Item Response Theory)在单个提示级别上审计大型语言模型基准的方法。通过分析100个模型和34,000道题目的表现,该工具解耦了通常掩盖基准分数的混合能力,如安全性和通用推理。