Evaluation & benchmarks
media Hugging Face Forums · 6 天前 · 1 次浏览

GPT-5.6 在未见的文学密码学基准测试中恢复95%的隐藏信息

约瑟夫·JM·沃克(Joseph JM Walker)撰写的工作论文评估了前沿语言模型在一个嵌入在实体小说《我写了一本书并赚了一百万美元(I.B. Wryten)》中的未见多通道文学密码学基准测试上的表现。研究发现,GPT-5.6 独立识别出次要通信信道,并在首次尝试中恢复了约95%的嵌入内容,而早期模型的有效能力几乎为0%。

media Hugging Face Forums · 7 天前 · 8 次浏览

Levent Bulut 对客观投射中 LLM 标注可靠性进行基准测试

Levent Bulut 发布了一项包含三项研究的基准测试,评估土耳其叙事语料库中机器生成标注的可靠性,揭示了自动评分器与人类判断之间的显著差异。该研究使用基于规则的检测器以及 Gemini 2.5 Flash、Grok、ChatGPT 5.5 和 Claude Fable 5 High 等模型,对 120 个和 100 个场景中的六个二元工艺特征进行了测试。