← 返回 media r/LocalLLaMA · 2 天前 · open_models Terminal Bench 4.0 发布,GLM-5.3 与 Fable 5 持平 译自 English → 中文 Terminal Bench 4.0 已发布,更新该基准测试以跟上新模型发布的步伐并应对基准测试饱和问题。 更新包含性能数据,显示 GLM-5.3 在考虑误差范围的情况下与 Fable 5 处于同一水平。公告强调了对 TerminalBench 的快速迭代,以保持与新兴模型的竞争力。社区讨论突出了大型基准测试的高计算成本,指出每次运行需要 5-10B tokens。 重要性 2/3 r/LocalLLaMA Benchmark results Evaluation & benchmarks 阅读原文 相关文章 media Hugging Face Forums · 8 天前 · 2 次浏览 EvalAudit 工具检查基准结论在不同评估器含义下是否成立 本文介绍了 EvalAudit,这是一种可执行工件,旨在确定在声明的评估器规范族中是否识别出基准结论——例如获胜者或完整排名。通过固定被评估的系统和数据,同时变化指标和聚合规则,该工具计算可能的主张集合是否为单例。 lab Hugging Face Blog · 10 天前 · 8 次浏览 Artificial Analysis 发现语音识别模型通过声学线索复现基准转录文本 Artificial Analysis 的研究揭示,多个高分开源自动语音识别(ASR)模型在优化基准测试时,即使音频内容与参考转录文本相矛盾,仍会复现这些参考转录文本。该研究评估了 11 个广泛使用的模型,并确定了三种特定行为:复现错误的参考文本、恢复被静音的数字,以及切换正字法变体以匹配基准规范。 arxiv arXiv cs.AI · 26 天前 · 12 次浏览 SciCode-Verified 修正基准缺陷,揭示模型真实的科学编码能力 作者指出,SciCode 基准上分数停滞的原因在于评估工具存在重大缺陷,而非模型能力的局限。对 65 个测试问题的领域专家审计发现了 263 个缺陷,其中 192 个因不可复现的标准答案和过紧的容差等问题导致正确解法被错误拒绝。 media Hugging Face Forums · 30 天前 · 17 次浏览 Levent Bulut 对客观投射中 LLM 标注可靠性进行基准测试 Levent Bulut 发布了一项包含三项研究的基准测试,评估土耳其叙事语料库中机器生成标注的可靠性,揭示了自动评分器与人类判断之间的显著差异。该研究使用基于规则的检测器以及 Gemini 2.5 Flash、Grok、ChatGPT 5.5 和 Claude Fable 5 High 等模型,对 120 个和 100 个场景中的六个二元工艺特征进行了测试。 arxiv τ²-bench (tau2-bench) · 40 天前 · 7 次浏览 τ-bench 1.0.1 修复 banking_knowledge 评分,防止惩罚谨慎的代理行为 Sierra Research 发布了 τ-bench 1.0.1,修正了 `banking_knowledge` 任务的评分方案,停止因审慎的验证读取而惩罚代理,并修复了若干数据不一致问题。此次更新确保重新评分排行榜轨迹仅提升分数,此前通过的模拟不再失败。
media Hugging Face Forums · 8 天前 · 2 次浏览 EvalAudit 工具检查基准结论在不同评估器含义下是否成立 本文介绍了 EvalAudit,这是一种可执行工件,旨在确定在声明的评估器规范族中是否识别出基准结论——例如获胜者或完整排名。通过固定被评估的系统和数据,同时变化指标和聚合规则,该工具计算可能的主张集合是否为单例。
lab Hugging Face Blog · 10 天前 · 8 次浏览 Artificial Analysis 发现语音识别模型通过声学线索复现基准转录文本 Artificial Analysis 的研究揭示,多个高分开源自动语音识别(ASR)模型在优化基准测试时,即使音频内容与参考转录文本相矛盾,仍会复现这些参考转录文本。该研究评估了 11 个广泛使用的模型,并确定了三种特定行为:复现错误的参考文本、恢复被静音的数字,以及切换正字法变体以匹配基准规范。
arxiv arXiv cs.AI · 26 天前 · 12 次浏览 SciCode-Verified 修正基准缺陷,揭示模型真实的科学编码能力 作者指出,SciCode 基准上分数停滞的原因在于评估工具存在重大缺陷,而非模型能力的局限。对 65 个测试问题的领域专家审计发现了 263 个缺陷,其中 192 个因不可复现的标准答案和过紧的容差等问题导致正确解法被错误拒绝。
media Hugging Face Forums · 30 天前 · 17 次浏览 Levent Bulut 对客观投射中 LLM 标注可靠性进行基准测试 Levent Bulut 发布了一项包含三项研究的基准测试,评估土耳其叙事语料库中机器生成标注的可靠性,揭示了自动评分器与人类判断之间的显著差异。该研究使用基于规则的检测器以及 Gemini 2.5 Flash、Grok、ChatGPT 5.5 和 Claude Fable 5 High 等模型,对 120 个和 100 个场景中的六个二元工艺特征进行了测试。
arxiv τ²-bench (tau2-bench) · 40 天前 · 7 次浏览 τ-bench 1.0.1 修复 banking_knowledge 评分,防止惩罚谨慎的代理行为 Sierra Research 发布了 τ-bench 1.0.1,修正了 `banking_knowledge` 任务的评分方案,停止因审慎的验证读取而惩罚代理,并修复了若干数据不一致问题。此次更新确保重新评分排行榜轨迹仅提升分数,此前通过的模拟不再失败。