← 返回 media r/LocalLLaMA · 2 天前 · open_models AA 根据新测试结果更新前沿模型排名 译自 English → 中文 AA 基准测试已更新,以反映前沿语言模型的最新性能。此次更新包含了顶级模型的最新测试数据。 Flash-next 据报道在新排名中优于 3.5 max。Gemini 3.1 pro 被认为明显落后于其他竞争对手。 文章强调了这些领先 AI 模型之间竞争格局的变化。 重要性 2/3 r/LocalLLaMA Benchmark results 阅读原文 相关文章 lab Hugging Face Blog · 20 小时前 IBM发布SOTA Granite时间序列PatchTST-FM-r2模型,采用商业友好许可证 IBM发布了Granite Time Series PatchTST-FM-r2,这是一个约3.85亿参数的时间序列基础模型,在GIFT-Eval排行榜上以宽松的商业许可证实现了最先进的零样本性能。 arxiv arXiv cs.AI · 1 天前 · 1 次浏览 Doctorina在合成波兰语初级保健诊断中优于医生 一项研究将临床AI系统Doctorina与8名医生和4个独立的领先语言模型进行了比较,测试场景为150次合成的波兰语初级保健咨询。 media r/LocalLLaMA · 6 天前 · 4 次浏览 Nvidia 使用 AVO 工具在 ARC AGI-3 上实现 100% 得分 Nvidia 使用其新型工具 AVO 在 ARC AGI-3 基准测试中取得了 100% 的完美成绩。文章指出,OpenAI 在相同基准测试的结果中并未使用这一标准工具。 media Latent Space · 6 天前 · 8 次浏览 OpenAI推出GPT-6 Astra作为其新旗舰模型 OpenAI已正式推出GPT-6 Astra,将其定位为迄今为止最智能且对齐度最高的模型。此次发布主要针对计算机使用、软件工程、数学与科学、办公工作以及网络安全。 blog Simon Willison · 7 天前 · 18 次浏览 OpenAI发布GPT-6 Astra,具备ARC-AGI 3能力与安全改进 OpenAI发布了GPT-6 Astra,这是一款面向ChatGPT Plus、Pro、Business和Enterprise用户的新模型,同时通过OpenAI API和AWS提供。该模型的定价为每百万输入token 10美元、每百万输出token 50美元,旨在与Claude Fable 5竞争。
lab Hugging Face Blog · 20 小时前 IBM发布SOTA Granite时间序列PatchTST-FM-r2模型,采用商业友好许可证 IBM发布了Granite Time Series PatchTST-FM-r2,这是一个约3.85亿参数的时间序列基础模型,在GIFT-Eval排行榜上以宽松的商业许可证实现了最先进的零样本性能。
arxiv arXiv cs.AI · 1 天前 · 1 次浏览 Doctorina在合成波兰语初级保健诊断中优于医生 一项研究将临床AI系统Doctorina与8名医生和4个独立的领先语言模型进行了比较,测试场景为150次合成的波兰语初级保健咨询。
media r/LocalLLaMA · 6 天前 · 4 次浏览 Nvidia 使用 AVO 工具在 ARC AGI-3 上实现 100% 得分 Nvidia 使用其新型工具 AVO 在 ARC AGI-3 基准测试中取得了 100% 的完美成绩。文章指出,OpenAI 在相同基准测试的结果中并未使用这一标准工具。
media Latent Space · 6 天前 · 8 次浏览 OpenAI推出GPT-6 Astra作为其新旗舰模型 OpenAI已正式推出GPT-6 Astra,将其定位为迄今为止最智能且对齐度最高的模型。此次发布主要针对计算机使用、软件工程、数学与科学、办公工作以及网络安全。
blog Simon Willison · 7 天前 · 18 次浏览 OpenAI发布GPT-6 Astra,具备ARC-AGI 3能力与安全改进 OpenAI发布了GPT-6 Astra,这是一款面向ChatGPT Plus、Pro、Business和Enterprise用户的新模型,同时通过OpenAI API和AWS提供。该模型的定价为每百万输入token 10美元、每百万输出token 50美元,旨在与Claude Fable 5竞争。