Benchmark results
media Latent Space · только что · 2 просмотра Live

Anthropic запускает Claude Opus 5.5 с улучшенным письмом и сниженными затратами

Anthropic выпустила Claude Opus 5.5, первую модель в своей новой семье Claude 5.5, позиционируя её как более эффективную альтернативу предыдущим поколениям. Модель разработана для выполнения задач на уровне Claude Fable 5.1 при стоимости запуска на 40% ниже, чем у Opus 5.

media MarkTechPost · 8 ч назад · 9 просмотров

Anthropic выпустила Claude Opus 5.5 с производительностью Fable 5.1 при стоимости на 40% ниже

Anthropic выпустила Claude Opus 5.5, первую модель в новой семье Claude 5.5, которая демонстрирует уровень производительности Claude Fable 5.1 в большинстве задач, но обходится на 40% дешевле в обслуживании, чем Opus 5.

lab Hugging Face Blog · 15 ч назад · 9 просмотров

AISI публикует подтверждённые результаты оценки шести передовых моделей по пяти бенчмаркам

Британский Институт безопасности ИИ (AISI) опубликовал методы оценки и их результаты через платформу Evaluation Cards сервиса EvalEval, чтобы повысить воспроизводимость бенчмарков. В этот выпуск вошли подтверждённые результаты, контекст и информация о конфигурации для пяти конкретных бенчмарков: HealthBench, FrontierMath, Humanity's Last Exam, SWE-Bench Pro и Terminal-Bench 2.0.

media MarkTechPost · 21 ч назад GDPval-AA (Elo) · 1695.0Elo · 13 просмотров

SpaceXAI выпустила Grok 4.7 с увеличенной базовой моделью и улучшенными результатами в бенчмарках

SpaceXAI выпустила Grok 4.7, новую флагманскую модель для программирования, агентных задач и работы с знаниями, которая использует более крупную базовую модель и расширенный цикл обучения с подкреплением по сравнению с Grok 4.6. Модель сохраняет ту же структуру ценообразования, что и её предшественник, но предлагает улучшенные возможности самопроверки, обработки длинного контекста и безопасности.

media Interconnects · 2 д назад Artificial Analysis Intelligence Index · 45.0% · 17 просмотров

Китайские модели с открытым весом обгоняют американские аналоги по количеству загрузок и результатам бенчмарков

Автор представляет обзор состояния моделей с открытым весом, отмечая, что китайские ИИ-компании стали явными лидерами в этой области примерно с апреля 2025 года. Этот сдвиг подтверждается метриками загрузок на Hugging Face и результатами на бенчмарках оценки возможностей.

media Hugging Face Forums · 6 д назад · 13 просмотров

Индекс отходов агентов оценил 341 054 публичных запусков кодовых агентов на наличие паттернов отходов

Индекс отходов агентов (Agent Waste Index) оценил 341 054 траектории агентов из 11 публичных наборов данных, чтобы выявить неэффективности, такие как циклы, слепые повторные попытки, избыточный вывод инструментов и заброшенные запуски. Анализ показывает, что поведение с циклами и повторными попытками широко распространено в более слабых моделях, таких как агенты на базе Llama, но редко встречается у Claude 3.7 Sonnet и Qwen3-Coder-480B.

media r/LocalLLaMA · 7 д назад · 18 просмотров

Отчёт Mozilla: открытые китайские ИИ-модели отстают от американских флагманов на 4 месяца

Согласно отчёту Mozilla, разрыв в разработке между открытыми китайскими ИИ-моделями и американскими флагманскими решениями сократился до четырёх месяцев. Несмотря на такой быстрый прогресс, модели продолжают уступать в некоторых бенчмарках.

media MarkTechPost · 7 д назад LMSYS Arena (Elo) · 1866.0Elo · 20 просмотров

Prior Labs выпускает TabPFN-3.5, превосходя победителя Otto Kaggle 2015 года со стандартными настройками

Prior Labs выпустила TabPFN-3.5, табличную фундаментальную модель, которая делает прогнозы по таблице за один прямой проход без обучения или настройки под конкретный набор данных. Модель набирает 0.375 в закрытом рейтинге соревнования Otto Group Product Classification Challenge 2015 года, превосходя оригинальный победивший результат 0.382, достигнутый Гилберто Титеричем и Станиславом Семёновым.

media r/LocalLLaMA · 7 д назад · 17 просмотров

Отчёт Mozilla: разрыв в возможностях ИИ-моделей Китая и США сократился до 4,4 месяцев

Согласно отчёту Mozilla, разрыв в возможностях между китайскими и американскими моделями искусственного интеллекта значительно сузился, составив всего 4,4 месяца.

media MarkTechPost · 7 д назад · 28 просмотров

Nums AI выпустила Causilo, табличную базовую модель, лидирующую в TabArena среди одиночных моделей

Nums AI выпустила Causilo, предварительно обученную табличную базовую модель для классификации и регрессии, которая демонстрирует наивысший показатель Elo среди одиночных моделей в TabArena. Модель использует подход обучения с контекстом (in-context learning), где обучающие строки хранятся как контекст без обновления весов, и доступна с кодом по лицензии Apache-2.0 и предварительно обученными весами на Hugging Face.

arxiv arXiv cs.CL · 8 д назад Codeforces (Elo) · 98.2% · 27 просмотров

Stellar Colosseum использует многоагентный вывод для долгосрочных математических исследований

Stellar Colosseum — это модель-агностический фреймворк, предназначенный для распределения вывода при проведении долгосрочных исследований в области математики и теоретической информатики, что позволяет решить проблему ненадежности языковых моделей при работе со сложными задачами. Система исследует альтернативные стратегии до начала построения доказательства, использует вентиль готовности для определения момента, когда маршрут достаточно зрел для декомпозиции, и представляет план доказательства как набор взаимосвязанных подзадач на уровне разделов.

arxiv arXiv cs.LG · 8 д назад Codeforces (Elo) · 98.2% · 25 просмотров

Stellar Colosseum: многоагентная платформа для долгосрочных исследований в математике и теории вычислительных систем

Авторы представляют Stellar Colosseum, модель-агностическую платформу, предназначенную для распределения вывода при проведении долгосрочных исследований в области математики и теоретической информатики. Система исследует альтернативные стратегии до начала построения доказательства, использует вентиль готовности для определения момента, когда маршрут достаточно зрел для декомпозиции, и представляет план доказательства как взаимосвязанные подзадачи на уровне разделов.

arxiv arXiv cs.AI · 9 д назад · 25 просмотров

Экспертная повторная оценка показывает, что передовые модели достигли почти насыщения на физических бенчмарках

Исследование, проверяющее шесть широко используемых физических бенчмарков, выявило, что низкие результаты, сообщаемые для передовых языковых моделей, в значительной степени обусловлены ошибками бенчмаркинга, а не недостатками самих моделей. Эксперты проанализировали формулировки задач, эталонные решения и ответы моделей, отделив реальные ошибки от ошибок оценщиков, неверных ссылок и неоднозначных вопросов.

lab Cohere Blog · 10 д назад · 35 просмотров

Cohere выпустила North Small Translate, суверенную модель машинного перевода с открытыми весами

Cohere выпустила North Small Translate, свою первую модель перевода из семейства North, доступную для исследований и некоммерческого использования под лицензией CC BY-NC 4.0. Эта модель типа mixture-of-experts достигает результата 83.6 на бенчмарке WMT26 All Languages, превосходя проприетарные модели, такие как DeepL NextGen и Google Translate.

media MarkTechPost · 10 д назад Terminal-Bench 2 · 92.8% · 28 просмотров

Cognition выпустила SWE-2: модель для программирования на базе Kimi K3 с настраиваемыми усилиями на рассуждение

Cognition выпустила SWE-2, свою самую мощную модель для программирования на сегодняшний день, которая прошла постобучение методом подкрепления от открытой модели Moonshot AI с 2.8 триллиона параметров — Kimi K3. Модель набрала 50.0% в FrontierCode 1.1 Main, что всего на один балл меньше, чем у Fable 5.1, при этом затраты оказались на 64% ниже.

lab NVIDIA Research · 11 д назад · 16 просмотров

ReasoningBomb вызывает патологически длинное рассуждение в больших моделях рассуждения

Исследователи формализовали атаки на отказ в обслуживании во время вывода (PI-DoS), которые используют высокую вычислительную стоимость явного многошагового рассуждения в больших моделях рассуждения (LRM). Они представляют ReasoningBomb — основанную на обучении с подкреплением систему, которая обучает атакующего генерировать короткие естественные промпты, заставляющие модели-жертвы вступать в патологически длинные и часто не завершающиеся цепочки рассуждений.

media The Batch · 12 д назад GPQA Diamond · 96.3% · 29 просмотров

OpenAI запускает GPT-6 Astra, занимая верхние позиции в рейтингах при снижении стоимости

OpenAI выпустила GPT-6 Astra, свою новую флагманскую модель для работы с визуальными и языковыми данными, которая достигает лучших или близких к лучшим результатов на основных рейтингах ИИ, используя значительно меньше токенов и обходясь дешевле по сравнению с конкурирующими моделями. Модель разработана в соответствии с критическим уровнем кибербезопасности OpenAI, при этом расширенные кибервозможности ограничены для выбранных организаций.