Тема · Benchmark results
lab xAI News · 22 д назад · 27 просмотров

Grok 4.6 лидирует по отказам в биобезопасности при сохранении обычных биологических показателей

LatchBio опубликовала независимый анализ Grok 4.6 на бенчмарках BioSecBench-Refusal и BioSecBench-Surveillance, выявив, что модель является наиболее сильной среди протестированных передовых систем в отказе от замаскированных опасных задач.

lab NVIDIA Research · 11 д назад · 16 просмотров

ReasoningBomb вызывает патологически длинное рассуждение в больших моделях рассуждения

Исследователи формализовали атаки на отказ в обслуживании во время вывода (PI-DoS), которые используют высокую вычислительную стоимость явного многошагового рассуждения в больших моделях рассуждения (LRM). Они представляют ReasoningBomb — основанную на обучении с подкреплением систему, которая обучает атакующего генерировать короткие естественные промпты, заставляющие модели-жертвы вступать в патологически длинные и часто не завершающиеся цепочки рассуждений.

media Latent Space · только что · 2 просмотра Live

Anthropic запускает Claude Opus 5.5 с улучшенным письмом и сниженными затратами

Anthropic выпустила Claude Opus 5.5, первую модель в своей новой семье Claude 5.5, позиционируя её как более эффективную альтернативу предыдущим поколениям. Модель разработана для выполнения задач на уровне Claude Fable 5.1 при стоимости запуска на 40% ниже, чем у Opus 5.

media MarkTechPost · 8 ч назад · 9 просмотров

Anthropic выпустила Claude Opus 5.5 с производительностью Fable 5.1 при стоимости на 40% ниже

Anthropic выпустила Claude Opus 5.5, первую модель в новой семье Claude 5.5, которая демонстрирует уровень производительности Claude Fable 5.1 в большинстве задач, но обходится на 40% дешевле в обслуживании, чем Opus 5.

media MarkTechPost · 21 ч назад GDPval-AA (Elo) · 1695.0Elo · 13 просмотров

SpaceXAI выпустила Grok 4.7 с увеличенной базовой моделью и улучшенными результатами в бенчмарках

SpaceXAI выпустила Grok 4.7, новую флагманскую модель для программирования, агентных задач и работы с знаниями, которая использует более крупную базовую модель и расширенный цикл обучения с подкреплением по сравнению с Grok 4.6. Модель сохраняет ту же структуру ценообразования, что и её предшественник, но предлагает улучшенные возможности самопроверки, обработки длинного контекста и безопасности.

media The Batch · 12 д назад GPQA Diamond · 96.3% · 29 просмотров

OpenAI запускает GPT-6 Astra, занимая верхние позиции в рейтингах при снижении стоимости

OpenAI выпустила GPT-6 Astra, свою новую флагманскую модель для работы с визуальными и языковыми данными, которая достигает лучших или близких к лучшим результатов на основных рейтингах ИИ, используя значительно меньше токенов и обходясь дешевле по сравнению с конкурирующими моделями. Модель разработана в соответствии с критическим уровнем кибербезопасности OpenAI, при этом расширенные кибервозможности ограничены для выбранных организаций.

media Latent Space · 19 д назад · 26 просмотров

OpenAI представила GPT-6 Astra в качестве новой флагманской модели

OpenAI официально выпустила GPT-6 Astra, позиционируя её как свою самую интеллектуальную и выровненную модель на сегодняшний день. Запуск ориентирован на компьютерное использование, программную инженерию, математику и естественные науки, офисную работу и кибербезопасность.

blog Simon Willison · 19 д назад Artificial Analysis Intelligence Index · 66.0% · 45 просмотров

OpenAI выпустила GPT-6 Astra с ARC-AGI 3 и улучшениями безопасности

OpenAI выпустила GPT-6 Astra, новую модель, доступную для пользователей ChatGPT Plus, Pro, Business и Enterprise, а также через OpenAI API и AWS. Модель оценивается в $10 за миллион входных токенов и $50 за миллион выходных токенов, позиционируясь как конкурент Claude Fable 5.

media Latent Space · 21 д назад · 38 просмотров

Anthropic запускает Claude Fable и Mythos 5.1 с новыми SOTA бенчмарками

Anthropic выпустила Claude Fable 5.1 и Claude Mythos 5.1 в качестве своих новых флагманских моделей для программирования и интеллектуального труда, позиционируя их как самые передовые модели в мире для автономных многошаговых задач.

media AI News (smol.ai) · 21 д назад · 42 просмотра

Anthropic выпустила Claude Fable 5.1 и Mythos 5.1 с пониженными ценами на кэш

Anthropic выпустила Claude Fable 5.1 и Claude Mythos 5.1 в качестве своих новых флагманских моделей для программирования и работы с знаниями, позиционируя их как способные выполнять автономные многошаговые задачи. В релизе предусмотрено значительное снижение цены на чтение кэша до $0.25 за миллион токенов при контекстном окне в 1 миллион токенов.

media Together AI Blog · 25 д назад · 50 просмотров

Дистилляция GLM-5.3 Flash жертвует надёжностью ради снижения стоимости в 17 раз

Сравнение GLM-5.3 и её дистиллированной версии GLM-5.3 Flash на бенчмарке DeepSWE показывает, что дистилляция сохраняет базовые способности к программированию, значительно снижая стоимость генерации ответов. Полная модель достигает показателя pass@1 на уровне 69,0% при стоимости $3,99 за задачу, тогда как версия Flash набирает 63,4% всего за $0,24, что представляет собой снижение цены в 17 раз.

lab Hugging Face Blog · 15 ч назад · 9 просмотров

AISI публикует подтверждённые результаты оценки шести передовых моделей по пяти бенчмаркам

Британский Институт безопасности ИИ (AISI) опубликовал методы оценки и их результаты через платформу Evaluation Cards сервиса EvalEval, чтобы повысить воспроизводимость бенчмарков. В этот выпуск вошли подтверждённые результаты, контекст и информация о конфигурации для пяти конкретных бенчмарков: HealthBench, FrontierMath, Humanity's Last Exam, SWE-Bench Pro и Terminal-Bench 2.0.

media Interconnects · 2 д назад Artificial Analysis Intelligence Index · 45.0% · 17 просмотров

Китайские модели с открытым весом обгоняют американские аналоги по количеству загрузок и результатам бенчмарков

Автор представляет обзор состояния моделей с открытым весом, отмечая, что китайские ИИ-компании стали явными лидерами в этой области примерно с апреля 2025 года. Этот сдвиг подтверждается метриками загрузок на Hugging Face и результатами на бенчмарках оценки возможностей.

media Hugging Face Forums · 6 д назад · 13 просмотров

Индекс отходов агентов оценил 341 054 публичных запусков кодовых агентов на наличие паттернов отходов

Индекс отходов агентов (Agent Waste Index) оценил 341 054 траектории агентов из 11 публичных наборов данных, чтобы выявить неэффективности, такие как циклы, слепые повторные попытки, избыточный вывод инструментов и заброшенные запуски. Анализ показывает, что поведение с циклами и повторными попытками широко распространено в более слабых моделях, таких как агенты на базе Llama, но редко встречается у Claude 3.7 Sonnet и Qwen3-Coder-480B.

media r/LocalLLaMA · 7 д назад · 18 просмотров

Отчёт Mozilla: открытые китайские ИИ-модели отстают от американских флагманов на 4 месяца

Согласно отчёту Mozilla, разрыв в разработке между открытыми китайскими ИИ-моделями и американскими флагманскими решениями сократился до четырёх месяцев. Несмотря на такой быстрый прогресс, модели продолжают уступать в некоторых бенчмарках.

media MarkTechPost · 7 д назад LMSYS Arena (Elo) · 1866.0Elo · 20 просмотров

Prior Labs выпускает TabPFN-3.5, превосходя победителя Otto Kaggle 2015 года со стандартными настройками

Prior Labs выпустила TabPFN-3.5, табличную фундаментальную модель, которая делает прогнозы по таблице за один прямой проход без обучения или настройки под конкретный набор данных. Модель набирает 0.375 в закрытом рейтинге соревнования Otto Group Product Classification Challenge 2015 года, превосходя оригинальный победивший результат 0.382, достигнутый Гилберто Титеричем и Станиславом Семёновым.

media r/LocalLLaMA · 7 д назад · 17 просмотров

Отчёт Mozilla: разрыв в возможностях ИИ-моделей Китая и США сократился до 4,4 месяцев

Согласно отчёту Mozilla, разрыв в возможностях между китайскими и американскими моделями искусственного интеллекта значительно сузился, составив всего 4,4 месяца.