QMFOL — это автоматизированная система, генерирующая задачи логического мышления на монадическом первом порядке с количественной сложностью. Она создает 2880 экземпляров тестов на 960 конфигурациях, оценивая шесть больших моделей логического мышления и две большие языковые модели, демонстрируя снижение производительности и рост вычислительных затрат при росте логической сложности.
QMFOL: Оценка способности больших моделей к логическому мышлению с контролируемой логической сложностью
CombEval: бенчмарк для подсчёта комбинаторных задач в LLMs
CombEval — это динамический бенчмарк, который генерирует задачи подсчёта на естественном языке с проверенными ответами с использованием типизированных спецификаций Cofola. Он оценивает 11 больших языковых моделей и выявляет устойчивые сбои при обработке упорядоченных объектов, неотличимых элементов, позиционных ограничений и вложенных зависимостей, причём ошибки связаны с интерпретацией ограничений и принципов подсчёта.
ForecastBench-Sim: бенчмарк прогнозирования в имитационном мире
ForecastBench-Sim — это бенчмарк прогнозирования в имитационном мире, использующий симуляции игры Freeciv. Он позволяет осуществлять непрерывные или бинарные прогнозы на любых горизонтах, с мирами с вмешательством для вопросов причинности и редких событий, и обеспечивает немедленную, разрешимую обратную связь для оценки вероятностного мышления в динамических средах.
VibeThinker-3B: Что за колдовство?
VibeThinker-3B — это маленький модель с 3 миллиардами параметров, которая показывает исключительные результаты на тесте MathQA, достигая результатов, сопоставимых с моделями, имеющими около 30 миллиардов параметров. Сильная производительность модели вызвала обсуждение её эффективности и возможностей в математическом мышлении.
NVIDIA AVO достигла 100% на ARC-AGI-3
Модель NVIDIA AVO показала идеальный результат на бенчмарке ARC-AGI-3. Она успешно прошла все 183 уровня в 25 публичных средах без каких-либо инструкций, явных правил или заявленных целей.
Artificial Analysis обнаруживает, что модели распознавания речи воспроизводят транскрипты бенчмарков по акустическим признакам
Исследование Artificial Analysis показывает, что несколько высоко оцениваемых моделей распознавания речи с открытым исходным кодом (ASR) оптимизируются под бенчмарки, воспроизводя эталонные транскрипты даже тогда, когда аудио им противоречит. В исследовании были оценены 11 широко используемых моделей и выявлены три конкретных поведения: воспроизведение ошибочного эталонного текста, восстановление замаскированных чисел и переключение орфографических вариантов для соответствия стандартам бенчмарка.