TxBench-PP — это проверяемый бенчмарк для преследования фармакологии маломолекул, проверяющий способность ИИ-агентов делать точные выводы на основе реальных данных о пробах. В 16 конфигурациях моделей-инструментов ни одна система не демонстрировала надежную способность принимать правильные решения в области преследования фармакологии, лучшая производительность составила 59,3% (Claude Opus 4.8 / Pi) и 55,3% (GPT-5.5 / Pi) по попыткам достижения конечных результатов.
TxBench-PP: производительность ИИ-агента в преследовании фармакологии
TxBench-PP: оценка AI-агента в проклинической фармакологии
TxBench-PP — это проверяемая оценка для проклинической фармакологии маломолекулярных соединений, проверяющая способность AI-агентов делать точные выводы на основе реальных данных о пробах. При 16 конфигурациях моделей ни одна система не проходила все оценки, лучшая настройка (Claude Opus 4.8 / Pi) достигла 59,3% успеха при 300 попытках на конечных точках.
MacAgentBench запускает бенчмарк AI-агента для macOS
MacAgentBench представляет всесторонний бенчмарк, включающий 676 задач по 25 приложениям, 60% из которых включают взаимодействие как с графическим интерфейсом, так и с командной строкой. Используя детерминированные правилу-ориентированные оценки и оценку с использованием мелких контрольных точек, было установлено, что Claude Opus 4.6 на OpenClaw достигает 73,7% Pass@1, в основном благодаря своей библиотеке навыков, а не архитектуре платформы.
Анализ траекторий раскрывает структуру навыков, но не улучшает политики
Трехэтапный пайплайн извлекает библиотеки навыков из данных взаимодействия с интерфейсом, достигая высокой чистоты в пяти из восьми кластеров по сравнению с метками InteraSkill. Однако метод лишь слегка улучшает точность навыков-шагов на IW и не улучшает производительность на BrowseComp+ или ключевые метрики, что указывает на ограниченность переноса политики между доменами.
AtomMem: Простая и эффективная система памяти для агентов LLM
AtomMem представляет систему памяти, которая хранит высокочастотные атомарные факты из длительных взаимодействий. Она использует иерархические структуры событий и временные профили для отслеживания согласованных эпизодических контекстов и изменяющихся пользовательских характеристик, обеспечивая стабильное и эффективное эволюционирование памяти. Эксперименты на бенчмарке LoCoMo показывают, что AtomMem достигает наилучших результатов в задачах логического мышления.
GEMS: Геометрические ограничения обеспечивают мульти-семантическую суперпозицию в LLMs
GEMS обеспечивает обучение-бесподобную суперпозицию нескольких семантических направлений в LLMs за счёт устранения распределительной дисперсии и направляющего интерференции с помощью геометрических ограничений. На GSM8K оно сохраняет точность на уровне 98% при трёх неподходящих математических направлениях, в то время как неограниченное сложение падает до 4%; на Wikitext-2 оно повышает PPL всего на 2,2%.