Talos — это открытый инструмент, который автоматизирует итеративный пересмотр геномных данных для выявления диагнозов редких заболеваний. Он достиг 90% восстановления диагнозов в рамках охвата при только 1,3 кандидатных вариантах на пациента, и предоставил 241 новый диагноз среди 5 000 незапланированных пациентов, при этом большинство новых находок появлялись в течение 32 дней после публикации доказательств.
Talos: автоматизированный пересмотр геномных данных для диагностики редких заболеваний
Стабилизация намерения инструмента в потоковом RAG
Исследование оценивает стабилизацию намерения инструмента в потоковом RAG, определяя момент, когда спекулятивные запросы на инструменты сходятся к правильным ответам. На бенчмарке CRAG 73,9% запросов позволяют значительное скрытие задержки, при этом ранняя стабилизация наблюдается в вопросах с прямым извлекаемым доказательством. Тип вопроса значительно предсказывает раннюю или позднюю стабилизацию, что позволяет определить, когда спекулятивные триггеры оказываются эффективными.
M$^3$R-Bench представляет доказательный бенчмарк для понимания мультимодальных метафор
Исследователи представляют M$^3$R-Bench, унифицированный бенчмарк, содержащий 1 000 пар «изображение-текст» с аннотациями, проверенными экспертами, предназначенный для оценки понимания мультимодальных метафор, основанного на доказательствах. Бенчмарк предоставляет совместные аннотации для выявления наличия метафоры, отображения «Цель-Источник», тональности и поэтапных объяснений на основе теории концептуальной метафоры.
SkillOpt от Microsoft обеспечивает передачу навыков агента между Codex и Claude Code
Исследователи из Microsoft, Шанхайского университета Цзяо Тун, Университата Тунцзи и Университета Фудан разработали SkillOpt — оптимизатор в текстовом пространстве, который обучает документы с навыками на естественном языке, оставляя целевую модель замороженной. Система использует модель-оптимизатор для предложения ограниченных правок на основе оценённых прогонов, экспортируя результат в виде одного файла `best_skill.md`.
Фреймворк Zing улучшает социальный интеллект больших языковых моделей с помощью бенчмарка SoMBench и заземления Actio
В докладе представлен Zing, интегрированный фреймворк, разработанный для повышения социального интеллекта больших языковых моделей путём измерения, интериоризации и заземления социальных способностей. Авторы представляют SoMBench — бенчмарк, основанный на психологии, охватывающий 17 вторичных измерений и 3481 экземпляр, верифицированных экспертами, который показывает, что текущие большие языковые модели имеют значительный потенциал для улучшения, ни одна из них не достигла производительности, близкой к максимальному пределу.
Бенчмарк SRRM показывает, что Qwen2.5-1.5B превосходит 3B в долговременной контекстной памяти
Исследователь ищет одобрение arXiv cs.CL для статьи, представляющей Simple Retrieval-Reconstruction Memory (SRRM), легкий бенчмарк, предназначенный для оценки долговременной контекстной памяти в малых языковых моделях.