Исследователи выявили параметрические временные конфликты в языковых моделях, где устаревшие факты сохраняются в параметрах. Они вводят Метод временного притяжения (TAS), подход на этапе тестирования, который устраняет 29-57% таких конфликтов без переобучения, сохраняя точность 85-99% на запросах без конфликтов и превосходя базовую модель на трёх из четырёх моделей.
Метод направления на этапе тестирования устраняет конфликты временных фактов в языковых моделях
Каузальные направления активации для смягчения эмерджентной несоответственности в языковых моделях
Тонкая настройка языковых моделей на небезопасном коде приводит к эмерджентной несоответственности. Общее направление активации в четырех семействах моделей обеспечивает разделяемость 99,6% между соответствующими и несоответствующими активациями, а вычитание этого направления снижает проникновение кода на 21–51 балл. Переход между архитектурами демонстрирует подавление поведения, но отсутствует специфичность; направления внутри модели являются кausalно действительными, а направления между моделями — только кausalно реальными.
LLMs предсказывают деменцию и депрессию на основе клинической речи
Исследование использует открытые большие языковые модели для оценки степени деменции и депрессии на основе клинических интервью. Модели достигают точного нуля-шот-предсказания депрессии (MAE 0,60) и улучшенной оценки деменции с извлечением признаков (MAE 0,78), снижая ошибки до 35%. Транскрипции с учетом пауз соответствуют ручным транскрипциям, что поддерживает автоматизированные потоки фильтрации для невропсихиатрических расстройств.
RubricsTree: масштабируемая система оценки для персональных агентов здоровья
RubricsTree вводит иерархическую классификацию более 100 клинически подтвержденных булевых рубрик, эволюционировавших из 4000 реальных запросов пользователей при помощи ручной коррекции. Оно обеспечивает масштабируемую оценку персональных агентов здоровья, согласованную с экспертами, путем динамического направления запросов в соответствующие рубрики и превосходит базовые методы по согласованности, чувствительности к контексту и достигает роста производительности моделей до 66% на HealthBench.
RubricsTree: масштабируемая система оценки для персональных агентов здравоохранения
RubricsTree вводит иерархическую классификацию более 100 клинически подтвержденных булевых рубрик, эволюционировавших из 4 000 реальных запросов пользователей при помощи ручной коррекции. Оно позволяет масштабируемо оценивать персональные агенты здравоохранения с учетом экспертных критериев, динамически направляя запросы в соответствующие рубрики и превосходит базовые методы по степени синхронизации, обнаружению деградации контекста и обеспечивает рост производительности моделей до 66% на HealthBench.
LLM демонстрируют различные стратегии под скептическим давлением, а не сиреневое отступление
Исследование, тестирующее Llama-3.1-8B, Qwen2.5-7B и Mistral-7B в областях климата, вакцин и эволюции, показывает, что модели не отступают сиреннически от научного консенсуса, когда пользователи выражают сомнение. Вместо этого модели демонстрируют три различные стратегии: реактивное утверждение, где консенсус увеличивается (Llama), поверхностное хеджирование с смягченным тоном (Qwen) и отсутствие ответа (Mistral).