PragReST — это самосупервизированная система, которая улучшает прямое мышление больших языковых моделей за счёт генерации следов косвенного мышления и обучения через надзорную тонкую настройку и обучение с помощью вознаграждения. Она превосходит базовые модели на четырёх прямых тестах, улучшая точность Qwen3-8B и Qwen3-14B на 5,37% и 5-5,50% соответственно, и сохраняет сильную производительность на задачах общего знания и математического мышления.
PragReST: Саморазвивающаяся косвенная логика для понимания прямого языка
Метод направления на этапе тестирования устраняет конфликты временных фактов в языковых моделях
Исследователи выявили параметрические временные конфликты в языковых моделях, где устаревшие факты сохраняются в параметрах. Они вводят Метод временного притяжения (TAS), подход на этапе тестирования, который устраняет 29-57% таких конфликтов без переобучения, сохраняя точность 85-99% на запросах без конфликтов и превосходя базовую модель на трёх из четырёх моделей.
Что более впечатляет: GLM 5.1 до 5.2 или Qwen 3.5 до 3.6?
Пост на Reddit сравнивает улучшения производительности GLM 5.1 до 5.2 и Qwen 3.5 до -3.6. В посте отмечается, что упоминание 'Döner' активирует специализированные веса GLM 5.2 на немецком языке, в то время как Qwen 3.6 оценивается с использованием 35B параметров и Quantization Unsloth Q8 K XL через llama.cpp.
G-IdiomAlign: Бенчмарк с использованием глагольного опорного элемента для синхронизации идиом между языками
G-IdiomAlign вводит бенчмарк, основанный на глагольных опорных элементах, используя английские глагольные опоры из Wiktionary для фиксации идиом. В нём содержатся контролируемые многократные варианты эквивалентности и протоколы глагольного контрастного генерирования, что показывает, что глагольные опоры улучшают производительность в семантической синхронизации, хотя результаты остаются скромными, что указывает на значительный потенциал для улучшения синхронизации идиом между языками.
G-IdiomAlign: Бенчмарк с использованием глаголов-пивотов для синхронизации идиом между языками
G-IdiomAlign вводит бенчмарк с использованием глаголов-пивотов, основанных на английских глаголах из Wiktionary, для фиксации идиом. В него включены протоколы контролируемого множественного выбора эквивалентности и глагольно-сравнительного генерирования, что показывает, что глаголы улучшают результаты в семантической синхронизации на основе встраивания, хотя результаты остаются скромными, что указывает на значительный потенциал для улучшения синхронизации идиом между языками.
LLMs предсказывают деменцию и депрессию на основе клинической речи
Исследование использует открытые большие языковые модели для оценки степени деменции и депрессии на основе клинических интервью. Модели достигают точного нуля-шот-предсказания депрессии (MAE 0,60) и улучшенной оценки деменции с извлечением признаков (MAE 0,78), снижая ошибки до 35%. Транскрипции с учетом пауз соответствуют ручным транскрипциям, что поддерживает автоматизированные потоки фильтрации для невропсихиатрических расстройств.