Новый метод использует синтез программ для генерации программ на языке Python, которые воспроизводят паттерны внимания в моделях трансформеров. Более 999 таких программ достигают более чем 75% схожести по пересечению-объединению на TinyStories, и замена 25% голов внимания этими программами приводит к росту перплексности на 16%, при этом сохраняется производительность на задачах ответа на вопросы.
Разбор внимания трансформера с помощью исполняемых программ
Кадр P4IR повышает точность соблюдения кода на основе больших языковых моделей
P4IR, двухэтапная система, использует обучение с учителем и групповую относительную оптимизацию политик для улучшения систем автоматического соблюдения кода на основе больших языковых моделей. Она снижает расстояние редактирования дерева и расстояние Левенштейна на уровне токенов до 23,8% и 38,6% соответственно, превосходя ведущие языковые модели, такие как Claude Opus, GPT-5.2 и GLM-4.7, в условиях нуля-шота и с использованием небольшого количества примеров, и снижает количество ложноположительных результатов на статистически значимом уровне.
Генерируемые LLM-ядра GPU подвергаются иллюзии корректности
Оценки с использованием проверок фиксированной формы пропускают реальные ошибки в ядрах GPU, генерируемых LLM. Контролируемый корпус из 24 ядер, включающий 9 вариантов с ошибками транскрипции, показывает, что оракул, учитывающий схему операций, обнаруживает все сбои и проходит все корректные проверки, с одинаковыми результатами на пяти архитектурах GPU.
LLM-как-интерфейс, ML-как-прогнозатор для детской аппендицитной болезни
ClaMPAPP, гибридная система, использует LLM для извлечения структурированных клинических признаков из свободно-текстовых записей и передает их в классификатор XGBoost для диагностики. Она превосходила конечные LLM в обеих внутренних и внешних валидациях, демонстрируя лучшую стабильность и меньшее количество пропущенных случаев аппендицита, что свидетельствует о превосходной диагностической эффективности и безопасности в педиатрической дифференциации.
Неподготовленная оптимизация вознаграждения для языковых моделей белков
Новый фреймворк позволяет языковым моделям белков генерировать управляемые последовательности белков без обучающих данных или проверки в лаборатории. Он использует вознаграждения, не зависящие от задачи, основанные на неопределённости модели и семантической согласованности, для направления генерации, при этом Soft и бинаризованная оптимизация вознаграждения превосходят базовые методы по охвату и управляемости в различных условиях.
Триада Волков: роль Шута для многошагового понимания теории разума в больших языковых моделях
Исследователи расширили игру «Волки и овцы», добавив роль Шута, чтобы создать триадную среду социального дедуктирования, требующую рассуждений над тремя противоположными функциями полезности, что бросает вызов возможностям больших языковых моделей в области теории разума. Оценки на GPT-4.1, DeepSeek-V3.1 и Llama-3.3-70B показали, что хотя Шут выигрывал 60–70% игр, волки GPT-4.1 часто голосовали за изгнание Шута в первый день в 60–70% случаев — это самоподрывающее действие, обусловленное языковыми приоритетами.