P4IR, двухэтапная система, использует обучение с учителем и групповую относительную оптимизацию политик для улучшения систем автоматического соблюдения кода на основе больших языковых моделей. Она снижает расстояние редактирования дерева и расстояние Левенштейна на уровне токенов до 23,8% и 38,6% соответственно, превосходя ведущие языковые модели, такие как Claude Opus, GPT-5.2 и GLM-4.7, в условиях нуля-шота и с использованием небольшого количества примеров, и снижает количество ложноположительных результатов на статистически значимом уровне.
Кадр P4IR повышает точность соблюдения кода на основе больших языковых моделей
Разбор внимания трансформера с помощью исполняемых программ
Новый метод использует синтез программ для генерации программ на языке Python, которые воспроизводят паттерны внимания в моделях трансформеров. Более 999 таких программ достигают более чем 75% схожести по пересечению-объединению на TinyStories, и замена 25% голов внимания этими программами приводит к росту перплексности на 16%, при этом сохраняется производительность на задачах ответа на вопросы.
LLM-как-интерфейс, ML-как-прогнозатор для детской аппендицитной болезни
ClaMPAPP, гибридная система, использует LLM для извлечения структурированных клинических признаков из свободно-текстовых записей и передает их в классификатор XGBoost для диагностики. Она превосходила конечные LLM в обеих внутренних и внешних валидациях, демонстрируя лучшую стабильность и меньшее количество пропущенных случаев аппендицита, что свидетельствует о превосходной диагностической эффективности и безопасности в педиатрической дифференциации.
Оценка LLM для обнаружения уязвимостей в веб-приложениях
Исследование оценивает шесть LLM на обнаружение реальных уязвимостей в веб-приложениях в плагинах WordPress, выявляя, что показатели обнаружения варьируются в зависимости от модели и дизайна запроса. Claude Opus 4.6 достиг наивысшего показателя обнаружения — 63%, в то время как Qwen 3.5 достиг лишь 35%, и ни одна модель не стабильно идентифицировала все базовые уязвимости на всех итерациях.
Оценка бенчмарка малых языковых моделей для арабской NLP
Бенчмарк из 240 арабских тестовых заданий в восьми областях и десяти навыках оценивает двенадцать малых языковых моделей в нулевом режиме. Gemma 3 (12B) достигла наивысшей общей оценки (4,548/5), за ним следуют Aya и C4AI Command Arabic, производительность которых связана больше с арабской настройкой и выполнением инструкций, чем с размером модели. Общие недостатки включают утечку промпта, халлюцинации и слабое выполнение задач.
ORBIT: Обучение-бесплатное управление многими атрибутами поведения
ORBIT обеспечивает обучение-бесплатное одновременное управление несколькими атрибутами поведения с использованием ортогонального вращения подпространства. Оно достигает сбалансированного и согласованного управления атрибутами без переподготовки, превосходя существующие базовые решения на тестах TraitFactory и ToneBank.