Этот исследовательский проект представляет рамку Match Task to Objective (MTO), которая позволяет сопоставить цели предобучения и настройки с конкретными задачами. Рамка обеспечивает автоматическую, неподконтрольную адаптацию данных и обеспечивает рост производительности более чем на 120% в условиях малообучающих данных, превосходя базовые методы как в условиях малообучающих данных, так и в условиях полного набора данных. Кроме того, она улучшает настройку промптов, предоставляя эффективные рекомендации по мягкому инженерированию промптов.
Соответствие задачи и рамочной структуры для моделей кодировщиков-декодеров
GLM 5.2 только на CPU: Epyc и 512 ГБ ОЗУ
Пользователь протестировал 4-битную версию GLM-5.2 (GLM-5.2-UD-Q4_K_XL) на сервере с процессором AMD Epyc Rome 7452 и 512 ГБ ОЗУ. Модель оценивалась с использованием сложного промпта для программирования, требующего создания самодостаточной 3D-игры в формате HTML, CSS и JavaScript.
Кадровая система на основе TRIZ улучшает креативный дизайн
Кадровая система на основе TRIZ использует большие языковые модели для генерации креативных, редактируемых 3D моделей CAD, интегрируя изобретательские принципы из патентной информации. В случае исследования дизайна стула она обеспечила снижение массы на 4,0-14,7% при сохранении структурной целостности за счёт принципов, таких как сегментация и композитные материалы.
llama-server аварийно останавливается при использовании промпта 'вставленного как файл' для извлечения данных из изображения
llama-server аварийно останавливается, когда пользователь вставляет длинный промпт в виде текстового файла вместе с изображением, рассматривая его как вложение файла. Сервер работает корректно при отправке промпта в меньших блоках, но несёт сбой при объединении полного промпта в один текстовый блок и отправке вместе с изображением.
Байесовский контроль для агентов кодирования
Байесовский контроль улучшает решения о применении инструментов в агентах кодирования, моделируя неопределенность и динамически выбирая действия. Метод превосходит регулярные системы координации, особенно когда проверка является дорогостоящей и критики предоставляют информативную, но несовершенную обратную связь. Метод также обеспечивает более интерпретируемую оценку корректности, чем метрики на основе вероятности токенов или чистого успеха инструмента.
Оценка LLM для обнаружения уязвимостей в веб-приложениях
Исследование оценивает шесть LLM на обнаружение реальных уязвимостей в веб-приложениях в плагинах WordPress, выявляя, что показатели обнаружения варьируются в зависимости от модели и дизайна запроса. Claude Opus 4.6 достиг наивысшего показателя обнаружения — 63%, в то время как Qwen 3.5 достиг лишь 35%, и ни одна модель не стабильно идентифицировала все базовые уязвимости на всех итерациях.