Байесовский контроль улучшает решения о применении инструментов в агентах кодирования, моделируя неопределенность и динамически выбирая действия. Метод превосходит регулярные системы координации, особенно когда проверка является дорогостоящей и критики предоставляют информативную, но несовершенную обратную связь. Метод также обеспечивает более интерпретируемую оценку корректности, чем метрики на основе вероятности токенов или чистого успеха инструмента.
Байесовский контроль для агентов кодирования
GLM 5.2 только на CPU: Epyc и 512 ГБ ОЗУ
Пользователь протестировал 4-битную версию GLM-5.2 (GLM-5.2-UD-Q4_K_XL) на сервере с процессором AMD Epyc Rome 7452 и 512 ГБ ОЗУ. Модель оценивалась с использованием сложного промпта для программирования, требующего создания самодостаточной 3D-игры в формате HTML, CSS и JavaScript.
Кадровая система на основе TRIZ улучшает креативный дизайн
Кадровая система на основе TRIZ использует большие языковые модели для генерации креативных, редактируемых 3D моделей CAD, интегрируя изобретательские принципы из патентной информации. В случае исследования дизайна стула она обеспечила снижение массы на 4,0-14,7% при сохранении структурной целостности за счёт принципов, таких как сегментация и композитные материалы.
llama-server аварийно останавливается при использовании промпта 'вставленного как файл' для извлечения данных из изображения
llama-server аварийно останавливается, когда пользователь вставляет длинный промпт в виде текстового файла вместе с изображением, рассматривая его как вложение файла. Сервер работает корректно при отправке промпта в меньших блоках, но несёт сбой при объединении полного промпта в один текстовый блок и отправке вместе с изображением.
Соответствие задачи и рамочной структуры для моделей кодировщиков-декодеров
Этот исследовательский проект представляет рамку Match Task to Objective (MTO), которая позволяет сопоставить цели предобучения и настройки с конкретными задачами. Рамка обеспечивает автоматическую, неподконтрольную адаптацию данных и обеспечивает рост производительности более чем на 120% в условиях малообучающих данных, превосходя базовые методы как в условиях малообучающих данных, так и в условиях полного набора данных. Кроме того, она улучшает настройку промптов, предоставляя эффективные рекомендации по мягкому инженерированию промптов.
Оценка LLM для обнаружения уязвимостей в веб-приложениях
Исследование оценивает шесть LLM на обнаружение реальных уязвимостей в веб-приложениях в плагинах WordPress, выявляя, что показатели обнаружения варьируются в зависимости от модели и дизайна запроса. Claude Opus 4.6 достиг наивысшего показателя обнаружения — 63%, в то время как Qwen 3.5 достиг лишь 35%, и ни одна модель не стабильно идентифицировала все базовые уязвимости на всех итерациях.