Датасет ProductConsistency вводит 87k образцов SFT и 869 образцов RL для улучшения сохранения идентичности продукта при редактировании изображений. В нём включён бенчмарк для стандартизированной оценки и используется циклическая согласованность вознаграждения для обеспечения семантической идентичности продукта через сходство описаний. Тонкая настройка Qwen-Image-Edit-2511 и Flux.1-Kontext-dev показывает снижение ошибки в 5 раз и улучшение отображения текста и визуальной качества.
ProductConsistency: Улучшение идентичности продукта в редактировании изображений
NoiseTilt: Noise-Tilted Reverse Kernels для выравнивания вознаграждения в диффузионных моделях
NoiseTilt вводит NTRK, диффузионный образовательный сэмплер, который вводит градиенты вознаграждения через компонент шума без изменения обратного ядра. Используя оператор белого шума, NTRK безопасно смещает шум в сторону высоких вознаграждений, сохраняя качество образцов при обеспечении сильного направления. В задаче эстетического генерирования NTRK достигает превосходной производительности по вознаграждению при 25 NFE, снижая вычислительные затраты на 20× по сравнению с существующими базовыми моделями.
OpenEnv воспроизводит модель акварельной живописи Суры Нарредди с помощью TRL
Инженер открыл исходный код воспроизведения вирусного проекта Суры Нарредди, который обучает модель программирования рисовать акварелью с использованием JavaScript и обучения с подкреплением. Реализация использует библиотеку TRL и OpenEnv для создания сквозного конвейера на Hugging Face для обучения, оценки и вывода.
GSM-Plus-BN представляет бенчмарк на основе возмущений для математического рассуждения на бенгальском языке
Исследование представляет GSM-Plus-BN, новый набор данных по математике на бенгальском языке с возмущениями, полученный из английского бенчмарка GSM-Plus и проверенный переводчиками-людьми. Этот ресурс восполняет отсутствие системных бенчмарков для оценки устойчивости моделей в лингвистически разнообразных регионах, таких как Бангладеш.
Оценка LLM для обнаружения уязвимостей в веб-приложениях
Исследование оценивает шесть LLM на обнаружение реальных уязвимостей в веб-приложениях в плагинах WordPress, выявляя, что показатели обнаружения варьируются в зависимости от модели и дизайна запроса. Claude Opus 4.6 достиг наивысшего показателя обнаружения — 63%, в то время как Qwen 3.5 достиг лишь 35%, и ни одна модель не стабильно идентифицировала все базовые уязвимости на всех итерациях.
Оценка бенчмарка малых языковых моделей для арабской NLP
Бенчмарк из 240 арабских тестовых заданий в восьми областях и десяти навыках оценивает двенадцать малых языковых моделей в нулевом режиме. Gemma 3 (12B) достигла наивысшей общей оценки (4,548/5), за ним следуют Aya и C4AI Command Arabic, производительность которых связана больше с арабской настройкой и выполнением инструкций, чем с размером модели. Общие недостатки включают утечку промпта, халлюцинации и слабое выполнение задач.