El conjunto de datos ProductConsistency introduce 87k muestras SFT y 869 muestras RL para mejorar la preservación de la identidad del producto en la edición de imágenes. Incluye un benchmark para evaluación estandarizada y utiliza una recompensa de consistencia cíclica para imponer la identidad semántica del producto a través de la similitud de las descripciones. El ajuste fino de Qwen-Image-Edit-2511 y Flux.1-Kontext-dev muestra una reducción de 5 veces en la tasa de error de caracteres y una mejora en la renderización de texto y la calidad visual.
ProductConsistency: Mejorar la identidad del producto en la edición de imágenes
NoiseTilt: Kernels inversos con inclinación de ruido para la alineación de recompensas en difusión
NoiseTilt introduce NTRK, un muestreador de difusión guiado por recompensa que inyecta gradientes de recompensa a través del término de ruido sin alterar el kernel inverso. Al utilizar un operador de blanqueo, NTRK sesga de forma segura el ruido hacia la alta recompensa, preservando la calidad de la muestra mientras mantiene una fuerte guía. En la generación estética, NTRK logra un rendimiento de recompensa superior con 25 NFEs, reduciendo el cómputo en 20× en comparación con las líneas base más avanzadas.
OpenEnv reproduce el modelo de acuarela de Surya Narreddi usando TRL
Un ingeniero ha liberado como código abierto una reproducción del proyecto viral de Surya Narreddi, que entrena un modelo de programación para pintar acuarelas utilizando JavaScript y aprendizaje por refuerzo. La implementación utiliza la biblioteca TRL y OpenEnv para crear un pipeline de extremo a extremo en Hugging Face para entrenamiento, puntuación e inferencia.
GSM-Plus-BN presenta un benchmark basado en perturbaciones para el razonamiento matemático en bengalí
El estudio introduce GSM-Plus-BN, un nuevo conjunto de datos matemáticos en bengalí perturbado derivado del benchmark GSM-Plus en inglés y verificado por traductores humanos. Este recurso aborda la falta de benchmarks sistemáticos para evaluar la robustez de los modelos en regiones lingüísticamente diversas como Bangladés.
LLMs evaluados para la detección de vulnerabilidades web
Un estudio evalúa seis LLMs en la detección de vulnerabilidades web del mundo real en plugins de WordPress, encontrando que las tasas de detección varían según el modelo y el diseño del prompt. Claude Opus 4.6 logró la tasa de detección más alta con un 63%, mientras que Qwen 3.5 solo alcanzó un 35%, y ningún modelo identificó consistentemente todas las vulnerabilidades de referencia a través de las iteraciones.
Evaluación de referencia de modelos de lenguaje pequeños para PLN en árabe
Una evaluación de referencia con 240 elementos de prueba en árabe en ocho dominios y diez habilidades evalúa doce modelos de lenguaje pequeños en configuraciones zero-shot. Gemma 3 (12B) obtuvo la puntuación general más alta (4.548/5), seguido por Aya y C4AI Command Arabic, con un rendimiento vinculado más a la alineación con el árabe y al seguimiento de instrucciones que al tamaño del modelo. Los modos de fallo comunes incluyen filtración de prompt, alucinación y débil adherencia a la tarea.