Un usuario evaluó modelos de 2B a 35B parámetros en 29 páginas difíciles de extracción de datos HTML, encontrando que modelos más pequeños como gemma4 e2b y e4b superan a los más grandes. Qwen3.6 27B lideró en rendimiento, mientras que todos los modelos MOE obtuvieron malos resultados, destacando la importancia de la evaluación específica para cada tarea.
Evaluación de pequeños LLMs en extracción de datos HTML compleja
LLMs evaluados para la detección de vulnerabilidades web
Un estudio evalúa seis LLMs en la detección de vulnerabilidades web del mundo real en plugins de WordPress, encontrando que las tasas de detección varían según el modelo y el diseño del prompt. Claude Opus 4.6 logró la tasa de detección más alta con un 63%, mientras que Qwen 3.5 solo alcanzó un 35%, y ningún modelo identificó consistentemente todas las vulnerabilidades de referencia a través de las iteraciones.
Evaluación de referencia de modelos de lenguaje pequeños para PLN en árabe
Una evaluación de referencia con 240 elementos de prueba en árabe en ocho dominios y diez habilidades evalúa doce modelos de lenguaje pequeños en configuraciones zero-shot. Gemma 3 (12B) obtuvo la puntuación general más alta (4.548/5), seguido por Aya y C4AI Command Arabic, con un rendimiento vinculado más a la alineación con el árabe y al seguimiento de instrucciones que al tamaño del modelo. Los modos de fallo comunes incluyen filtración de prompt, alucinación y débil adherencia a la tarea.
Evaluación de referencia de modelos de lenguaje pequeños para PLN en árabe
Una evaluación de referencia de 240 elementos de prueba en árabe a través de ocho dominios y diez habilidades evalúa doce modelos de lenguaje pequeños en configuraciones zero-shot. Gemma 3 (12B) obtuvo la puntuación general más alta (4.548/5), seguido por Aya y C4AI Command Arabic, con un rendimiento vinculado más a la alineación en árabe y al seguimiento de instrucciones que al tamaño del modelo. Los modos de fallo comunes incluyen filtración de prompt, alucinación y débil adherencia a la tarea.
Protocolo VLM-as-3D-Judge de-biased para Generación de Muebles
Un protocolo de juez basado en VLM de-biased especializa TRELLIS en la generación de muebles mediante adaptación ligera. El protocolo aborda modos de fallo como sobrecarga de imagen y ocultamiento de geometría, con calibración que muestra tasas de victoria de 0.83–1.0 y simetría base-vs-base en 0.5. Entre seis métodos de adaptación, la reparación del condicionador bajo degradación severa alcanza paridad con el modelo base, mientras que ningún método supera el objetivo de tasa de victoria del 65%.
Optimización de recompensas no supervisada para modelos de lenguaje de proteínas
Un nuevo marco permite a los modelos de lenguaje de proteínas generar secuencias de proteínas controlables sin datos etiquetados ni validación de laboratorio húmedo. Utiliza recompensas independientes de la tarea basadas en la incertidumbre del modelo y la consistencia semántica para guiar la generación, con Optimización de Recompensa Suave y Binarizada superando a las líneas base en cobertura y controlabilidad bajo diversas condiciones.