Este estudio evalúa si los clasificadores de codificador ModernBERT ajustados pueden servir como alternativas rentables a los jueces basados en LLM para la evaluación de seguridad. Los investigadores compararon ModernBERT y Ettin frente a la coincidencia de prefijos basada en reglas, clasificadores de LLM ajustados y varias metodologías de jueces LLM. Estos jueces LLM incluyeron estrategias de StrongReject, ShieldGemma, JailbreakBench, AILuminate, SorryBench, Claude-as-a-judge y modelos como LlamaGuard 3 y 4. Los clasificadores de codificador se entrenaron con datos etiquetados por jueces utilizando una estrategia de etiqueta de votación mayoritaria y se probaron en un conjunto de prueba estándar de oro. El rendimiento se midió utilizando la puntuación F1, la tasa de falsos negativos y las métricas de precisión-recuperación en conjuntos de datos adversariales de código abierto. Los resultados se analizaron adicionalmente por técnica de ataque, incluyendo prompting de turno único, descomposición, escalada y manipulación del contexto. Los hallazgos proporcionan orientación sobre cuándo los clasificadores de codificador pueden reemplazar de manera confiable a los jueces basados en LLM sin una pérdida sustancial de rendimiento.
¿Bastan los codificadores? Una comparación sistemática de jueces evaluadores de seguridad basados en codificadores y decodificadores para la evaluación adversarial de LLM
Los LLM muestran potencial pero necesitan mejoras para la clasificación de incidentes antisemitas
Este estudio evalúa la capacidad de los modelos de lenguaje grandes para detectar y clasificar informes de eventos antisemitas utilizando etiquetas detalladas. Los autores probaron GPT-4o de OpenAI y Llama-3.2-3B-Instruct de Meta en conjuntos de datos anotados por expertos derivados de artículos de noticias, informes de la sociedad civil y registros oficiales.
El marco PSALM evalúa la apropiación estilística de LLM bajo la legislación de derechos de autor de la UE
Los autores presentan PSALM, un marco de tipo "LLM-as-a-judge" diseñado para operacionalizar la doctrina de derechos de autor de la UE con el fin de evaluar la apropiación estilística en modelos de lenguaje grandes. A diferencia de las salvaguardias existentes que se centran en la memorización literal, PSALM evalúa la superposición computacional y las dimensiones estilísticas como el estilo de escritura y la voz narrativa.
Calibración sin comprensión en la detección de vulnerabilidades de LLM
CWE-Trace evalúa ocho LLMs base y 15 LLMs ajustados con LoRA en la detección de vulnerabilidades del kernel de Linux. Los resultados muestran que la contaminación de los datos no ofrece ninguna ventaja, y el ajuste fino solo desplaza los umbrales de salida sin alterar las políticas de decisión. A pesar de las puntuaciones de detección mejoradas, los LLMs carecen de razonamiento de seguridad confiable, con una precisión de CWE top-1 inferior al 1.3% y un rendimiento de detección binaria del 52.1%.
Alineación de LLM mediante Retroalimentación Implícita del Usuario
Un nuevo conjunto de datos, IFLLM, recopila trayectorias del ratón y datos de fijación ocular de usuarios que interactúan con LLMs. Muestra que la retroalimentación implícita mejora significativamente la alineación de LLMs, aumentando la precisión del modelo de recompensa basado en texto del 55% al 64% y casi triplicando las mejoras en la calidad de respuesta después del entrenamiento DPO en ocho LLMs.
Alineación de LLM usando retroalimentación implícita del usuario
Un nuevo conjunto de datos, IFLLM, recopila trayectorias del ratón y datos de fijación ocular de usuarios que interactúan con LLMs. Muestra que la retroalimentación implícita mejora significativamente la alineación de LLMs, aumentando la precisión del modelo de recompensa basado en texto del 55% al 64% y casi triplicando las mejoras en la calidad de respuesta después del entrenamiento DPO en ocho LLMs.