P4IR, un marco de dos etapas, utiliza ajuste fino supervisado y Optimización de Política Relativa de Grupo para mejorar los sistemas automatizados de cumplimiento de código basados en modelos de lenguaje grandes. Reduce las distancias de Levenshtein a nivel de árbol y de token hasta en un 23,8% y un 38,6% respectivamente, superando a LLMs líderes como Claude Opus, GPT-5.2 y GLM-4.7 en configuraciones de zero-shot con prompting few-shot, y reduce los falsos positivos por un margen estadísticamente significativo.
El marco P4IR mejora la precisión del cumplimiento de código basado en LLM
Ingeniería inversa de la atención del Transformer con programas ejecutables
Un nuevo método utiliza síntesis de programas para generar programas en Python que reproducen los patrones de atención en modelos Transformer. Menos de 1,000 de estos programas logran una similitud de intersección sobre unión superior al 75% en TinyStories, y reemplazar el 25% de las cabezas de atención con estos programas aumenta la perplexidad solo un 16% mientras preserva el rendimiento en tareas de respuesta a preguntas.
LLM como interfaz, ML como predictor para apendicitis pediátrica
ClaMPAPP, un sistema híbrido, utiliza un LLM para extraer características clínicas estructuradas de notas de texto libre y las pasa a un clasificador XGBoost para el diagnóstico. Superó a los LLM de extremo a extremo tanto en validación interna como externa, con mayor estabilidad y menos casos de apendicitis no detectados, demostrando un rendimiento diagnóstico y una seguridad superiores en la triaje pediátrica.
LLMs evaluados para la detección de vulnerabilidades web
Un estudio evalúa seis LLMs en la detección de vulnerabilidades web del mundo real en plugins de WordPress, encontrando que las tasas de detección varían según el modelo y el diseño del prompt. Claude Opus 4.6 logró la tasa de detección más alta con un 63%, mientras que Qwen 3.5 solo alcanzó un 35%, y ningún modelo identificó consistentemente todas las vulnerabilidades de referencia a través de las iteraciones.
Evaluación de referencia de modelos de lenguaje pequeños para PLN en árabe
Una evaluación de referencia con 240 elementos de prueba en árabe en ocho dominios y diez habilidades evalúa doce modelos de lenguaje pequeños en configuraciones zero-shot. Gemma 3 (12B) obtuvo la puntuación general más alta (4.548/5), seguido por Aya y C4AI Command Arabic, con un rendimiento vinculado más a la alineación con el árabe y al seguimiento de instrucciones que al tamaño del modelo. Los modos de fallo comunes incluyen filtración de prompt, alucinación y débil adherencia a la tarea.
ORBIT: Dirección de comportamiento multiatributo sin entrenamiento
ORBIT permite el control simultáneo y sin entrenamiento de múltiples atributos conductuales mediante la rotación de subespacios ortogonales. Logra una dirección equilibrada y coherente entre atributos sin necesidad de reentrenamiento, superando a las líneas base existentes en los benchmarks TraitFactory y ToneBank.