GLM-5.2 supera a GPT-5.4 y a toda la línea de Gemini en rendimiento de codificación en el benchmark DeepSWE. Sin embargo, requiere significativamente más tokens de salida, lo que lo hace sustancialmente menos eficiente en términos de costo por tarea en comparación con modelos como GPT-5.5 y Claude Opus 4.8.
GLM-5.2 supera a Gemini y GPT-5.4 en programación, pero es ineficiente
Los núcleos de GPU generados por LLM enfrentan la ilusión de la corrección
Las pruebas de referencia que utilizan comprobaciones de forma fija pasan por alto errores reales en los núcleos de GPU generados por LLM. Un corpus controlado de 24 núcleos, que incluye 9 variantes con errores de transcripción, revela que un oráculo consciente del esquema de operaciones detecta todos los fallos y pasa todos los controles correctos, con resultados idénticos en cinco arquitecturas de GPU.
Ingeniería inversa de la atención del Transformer con programas ejecutables
Un nuevo método utiliza síntesis de programas para generar programas en Python que reproducen los patrones de atención en modelos Transformer. Menos de 1,000 de estos programas logran una similitud de intersección sobre unión superior al 75% en TinyStories, y reemplazar el 25% de las cabezas de atención con estos programas aumenta la perplexidad solo un 16% mientras preserva el rendimiento en tareas de respuesta a preguntas.
LLM como interfaz, ML como predictor para apendicitis pediátrica
ClaMPAPP, un sistema híbrido, utiliza un LLM para extraer características clínicas estructuradas de notas de texto libre y las pasa a un clasificador XGBoost para el diagnóstico. Superó a los LLM de extremo a extremo tanto en validación interna como externa, con mayor estabilidad y menos casos de apendicitis no detectados, demostrando un rendimiento diagnóstico y una seguridad superiores en la triaje pediátrica.
Optimización de recompensas no supervisada para modelos de lenguaje de proteínas
Un nuevo marco permite a los modelos de lenguaje de proteínas generar secuencias de proteínas controlables sin datos etiquetados ni validación de laboratorio húmedo. Utiliza recompensas independientes de la tarea basadas en la incertidumbre del modelo y la consistencia semántica para guiar la generación, con Optimización de Recompensa Suave y Binarizada superando a las líneas base en cobertura y controlabilidad bajo diversas condiciones.
Evaluación de referencia de LLMs de código abierto para clasificación multi-etiqueta de ATT&CK
Se construyó un conjunto de datos con verdad fundamental de 2,076 oraciones anotadas por humanos procedentes de 83 informes complejos de CTI y se asignaron a 114 técnicas de ATT&CK con \k{appa} = 0.68 de acuerdo entre anotadores. Se evaluaron siete LLMs de código abierto que oscilan entre 8B y 236B parámetros, alcanzando una puntuación F1 micro-promediada máxima de 0.22. El tamaño del parámetro mostró una correlación positiva estadísticamente significativa con la puntuación F1, mientras que la estrategia de prompt y la temperatura no produjeron mejoras significativas, lo que indica que los LLMs actuales de código abierto son insuficientes para la clasificación de ATT&CK de grado de producción.