Un nuevo marco permite a los modelos de lenguaje de proteínas generar secuencias de proteínas controlables sin datos etiquetados ni validación de laboratorio húmedo. Utiliza recompensas independientes de la tarea basadas en la incertidumbre del modelo y la consistencia semántica para guiar la generación, con Optimización de Recompensa Suave y Binarizada superando a las líneas base en cobertura y controlabilidad bajo diversas condiciones.
Optimización de recompensas no supervisada para modelos de lenguaje de proteínas
Los núcleos de GPU generados por LLM enfrentan la ilusión de la corrección
Las pruebas de referencia que utilizan comprobaciones de forma fija pasan por alto errores reales en los núcleos de GPU generados por LLM. Un corpus controlado de 24 núcleos, que incluye 9 variantes con errores de transcripción, revela que un oráculo consciente del esquema de operaciones detecta todos los fallos y pasa todos los controles correctos, con resultados idénticos en cinco arquitecturas de GPU.
AtomMem: Sistema de memoria simple y efectivo para agentes LLM
AtomMem introduce un sistema de memoria que almacena hechos atómicos de alto valor procedentes de interacciones extensas. Utiliza estructuras de eventos jerárquicas y perfiles temporales para capturar contextos episódicos coherentes y rastrear atributos de usuario en evolución, permitiendo una evolución de la memoria estable y eficiente. Los experimentos en el benchmark LoCoMo muestran que AtomMem alcanza un rendimiento de vanguardia en tareas de razonamiento.
GEMS: Las restricciones geométricas permiten la superposición multi-semántica en LLMs
GEMS permite la superposición sin entrenamiento de múltiples direcciones semánticas en LLMs abordando la desviación distribucional y la interferencia direccional mediante restricciones geométricas. En GSM8K, mantiene una precisión del 98% con tres direcciones no matemáticas, mientras que la adición sin restricciones cae al 4%; en Wikitext-2, aumenta el PPL solo un 2.2%.
El RL guiado por discriminador corrige el emparejamiento de flujos con recompensas alineadas a los datos
El RL guiado por discriminador (DRL) utiliza un espacio de representaciones preentrenado para entrenar un discriminador que separa los datos reales de las muestras generadas por el modelo. Su logit se usa como recompensa en el RL con regularización KL, alineando las salidas del modelo con la realismo visual y semántico sin preferencias humanas. DRL mejora FID y FD semántico en modelos como SiT y JiT, y mejora la frontera de Pareto entre preferencia y fidelidad.
LLM-as-Interface, ML-as-Predictor para Apendicitis Pediátrica
ClaMPAPP, un sistema híbrido, utiliza un LLM para extraer características clínicas estructuradas de notas en texto libre y las pasa a un clasificador XGBoost para el diagnóstico. Superó a los LLMs end-to-end tanto en validación interna como externa, con mejor rendimiento diagnóstico y menos casos pasados por alto, demostrando mayor estabilidad y seguridad en la triaje de apendicitis pediátrica.