ClaMPAPP, un sistema híbrido, utiliza un LLM para extraer características clínicas estructuradas de notas de texto libre y las pasa a un clasificador XGBoost para el diagnóstico. Superó a los LLM de extremo a extremo tanto en validación interna como externa, con mayor estabilidad y menos casos de apendicitis no detectados, demostrando un rendimiento diagnóstico y una seguridad superiores en la triaje pediátrica.
LLM como interfaz, ML como predictor para apendicitis pediátrica
El marco P4IR mejora la precisión del cumplimiento de código basado en LLM
P4IR, un marco de dos etapas, utiliza ajuste fino supervisado y Optimización de Política Relativa de Grupo para mejorar los sistemas automatizados de cumplimiento de código basados en modelos de lenguaje grandes. Reduce las distancias de Levenshtein a nivel de árbol y de token hasta en un 23,8% y un 38,6% respectivamente, superando a LLMs líderes como Claude Opus, GPT-5.2 y GLM-4.7 en configuraciones de zero-shot con prompting few-shot, y reduce los falsos positivos por un margen estadísticamente significativo.
Los núcleos de GPU generados por LLM enfrentan la ilusión de la corrección
Las pruebas de referencia que utilizan comprobaciones de forma fija pasan por alto errores reales en los núcleos de GPU generados por LLM. Un corpus controlado de 24 núcleos, que incluye 9 variantes con errores de transcripción, revela que un oráculo consciente del esquema de operaciones detecta todos los fallos y pasa todos los controles correctos, con resultados idénticos en cinco arquitecturas de GPU.
TxBench-PP: Rendimiento de Agentes de IA en Farmacología Preclínica
TxBench-PP es una benchmark verificable para farmacología preclínica de moléculas pequeñas, que prueba la capacidad de los agentes de IA para derivar conclusiones precisas a partir de datos de ensayos del mundo real. En 16 configuraciones de model-harness, ningún sistema tomó decisiones de farmacología preclínica correctas de manera confiable, con el mejor rendimiento en 59.3% (Claude Opus 4.8 / Pi) y 55.3% (GPT-5.5 / Pi) de intentos de punto final.
TxBench-PP: Benchmark de Agentes de IA en Farmacología Preclínica
TxBench-PP es un benchmark verificable para farmacología preclínica de moléculas pequeñas, que prueba la capacidad de los agentes de IA para derivar conclusiones precisas a partir de datos de ensayos del mundo real. En 16 configuraciones de modelos, ningún sistema pasó confiablemente todas las evaluaciones, con la configuración de mejor rendimiento (Claude Opus 4.8 / Pi) logrando una tasa de éxito del 59.3% en 300 intentos de punto final.
Ingeniería inversa de la atención del Transformer con programas ejecutables
Un nuevo método utiliza síntesis de programas para generar programas en Python que reproducen los patrones de atención en modelos Transformer. Menos de 1,000 de estos programas logran una similitud de intersección sobre unión superior al 75% en TinyStories, y reemplazar el 25% de las cabezas de atención con estos programas aumenta la perplexidad solo un 16% mientras preserva el rendimiento en tareas de respuesta a preguntas.