TxBench-PP: Rendimiento de Agentes de IA en Farmacología Preclínica

TxBench-PP es una benchmark verificable para farmacología preclínica de moléculas pequeñas, que prueba la capacidad de los agentes de IA para derivar conclusiones precisas a partir de datos de ensayos del mundo real. En 16 configuraciones de model-harness, ningún sistema tomó decisiones de farmacología preclínica correctas de manera confiable, con el mejor rendimiento en 59.3% (Claude Opus 4.8 / Pi) y 55.3% (GPT-5.5 / Pi) de intentos de punto final.