Los investigadores presentan GPQA, un conjunto desafiante de 448 preguntas de opción múltiple escritas por expertos en biología, física y química. El benchmark está diseñado para ser extremadamente difícil; los expertos a nivel de doctorado logran solo un 65% de precisión, mientras que los no expertos cualificados alcanzan el 34% incluso con acceso ilimitado a la web. Los sistemas de IA de última generación también luchan, con la línea base más fuerte de GPT-4 logrando solo un 39% de precisión. Esta dificultad tanto para humanos como para modelos de vanguardia tiene como objetivo permitir experimentos realistas y escalables de supervisión para vigilar las salidas de la IA en el desarrollo de conocimientos científicos.
GPQA: Un conjunto de preguntas y respuestas a nivel de posgrado, a prueba de Google
Benchmarks
| Benchmark | Modelo | Puntuación |
|---|---|---|
| GPQA Diamond | GPT-4 based baseline | 39% |
Investigador busca un único anotador independiente para resolver la ambigüedad del acuerdo de LLM
Un investigador está solicitando un único anotador humano independiente para etiquetar 100 escenas narrativas turcas con el fin de determinar si el bajo acuerdo interevaluador se debe a la naturaleza interpretativa de la tarea o a definiciones de anotación insuficientemente especificadas. El estudio encontró que cuatro LLM y un detector basado en reglas coincidieron entre sí y con la referencia humana aproximadamente al azar, con puntuaciones de κ de Cohen que oscilan entre 0.000 y 0.185.
El estudio identifica FragileTokens que fallan en la copia contextual pese a superar las pruebas de aislamiento
Un estudio caracteriza los "FragileTokens", entradas del vocabulario en modelos de lenguaje de peso abierto que copian con éxito cuando están aisladas, pero presentan errores cuando se insertan en el texto circundante. La investigación destaca que la preservación literal de la identidad no está garantizada por las pruebas de aislamiento estándar, ya que los tokens pueden eliminarse, sustituirse o truncarse dentro de las secuencias.
GPT-5 y GPT-5 Nano igualan a expertos en la evaluación de investigaciones sobre oncogénesis microbiana
Un estudio demuestra que GPT-5 y GPT-5 Nano logran un rendimiento de nivel experto en la extracción de evidencia y la evaluación crítica de publicaciones de investigación sobre oncogénesis microbiana. Los investigadores evaluaron estos modelos junto con Gemini 2.5 Pro y Gemini 2.5 Flash frente a expertos del dominio utilizando un conjunto de datos de 24 artículos centrados en MMTV-LV y cáncer de mama.
GPT-5 y GPT-5 Nano igualan a expertos en la extracción de evidencia sobre oncogénesis microbiana
Un estudio que evalúa modelos de lenguaje grandes en la síntesis sistemática de evidencia para la oncogénesis microbiana encontró que GPT-5 y GPT-5 Nano se desempeñan de manera indistinguible de los expertos del dominio. Los investigadores evaluaron Gemini 2.5 Pro, Gemini 2.5 Flash, GPT-5 y GPT-5 Nano en 24 artículos de investigación utilizando una plantilla estructurada de 77 elementos a través de múltiples tipos de preguntas.
M$^3$R-Bench presenta un benchmark fundamentado en evidencia para la comprensión de metáforas multimodales
Los investigadores presentan M$^3$R-Bench, un benchmark unificado que contiene 1.000 instancias de imagen-texto con anotaciones verificadas por humanos diseñadas para evaluar la comprensión de metáforas multimodales fundamentadas en evidencia. El benchmark proporciona anotaciones conjuntas para la ocurrencia de metáforas, el mapeo Objetivo-Fuente, el sentimiento y explicaciones por etapas basadas en la Teoría de las Metáforas Conceptuales.