Los investigadores presentan GPQA, un conjunto desafiante de 448 preguntas de opción múltiple escritas por expertos en biología, física y química. El benchmark está diseñado para ser extremadamente difícil; los expertos a nivel de doctorado logran solo un 65% de precisión, mientras que los no expertos cualificados alcanzan el 34% incluso con acceso ilimitado a la web. Los sistemas de IA de última generación también luchan, con la línea base más fuerte de GPT-4 logrando solo un 39% de precisión. Esta dificultad tanto para humanos como para modelos de vanguardia tiene como objetivo permitir experimentos realistas y escalables de supervisión para vigilar las salidas de la IA en el desarrollo de conocimientos científicos.
GPQA: Un conjunto de preguntas y respuestas a nivel de posgrado, a prueba de Google
Benchmarks
| Benchmark | Modelo | Puntuación |
|---|---|---|
| GPQA Diamond | GPT-4 based baseline | 39% |
M$^3$R-Bench presenta un benchmark fundamentado en evidencia para la comprensión de metáforas multimodales
Los investigadores presentan M$^3$R-Bench, un benchmark unificado que contiene 1.000 instancias de imagen-texto con anotaciones verificadas por humanos diseñadas para evaluar la comprensión de metáforas multimodales fundamentadas en evidencia. El benchmark proporciona anotaciones conjuntas para la ocurrencia de metáforas, el mapeo Objetivo-Fuente, el sentimiento y explicaciones por etapas basadas en la Teoría de las Metáforas Conceptuales.
El marco Zing mejora la inteligencia social de los LLM mediante el benchmark SoMBench y la fundamentación Actio
El informe presenta Zing, un marco integrado diseñado para mejorar la inteligencia social de los modelos de lenguaje grandes mediante la medición, internalización y fundamentación de las capacidades sociales. Los autores presentan SoMBench, un benchmark basado en psicología que abarca 17 dimensiones secundarias y 3.481 instancias verificadas por expertos, el cual revela que los LLM actuales tienen un margen significativo de mejora, sin que ningún modelo alcance un rendimiento cercano al máximo.
El benchmark SRRM revela que Qwen2.5-1.5B supera a 3B en memoria de contexto largo
Un investigador busca un aval de arXiv cs.CL para un artículo que presenta Simple Retrieval-Reconstruction Memory (SRRM), un benchmark ligero diseñado para evaluar la memoria de contexto largo en Modelos de Lenguaje Pequeños.
El ajuste fino de LLM con rasgos mejora la puntuación de ensayos según múltiples rúbricas
Los investigadores abordan el desafío de la puntuación automática de ensayos cuando los educadores revisan o introducen nuevas rúbricas, un escenario conocido como generalización cruzada de rúbricas. Proponen un marco de ajuste fino para Modelos de Lenguaje Grande que utiliza representaciones intermedias independientes de la rúbrica llamadas "rasgos" junto con la supervisión del ensayo objetivo durante el entrenamiento.
Seguimiento en vivo de Gurbani: Benchmark y sistema de referencia para la transcripción de Kirtan sij
Los autores presentan un benchmark y un sistema de referencia para la transcripción en vivo del Kirtan sij, que implica la recitación cantada continua de versos del Sri Guru Granth Sahib Ji. A diferencia de la transcripción con vocabulario abierto, esta tarea requiere coincidencias exactas palabra por palabra del texto canónico para evitar errores ortográficos religiosamente inapropiados.