Pesquisadores apresentam o GPQA, um conjunto desafiador de 448 perguntas de múltipla escolha escritas por especialistas em biologia, física e química. O benchmark é projetado para ser extremamente difícil; especialistas de nível de doutorado alcançam apenas 65% de precisão, enquanto não especialistas qualificados atingem 34% mesmo com acesso ilimitado à web. Sistemas de IA de última geração também têm dificuldades, com a linha de base mais forte do GPT-4 alcançando apenas 39% de precisão. Essa dificuldade tanto para humanos quanto para modelos de fronteira visa permitir experimentos realistas e escaláveis de supervisão para monitorar as saídas da IA no desenvolvimento de conhecimento científico.
GPQA: Um benchmark de perguntas e respostas de nível de pós-graduação à prova do Google
Benchmarks
| Benchmark | Modelo | Pontuação |
|---|---|---|
| GPQA Diamond | GPT-4 based baseline | 39% |
M$^3$R-Bench apresenta benchmark fundamentado em evidências para compreensão de metáforas multimodais
Pesquisadores apresentam o M$^3$R-Bench, um benchmark unificado contendo 1.000 instâncias de imagem-texto com anotações verificadas por humanos, projetado para avaliar a compreensão fundamentada em evidências de metáforas multimodais. O benchmark fornece anotações conjuntas para ocorrência de metáfora, mapeamento Alvo-Fonte, sentimento e explicações etapa a etapa baseadas na Teoria da Metáfora Conceitual.
Framework Zing melhora a inteligência social de LLMs por meio do benchmark SoMBench e fundamentação Actio
O relatório apresenta o Zing, um framework integrado projetado para aprimorar a inteligência social de grandes modelos de linguagem ao medir, internalizar e fundamentar capacidades sociais. Os autores apresentam o SoMBench, um benchmark fundamentado na psicologia que abrange 17 dimensões secundárias e 3.481 instâncias verificadas por especialistas, revelando que os LLMs atuais têm uma margem significativa de melhoria, sem nenhum modelo alcançar desempenho próximo ao teto.
Benchmark SRRM revela que Qwen2.5-1.5B supera o 3B em memória de contexto longo
Um pesquisador está buscando um aval do arXiv cs.CL para um artigo que apresenta a Simple Retrieval-Reconstruction Memory (SRRM), um benchmark leve projetado para avaliar a memória de contexto longo em Small Language Models.
Ajuste fino de LLM com traços melhora a pontuação de ensaios em múltiplas rúbricas
Pesquisadores abordam o desafio da pontuação automática de ensaios quando educadores revisam ou introduzem novas rúbricas, um cenário conhecido como generalização cruzada de rúbricas. Eles propõem um framework de ajuste fino para Grandes Modelos de Linguagem que utiliza representações intermediárias independentes da rúbrica chamadas "traços" juntamente com a supervisão do ensário-alvo durante o treinamento.
Acompanhamento ao vivo de Gurbani: Benchmark e sistema de referência para legendagem de Kirtan sikh
Os autores apresentam um benchmark e um sistema de referência para a legendagem ao vivo do Kirtan sikh, que envolve a recitação cantada contínua de versos do Sri Guru Granth Sahib Ji. Diferente da transcrição com vocabulário aberto, esta tarefa requer correspondências exatas palavra por palavra do texto canônico para evitar erros ortográficos religiosamente inadequados.