Pesquisadores apresentam o GPQA, um conjunto desafiador de 448 perguntas de múltipla escolha escritas por especialistas em biologia, física e química. O benchmark é projetado para ser extremamente difícil; especialistas de nível de doutorado alcançam apenas 65% de precisão, enquanto não especialistas qualificados atingem 34% mesmo com acesso ilimitado à web. Sistemas de IA de última geração também têm dificuldades, com a linha de base mais forte do GPT-4 alcançando apenas 39% de precisão. Essa dificuldade tanto para humanos quanto para modelos de fronteira visa permitir experimentos realistas e escaláveis de supervisão para monitorar as saídas da IA no desenvolvimento de conhecimento científico.
GPQA: Um benchmark de perguntas e respostas de nível de pós-graduação à prova do Google
Benchmarks
| Benchmark | Modelo | Pontuação |
|---|---|---|
| GPQA Diamond | GPT-4 based baseline | 39% |
Pesquisador busca um único anotador independente para resolver ambiguidade de concordância em LLMs
Um pesquisador está solicitando que um único anotador humano independente rotule 100 cenas narrativas turcas para determinar se o baixo acordo entre avaliadores decorre da natureza interpretativa da tarefa ou de definições de anotação mal especificadas. O estudo constatou que quatro LLMs e um detector baseado em regras concordaram entre si e com a referência humana aproximadamente no nível do acaso, com escores de κ de Cohen variando de 0,000 a 0,185.
Estudo identifica FragileTokens que falham na cópia contextual apesar de passar em testes de isolamento
Um estudo caracteriza os "FragileTokens", entradas do vocabulário em modelos de linguagem de peso aberto que copiam com sucesso quando isolados, mas exibem erros quando inseridos no texto circundante. A pesquisa destaca que a preservação literal da identidade não é garantida por testes de isolamento padrão, pois tokens podem ser excluídos, substituídos ou truncados dentro de sequências.
GPT-5 e GPT-5 Nano igualam especialistas na avaliação de pesquisas sobre oncogênese microbiana
Um estudo demonstra que o GPT-5 e o GPT-5 Nano alcançam desempenho de nível especialista na extração de evidências e na avaliação crítica de publicações de pesquisa sobre oncogênese microbiana. Os pesquisadores avaliaram esses modelos junto com Gemini 2.5 Pro e Gemini 2.5 Flash em comparação a especialistas do domínio, utilizando um conjunto de dados com 24 artigos focados em MMTV-LV e câncer de mama.
GPT-5 e GPT-5 Nano igualam especialistas na extração de evidências sobre oncogênese microbiana
Um estudo que avaliou modelos de linguagem grandes na síntese sistemática de evidências para oncogênese microbiana descobriu que o GPT-5 e o GPT-5 Nano têm desempenho indistinguível do de especialistas da área. Os pesquisadores avaliaram o Gemini 2.5 Pro, o Gemini 2.5 Flash, o GPT-5 e o GPT-5 Nano em 24 artigos de pesquisa, utilizando um modelo estruturado com 77 itens em múltiplos tipos de pergunta.
M$^3$R-Bench apresenta benchmark fundamentado em evidências para compreensão de metáforas multimodais
Pesquisadores apresentam o M$^3$R-Bench, um benchmark unificado contendo 1.000 instâncias de imagem-texto com anotações verificadas por humanos, projetado para avaliar a compreensão fundamentada em evidências de metáforas multimodais. O benchmark fornece anotações conjuntas para ocorrência de metáfora, mapeamento Alvo-Fonte, sentimento e explicações etapa a etapa baseadas na Teoria da Metáfora Conceitual.