Benchmark · reasoning

BIG-Bench Hard

saturated 5 resultados 4 modelos

O BIG-Bench Hard (BBH) é um conjunto de 23 tarefas difíceis extraídas do BIG-Bench nas quais os modelos de linguagem anteriores não conseguiam superar o avaliador humano médio; ele mede o raciocínio de várias etapas e é pontuado pela acurácia de correspondência exata (exact-match).

Saiba mais
Exemplo
Um tipo de tarefa como Boolean Expressions — avaliar uma expressão aninhada de True/False —, além de outras como aritmética de várias etapas, compreensão de datas, dedução lógica, rastreamento de objetos embaralhados e navegação; cada uma exige várias etapas de raciocínio para chegar a uma resposta.
Pontuação
Acurácia de correspondência exata por item: a resposta final extraída do modelo precisa ser exatamente igual ao rótulo de referência (uma opção de múltipla escolha ou uma string curta). O número principal é a acurácia macromédia entre as 23 tarefas, geralmente reportada tanto para o prompting direto (answer-only) quanto para o few-shot chain-of-thought.
Verificação
Uma previsão só é considerada correta quando a string da resposta final extraída corresponde exatamente à resposta de referência; os resultados costumam ser comparados com as linhas de base do avaliador humano médio e máximo do BIG-Bench, e o chain-of-thought e o answer-only são reportados separadamente.
Por que importa
Ele isola o subconjunto de raciocínio difícil em que os modelos historicamente ficavam atrás das pessoas e foi o cenário que mostrou que o chain-of-thought pode levar modelos grandes além do avaliador humano médio, tornando-se uma prova padrão de raciocínio de várias etapas.
Exemplo resolvido
Tarefa
Tarefa Boolean Expressions — Avalie o resultado da seguinte expressão booleana: not ( True and False )
Solução
Passo 1: True and False = False. Passo 2: not False = True. Resposta final: True
Explicação
O 'and' booleano resulta em False a menos que ambos os operandos sejam True, então (True and False) é False; negar False dá True. A avaliação é a correspondência exata da string da resposta final com o rótulo de referência.
0 24.5 49 73.5 98 2024-06-20 2024-09-18 2024-12-17 Claude 3.5 Sonnet · 93.1 · 2024-06-20 Qwen2-72B · 82.4 · 2024-07-15 Qwen2-72B · 82.4 · 2024-07-15 Falcon3-7B-Base · 51 · 2024-12-17 Falcon3-10B-Base · 59.7 · 2024-12-17
Claude 3.5 Sonnet Qwen2-72B Falcon3-7B-Base Falcon3-10B-Base
Linha do tempo
Data Modelo Pontuação Fonte
2024-12-17 Falcon3-7B-Base 51.0% Família Falcon3 lança cinco modelos abertos com capacidades aprimoradas de ciência, matemática e código
2024-12-17 Falcon3-10B-Base 59.7% Família Falcon3 lança cinco modelos abertos com capacidades aprimoradas de ciência, matemática e código
2024-07-15 Qwen2-72B 82.4% Relatório Técnico do Qwen2 apresenta modelos densos e MoE até 72B
2024-07-15 Qwen2-72B 82.4% Equipe Qwen lança série Qwen2 com modelos densos e MoE de 72B
2024-06-20 Claude 3.5 Sonnet 93.1% Anthropic lança adendo do Claude 3.5 Sonnet com benchmarks de codificação e visão aprimorados