Tema · Evaluation & benchmarks
lab OpenAI News · há 7 d · 25 visualizações

OpenAI lança MentalHealthBench para avaliar respostas de IA em saúde mental

A OpenAI apresentou o MentalHealthBench, um benchmark aberto projetado para avaliar como os sistemas de IA respondem em conversas realistas sobre saúde mental. Desenvolvido com mais de 80 especialistas licenciados em saúde mental de 22 países, o benchmark avalia as capacidades dos modelos em comportamentos-chave, como segurança, busca de contexto e preservação da autonomia do usuário.

media Don't Worry About the Vase · há 22 d · 20 visualizações

O modelo Astra da OpenAI é mais difícil de monitorar à medida que a eficácia do Pensamento em Cadeia diminui

A OpenAI reconhece que seu novo modelo Astra é significativamente mais difícil de monitorar do que as iterações anteriores, marcando um declínio na eficácia do monitoramento do Pensamento em Cadeia (CoT). Essa tendência sugere que, à medida que as capacidades do modelo aumentam, a capacidade de detectar desalinhamento por meio da análise CoT diminui, potencialmente tornando os sistemas de monitoramento atuais pouco confiáveis dentro de um ano.

arxiv arXiv cs.CL · há 2 d · 1 visualização

Estudo revela divergência de política epistêmica na contaminação de LLMs multi-turno

Um estudo intitulado "Epistemic Policy Divergence in Multi-Turn LLM Contamination: A Protocol-Gradient Investigation" avalia como grandes modelos de linguagem lidam com premissas falsas injetadas no histórico da conversa, um modo de falha denominado contaminação em nível de sessão. Os pesquisadores testaram GPT-5.4 Mini, Gemini-3.1 Flash-Lite e GLM-4.5-Air em dez domínios de conhecimento usando 22.500 turnos com temperatura zero.

arxiv arXiv cs.CL · há 2 d · 1 visualização

Rep2Act alinha representações de VLM para melhorar a abstenção no novo benchmark VAD-R

Pesquisadores introduzem o Diagnóstico de Responsividade Visual com Raciocínios (VAD-R), um novo benchmark projetado para avaliar a capacidade dos modelos de visão e linguagem de se absterem de perguntas sem resposta sem usar atalhos. O estudo revela que, embora os estados ocultos possam distinguir a responsividade, os modelos atuais falham em traduzir isso em decisões explícitas.

media Hugging Face Forums · há 2 d · 1 visualização

Ujjal Bhattacharjee propõe um desenho de estudo para testar debate estruturado de agentes para revisão de evidências

Ujjal Bhattacharjee propôs uma estrutura metodológica para avaliar se o desafio e a revisão estruturados melhoram uma tarefa de revisão de evidências sob restrições fixas de orçamento e prazo. A proposta descreve um experimento de quatro condições comparando revisores individuais, agregação independente, deliberação estruturada e deliberação com o avaliador Jev.

media Hugging Face Forums · há 3 d · 1 visualização

SecFathy rejeita modelo especializado de 8B para XSS devido a falhas adversariais

O desenvolvedor SecFathy disponibilizou como código aberto um protótipo de pesquisa chamado XSS Specialist, um modelo de segurança de 8B projetado para análise de vulnerabilidades XSS. O projeto inicialmente visava empurrar os limites da especialização usando recuperação e LoRA, mas acabou rejeitando o modelo porque ele falhou nos testes adversariais de quase-acerto, onde pequenas alterações nos identificadores causavam julgamentos de segurança incorretos.

media Hugging Face Forums · há 3 d · 9 visualizações

Claude Opus 5 e Tetsu encontram seis verificações de CI vazias em seu próprio projeto

Em 27 de setembro, o Claude Opus 5 e o modelo Tetsu de 3B identificaram seis verificações de integração contínua separadas em seu repositório público que foram marcadas como verdes ou aprovadas, apesar de não verificarem o que deveriam medir. Os problemas variavam desde um gate de implantação que recusava reinicializações válidas devido a digests desatualizados até benchmarks de tempo com limiares vazios que aceitavam diferenças de desempenho insignificantes.

media Hugging Face Forums · há 4 d · 7 visualizações

Ceticismo da comunidade em relação às alegações de eficiência e novidade técnica de Jev

O artigo discute uma onda de interesse em "Jev" no LinkedIn, onde foi promovido como um avanço revolucionário em IA, apesar do autor ter encontrado poucas evidências substanciais para apoiar essas afirmações. O autor observa que, embora Jev promova eficiência massiva e um novo paradigma, ele carece de dados de avaliação e detalhes técnicos, levantando dúvidas sobre se representa uma verdadeira inovação arquitetônica ou apenas uma reclassificação.

media Hugging Face Forums · há 7 d · 12 visualizações

Análise da sobreconfiança artificial em sistemas de IA treinados via RLHF

Os grandes modelos de linguagem modernos são sistematicamente sobreconfiantes, expressando alta confiança em respostas incorretas devido a incentivos de treinamento, e não a falhas técnicas de calibração. Durante o Aprendizado por Reforço com Feedback Humano (RLHF), os avaliadores humanos recompensam respostas que soam autoritativas e definitivas, fazendo com que o modelo aprenda que a incerteza é penalizada.

arxiv arXiv cs.CL · há 7 d · 2 visualizações

Benchmark WebMRE revela reforço mútuo entre guia e ação em agentes web

Os autores apresentam o WebMRE, um benchmark offline com 541 tarefas e 5.293 passos derivados de trajetórias bem-sucedidas do WebArena, projetado para fornecer um protocolo determinístico para pontuar checkpoints de agentes web sem deriva do ambiente. Este framework combina frases-guia orientadas ao humano com ações fundamentadas para estudar o efeito de reforço mútuo entre elas.

lab Hugging Face Blog · há 8 d · 25 visualizações

AISI divulga resultados verificados de avaliação para seis modelos de ponta em cinco benchmarks

O Instituto de Segurança de IA do Reino Unido (AISI) disponibilizou publicamente métodos de avaliação e achados por meio da plataforma Evaluation Cards do EvalEval, visando melhorar a reprodutibilidade dos benchmarks. Esta divulgação inclui resultados verificados, contexto e informações de configuração para cinco benchmarks específicos: HealthBench, FrontierMath, Humanity's Last Exam, SWE-Bench Pro e Terminal-Bench 2.0.

media Hugging Face Forums · há 9 d · 14 visualizações

CosmicUndercurrent lança Principia-Structurae-Realitatis para testar coordenação de todo o sistema em LLMs

A CosmicUndercurrent disponibilizou como código aberto um framework de raciocínio agnóstico a modelos, projetado para testar se o priming estrutural pode reduzir inconsistências globais em grandes modelos de linguagem. O projeto, hospedado, investiga se um processo de duas etapas melhora a coordenação de todo o sistema em comparação com a correção local.