O GiulioDER lançou o AMB, um benchmark aberto e pré-registrado projetado para avaliar a eficácia das camadas de memória em agentes de codificação. Diferente dos benchmarks tradicionais que focam na relevância da recuperação, o AMB testa se as memórias recuperadas realmente ajudam um agente a concluir tarefas reais de codificação ou causam resultados piores.

  • O benchmark executa o Claude Code dentro de um repositório isolado onde testes executáveis avaliam os artefatos resultantes.
  • Ele é construído adversarialmente com memórias ausentes, desatualizadas, substituídas, contraditórias, adjacentes e irrelevantes.
  • O feed público contém 195 transcrições de sessão pré-autoradas.
  • Um corpus separado difícil escala para 4.900 documentos, incluindo 196 documentos reais e 4.704 distratores sintéticos, com aproximadamente 143.000 chunks.
  • O conjunto atual mede principalmente o caminho de leitura e ainda não mede se uma camada de memória aprende a partir do próprio trabalho do agente entre sessões.

O autor está convidando pequenos fornecedores de memória a testar seus sistemas sem taxa de participação, permitindo que publiquem sua configuração e resultados.