O GiulioDER lançou o AMB, um benchmark aberto e pré-registrado projetado para avaliar a eficácia das camadas de memória em agentes de codificação. Diferente dos benchmarks tradicionais que focam na relevância da recuperação, o AMB testa se as memórias recuperadas realmente ajudam um agente a concluir tarefas reais de codificação ou causam resultados piores.
- O benchmark executa o Claude Code dentro de um repositório isolado onde testes executáveis avaliam os artefatos resultantes.
- Ele é construído adversarialmente com memórias ausentes, desatualizadas, substituídas, contraditórias, adjacentes e irrelevantes.
- O feed público contém 195 transcrições de sessão pré-autoradas.
- Um corpus separado difícil escala para 4.900 documentos, incluindo 196 documentos reais e 4.704 distratores sintéticos, com aproximadamente 143.000 chunks.
- O conjunto atual mede principalmente o caminho de leitura e ainda não mede se uma camada de memória aprende a partir do próprio trabalho do agente entre sessões.
O autor está convidando pequenos fornecedores de memória a testar seus sistemas sem taxa de participação, permitindo que publiquem sua configuração e resultados.