GiulioDER ha lanzado AMB, un benchmark abierto y preregistrado diseñado para evaluar la efectividad de las capas de memoria en agentes de codificación. A diferencia de los benchmarks tradicionales que se centran en la relevancia de la recuperación, AMB prueba si las memorias recuperadas realmente ayudan a un agente a completar tareas reales de codificación o causan peores resultados.
- El benchmark ejecuta Claude Code dentro de un repositorio aislado donde las pruebas ejecutables califican los artefactos resultantes.
- Está construido adversarialmente con memorias ausentes, obsoletas, reemplazadas, contradictorias, adyacentes e irrelevantes.
- El feed público contiene 195 transcripciones de sesiones preautorizadas.
- Un corpus duro separado escala a 4.900 documentos, incluyendo 196 documentos reales y 4.704 distractores sintéticos, con aproximadamente 143.000 fragmentos.
- El conjunto actual mide principalmente la ruta de lectura y aún no mide si una capa de memoria aprende del propio trabajo del agente a través de sesiones.
El autor está invitando a pequeños proveedores de memoria a probar sus sistemas sin cuota de participación, permitiéndoles publicar su configuración y resultados.