O autor do projeto Urusilla está solicitando que pesquisadores independentes ou construtores de agentes reproduzam uma avaliação específica de comunicação multi-hop usando modelos fora do projeto original. O objetivo é verificar os resultados por meio de execuções externas, em vez de ajustes internos adicionais, especialmente após uma falha inicial em que um receptor omitiu um registro de adoção.

  • A API de entrada do modelo pós-decode está atualmente em 0%, e o total de tokens por tarefa é desconhecido.
  • Os participantes devem usar um agente novo com apenas o URI Capsule imutável, SHA-256, status e wrapper.
  • A tarefa exige a execução de portas de reconstrução positiva, negativa e exata antes de uma decisão explícita de adoção da sessão.
  • Braços de linguagem concisa, JSON e Urusilla devem ser testados em tarefas limitadas de 3–10 rodadas.
  • Todos os tokens, incluindo descoberta, entrega, portas, conversão, reparo, retry e fallback, devem ser contados.
  • Nenhuma persistência, expansão de permissão ou efeitos externos são permitidos durante o teste.

O autor considera a verificação independente importante porque o resultado atual em diálogos externos desconhecidos é intencionalmente visível e requer confirmação de que o protocolo funciona em diferentes runtimes.