Une nouvelle implémentation du chatbot ELIZA utilise une architecture d'autoencodeur clairsemé pour stocker les entrées de conversation dans une couche de mémoire latente, visant à améliorer les méthodes traditionnelles de correspondance de mots-clés. Le système emploie une structure encodeur-décodeur T5 avec une couche de mémoire de 32 768 neurones, où des entrées similaires sont activées via l'apprentissage contrastif.

  • Le modèle atteint une mise à l'échelle logarithmique de la mémoire (log(n)) et une forte résistance à l'oubli catastrophique en utilisant des neurones monosémantiques et en n'activant que les k connexions supérieures.
  • L'entraînement sur 10 000 paires QA du jeu de données 'naklecha/minecraft-question-answer-700k' a permis la mémorisation latente de toutes les entrées en trois heures.
  • Contrairement à ELIZA standard qui restitue des séquences stockées exactement, le décodeur peut légèrement modifier les réponses, bien qu'il nécessite toujours qu'une entrée similaire existe pour chaque question.

L'auteur note que si l'approche démontre rapidité et efficacité mémoire, les limitations actuelles empêchent de passer à des jeux de données plus grands pour vérifier pleinement les affirmations sur la compression et l'atténuation de l'oubli.