Новая реализация чат-бота ELIZA использует архитектуру разреженного автоэнкодера для хранения записей разговора в слое латентной памяти, стремясь улучшить традиционные методы сопоставления ключевых слов. Система применяет структуру энкодер-декодер T5 с 32768-нейронным слоем памяти, где похожие записи активируются посредством контрастивного обучения.

  • Модель достигает логарифмического масштабирования памяти (log(n)) и высокой устойчивости к катастрофическому забыванию благодаря использованию моносемантических нейронов и активации только топ-k связей.
  • Обучение на 10 000 пар вопрос-ответ из набора данных 'naklecha/minecraft-question-answer-700k' позволило достичь латентного запоминания всех записей за три часа.
  • В отличие от стандартной ELIZA, которая выводит точно сохранённые последовательности, декодер может незначительно изменять ответы, хотя для каждого вопроса всё ещё требуется наличие похожей записи.

Автор отмечает, что, несмотря на демонстрацию скорости и эффективности использования памяти, текущие ограничения не позволяют масштабировать подход на большие наборы данных для полной проверки утверждений о сжатии и смягчении забывания.