ThetaMem est une étude préliminaire à graine unique d'un mélangeur récurrent qui modifie l'état récurrent par des relèvements de clé signés appris (Hadamard ou produit extérieur) plutôt que par l'affinement des mécanismes de gating. L'auteur présente des résultats mitigés sur des benchmarks synthétiques et cherche explicitement des critiques pour identifier l'expérience la moins coûteuse susceptible de falsifier l'approche.
- Sur MQAR avec une extrapolation de longueur 4×, ThetaMem (produit extérieur) a obtenu un score de 0.976 en utilisant des flottants à état central 32×, tandis que GDN-2 avec une clé plus large a obtenu 0.814.
- ThetaMem (Hadamard) a obtenu 0.668 sur le même benchmark comparé à 0.567 pour GDN-2.
- Dans les tests de rappel flou MAD, ThetaMem a performé moins bien que GDN-2 (perte de 0.181 contre 0.323).
L'auteur note que les comparaisons à état central apparié ne sont pas appariées en paramètres et appelle à des contrôles plus équitables impliquant l'appariement de l'état, des paramètres et du calcul dans les travaux futurs.