微软研究院推出了EvoLib,这是一个框架,使大型语言模型能够在推理过程中从自身经验中学习,而无需真实标签或外部反馈。EvoLib不将原始经验存储为静态记忆,而是将其转化为可重用的技能和反思性见解,这些技能和见解会不断被精炼、整合和重新加权。
- 整合将新知识合并到相似的现有条目中,以创建更通用且可重用的单元。
- 动态加权机制根据每个知识单元的即时效用及其对未来任务的长期影响来更新其重要性。
- 该系统作为黑盒解决方案运行,适用于任何通过API部署的语言模型,无需进行模型更新。
EvoLib在数学推理、代码生成和长程决策任务中始终优于基于检索的顶级记忆方法。它将测试时计算转化为性能提升的效率高于现有方法,并且无论遇到异构任务的顺序如何,都能保持稳定的性能。