微软、上海交通大学、同济大学以及复旦大学的研究人员开发了 SkillOpt,这是一种文本空间优化器,在保持目标模型冻结的同时训练自然语言技能文档。该系统使用一个优化器模型,基于评分的 rollout 提出有界编辑,并将结果导出为单个 `best_skill.md` 文件。
- 在 GPT-5.4 上训练的技能可迁移到较小变体,保留率介于域内增益的 16% 至 82% 之间。
- 在 Codex 中优化的技能将 Claude Code 的 SpreadsheetBench 分数从 22.1 提升至 81.8,略高于直接在 Claude Code 上训练所取得的 80.4 分。
- LiveMath 的跨平台迁移呈现不对称性,从 Codex 迁移到 Claude Code 时仅保留 10%。
- 工件大小介于 379 至 1,995 个 token 之间,由一次到四次接受的编辑构建而成,且在部署时不增加任何推理调用。
共享的 `best_skill.md` 格式允许过程性技能在不同工具 API 之间迁移,从而能够在成本最低的环境中进行优化,以便在另一个环境中部署。