用户 pop123-ux 发布了一个学习仓库,其中包含 38 个可运行的笔记本,旨在通过逐步移除高级抽象来帮助理解 Hugging Face 技术栈。该集合涵盖了从 transformers 和 tokenizers 等核心组件到微调、PEFT、推理/RL 以及端到端项目工作的路径。
- 包括从零开始构建的 WordPiece 和 Unigram 分词器实现。
- 展示了 LoRA 和监督式微调,以及在首次使用 GRPOTrainer 之前从基本原理实现的 GRPO。
- 涵盖 FAISS 语义搜索、trl、Unsloth 和 vLLM 实验。
- 包含一个罗马尼亚语 XQuAD 项目,比较单语和多语 BERT,并采用修正后的文章级保留评估。
作者寻求关于从零开始实现 GRPO 和罗马尼亚语 QA 评估部分清晰度的技术反馈,以及对学习路径中缺失内容的建议。