L'utilisateur pop123-ux a publié un référentiel d'apprentissage contenant 38 notebooks exécutables conçus pour aider les utilisateurs à comprendre la pile Hugging Face en supprimant progressivement les abstractions de haut niveau. La collection couvre un parcours allant des composants centraux comme transformers et tokenizers jusqu'au fine-tuning, PEFT, raisonnement/RL et au travail sur des projets de bout en bout.
- Comprend des implémentations des tokenizers WordPiece et Unigram construits à partir de zéro.
- Démonstre LoRA et le fine-tuning supervisé ainsi que GRPO implémenté à partir des premiers principes avant d'utiliser GRPOTrainer.
- Couvre les expériences de recherche sémantique FAISS, trl, Unsloth et vLLM.
- Présente un projet XQuAD roumain comparant BERT monolingue et multilingue avec une évaluation corrigée au niveau de l'article.
L'auteur cherche des retours techniques sur la clarté des sections GRPO-from-scratch et de l'évaluation QA roumaine, ainsi que des suggestions pour les lacunes du parcours d'apprentissage.