Pengguna pop123-ux telah menerbitkan repositori pembelajaran yang berisi 38 notebook yang dapat dijalankan yang dirancang untuk membantu pengguna memahami tumpukan Hugging Face dengan secara bertahap menghapus abstraksi tingkat tinggi. Koleksi ini mencakup jalur dari komponen inti seperti transformers dan tokenizers hingga fine-tuning, PEFT, reasoning/RL, dan pekerjaan proyek end-to-end.
- Termasuk implementasi tokenizer WordPiece dan Unigram yang dibangun dari nol.
- Mendemonstrasikan LoRA dan fine-tuning terawasi bersama dengan GRPO yang diimplementasikan dari prinsip pertama sebelum menggunakan GRPOTrainer.
- Mencakup eksperimen pencarian semantik FAISS, trl, Unsloth, dan vLLM.
- Menampilkan proyek XQuAD Romania yang membandingkan BERT monolingual dan multilingual dengan evaluasi held-out tingkat artikel yang dikoreksi.
Penulis mencari umpan balik teknis mengenai kejelasan bagian GRPO-from-scratch dan evaluasi QA Romania, serta saran untuk celah dalam jalur pembelajaran.