Training methods
arxiv arXiv cs.LG · 2 hari lalu

U-OPSD memungkinkan distilasi diri on-policy tanpa pengawasan untuk LLM

Para peneliti mengusulkan Distilasi Diri On-Policy Tanpa Pengawasan (U-OPSD), sebuah metode yang mencapai peningkatan pasca-pelatihan untuk model bahasa besar hanya menggunakan generasi model itu sendiri tanpa supervisi eksternal. Pendekatan ini mengambil beberapa rollouts untuk membangun solusi pseudo melalui pemungutan suara mayoritas, lalu mendistilasi distribusi guru ke dalam awalan dari penyelesaian salah terpanjang model.

media Hugging Face Forums · 8 hari lalu

Menyelidiki apakah jejak agen yang gagal dapat digunakan sebagai data penalaan halus

Penulis mengajukan hipotesis bahwa jejak agen yang menggunakan alat dan gagal, seperti pemilihan alat yang salah atau argumen yang tidak sesuai format, dapat berfungsi sebagai data penalaan halus yang berharga untuk melatih model agar menjauh dari kesalahan tersebut. Posting ini mencari umpan balik komunitas mengenai apakah pelatihan pada jejak kegagalan yang telah dikoreksi efektif atau justru merugikan.

arxiv arXiv cs.CL · 9 hari lalu · 2 tayangan

Decoder Memori dalam Skala: Menskalakan memori jangka panjang parametrik hingga 6.9B parameter

Para peneliti menyajikan Memory Decoder at Scale, sebuah sistem yang menskalakan model memori jangka panjang parametrik hingga 6.9B parameter dan melatihnya terlebih dahulu pada 300B token. Untuk mengatasi ketidakmungkinan pipeline Faiss standar pada skala data ini, para penulis mengimplementasikan pipeline pengindeksan terdistribusi dengan pemuatan kNN yang jarang dan berbasis batch.

lab Microsoft Research Blog · 9 hari lalu · 3 tayangan

Microsoft Research memperkenalkan EvoLib untuk pembelajaran saat pengujian dengan perpustakaan yang berkembang

Microsoft Research telah memperkenalkan EvoLib, sebuah kerangka kerja yang memungkinkan model bahasa besar belajar dari pengalaman mereka sendiri selama inferensi tanpa memerlukan label kebenaran dasar atau umpan balik eksternal. Daripada menyimpan pengalaman mentah sebagai memori statis, EvoLib mengubahnya menjadi keterampilan yang dapat digunakan kembali dan wawasan reflektif yang terus disempurnakan, dikonsolidasikan, dan diberi bobot ulang.

arxiv arXiv cs.CL · 11 hari lalu

Relay-OPD mengurangi panjang lintasan pelatihan lebih dari 50% dalam distilasi on-policy

Para peneliti memperkenalkan Relay On-Policy Distillation (Relay-OPD) untuk mengatasi kegagalan prefix dalam distilasi on-policy standar, di mana kesalahan siswa menyebabkan pengawasan yang tidak dapat diandalkan. Metode ini menggunakan asimetri kelanjutan guru-siswa sebagai pemicu bagi guru untuk sebentar mengambil alih dan mengarahkan ulang lintasan sebelum siswa melanjutkan.

arxiv arXiv cs.CL · 13 hari lalu OSWorld · 37.7%

OpenForgeRL memungkinkan pelatihan end-to-end agen berbasis harness di lingkungan apa pun

OpenForgeRL adalah kerangka kerja sumber terbuka yang memungkinkan peneliti melatih agen AI berbasis harness secara end-to-end menggunakan tumpukan pembelajaran penguatan standar. Ia memisahkan pelatihan dari inferensi dengan menggunakan proksi ringan untuk merekam panggilan model sebagai data dan orkestrator Kubernetes untuk mengelola peluncuran di kontainer jarak jauh.

media Hugging Face Forums · 14 hari lalu GSM8K · 74.22%

CrowdTensor meluncurkan Beta pelatihan sukarelawan dan Kampanye RFC Draft Qwen2.5-7B GSM8K

CrowdTensor adalah protokol open-source Apache-2.0 untuk kampanye pelatihan model sukarelawan dengan checkpoint yang mengaitkan revisi model dan data yang tidak dapat diubah untuk memberikan pekerjaan terbatas kepada sel CPU, GPU, atau TPU yang diterima. Proyek ini telah merilis proses pendaftaran Beta bersama RFC Draft untuk kampanye Qwen2.5-7B GSM8K.

arxiv arXiv cs.CL · 16 hari lalu SWE-bench Pro · 55.9% · 2 tayangan

OpenForgeRL memungkinkan pelatihan end-to-end agen berbasis harness di lingkungan apa pun

Para peneliti menyajikan OpenForgeRL, sebuah kerangka kerja sumber terbuka yang memungkinkan pelatihan end-to-end agen AI menggunakan harness inferensi kompleks seperti Claude Code dan OpenClaw. Sistem ini memisahkan pelatihan dari inferensi dengan menggunakan proxy ringan untuk merekam panggilan model sebagai data dan orkestrator Kubernetes untuk mengelola peluncuran container jarak jauh.

arxiv arXiv cs.AI · 16 hari lalu OSWorld · 37.7% · 5 tayangan

OpenForgeRL memungkinkan pelatihan end-to-end agen berbasis harness di lingkungan apa pun

OpenForgeRL adalah kerangka kerja sumber terbuka yang memungkinkan peneliti melatih agen AI berbasis harness secara end-to-end menggunakan tumpukan pembelajaran penguatan standar. Hal ini dicapai dengan memisahkan pelatihan dari inferensi melalui proksi ringan yang merekam panggilan model sebagai data dan orkestrator Kubernetes yang mengelola peluncuran kontainer jarak jauh.

arxiv arXiv cs.AI · 17 hari lalu · 4 tayangan

SLAI T-Rex memungkinkan pelatihan pasca-pelatihan parameter penuh DeepSeek-V4 di Ascend SuperPOD

SLAI memperkenalkan T-Rex, sebuah kerangka kerja optimasi end-to-end untuk pelatihan pasca-pelatihan parameter penuh model MoE berskala triliun parameter di Ascend NPU SuperPOD. Menggunakan keluarga model DeepSeek-V4 sebagai beban kerja target, sistem ini mengatasi tekanan memori dan overhead komunikasi melalui paralelisme hierarkis dan optimasi eksekusi kernel.