Topik · Training methods
lab NVIDIA Research · 3 hari lalu · 38 tayangan

LLM menyamai atau mengalahkan optimisasi Bayesian untuk optimisasi hiperparameter

Sebuah makalah baru mengeksplorasi penggunaan model bahasa besar fundamental (LLM) untuk mengotomatisasi optimisasi hiperparameter (HPO), sebuah proses yang biasanya mengandalkan pendekatan manual dalam pengaturan anggaran terbatas. Para penulis mengembangkan metodologi di mana LLM menyarankan konfigurasi hiperparameter berdasarkan deskripsi dataset dan model, yang kemudian disempurnakan secara iteratif sesuai dengan kinerja model.

lab NVIDIA Research · 3 hari lalu · 40 tayangan

Source memperkenalkan diferensiasi unrolled aproksimasi untuk atribusi data pelatihan

Peneliti memperkenalkan Source, metode atribusi data pelatihan (TDA) baru yang menggabungkan efisiensi komputasi fungsi pengaruh dengan akurasi pendekatan berbasis unrolling. Dengan menggunakan formula mirip fungsi pengaruh untuk mengaproksimasi diferensiasi unrolled, Source mengatasi keterbatasan dalam metode diferensiasi implisit, seperti kegagalan mereka memperhitungkan bias optimisasi atau pipeline multi-tahap.

lab NVIDIA Research · 4 hari lalu · 9 tayangan

ZPPO menggunakan prompt alih-alih gradien untuk meningkatkan pelatihan model visi-bahasa kecil

Para peneliti memperkenalkan Zone of Proximal Policy Optimization (ZPPO), sebuah metode yang menyuntikkan pengetahuan guru ke dalam prompt daripada gradien kebijakan untuk mengatasi kerapuhan dalam distilasi pengetahuan dan pergeseran dalam pembelajaran penguatan. ZPPO membangun Binary Candidate-included Questions (BCQ) dan Negative Candidate-included Questions (NCQ) untuk pertanyaan sulit, dan memutar ulang pertanyaan tersebut melalui buffer replays hingga akurasi siswa meningkat atau pertanyaan tersebut dihapus.

lab Microsoft Research Blog · 15 hari lalu · 4 tayangan

Microsoft Research memperkenalkan EvoLib untuk pembelajaran saat pengujian dengan perpustakaan yang berkembang

Microsoft Research telah memperkenalkan EvoLib, sebuah kerangka kerja yang memungkinkan model bahasa besar belajar dari pengalaman mereka sendiri selama inferensi tanpa memerlukan label kebenaran dasar atau umpan balik eksternal. Daripada menyimpan pengalaman mentah sebagai memori statis, EvoLib mengubahnya menjadi keterampilan yang dapat digunakan kembali dan wawasan reflektif yang terus disempurnakan, dikonsolidasikan, dan diberi bobot ulang.

media Hugging Face Forums · 2 hari lalu · 1 tayangan

ThetaMem mengusulkan pengangkatan kunci perkalian bertanda untuk memori urutan keadaan tetap

ThetaMem adalah studi awal satu-seed dari mixer rekuren yang memodifikasi keadaan rekuren melalui pengangkatan kunci Hadamard atau produk-luar bertanda yang dipelajari, bukan dengan menyempurnakan mekanisme gerbang. Penulis menyajikan hasil campuran pada benchmark sintetis dan secara eksplisit mencari kritik untuk mengidentifikasi eksperimen termurah yang dapat menyangkal pendekatan tersebut.

arxiv arXiv cs.CL · 3 hari lalu · 1 tayangan

MiLMMT-46-v1.0 meningkatkan terjemahan multibahasa melalui pasca-pelatihan tanpa referensi

Para peneliti telah merilis MiLMMT-46-v1.0, sebuah model bahasa besar sumber terbuka untuk terjemahan mesin multibahasa yang memanfaatkan pasca-pelatihan tanpa referensi. Dimulai dari MiLMMT-46-v0.1 yang telah disetel halus secara terawasi, tim menerapkan Group Relative Policy Optimization (GRPO) dengan imbalan berdasarkan dua model estimasi kualitas tanpa referensi yang dikendalikan oleh identifikasi bahasa.

lab Hugging Face Blog · 5 hari lalu · 8 tayangan

Multiverse Computing mengurangi VRAM distilasi pengetahuan dengan kerugian KL terpotong yang digabungkan

Multiverse Computing memperkenalkan pendekatan hemat memori untuk distilasi pengetahuan model bahasa besar dengan menggabungkan kaching logit top-K offline dan kerugian divergensi Kullback-Leibler (KL) terpotong yang digabungkan. Metode ini menghilangkan kebutuhan untuk menyimpan model guru dan siswa secara bersamaan dalam memori, secara drastis mengurangi persyaratan VRAM.

arxiv arXiv cs.LG · 8 hari lalu

U-OPSD memungkinkan distilasi diri on-policy tanpa pengawasan untuk LLM

Para peneliti mengusulkan Distilasi Diri On-Policy Tanpa Pengawasan (U-OPSD), sebuah metode yang mencapai peningkatan pasca-pelatihan untuk model bahasa besar hanya menggunakan generasi model itu sendiri tanpa supervisi eksternal. Pendekatan ini mengambil beberapa rollouts untuk membangun solusi pseudo melalui pemungutan suara mayoritas, lalu mendistilasi distribusi guru ke dalam awalan dari penyelesaian salah terpanjang model.

media Hugging Face Forums · 14 hari lalu

Menyelidiki apakah jejak agen yang gagal dapat digunakan sebagai data penalaan halus

Penulis mengajukan hipotesis bahwa jejak agen yang menggunakan alat dan gagal, seperti pemilihan alat yang salah atau argumen yang tidak sesuai format, dapat berfungsi sebagai data penalaan halus yang berharga untuk melatih model agar menjauh dari kesalahan tersebut. Posting ini mencari umpan balik komunitas mengenai apakah pelatihan pada jejak kegagalan yang telah dikoreksi efektif atau justru merugikan.