Arcee, pengembang model bobot terbuka di AS, telah bermitra dengan Departemen Energi untuk membuat Genesis-Science-1. Kolaborasi ini menghasilkan model terbuka yang dirancang khusus untuk penelitian ilmiah.
Arcee dan Departemen Energi bermitra untuk membangun Genesis-Science-1
Arcee AI dan DOE mengumumkan Genesis-Science-1, model bobot terbuka 1T untuk penelitian ilmiah
Departemen Energi (DOE) dan Arcee AI telah mengumumkan pengembangan Genesis-Science-1 (GS1), sebuah model bahasa bobot terbuka yang dirancang khusus untuk penelitian ilmiah. Inisiatif ini merupakan bagian dari Misi Genesis, bertujuan membawa kemampuan AI canggih ke berbagai bidang ilmiah melalui kerja sama antara lembaga pemerintah dan perusahaan swasta.
Tencent merilis HiLS-Attention-7B dengan perhatian jarang per-kuint
Tencent telah merilis checkpoint HiLS-Attention-7B, sebuah model dengan 7 miliar parameter yang dibangun di atas backbone bergaya OLMo3. Model ini mengimplementasikan mekanisme perhatian jarang per-kuint yang mempelajari pemilihan kuint secara end-to-end di bawah kerugian pemodelan bahasa.
DiaLLM menyelidiki kesenjangan robustness-pembuatan dalam adaptasi dialek Inggris
Studi DiaLLM mengatasi ketidaksesuaian antara pemahaman dan produksi bahasa Inggris dialek dengan melakukan pra-pelatihan berkelanjutan pada tiga keluarga model bahasa bobot terbuka di Korpus Internasional Bahasa Inggris. Studi ini menerapkan paradigma pasca-pelatihan implisit dan eksplisit yang dikombinasikan dengan tiga strategi penyesuaian untuk membandingkan bahasa Inggris Australia, India, dan Inggris Utara.
DiaLLM menyelidiki kesenjangan robustness-generasi dalam adaptasi dialek Inggris
Studi DiaLLM mengungkapkan bahwa robustness dialektal dan generasi terdisosiasi dalam model bahasa besar, karena benchmark yang dibentuk oleh pra-pelatihan berkelanjutan tidak menangkap bagaimana penyesuaian membentuk ulang output aktual. Penulis melakukan pra-pelatihan berkelanjutan pada tiga keluarga model bobot terbuka menggunakan International Corpus of English dan menerapkan paradigma pasca-pelatihan implisit dan eksplisit yang dikombinasikan dengan tiga strategi penyesuaian untuk Inggris Australia, India, dan Inggris Utara.\n\n- Adaptasi yang ditargetkan secara eksplisit ke variasi menghasilkan output yang secara andal dikenali sebagai dialektal dan lebih disukai daripada penyesuaian luas.
Qllm merilis model inferensi O(1) tanpa cache KV
Seorang peneliti telah merilis Qllm, sebuah arsitektur model bahasa besar baru yang mencapai waktu inferensi O(1) dengan menghilangkan kebutuhan akan cache kunci-nilai (KV). Model 100M parameter ini dibangun berdasarkan asosiativitas fase dan tidak bergantung pada struktur transformer atau mamba.