अमेरिका में ओपन-वेट मॉडल के एक डेवलपर, Arcee ने Genesis-Science-1 बनाने के लिए ऊर्जा विभाग के साथ भागीदारी की है। इस सहयोग से वैज्ञानिक शोध के लिए विशेष रूप से डिज़ाइन किया गया एक ओपन मॉडल बना है।
Genesis-Science-1 बनाने के लिए Arcee और ऊर्जा विभाग ने भागीदारी की
Arcee AI और DOE ने वैज्ञानिक शोध के लिए 1T ओपन-वेट मॉडल Genesis-Science-1 की घोषणा की
ऊर्जा विभाग (DOE) और Arcee AI ने वैज्ञानिक शोध के लिए विशेष रूप से डिज़ाइन किए गए ओपन-वेट लैंग्वेज मॉडल Genesis-Science-1 (GS1) के विकास की घोषणा की है। यह पहल जीनेसिस मिशन का हिस्सा है, जिसका उद्देश्य सरकारी एजेंसी और निजी कंपनी के बीच संयुक्त प्रयास के माध्यम से उन्नत AI क्षमताओं को वैज्ञानिक क्षेत्रों की एक विस्तृत श्रृंखला तक लाना है।
Tencent ने HiLS-Attention-7B को चंक-वाइड स्पार्स एटेंशन के साथ रिलीज़ किया
Tencent ने HiLS-Attention-7B चेकपॉइंट जारी किया है, जो OLMo3-style बैकबोन पर बना 7-अरब पैरामीटर वाला मॉडल है। मॉडल एक चंक-वाइड स्पार्स एटेंशन तंत्र लागू करता है जो भाषा-मॉडलिंग नुकसान के तहत चंक चयन को end-to-end सीखता है।
DiaLLM अंग्रेजी बोलियों के अनुकूलन में मजबूती-उत्पादन अंतरााल की जांच करता है
DiaLLM अध्ययन अंतर्राष्ट्रीय कांपस ऑफ़ इंग्लिश पर तीन ओपन-वेट भाषा मॉडल परिवारों को लगातार प्रीट्रेनिंग करके, बोलियों वाले अंग्रेजी को समझने और उत्पन्न करने के बीच की असंगति को संबोधित करता है। यह ऑस्ट्रेलियाई, भारतीय और उत्तरी ब्रिटिश अंग्रेजी की तुलना करने के लिए निहित और स्पष्ट पोस्ट-ट्रेनिंग पैराडिम्स को तीन एलाइनमेंट रणनीतियों के साथ लागू करता है।
DiaLLM अंग्रेजी बोलियों के अनुकूलन में मजबूती-जनरेशन अंतर की जांच करता है
DiaLLM अध्ययन से पता चलता है कि बड़े भाषा मॉडलों में बौलीगत दृढ़ता और जनरेशन अलग हैं, क्योंकि निरंतर प्रीट्रेनिंग द्वारा आकार दिए गए बेंचमार्क यह नहीं पकड़ते कि एलाइनमेंट वास्तविक आउटपुट को कैसे बदलता है। लेखकों ने अंतर्राष्ट्रीय अंग्रेजी कॉर्पस (International Corpus of English) पर तीन ओपन-वेट मॉडल परिवारों का निरंतर प्रीट्रेनिंग किया और ऑस्ट्रेलियाई, भारतीय और उत्तरी ब्रिटिश अंग्रेजी के लिए तीन एलाइनमेंट रणनीतियों के साथ अंतर्निहित और स्पष्ट पोस्ट-ट्रेनिंग पैराडाइम लागू किए।
Qllm ने KV कैश के बिना O(1) इनफरेंस मॉडल जारी किया
एक शोधकर्ता ने Qllm जारी किया है, एक नया बड़ा भाषा मॉडल आर्किटेक्चर जो कुंजी-मूल्य (KV) कैश की आवश्यकता को समाप्त करके O(1) इनफरेंस समय प्राप्त करता है। 100M पैरामीटर वाला मॉडल फेज एसोसिएटिविटी पर बनाया गया है और ट्रान्सफॉर्मर या mamba संरचनाओं पर निर्भर नहीं करता है।