GPT-5.6 मॉडल, इनफरेंस और एजेंटिक वर्कफ़्लो में AI दक्षता को बेहतर बनाता है
GPT-5.6 मॉडल आर्किटेक्चर, इनफरेंस प्रक्रियाओं और एजेंटिक वर्कफ़्लो सहित कई आयामों में कृत्रिम बुद्धिमत्ता की दक्षता को बढ़ाता है।
GPT-5.6 मॉडल आर्किटेक्चर, इनफरेंस प्रक्रियाओं और एजेंटिक वर्कफ़्लो सहित कई आयामों में कृत्रिम बुद्धिमत्ता की दक्षता को बढ़ाता है।
OpenAI ने "डॉलर प्रति उपयोगी बुद्धिमत्ता" नामक एक ढांचे की रूपरेखा तैयार की है, जो कंपनियों को साधारण टोकन-प्रति-लागत मापदंडों के परे अपने AI निवेशों के आर्थिक मूल्य को मापने में मदद करता है। लेख में तर्क दिया गया है कि सफलता को केवल अपनाने की दरों के बजाय पूरा किया गया कार्य, विश्वसनीयता और स्केलेबिलिटी द्वारा मापा जाना चाहिए।
OpenAI एक नई सेवा स्तर Ultrafast का पूर्वावलोकन शुरू कर रहा है, जो मानक प्रसंस्करण की तुलना में GPT-5.6 Sol मॉडल को 14 गुना तक तेज़ी से चलाता है। Cerebras हार्डवेयर द्वारा संचालित, यह मोड प्रति सेकंड 750 आउटपुट टोकन तक उत्पन्न करता है और प्रारंभिक रूप से OpenAI API के माध्यम से उपलब्ध है।
OpenAI ने अपने GPT-5.6 Luna और Terra मॉडलों की लागत को कम कर दिया है, साथ ही एंटरप्राइज वर्कलोड में प्रति डॉलर प्रदर्शन को बेहतर बनाने के लिए GPT-5.6 Sol के लिए एक नया "Fast मोड" पेश किया है।
Nvidia के शोधकर्ताओं ने FusionRelight पेश किया है, जो एक विधि है जो भौतिक रूप से युक्तिसंगत प्रकाश स्थानांतरण को पहचान संरक्षण और संपीड़ित रियल-टाइम इनफरेंस के साथ जोड़ती है। यह दृष्टिकोण हाइब्रिड डोमेन नॉलेज फ्यूजन (HDKF) का उपयोग करता है, एक प्रशिक्षण ढांचा जो सिंथेटिक, वन-लाइट-एट-ए-टाइम (OLAT), और इन-द-वाइल्ड डेटा से भौतिकी, प्रतिबिंब और यथार्थता के पूर्वज्ञान को एक छात्र मॉडल में संक्षिप्त करता है।
शोधकर्ताओं ने डिकोडिंग के दौरान प्रासंगिक दृश्य जानकारी शिफ्ट (RVIS) को बहुआयामी बड़े भाषा मॉडलों (MLLMs) में मौजूदा दृश्य टोकन प्रूनिंग विधियों की विफलता का मुख्य कारण पहचाना। इसका समाधान करने के लिए, वे डिकोडिंग-स्टेज शिफ्ट-अवेयर टोकन प्रूनिंग (DSTP) का प्रस्ताव करते हैं, जो एक ट्रेनिंग-फ्री फ्रेमवर्क है जो दृश्य टोकनों को बदलते तर्क आवश्यकताओं के साथ संरेखित करता है।
शोधकर्ता Cluster-Guided Vector Quantization (CGVQ) प्रस्तुत करते हैं, जो गॉसियन प्राइमिटिव-आधारित छवि संपीड़न में दर-विकृति प्रदर्शन को बेहतर बनाने के लिए डिज़ाइन किया गया एक विधि है। दृष्टिकोण क्वांटीकरण से पहले गॉसियन पैरामीटर को समजात समूहों में विभाजित करता है, जिसमें प्रति प्राइमिटिव बड़ी संख्या में फ्लोटिंग-पॉइंट पैरामीटर संग्रहीत करने के कारण होने वाली अक्षमता को दूर किया जाता है।
vLLM ने संस्करण 0.27.1 जारी किया है, जो पिछले v0.27.0 रिलीज़ पर बनाया गया एक पैच अपडेट है।
मेटा ने Apache 2.0 के तहत लोकल एजेंट डिप्लॉयमेंट के लिए अनुकूलित 30B डेंस मल्टीमोडल मॉडल Muse Glimmer जारी किया, साथ ही Muse Spark 1.2 के लिए भविष्य में वेट्स की भी घोषणा की।
OpenAI ने अपने GPT-5.6 मॉडलों के लिए महत्वपूर्ण मूल्य कटौती की घोषणा की है, जो सिस्टम दक्षता में सुधार और पुनरावर्ती स्व-अनुकूलन तकनीकों से प्रेरित है। कंपनी का दावा है कि GPT-5.4 स्तर की बुद्धिमत्ता की लागत चार महीनों में लगभग 13x कम हो गई है, जबकि GPT-5.6 Luna की कीमतें 80% और Terra की कीमतें 20% तक घटा दी गई हैं।
OpenAI ने अपने GPT-5.6 मॉडल परिवार की कीमतों में महत्वपूर्ण कमी की है, GPT-5.6 Luna के लिए 80% की भारी कीमत कमी और GPT-5.6 Terra के लिए 20% की कमी पेश की है। ये बदलाव GPT-5.6 Sol द्वारा सक्षम हैं, जो दक्षता में सुधार करने के लिए मॉडल के फॉरवर्ड पास और उत्पादन कुंजकों को अनुकूलित करता है।
Tencent ने "तेज़-विचार करने वाले" बहुभाषी अनुवाद मॉडलों के Hy-MT2 परिवार को जारी किया है, जिसमें 1.8B, 7B, और 30B-A3B (MoE) आकार शामिल हैं, साथ ही निर्देश-अनुपालन क्षमताओं का मूल्यांकन करने के लिए IFMTBench बेंचमार्क भी।
llama.cpp परियोजना ने संस्करण b10435 जारी किया है, जो Jinja टेम्पलेट इंजन के भीतर एक प्रदर्शन समस्या को संबोधित करता है। प्राथमिक परिवर्तन `gather_string_parts` फ़ंक्शन में द्विघात समय जटिलता बग को ठीक करता है।
llama.cpp प्रोजेक्ट ने बिल्ड b10434 जारी किया, जिसने Jinja टेम्पलेट्स में `reasoning_effort` पैरामीटर पास करने का समर्थन जोड़ा। इस बदलाव से OpenAI Chat Completions के `reasoning_effort` मानों को संग्रहीत और जनरेशन के दौरान उपलब्ध कराया जाता है।
llama.cpp परियोजना ने संस्करण b10431 जारी किया, जिसने ggml_ssm_scan संचालन में पुनरावर्ती स्थिति (RS) रोलबैक के लिए समर्थन पेश किया। इस बदलाव से CPU और CUDA बैकएंड पर Nemotron मॉडल के लिए RS रोलबैक सक्षम हो जाता है।
Qwen ने अपने Qwen 3.8 27B मॉडल के लिए ओपन वेट्स जारी किए हैं। चेकपॉइंट Hugging Face पर उपलब्ध है।
llama.cpp प्रोजेक्ट ने संस्करण b10429 जारी किया, जो सर्वर को संशोधित करता है ताकि llama_decode() चल रहे होने पर /metrics और /slots एंडपॉइंट्स तक पहुंच की अनुमति मिल सके।
llama.cpp परियोजना ने संस्करण b10430 जारी किया है, जो आभासी एकीकृत GPU (igpu) उपकरणों के लिए समर्थन पेश करता है। इस अपडेट में कोडबेस के भीतर सुधारे गए कमेंट्स भी शामिल हैं।
llama.cpp प्रोजेक्ट ने संस्करण b10427 जारी किया, जिसमें SYCL के माध्यम से Intel Arc GPUs के लिए एक प्रदर्शन अनुकूलन शामिल है। अपडेट q4_K घन फीड-फॉरवर्ड नेटवर्क (FFN) परत के भीतर gate, up और GLU ऑप्स के विलय को लागू करता है।
llama.cpp प्रोजेक्ट ने संस्करण b10425 जारी किया है, जिसमें गेटेड-डेल्टा-नेट स्टेट राइटबैक कॉपी को फ्यूज़ करने के लिए SYCL अनुकूलन का पोर्ट शामिल है।