विषय · Inference efficiency
lab OpenAI News · 16 दिन पहले · 42 बार देखा गया

GPT-5.6 मॉडल, इनफरेंस और एजेंटिक वर्कफ़्लो में AI दक्षता को बेहतर बनाता है

GPT-5.6 मॉडल आर्किटेक्चर, इनफरेंस प्रक्रियाओं और एजेंटिक वर्कफ़्लो सहित कई आयामों में कृत्रिम बुद्धिमत्ता की दक्षता को बढ़ाता है।

lab OpenAI News · 28 दिन पहले · 21 बार देखा गया

OpenAI ने AI मूल्य के लिए 'डॉलर प्रति उपयोगी बुद्धिमत्ता' स्कोरकार्ड का प्रस्ताव रखा

OpenAI ने "डॉलर प्रति उपयोगी बुद्धिमत्ता" नामक एक ढांचे की रूपरेखा तैयार की है, जो कंपनियों को साधारण टोकन-प्रति-लागत मापदंडों के परे अपने AI निवेशों के आर्थिक मूल्य को मापने में मदद करता है। लेख में तर्क दिया गया है कि सफलता को केवल अपनाने की दरों के बजाय पूरा किया गया कार्य, विश्वसनीयता और स्केलेबिलिटी द्वारा मापा जाना चाहिए।

lab OpenAI News · 1 दिन पहले · 2 बार देखा गया

OpenAI GPT-5.6 Sol को 14 गुना तेज़ी से चलाने वाला Ultrafast मोड प्रदर्शित करता है

OpenAI एक नई सेवा स्तर Ultrafast का पूर्वावलोकन शुरू कर रहा है, जो मानक प्रसंस्करण की तुलना में GPT-5.6 Sol मॉडल को 14 गुना तक तेज़ी से चलाता है। Cerebras हार्डवेयर द्वारा संचालित, यह मोड प्रति सेकंड 750 आउटपुट टोकन तक उत्पन्न करता है और प्रारंभिक रूप से OpenAI API के माध्यम से उपलब्ध है।

lab OpenAI News · 15 दिन पहले · 45 बार देखा गया

OpenAI ने GPT-5.6 Luna और Terra के लिए कीमतें कम कीं, Sol के लिए Fast मोड पेश किया

OpenAI ने अपने GPT-5.6 Luna और Terra मॉडलों की लागत को कम कर दिया है, साथ ही एंटरप्राइज वर्कलोड में प्रति डॉलर प्रदर्शन को बेहतर बनाने के लिए GPT-5.6 Sol के लिए एक नया "Fast मोड" पेश किया है।

lab NVIDIA Research · 4 घंटे पहले · 2 बार देखा गया

Nvidia ने हाइब्रिड डोमेन नॉलेज फ्यूजन के माध्यम से रियल-टाइम पोर्ट्रेट रिलिटिंग के लिए FusionRelight प्रस्तुत किया

Nvidia के शोधकर्ताओं ने FusionRelight पेश किया है, जो एक विधि है जो भौतिक रूप से युक्तिसंगत प्रकाश स्थानांतरण को पहचान संरक्षण और संपीड़ित रियल-टाइम इनफरेंस के साथ जोड़ती है। यह दृष्टिकोण हाइब्रिड डोमेन नॉलेज फ्यूजन (HDKF) का उपयोग करता है, एक प्रशिक्षण ढांचा जो सिंथेटिक, वन-लाइट-एट-ए-टाइम (OLAT), और इन-द-वाइल्ड डेटा से भौतिकी, प्रतिबिंब और यथार्थता के पूर्वज्ञान को एक छात्र मॉडल में संक्षिप्त करता है।

lab NVIDIA Research · 4 दिन पहले · 14 बार देखा गया

DSTP जटिल MLLM तर्क में दृश्य टोकन प्रूनिंग विफलताओं को कम करता है

शोधकर्ताओं ने डिकोडिंग के दौरान प्रासंगिक दृश्य जानकारी शिफ्ट (RVIS) को बहुआयामी बड़े भाषा मॉडलों (MLLMs) में मौजूदा दृश्य टोकन प्रूनिंग विधियों की विफलता का मुख्य कारण पहचाना। इसका समाधान करने के लिए, वे डिकोडिंग-स्टेज शिफ्ट-अवेयर टोकन प्रूनिंग (DSTP) का प्रस्ताव करते हैं, जो एक ट्रेनिंग-फ्री फ्रेमवर्क है जो दृश्य टोकनों को बदलते तर्क आवश्यकताओं के साथ संरेखित करता है।

lab NVIDIA Research · 18 दिन पहले · 13 बार देखा गया

2D गॉसियन-आधारित छवि संपीड़न के लिए क्लस्टर कोडबुक क्वांटीकरण

शोधकर्ता Cluster-Guided Vector Quantization (CGVQ) प्रस्तुत करते हैं, जो गॉसियन प्राइमिटिव-आधारित छवि संपीड़न में दर-विकृति प्रदर्शन को बेहतर बनाने के लिए डिज़ाइन किया गया एक विधि है। दृष्टिकोण क्वांटीकरण से पहले गॉसियन पैरामीटर को समजात समूहों में विभाजित करता है, जिसमें प्रति प्राइमिटिव बड़ी संख्या में फ्लोटिंग-पॉइंट पैरामीटर संग्रहीत करने के कारण होने वाली अक्षमता को दूर किया जाता है।

media AI News (smol.ai) · 4 दिन पहले · 12 बार देखा गया

मेटा ने Muse Glimmer 30B ओपन-वेट मॉडल जारी किया; Anthropic ने Riemann बॉउंड में सुधार किया

मेटा ने Apache 2.0 के तहत लोकल एजेंट डिप्लॉयमेंट के लिए अनुकूलित 30B डेंस मल्टीमोडल मॉडल Muse Glimmer जारी किया, साथ ही Muse Spark 1.2 के लिए भविष्य में वेट्स की भी घोषणा की।

media Latent Space · 15 दिन पहले · 16 बार देखा गया

OpenAI ने स्व-अनुकूलन के माध्यम से GPT-5.6 की कीमतों में 80% तक कमी की

OpenAI ने अपने GPT-5.6 मॉडलों के लिए महत्वपूर्ण मूल्य कटौती की घोषणा की है, जो सिस्टम दक्षता में सुधार और पुनरावर्ती स्व-अनुकूलन तकनीकों से प्रेरित है। कंपनी का दावा है कि GPT-5.4 स्तर की बुद्धिमत्ता की लागत चार महीनों में लगभग 13x कम हो गई है, जबकि GPT-5.6 Luna की कीमतें 80% और Terra की कीमतें 20% तक घटा दी गई हैं।

blog Simon Willison · 15 दिन पहले · 20 बार देखा गया

OpenAI ने GPT-5.6 Luna की कीमत में 80% की कमी की है, अनुमानित निष्पादन को अनुकूलित करने के लिए Sol का उपयोग करके

OpenAI ने अपने GPT-5.6 मॉडल परिवार की कीमतों में महत्वपूर्ण कमी की है, GPT-5.6 Luna के लिए 80% की भारी कीमत कमी और GPT-5.6 Terra के लिए 20% की कमी पेश की है। ये बदलाव GPT-5.6 Sol द्वारा सक्षम हैं, जो दक्षता में सुधार करने के लिए मॉडल के फॉरवर्ड पास और उत्पादन कुंजकों को अनुकूलित करता है।

lab Tencent Hunyuan (HF) · 22 दिन पहले · 6 बार देखा गया

Tencent ने Hy-MT2 बहुभाषी अनुवाद मॉडल और IFMTBench ओपन-सोर्स किए

Tencent ने "तेज़-विचार करने वाले" बहुभाषी अनुवाद मॉडलों के Hy-MT2 परिवार को जारी किया है, जिसमें 1.8B, 7B, और 30B-A3B (MoE) आकार शामिल हैं, साथ ही निर्देश-अनुपालन क्षमताओं का मूल्यांकन करने के लिए IFMTBench बेंचमार्क भी।

github llama.cpp · अभी अभी लाइव

llama.cpp b10435 ने jinja gather_string_parts में द्विघात लागत को ठीक किया

llama.cpp परियोजना ने संस्करण b10435 जारी किया है, जो Jinja टेम्पलेट इंजन के भीतर एक प्रदर्शन समस्या को संबोधित करता है। प्राथमिक परिवर्तन `gather_string_parts` फ़ंक्शन में द्विघात समय जटिलता बग को ठीक करता है।

github llama.cpp · 3 घंटे पहले

llama.cpp b10434 टेम्पलेट्स को reasoning_effort पास करता है

llama.cpp प्रोजेक्ट ने बिल्ड b10434 जारी किया, जिसने Jinja टेम्पलेट्स में `reasoning_effort` पैरामीटर पास करने का समर्थन जोड़ा। इस बदलाव से OpenAI Chat Completions के `reasoning_effort` मानों को संग्रहीत और जनरेशन के दौरान उपलब्ध कराया जाता है।

github llama.cpp · 5 घंटे पहले · 1 बार देखा गया

llama.cpp b10431 ने SSM मॉडल के लिए पुनरावर्ती स्थिति रोलबैक जोड़ा है

llama.cpp परियोजना ने संस्करण b10431 जारी किया, जिसने ggml_ssm_scan संचालन में पुनरावर्ती स्थिति (RS) रोलबैक के लिए समर्थन पेश किया। इस बदलाव से CPU और CUDA बैकएंड पर Nemotron मॉडल के लिए RS रोलबैक सक्षम हो जाता है।

github llama.cpp · 9 घंटे पहले · 1 बार देखा गया

llama.cpp b10429 llama_decode() के दौरान /metrics और /slots तक पहुंचने की अनुमति देता है

llama.cpp प्रोजेक्ट ने संस्करण b10429 जारी किया, जो सर्वर को संशोधित करता है ताकि llama_decode() चल रहे होने पर /metrics और /slots एंडपॉइंट्स तक पहुंच की अनुमति मिल सके।

github llama.cpp · 10 घंटे पहले · 1 बार देखा गया

llama.cpp b10430 आभासी igpu उपकरणों की अनुमति देता है

llama.cpp परियोजना ने संस्करण b10430 जारी किया है, जो आभासी एकीकृत GPU (igpu) उपकरणों के लिए समर्थन पेश करता है। इस अपडेट में कोडबेस के भीतर सुधारे गए कमेंट्स भी शामिल हैं।

github llama.cpp · 15 घंटे पहले · 1 बार देखा गया

llama.cpp b10427 SYCL FFN ऑप्स को फ्यूज़ करता है, थ्रूपुट में 12.4% तक वृद्धि

llama.cpp प्रोजेक्ट ने संस्करण b10427 जारी किया, जिसमें SYCL के माध्यम से Intel Arc GPUs के लिए एक प्रदर्शन अनुकूलन शामिल है। अपडेट q4_K घन फीड-फॉरवर्ड नेटवर्क (FFN) परत के भीतर gate, up और GLU ऑप्स के विलय को लागू करता है।

github llama.cpp · 16 घंटे पहले · 2 बार देखा गया

llama.cpp b10425 गेटेड-डेल्टा-नेट स्टेट राइटबैक को फ्यूज़ करता है, +1.2% स्पीडअप

llama.cpp प्रोजेक्ट ने संस्करण b10425 जारी किया है, जिसमें गेटेड-डेल्टा-नेट स्टेट राइटबैक कॉपी को फ्यूज़ करने के लिए SYCL अनुकूलन का पोर्ट शामिल है।