الموضوع · Retrieval & RAG
lab Hugging Face Blog · منذ 29 يوم · 8 مشاهدات

إنفيديا تطلق نماذج Nemotron 3 Embed التي تحتل المرتبة الأولى على RTEB

أطلقت إنفيديا (NVIDIA) مجموعة Nemotron 3 Embed، وهي مجموعة من نماذج التضمين المفتوحة والمتاحة تجارياً والمصممة لتحسين جودة الاسترجاع لتطبيقات RAG على نطاق الإنتاج، والاسترجاع الوكيل، واسترجاع الأكواد، وذاكرة الوكلاء. تتضمن المجموعة نموذجاً بحجم 8B يحتل المرتبة الأولى بشكل عام على لوحة المتصدرين في RTEB، جنباً إلى جنب مع متغيرات 1B الفعالة والمُحسّنة للنشر.

arxiv arXiv cs.AI · منذ 2 يوم HealthBench · 51.9% · 4 مشاهدات

يتطابق VITA السريري المعزز بالاسترجاع أو يتفوق على نماذج اللغات الكبيرة المتقدمة في HealthBench

تم تقييم نظام مُصمم خصيصًا لتوليد النصوص المعزز بالاسترجاع يُدعى VITA، والمُعدّ للبيئات ذات الدخل المنخفض والمتوسط، مقابل نماذج لغوية كبيرة لأغراض عامة على معيار HealthBench. تُظهر الدراسة أن التصميم المخصص للمجموعة النصية يمكنه الحفاظ على أداء تنافسي حتى مع إصدار نماذج متقدمة جديدة.

arxiv arXiv cs.CL · منذ 2 يوم HealthBench · 51.9% · 4 مشاهدات

يتطابق VITA الخاص بمجموعة البيانات أو يتفوق على نماذج اللغات الكبيرة المتقدمة في HealthBench

يحتل VITA، وهو نظام توليد مدعوم بالاسترجاع مصمم للبيئات ذات الدخل المنخفض والمتوسط، المرتبة الأولى في المجموعة الفرعية باللغة الإنجليزية من HealthBench، متفوقًا على GPT-5.4 و o4-mini و Gemini 3.1 Pro و Claude Sonnet 4.6.

arxiv arXiv cs.LG · منذ 2 يوم HealthBench · 51.9% · 5 مشاهدات

نظام VITA للرAG السريري يساوي أو يتفوق على نماذج LLM المتقدمة في HealthBench

تم تقييم نظام توليد معزز بالاسترجاع (RAG) المصمم خصيصًا والمسمى VITA، والمخصص للبيئات منخفضة ومتوسطة الدخل، مقابل نماذج لغوية كبيرة لأغراض عامة على معيار HealthBench. من بين 4023 سؤالًا تم تقييمها بواسطة حكم GPT-4.1، احتل VITA المرتبة الأولى بنسبة 51.9% من نقاط المعايير الممكنة، متفوقًا على GPT-5.4 و o4-mini و Gemini 3.1 Pro و Claude Sonnet 4.6.

media Hugging Face Forums · منذ 12 يوم · 7 مشاهدات

IntelShed يجمع بين RAG الهجين، وحل كيان GNN، والتعلم الموحد، وتنسيق وكلاء LLM متعددين

يقدم المؤلف IntelShed، وهو نظام مفتوح المصدر للاستخبارات المفتوحة المصدر (OSINT) يجمع 50 مصدر بيانات عام لإنتاج موجز أمني تلقائي على مدار 24 ساعة. تدمج البنية الاسترجاع الهجين، وحل الكيان القائم على GNN، والتعلم الموحد مع الخصوصية التفاضلية، وتنسيق الوكلاء المتعددين المُجمَّع بواسطة LLM.

media Hugging Face Forums · منذ 16 يوم · 3 مشاهدات

تزيل TIS 2.0 تحيز الموقع في RAG عن طريق إعادة ترتيب الفقرات باستخدام درجات أهمية الرمز المميز

يُقدم تحديث TIS 2.0 capability إعادة ترتيب الفقرات التي تزيل تحيز الموقع "المفقود في المنتصف" في التوليد المعزز بالاسترجاع دون الحاجة إلى تدريب إضافي. ومن خلال تطبيق درجات أهمية الرمز المميز المُتعلمة لإعادة ترتيب المستندات المسترجعة، يحقق النظام فجوة موقع صفرية ويحسن دقة التطابق الدقيق بنسبة 5 نقاط مئوية مقارنةً بالخطوط الأساسية.

media Hugging Face Forums · منذ 17 يوم · مشاهدة واحدة

تستخدم رسوم الذاكرة المرجحة بالاهتمام انتباه Jina لاجتياز graph-RAG

توضح اقتراح جديد بنية ذاكرة LLM تجمع بين التقطيع المتأخر مع حواف مرجحة بالاهتمام لتمكين الاجتياز خطوة بخطوة. يستفيد النظام من نموذج التضمين الخاص بـ Jina AI، الذي يحسب الاهتمام بين الجمل، لاستنتاج أوزان الحواف من المعالجة الداخلية للمستند.

media Hugging Face Forums · منذ 18 يوم · مشاهدتان

مراجعة DESi: مهارة Claude قابلة للتثبيت لمراجعة الأوراق البحثية المعرفية المهيكلة

أطلق المؤلف مراجعة DESi، وهي تطبيق عملي لإطار حوكمة معرفي مستقل عن النموذج يُعرف بـ DESi، مُعبّأً كمهارة Claude قابلة للتثبيت. يعمل هذا الأداة على تنفيذ خط أنابيب لمراجعة الأوراق البحثية بشكل مهيكل عبر النصوص الإنجليزية من خلال فصل استخراج الادعاءات الحتمية عن التقدير القائم على النموذج.

media Hugging Face Forums · منذ 22 يوم · مشاهدة واحدة

نقاش مجتمعي حول جدوى إنتاج نماذج LLM المتخصصة في المجال بحجم 7B–14B

يحقق مستخدم في منتدى Hugging Face فيما إذا كانت نماذج اللغات الكبيرة (LLMs) الصغيرة والمتخصصة في مجال معين، والتي تتراوح بين 7B و14B معلمة، يمكنها استبدال النماذج الأكبر بشكل فعال في بيئات الإنتاج الواقعية.

media Hugging Face Forums · منذ 22 يوم

إليزا مع مُشفِّر تلقائي متفرق

تستفيد نسخة جديدة من روبوت المحادثة إليزا من بنية المُشفِّر التلقائي المتفرق لتخزين إدخالات المحادثة في طبقة ذاكرة كامنة، بهدف تحسين الأساليب التقليدية لمطابقة الكلمات المفتاحية. يعتمد النظام على بنية مُشفِّر-مُفكِّك T5 مع طبقة ذاكرة تحتوي على 32,768 عصبوناً، حيث تُفعَّل الإدخالات المتشابهة عبر التعلم التبايني.

media r/LocalLLaMA · منذ 23 يوم · 6 مشاهدات

PaddlePaddle تطلق HPD-Parsing، نموذجًا بحجم 1 مليار معلمة مع فك تشابك متوازي هرمي

أطلقت PaddlePaddle نموذج HPD-Parsing، وهو نموذج خفيف الوزن لفك تشابك الوثائق يتكون من مليار معلمة، يستفيد من نهج فك التشابك المتوازي الهرمي لتحسين الإنتاجية. ينسق الهيكل البنيوي للصفحة العالمية من خلال فرع التخطيط الرئيسي، بينما يُوجّه توليد المحتوى الموضعي إلى فروع متزامنة، مستخدمًا التنبؤ متعدد الرموز التدريجي لتقليل خطوات فك التشابك.

media Hugging Face Forums · منذ 23 يوم · مشاهدة واحدة

المؤلف يقترح سجلاً مفتوحاً لـ k لتشبع الأدلة في نماذج LLM المحلية

نشر المؤلف ورقة تجريبية وسجلاً مفتوحاً على Hugging Face لقياس نقطة تشبع الأدلة (k*) للنماذج اللغوية. يحدد هذا المقياس العدد الأمثل لشظايا الأدلة التي يتم حقنها في المطالبات، حيث إن إضافة المزيد من السياق لا يحسن الصحة بشكل رتيب ويمكن أن يزيد التكلفة أو التلوث المعرفي.

media Hugging Face Forums · منذ 28 يوم · 3 مشاهدات

الذاكرة الوكيلية الهرمية تستخدم التضمينات الزائدية للاسترجاع المنظم

يعتمد معمارية ذاكرة جديدة تستخدم التضمينات الزائدية لتنظيم إدخالات قاعدة البيانات المتجهة بناءً على "درجة التجريد"، مما يسمح للوكلاء بإدارة المعرفة بفعالية أكبر من أنظمة RAG المسطحة. ينظم هذا النهج البيانات بحيث تجلس الإدخالات المجردة، مثل التفضيلات، بالقرب من المركز بينما تقع الأحداث المحددة عند الحدود، مما يسهل التجميع والاسترجاع الأفضل.

media Hugging Face Forums · منذ 29 يوم

تقترح ShinBay-UCTF إطاراً مفاهيمياً للتعلم المستمر والحفاظ على الخصوصية والمعرفة المضغوطة

يقدم K7007 نموذج ShinBay-UCTF، وهو إطار مفاهيمي يعالج القيود الموجودة في أنظمة الذكاء الاصطناعي فيما يتعلق بالتكرار متعدد اللغات، والذاكرة العرضية المستمرة، والتكيف المستمر. يحدد الاقتراح بنية موحدة تتكون من ثلاث طبقات متفاعلة: تنسيق التدريب المضغوط العالمي (UCTF)، والذاكرة العرضية المستوحاة بيولوجياً، والتعلم المستمر المدفوع بالبيئة.