Retrieval & RAG
media Hugging Face Forums · منذ 6 يوم · 3 مشاهدات

IntelShed يجمع بين RAG الهجين، وحل كيان GNN، والتعلم الموحد، وتنسيق وكلاء LLM متعددين

يقدم المؤلف IntelShed، وهو نظام مفتوح المصدر للاستخبارات المفتوحة المصدر (OSINT) يجمع 50 مصدر بيانات عام لإنتاج موجز أمني تلقائي على مدار 24 ساعة. تدمج البنية الاسترجاع الهجين، وحل الكيان القائم على GNN، والتعلم الموحد مع الخصوصية التفاضلية، وتنسيق الوكلاء المتعددين المُجمَّع بواسطة LLM.

media Hugging Face Forums · منذ 10 يوم · مشاهدة واحدة

تزيل TIS 2.0 تحيز الموقع في RAG عن طريق إعادة ترتيب الفقرات باستخدام درجات أهمية الرمز المميز

يُقدم تحديث TIS 2.0 capability إعادة ترتيب الفقرات التي تزيل تحيز الموقع "المفقود في المنتصف" في التوليد المعزز بالاسترجاع دون الحاجة إلى تدريب إضافي. ومن خلال تطبيق درجات أهمية الرمز المميز المُتعلمة لإعادة ترتيب المستندات المسترجعة، يحقق النظام فجوة موقع صفرية ويحسن دقة التطابق الدقيق بنسبة 5 نقاط مئوية مقارنةً بالخطوط الأساسية.

media Hugging Face Forums · منذ 12 يوم · مشاهدة واحدة

تستخدم رسوم الذاكرة المرجحة بالاهتمام انتباه Jina لاجتياز graph-RAG

توضح اقتراح جديد بنية ذاكرة LLM تجمع بين التقطيع المتأخر مع حواف مرجحة بالاهتمام لتمكين الاجتياز خطوة بخطوة. يستفيد النظام من نموذج التضمين الخاص بـ Jina AI، الذي يحسب الاهتمام بين الجمل، لاستنتاج أوزان الحواف من المعالجة الداخلية للمستند.

media Hugging Face Forums · منذ 13 يوم · مشاهدتان

مراجعة DESi: مهارة Claude قابلة للتثبيت لمراجعة الأوراق البحثية المعرفية المهيكلة

أطلق المؤلف مراجعة DESi، وهي تطبيق عملي لإطار حوكمة معرفي مستقل عن النموذج يُعرف بـ DESi، مُعبّأً كمهارة Claude قابلة للتثبيت. يعمل هذا الأداة على تنفيذ خط أنابيب لمراجعة الأوراق البحثية بشكل مهيكل عبر النصوص الإنجليزية من خلال فصل استخراج الادعاءات الحتمية عن التقدير القائم على النموذج.

media Hugging Face Forums · منذ 16 يوم · مشاهدة واحدة

نقاش مجتمعي حول جدوى إنتاج نماذج LLM المتخصصة في المجال بحجم 7B–14B

يحقق مستخدم في منتدى Hugging Face فيما إذا كانت نماذج اللغات الكبيرة (LLMs) الصغيرة والمتخصصة في مجال معين، والتي تتراوح بين 7B و14B معلمة، يمكنها استبدال النماذج الأكبر بشكل فعال في بيئات الإنتاج الواقعية.

media Hugging Face Forums · منذ 17 يوم

إليزا مع مُشفِّر تلقائي متفرق

تستفيد نسخة جديدة من روبوت المحادثة إليزا من بنية المُشفِّر التلقائي المتفرق لتخزين إدخالات المحادثة في طبقة ذاكرة كامنة، بهدف تحسين الأساليب التقليدية لمطابقة الكلمات المفتاحية. يعتمد النظام على بنية مُشفِّر-مُفكِّك T5 مع طبقة ذاكرة تحتوي على 32,768 عصبوناً، حيث تُفعَّل الإدخالات المتشابهة عبر التعلم التبايني.

media r/LocalLLaMA · منذ 17 يوم · 3 مشاهدات

PaddlePaddle تطلق HPD-Parsing، نموذجًا بحجم 1 مليار معلمة مع فك تشابك متوازي هرمي

أطلقت PaddlePaddle نموذج HPD-Parsing، وهو نموذج خفيف الوزن لفك تشابك الوثائق يتكون من مليار معلمة، يستفيد من نهج فك التشابك المتوازي الهرمي لتحسين الإنتاجية. ينسق الهيكل البنيوي للصفحة العالمية من خلال فرع التخطيط الرئيسي، بينما يُوجّه توليد المحتوى الموضعي إلى فروع متزامنة، مستخدمًا التنبؤ متعدد الرموز التدريجي لتقليل خطوات فك التشابك.

media Hugging Face Forums · منذ 18 يوم · مشاهدة واحدة

المؤلف يقترح سجلاً مفتوحاً لـ k لتشبع الأدلة في نماذج LLM المحلية

نشر المؤلف ورقة تجريبية وسجلاً مفتوحاً على Hugging Face لقياس نقطة تشبع الأدلة (k*) للنماذج اللغوية. يحدد هذا المقياس العدد الأمثل لشظايا الأدلة التي يتم حقنها في المطالبات، حيث إن إضافة المزيد من السياق لا يحسن الصحة بشكل رتيب ويمكن أن يزيد التكلفة أو التلوث المعرفي.

media Hugging Face Forums · منذ 22 يوم · 3 مشاهدات

الذاكرة الوكيلية الهرمية تستخدم التضمينات الزائدية للاسترجاع المنظم

يعتمد معمارية ذاكرة جديدة تستخدم التضمينات الزائدية لتنظيم إدخالات قاعدة البيانات المتجهة بناءً على "درجة التجريد"، مما يسمح للوكلاء بإدارة المعرفة بفعالية أكبر من أنظمة RAG المسطحة. ينظم هذا النهج البيانات بحيث تجلس الإدخالات المجردة، مثل التفضيلات، بالقرب من المركز بينما تقع الأحداث المحددة عند الحدود، مما يسهل التجميع والاسترجاع الأفضل.

media Hugging Face Forums · منذ 23 يوم

تقترح ShinBay-UCTF إطاراً مفاهيمياً للتعلم المستمر والحفاظ على الخصوصية والمعرفة المضغوطة

يقدم K7007 نموذج ShinBay-UCTF، وهو إطار مفاهيمي يعالج القيود الموجودة في أنظمة الذكاء الاصطناعي فيما يتعلق بالتكرار متعدد اللغات، والذاكرة العرضية المستمرة، والتكيف المستمر. يحدد الاقتراح بنية موحدة تتكون من ثلاث طبقات متفاعلة: تنسيق التدريب المضغوط العالمي (UCTF)، والذاكرة العرضية المستوحاة بيولوجياً، والتعلم المستمر المدفوع بالبيئة.

arxiv arXiv cs.AI · منذ 23 يوم · مشاهدة واحدة

RAGU يُطلق محرك GraphRAG متعدد الخطوات مع مستخرج Meno-Lite-0.1 المدمج

يُعد RAGU محرك GraphRAG مفتوح المصدر ونمطي، يحسّن دمج المعرفة الهيكلية من خلال فصل استخراج الكيانات عن عملية الدمج. يعتمد على عملية استخراج ذات مرحلتين مصنفة، واستبعاد للتكرارات مدعوم بـ DBSCAN، وتلخيص بواسطة نماذج لغوية كبيرة (LLM)، واكتشاف مجتمعات Leiden لتقليل الضوضاء والهشاشة الموجودة في الأنظمة أحادية المرور.

lab Hugging Face Blog · منذ 24 يوم · 8 مشاهدات

إنفيديا تطلق نماذج Nemotron 3 Embed التي تحتل المرتبة الأولى على RTEB

أطلقت إنفيديا (NVIDIA) مجموعة Nemotron 3 Embed، وهي مجموعة من نماذج التضمين المفتوحة والمتاحة تجارياً والمصممة لتحسين جودة الاسترجاع لتطبيقات RAG على نطاق الإنتاج، والاسترجاع الوكيل، واسترجاع الأكواد، وذاكرة الوكلاء. تتضمن المجموعة نموذجاً بحجم 8B يحتل المرتبة الأولى بشكل عام على لوحة المتصدرين في RTEB، جنباً إلى جنب مع متغيرات 1B الفعالة والمُحسّنة للنشر.

arxiv arXiv cs.CL · منذ 24 يوم

يستخدم RAGthoven خط أنابيب RAG متعدد المراحل لمساواة Gemini 2.5 Flash في توليد النكات متعدد اللغات

يقدم المؤلفون نظام RAGthoven، وهو نظام لمهمة SemEval-2026 Task 1 يقوم بتحليل توليد النص الإبداعي إلى خط أنابيب لنماذج اللغة الكبيرة متعدد المراحل قائم على نظرية النكتة الحسابية. يعزز التكوين النهائي المخطط بالتوليد المعزز بالاسترجاع من مجموعة نكات مختارة ويقيّم المتغيرات الوكيلية مقابل الأساس غير الوكيلى.

arxiv arXiv cs.CL · منذ 24 يوم · مشاهدة واحدة

إطار عمل Apaf الهجين يحلل الخطاب في سياسات إدارة الكوارث

يقدم المؤلفون Apaf، وهو خط أنابيب هجين يجمع بين النماذج اللغوية الكبيرة (LLM) والرموز، يعمل على تشغيل التحليل النقدي للخطاب كإطار جدلي ثنائي القطبية كمي للنصوص السياسية. يتم تصنيف الحجج إلى أطر تأملية أو إدارية، ويتم إنتاج أربعة أنواع فرعية للعلاقات الوسيطة للأطر بواسطة قواعد حتمية على السمات المستخرجة بواسطة LLM.

arxiv arXiv cs.CL · منذ 24 يوم · مشاهدة واحدة

الضبط الدقيق المتكيف مع المجموعة يحسن استدعاء استرداد مخطط SQL

أعاد المؤلفون صياغة خمس مجموعات بيانات من النص إلى SQL (Spider و BIRD و BEAVER ومتغيرين من LiveSQLBench) كمشاكل استرجاع للجداول والأعمدة لتقييم ربط المخططات. يقترحون ضبطاً دقيقاً متكاملاً مع المجموعة لموديل تضمين بحجم 305M معلمة، مما يرفع متوسط recall@10 من 60.4 إلى 75.6.

arxiv arXiv cs.CL · منذ 24 يوم

إشارات LLM-as-a-judge تفشل في تحسين التعرف على الجداول في حلقة مغلقة

تظهر دراسة تستخدم FinTabNet و OmniDocBench أن إشارات LLM-as-a-jridge غير كافية لتحسين إعادة التوليد في حلقة مغلقة في التعرف على الجداول. تكشف الأبحاث أن درجات الحكام كانت متعادلة في كثير من الأحيان، ولم تكن التصنيفات قابلة للتكرار، وفشل النظام في استعادة المرشحين الأفضل الذين تم إنتاجهم عن طريق التكرار.

arxiv arXiv cs.CL · منذ 24 يوم

تقلل طبقة POS البيانات اللازمة للتعليق الفوري الآلي للغة إرابو ريوكيو إلى النصف

قام الباحثون بتنفيذ خط أنابيب تدوين عصبي للغة إرابو ريوكيو لأتمتة إنشاء النص المعلق بين الأسطر، مما يعالج التكلفة العالية للتوثيق اليدوي. قاست الدراسة تجزئة الجذور، ووسم POS، والتعليق باستخدام نماذج BiLSTM-CRF الصغيرة تحت قيد صارم يقارب ساعة واحدة من الخطاب المدون.