Training data
media Hugging Face Forums · منذ 6 يوم

OpenGauntlet ينشر كتالوجًا يحتوي على 168 نظام TTS و106 نظام STT

نشر باحث كتالوج أبحاث OpenGauntlet، وهو مورد عام يحتوي على معلومات حول 168 نظامًا لتحويل النص إلى كلام (TTS) و106 أنظمة لتحويل الكلام إلى نص (STT). تغطي الدلائل النماذج مفتوحة المصدر والمُستضافة، والتراخيص، ومتطلبات الأجهزة، واللغات، والقدرات، وحالة دورة الحياة، ومعلومات المصدر، وبيانات المعايير المنشورة حيثما كانت متاحة.

media Hugging Face Forums · منذ 7 يوم · مشاهدة واحدة

تظهر مصفوفة الامتثال الشهرية أن 65% من مجموعات البيانات الـ 4893 باللغات الهندية تفتقر إلى علامات الترخيص

تم نشر مصفوفة امتثال يتم تحديثها شهريًا لجميع مجموعات البيانات الـ 4893 باللغات الهندية على Hub Hugging Face، وكشف ذلك عن أن 65.1% لا تعلن عن أي علامة ترخيص اعتبارًا من 1 أغسطس 2026.

media Hugging Face Forums · منذ 12 يوم · مشاهدتان

Calibra: مجموعة أدوات مفتوحة المصدر لمراقبة مجموعات بيانات الروبوتات

Calibra هي مجموعة أدوات مفتوحة المصدر مصممة لمساعدة الباحثين على تدقيق مجموعات بيانات الروبوتات وتحديد مشكلات الجودة قبل تدريب السياسات. يتضمن الإصدار العام الأول مساحة تفاعلية بعنوان Robot Dataset Health Check لتدقيق مجموعات بيانات LeRobot ومعايرة لـ 30 مجموعة بيانات عامة من LeRobot مع درجات صحية.

media Hugging Face Forums · منذ 12 يوم · 3 مشاهدات

محرك Huggy يُطلق قاعدة بيانات Huggy، أكبر مجموعة بيانات مفتوحة لسباقات الخيل الفرنسية

أصدر محرك Huggy قاعدة بيانات Huggy على منصة Hugging Face، والتي تُوصف بأنها أكبر مجموعة بيانات مفتوحة لسباقات الخيل الفرنسية المتاحة. يوفر هذا الإصدار تغطية يومية كاملة تمتد على مدى 30 عاماً من عام 1996 إلى عام 2026 للاستخدام في تطبيقات التعلم الآلي.

media r/LocalLLaMA · منذ 16 يوم · 4 مشاهدات

Hugging Face تطلق The Stack v3، أكبر مجموعة بيانات مفتوحة المصدر للأكواد

أطلقت Hugging Face النسخة الثالثة من The Stack، والتي تُوصف بأنها أكبر مجموعة بيانات مفتوحة المصدر للأكواد حتى الآن. يوفر هذا الإصدار طريقتين مختلفتين للوصول لتلبية احتياجات المستخدمين المختلفين.

media Hugging Face Forums · منذ 23 يوم · 3 مشاهدات

louidev يُصدر GlassBallAI، مجموعة بيانات مقفلة زمنياً لتوقعات Gemini لدراسة سلوك النماذج اللغوية الكبيرة

أصدر louidev مجموعة بيانات GlassBallAI على Hugging Face، والتي تلتقط سلوك التنبؤ المباشر من نماذج Google's Gemini قبل معرفة النتائج. تحتوي المجموعة على أكثر من 3,655 صفًا من البيانات تم جمعها بين 17 فبراير و19 مايو 2026، وتغطي Gemini 2.5 Flash، و2.5 Pro، و2.5 Flash Lite، و3.0 Flash Preview.

lab IBM Research (Granite) · منذ 23 يوم HumanEval · 83.5%

تطلق آي بي إم مشروع الكود الألكيمي مفتوح المصدر، وهو مجموعة بيانات اصطناعية ضخمة من الكود عالي الجودة

أطلقت آي بي إم مشروع الكود الألكيمي (CodeAlchemy)، وهو خط أنابيب ومجموعة بيانات اصطناعية مصممة لتحسين أداء نماذج الذكاء الاصطناعي من خلال ربط الكود بآثار التنفيذ. تتضمن الإصدار ما يقرب من تريليون رمز عبر 15 لغة برمجة، مما يصل إلى ضعف حجم ويكيبيديا بمقدار 200 مرة على الأقل.

media Hugging Face Forums · منذ 24 يوم

نقاش حول معالجة اختناقات البيانات في محاكاة التعلم الآلي العلمي

يشارك مستخدم تجربته بشأن التكلفة الحسابية لتوليد مجموعات بيانات التدريب من المحاكاة الفيزيائية، مثل تدفق الموائع والحقول الهيكلية. ويؤكد أن التحدي الرئيسي ليس في بنية النموذج، بل في صعوبة بناء مجموعة بيانات كبيرة ومتنوعة عندما يكون كل عينة مكلفة الإنتاج.

arxiv arXiv cs.LG · منذ 24 يوم

CSFS يقلل تكلفة اختيار ميزات التنبؤ بطاقة الرياح والطاقة الشمسية بنسبة 21%

يقترح الباحثون Cluster-based Sequential Feature Selection (CSFS)، وهي طريقة غلاف جديدة تعتمد على التجميع للاختيار التلقائي والكفء للميزات في خطوط أنابيب التنبؤ بالطاقة المتجددة. يعالج هذا النهج نقص الأساليب المنهجية لاختيار ميزات الإدخال من العدد الكبير من متغيرات المراقبة والبيئية المتاحة.

arxiv arXiv cs.AI · منذ 24 يوم

CSFS يقلل التكلفة الحسابية بنسبة 21% في توقعات الطاقة المتجددة

يقترح الباحثون اختيار السمات التسلسلي القائم على العناقيد (CSFS)، وهي طريقة غلاف جديدة وغير معتمدة على النموذج، مصممة لمعالجة نقص اختيار السمات المنهجي في توقعات طاقة الرياح والطاقة الشمسية. تهدف هذه الطريقة إلى توفير اختيار سمات تلقائي وفعال وموثوق لأنظمة الطاقة المتجددة.

arxiv arXiv cs.AI · منذ 24 يوم · مشاهدة واحدة

ViHoRec: مجموعة بيانات لتوصية الفنادق الفيتنامية خاضعة للتحكم في الجودة ومعيار لبدء التشغيل البارد

يقدم الباحثون ViHoRec، وهي مجموعة بيانات عامة تتكون من 18,267 تفاعلاً بين 6,832 مستخدمًا و560 فندقًا لتوصية الفنادق الفيتنامية. تعالج هذه الموارد تحديات حل الكيان عبر المنصات والإصدار الذي يحافظ على الخصوصية باستخدام أسماء مستعارة HMAC.

arxiv arXiv cs.AI · منذ 24 يوم

FormalAnalyticGeo يولد مسائل الهندسة التحليلية متعددة الوسائط عبر خط أنابيب رمزي-عصبي

يقدم الباحثون FormalAnalyticGeo، وهو إطار عمل قابل للتوسع لتوليد مسائل الهندسة التحليلية متعددة الوسائط تلقائيًا بالكامل والذي يلغي الحاجة إلى التوثيق البشري. يستخدم النظام تمثيلًا وسيطًا رسميًا يُدعى CDL لربط نص المسألة بالرسم الدقيق للمخطط عبر محرك Signed Distance Field.

media Hugging Face Forums · منذ 24 يوم

الباحثون يستخدمون أوريغامي الحمض النووي لتشفير الرسائل السرية كرمز مورس النانوي

طور الباحثون طريقة للتشفير الجزيئي الحيوي تستخدم أوريغامي الحمض النووي لتحويل الرسائل السرية إلى رمز مورس النانوي. تهدف هذه الطريقة إلى تأمين المعلومات باستخدام الجزيئات البيولوجية بدلاً من خوارزميات التشفير التقليدية المعتمدة على الحاسوب.

arxiv arXiv cs.CL · منذ 26 يوم · مشاهدة واحدة

الباحثون يطلقون مجموعة بيانات ICSL للتعرف على لغة الإشارة البرازيلية داخل السيارة

تم تقديم مجموعة بيانات متعددة الوسائط جديدة تسمى مجمع In-Car Sign Language (ICSL) لمعالجة تحديات استخدام لغة الإشارة في خدمات التنقل المشترك مثل سيارات الأجرة ومنصات مشاركة الرحلات. يركز هذا المورد على لغة الإشارة البرازيلية (Libras) لتحسين إمكانية الوصول إلى النقل العام لمجتمع الصم وضعاف السمع داخل مقصورات السيارات المغلقة.

arxiv arXiv cs.CL · منذ 26 يوم

دراسة تجد اتجاهًا سلبيًا صغيرًا في تركيبية التراكيب الألمانية والإنجليزية مع مرور الوقت

حقق الباحثون في التغيير الدلالي لـ 23 تركيبًا اسميًا ألمانيًا و26 إنجليزيًا من خلال إدخال مهمة التنبؤ باتجاه التركيبية (Compositionality Trend Prediction)، والتي تم تقييمها مقابل مجموعة بيانات جديدة من التقييمات عبر العقود. وعلى عكس الأدبيات التي تفترض اتجاهًا حاسمًا للتراكيب لتصبح أقل تركيبية، وجدت الدراسة فقط اتجاهًا سلبيًا صغيرًا مع مرور الوقت.

arxiv arXiv cs.CL · منذ 26 يوم

JobHop v2: مجموعة بيانات واسعة النطاق لمسارات الوظائف من السير الذاتية غير المهيكلة

أطلق الباحثون JobHop v2، وهو نسخة محسّنة من مجموعة بيانات JobHop المتاحة للجمهور والمصممة لتخطيط القوى العاملة وتحليل سوق العمل. تم بناء المجموعة عبر استخراج نموذج لغوي كبير من البداية إلى النهاية من حوالي 440,000 سيرة ذاتية متعددة اللغات مجهولة المصدر مقدمة من VDAB، الخدمة العامة للتوظيف في فلاندرز، وتحتوي على 355,315 مسارًا وظيفيًا.

arxiv arXiv cs.LG · منذ 26 يوم

دراسة تقيّم أساليب معالجة اللغات الطبيعية لاستخراج الكلمات المفتاحية من المجموعات الجماعية

قام مشروع يستخدم الأرشيف عبر الإنترنت Their Finest Hour Online Archive التابع لجامعة أكسفورد بتقييم ثلاث طرق لمعالجة اللغات الطبيعية - التعرف على الكيانات المسماة، واستخراج الكلمات المفتاحية، ونمذجة الموضوعات - لأتمتة استخراج الكلمات المفتاحية على نطاق واسع. اختبرت الدراسة هذه الأساليب عبر مجموعة من التقنيات، بدءاً من النماذج الإحصائية التقليدية وصولاً إلى الشبكات العصبية الحديثة للذكاء الاصطناعي التوليدي.

arxiv arXiv cs.LG · منذ 27 يوم

دراسة تستنتج صيغة تجريبية لتقدير حجم مجموعة التدريب لتصنيف أجهزة الاستشعار القصور الذاتي

يقدم الباحثون تقييماً تجريبياً منهجياً لمعدلات تقارب منحنيات التعلم لمعالجة نقص الإرشادات القائمة على البيانات لتحديد أحجام العينات الدنيا في مهام التصنيف المعتمدة على أجهزة الاستشعار القصور الذاتي.