تبحث شركة QuantVectors عن مجموعات بيانات وثائقية مُعلَّمة بلغات هندية من الهند، بما في ذلك الهنديّة، والمراثية، والغوجاراتية، والبنغالية، والبنجابية، والتاميلية، والأردية، والتيلوغوية، والأوديا، والكانادا، والماليالامية، والآسامية. يجب أن تتضمن مجموعات البيانات أنواع الفواتير، والإيصالات، وفواتير المرافق، وإشعارات الدفع، وقوائم التعبئة، والفواتير التجارية، وملاحظات الائتمان، مع حوالي 400 وثيقة لكل لغة، وتعليقات مُتحقَّقة من قبل البشر، ودقة بنسبة 99%+. يجب أن تكون مجموعات البيانات قابلة للتراخيص تجاريًا ويمكن أن تكون مفتوحة المصدر أو تجارية، مع طلب مجموعات بيانات على HuggingFace، أو مجموعات بيانات بحثية، أو موردين متخصصين في هذا المجال.
البحث عن مجموعات بيانات وثائقية بلغات هندية لتدريب الذكاء الاصطناعي/التعرف الضوئي على الحروف في الهند
vldmrbesk يُصدر أرشيف تسيلكوفسكي المكون من 51 ألف ورقة بدقة تعرف مقاسة
تم إصدار أرشيف شخصي كامل لكونستانتين تسيلكوفسكي، يتألف من 51,008 ورقة و2,019 ملفًا أرشيفيًا، كـ مجموعة بيانات CC0. تمتد المجموعة لخمسينيّات من عمل العالم المتعلم ذاتيًا لنظرية الصواريخ وتشمل مخطوطات بخط اليد إلى جانب نسخ مطبوعة.
Hugging Face تطلق The Stack v3، أكبر مجموعة بيانات مفتوحة المصدر للأكواد
أطلقت Hugging Face النسخة الثالثة من The Stack، والتي تُوصف بأنها أكبر مجموعة بيانات مفتوحة المصدر للأكواد حتى الآن. يوفر هذا الإصدار طريقتين مختلفتين للوصول لتلبية احتياجات المستخدمين المختلفين.
تطلق آي بي إم مشروع الكود الألكيمي مفتوح المصدر، وهو مجموعة بيانات اصطناعية ضخمة من الكود عالي الجودة
أطلقت آي بي إم مشروع الكود الألكيمي (CodeAlchemy)، وهو خط أنابيب ومجموعة بيانات اصطناعية مصممة لتحسين أداء نماذج الذكاء الاصطناعي من خلال ربط الكود بآثار التنفيذ. تتضمن الإصدار ما يقرب من تريليون رمز عبر 15 لغة برمجة، مما يصل إلى ضعف حجم ويكيبيديا بمقدار 200 مرة على الأقل.
MultiSynt/MT تطلق مجموعة متوازية من 4.8 تريليون رمز عبر 36 لغة
يقدم الباحثون MultiSynt/MT، وهو مجموعة متوازية اصطناعية مفتوحة تحتوي على حوالي 4.8 تريليون رمز للغة الهدف عبر 36 لغة أوروبية. تم إنشاء مجموعة البيانات عن طريق ترجمة 100 مليار رمز من Nemotron-CC عالي الجودة باستخدام أنظمة Tower+ و OPUS-MT/HPLT-MT.
Current AI تطلق خريطة فجوة الذكاء الاصطناعي مفتوح المصدر الإصدار 0.1 مع 421 منتج مُفهرس
أطلقت Current AI، وهي منظمة غير ربحية تأسست في قمة عمل الذكاء الاصطناعي في فبراير 2025، خريطة فجوة الذكاء الاصطناعي مفتوح المصدر الإصدار 0.1 لفهرسة حالة الذكاء الاصطناعي مفتوح المصدر.