أصدرت مكتبة tokenizers مرشح إصدار تجريبي للإصدار الأول يحسّن بشكل كبير أداء ترميز النصوص، مما يعالج الاختناقات في سير عمل التدريب والتقديم. يحافظ التحديث على توافق واجهة برمجة التطبيقات مع الإصدار v0.23 بينما يقدم تسريعات كبيرة عبر عشر عائلات من النماذج.
- الترميز أسرع بمعدل 3 إلى 30 مرة مقارنة بـ v0.23 على خيط واحد، وذلك باستبدال تقسيم التعبيرات النمطية بعمليات تدفق البتات عبر مكتبة bitcannon.
- يخزن ذاكرة التخزين المؤقت للكلمات الخاصة بكل خيط النتائج للرموز الأولية المتكررة، مما يسمح بتخطي عملية الدمج تماماً في الحالات اللاحقة.
- يعيد حلقة دمج BPE استخدام المخازن المؤقتة المساعدة ويعالج دفعات من الرموز الأولية في استدعاء واحد، مما يلغي تخصيص الذاكرة لكل استدعاء.
- يحقق التوسع عبر ثمانية عمّال 76% من الأداء الخطي، مع تحسين معدل فك الترميز أيضاً من خلال الكتابة المباشرة إلى المخازن المؤقتة.
تضمن هذه التحسينات أن عملية ترميز الرموز لم تعد تحرم النماذج من البيانات عن طريق منع وحدات معالجة الرسومات (GPUs) من البقاء خاملة أثناء انتظار المعالجة بواسطة وحدة المعالجة المركزية (CPU).