أضافت توغير AI قدرات التوسع التلقائي إلى منصة الاستدلال المخصصة للنماذج لديها، مما يتيح نشر النماذج بناءً على مقاييس يفهمها محرك الاستدلال، مثل الطلبات قيد التنفيذ، والوقت حتى أول رمز (TTFT)، واستهلاك وحدة معالجة الرسومات.

  • يستخدم النظام حلقة تحكم تناسبية مع حدود نسخ قابلة للتكوين ونوافذ زمنية لإدارة التوسع صعوداً وهبوطاً.
  • يمكن للمستخدمين الاختيار من بين ثمانية مقاييس، مصنفة كمقاييس مدفوعة بالتزامن (مثل inflight_requests)، أو مدفوعة باتفاقيات مستوى الخدمة (مثل ttft)، أو مدفوعة بالكفاءة (مثل gpu_utilization).
  • يُنصح باستخدام المقاييس المدفوعة بالتزامن كخيار افتراضي لأنها تعمل كمؤشرات رائدة للحمل قبل تدهور زمن الاستجابة.
  • لا تدعم المنصة التوسع التلقائي إلى الصفر؛ فوضع الحد الأدنى والحد الأقصى للنسخ على 0 يوقف النشر صراحةً.
  • أظهرت تجربة مع نموذج Qwen3.5-9B أن مقياس الطلبات قيد التنفيذ فقط نجح في التوسع أثناء ذروات حركة المرور، بينما فشلت سياسات TTFT واستهلاك وحدة معالجة الرسومات في الاستجابة.

يساعد التوسع التلقائي على موازنة التكلفة والأداء من خلال منع الإفراط في توفير وحدات معالجة الرسومات الخاملة، ونقص التوفير الذي يؤدي إلى تدهور شديد في زمن الاستجابة أثناء ذروة حركة المرور.