Dezkubeدزکوب

فناوری · GPU و هوش مصنوعی

Gateway API Inference Extension در دزکوب

مسیریابی آگاه به استنتاج

لایسنس
Apache 2.0
گروه در استک
GPU و هوش مصنوعی

Gateway API Inference Extension چیست

افزونه‌ای بر Gateway API که مسیریابی را برای بار کاری استنتاج بهینه می‌کند — چون درخواست به یک مدل زبانی، با یک درخواست HTTP معمولی فرق دارد: طولانی‌تر است، منابع بیشتری می‌گیرد، و توزیع بارِ ساده برایش خوب کار نمی‌کند.

چرا این را انتخاب کردیم

گزینه‌هایی که بررسی و رد شدند، و دلیل رد هر کدام
گزینه‌ای که رد شدچرا نه
توزیع بار round-robin سادهنمونه‌ای که یک درخواست سنگین دارد، همان‌قدر درخواست می‌گیرد که نمونهٔ بیکار
مسیریابی اختصاصی خودماناستانداردِ در حال شکل‌گیری همین است؛ همسو ماندن بهتر از واگرا شدن است

ما دقیقاً چطور استفاده‌اش می‌کنیم

  • مسیریابی بین نمونه‌های یک مدل سروشده، با آگاهی از بار واقعی.
  • همکاری با لایهٔ گیت‌وی هوش مصنوعی، که سیاست و مجوز را اعمال می‌کند.

برای شما چه چیزی عوض می‌شود

  • توزیع بار کورمسیریابی آگاه به بار
  • تأخیر نامتوازن بین نمونه‌هاتوزیع بهتر

مرزها و محدودیت‌ها

این سکشن در هر صفحهٔ فناوری اجباری است. هر ابزاری مرزی دارد؛ صفحه‌ای که مرزش را نگوید، بقیه‌اش هم قابل اتکا نیست.

  • این استاندارد نسبتاً جوان است و در حال تکامل. ما آن را به‌عنوان یک لایهٔ بهینه‌سازی استفاده می‌کنیم، نه به‌عنوان مسیر حیاتی — یعنی اگر لازم شود، بدون آن هم کار می‌کند.

این را روی زیرساخت خودتان ببینید.

همین مؤلفه را در کلاستر شما پیکربندی می‌کنیم و نشان می‌دهیم.