Dezkubeدزکوب

فناوری · GPU و هوش مصنوعی

KServe، vLLM و Ollama در دزکوب

سرو مدل

لایسنس
Apache 2.0
گروه در استک
GPU و هوش مصنوعی

KServe، vLLM و Ollama چیست

vLLM زمان اجرای بهینه برای مدل‌های زبانی است، با مدیریت کارآمد حافظه و دسته‌بندی پویا. KServe لایهٔ استاندارد سرو مدل روی Kubernetes است. Ollama گزینهٔ سبک برای موارد ساده‌تر و محیط توسعه است.

چرا این را انتخاب کردیم

گزینه‌هایی که بررسی و رد شدند، و دلیل رد هر کدام
گزینه‌ای که رد شدچرا نه
فقط یک زمان اجرامدل‌ها و بارهای کاری متفاوت، نیاز متفاوت دارند
سرو مدل با یک اسکریپت سادهبدون دسته‌بندی، بدون مدیریت حافظه، بدون مقیاس
سرویس ابری مدلدقیقاً چیزی که می‌خواهیم حذف کنیم

ما دقیقاً چطور استفاده‌اش می‌کنیم

  • وزن مدل از سطل آبجکت‌استوریج خودتان توسط یک init container کشیده می‌شود.
  • زمان اجرا در حالت آفلاین پین می‌شود — هیچ تلاشی برای دانلود از اینترنت نمی‌کند. این برای نصب ایزوله حیاتی است.
  • کش وزن روی دیسک، تا راه‌اندازی مجدد دوباره دانلود نکند.
  • مقیاس تا صفر با حداقل ظرفیت گرم و منطق ضدنوسان.
  • موازی‌سازی تانسور برای مدل بزرگ روی چند کارت.
  • توزیع نمونه‌ها: نمونه‌های مستقل روی zoneهای مختلف پخش می‌شوند؛ ولی مدلی که روی چند کارت تقسیم شده، کنار هم می‌ماند.
  • بودجهٔ اختلال برای هر مدل سروشده.
  • مدل یک شیء محصولی است و از روی رکوردش قطعی بازسازی می‌شود.

برای شما چه چیزی عوض می‌شود

  • prompt به سرویس بیرونیمدل روی GPU خودتان
  • مدل بیکار که کارت را نگه داشتهمقیاس تا صفر
  • از دست رفتن نود = از دست رفتن سرویستوزیع نمونه + بودجهٔ اختلال

مرزها و محدودیت‌ها

این سکشن در هر صفحهٔ فناوری اجباری است. هر ابزاری مرزی دارد؛ صفحه‌ای که مرزش را نگوید، بقیه‌اش هم قابل اتکا نیست.

  • راه‌اندازی سرد زمان می‌برد — بارگذاری وزن مدل بزرگ می‌تواند تا چند ده ثانیه طول بکشد. با حداقل ظرفیت گرم مدیریت می‌شود، ولی صفر نمی‌شود.
  • ماشین یا پادِ متصل به GPU عبوری، محدودیت جابه‌جایی دارد.
  • کیفیت پاسخ به خودِ مدل بستگی دارد، نه به لایهٔ سرو. دزکوب مدل تولید نمی‌کند.

این را روی زیرساخت خودتان ببینید.

همین مؤلفه را در کلاستر شما پیکربندی می‌کنیم و نشان می‌دهیم.