فناوری · GPU و هوش مصنوعی
KServe، vLLM و Ollama در دزکوب
سرو مدل
- لایسنس
- Apache 2.0
- گروه در استک
- GPU و هوش مصنوعی
KServe، vLLM و Ollama چیست
vLLM زمان اجرای بهینه برای مدلهای زبانی است، با مدیریت کارآمد حافظه و دستهبندی پویا. KServe لایهٔ استاندارد سرو مدل روی Kubernetes است. Ollama گزینهٔ سبک برای موارد سادهتر و محیط توسعه است.
چرا این را انتخاب کردیم
| گزینهای که رد شد | چرا نه |
|---|---|
| فقط یک زمان اجرا | مدلها و بارهای کاری متفاوت، نیاز متفاوت دارند |
| سرو مدل با یک اسکریپت ساده | بدون دستهبندی، بدون مدیریت حافظه، بدون مقیاس |
| سرویس ابری مدل | دقیقاً چیزی که میخواهیم حذف کنیم |
ما دقیقاً چطور استفادهاش میکنیم
- وزن مدل از سطل آبجکتاستوریج خودتان توسط یک init container کشیده میشود.
- زمان اجرا در حالت آفلاین پین میشود — هیچ تلاشی برای دانلود از اینترنت نمیکند. این برای نصب ایزوله حیاتی است.
- کش وزن روی دیسک، تا راهاندازی مجدد دوباره دانلود نکند.
- مقیاس تا صفر با حداقل ظرفیت گرم و منطق ضدنوسان.
- موازیسازی تانسور برای مدل بزرگ روی چند کارت.
- توزیع نمونهها: نمونههای مستقل روی zoneهای مختلف پخش میشوند؛ ولی مدلی که روی چند کارت تقسیم شده، کنار هم میماند.
- بودجهٔ اختلال برای هر مدل سروشده.
- مدل یک شیء محصولی است و از روی رکوردش قطعی بازسازی میشود.
برای شما چه چیزی عوض میشود
- prompt به سرویس بیرونیمدل روی GPU خودتان
- مدل بیکار که کارت را نگه داشتهمقیاس تا صفر
- از دست رفتن نود = از دست رفتن سرویستوزیع نمونه + بودجهٔ اختلال
مرزها و محدودیتها
این سکشن در هر صفحهٔ فناوری اجباری است. هر ابزاری مرزی دارد؛ صفحهای که مرزش را نگوید، بقیهاش هم قابل اتکا نیست.
- راهاندازی سرد زمان میبرد — بارگذاری وزن مدل بزرگ میتواند تا چند ده ثانیه طول بکشد. با حداقل ظرفیت گرم مدیریت میشود، ولی صفر نمیشود.
- ماشین یا پادِ متصل به GPU عبوری، محدودیت جابهجایی دارد.
- کیفیت پاسخ به خودِ مدل بستگی دارد، نه به لایهٔ سرو. دزکوب مدل تولید نمیکند.
اینها را هم ببینید
این را روی زیرساخت خودتان ببینید.
همین مؤلفه را در کلاستر شما پیکربندی میکنیم و نشان میدهیم.