فناوری · GPU و هوش مصنوعی
NVIDIA GPU Operator در دزکوب
مدیریت درایور و زمان اجرای GPU
- نسخهٔ پینشده
- ⟦V_NVIDIA_GPU_OPERATOR⟧
- لایسنس
- Apache 2.0
- گروه در استک
- GPU و هوش مصنوعی
NVIDIA GPU Operator چیست
اپراتوری که چرخهٔ کامل GPU روی نودهای Kubernetes را مدیریت میکند: درایور، زمان اجرای container، افزونهٔ دستگاه، و متریک سلامت.
چرا این را انتخاب کردیم
| گزینهای که رد شد | چرا نه |
|---|---|
| نصب دستی درایور روی هر نود | با ناوگان ناهمگون، کابوس نگهداری است |
| بدون اپراتور | ارتقای درایور، یک عملیات دستی و پرریسک |
ما دقیقاً چطور استفادهاش میکنیم
- کشف خودکار کارتها، مدل، حافظه و قابلیتها روی هر نود.
- برنامهٔ درایور بهازای مدل کارت — چون در ناوگان ناهمگون، یک برنامهٔ واحد بعضی نودها را خراب میکند.
- بررسی پیشنیاز نود پیش از نصب، با گزارش جداگانه بهازای هر نود.
- برش MIG برای تقسیم سختافزاری کارت.
- اشتراک زمانی برای وقتی که فقط میخواهید کارت بیکار نماند.
- متریک DCGM برای دما، مصرف، استفاده و خطا — با cordon خودکار در صورت خرابی.
- نصب از منبع تأییدشده در فهرست مجاز.
برای شما چه چیزی عوض میشود
- درایور دستی روی هر نودمدیریتشده
- ناوگان ناهمگون = دردسربرنامهٔ درایور بهازای مدل
- کارت خراب، بیصدا خطا میدهدcordon خودکار با متریک
مرزها و محدودیتها
این سکشن در هر صفحهٔ فناوری اجباری است. هر ابزاری مرزی دارد؛ صفحهای که مرزش را نگوید، بقیهاش هم قابل اتکا نیست.
- MIG فقط روی کارتهایی که پشتیبانی میکنند در دسترس است. برای بقیه، اشتراک زمانی تنها گزینه است.
- ارتقای درایور نیاز به راهاندازی مجدد بار کاری GPU دارد. باید در پنجرهٔ نگهداری برنامهریزی شود.
- این اپراتور مخصوص یک تولیدکنندهٔ کارت است. پشتیبانی از سایر شتابدهندهها در دامنهٔ فعلی نیست — صادقانه میگوییم.
این را روی زیرساخت خودتان ببینید.
همین مؤلفه را در کلاستر شما پیکربندی میکنیم و نشان میدهیم.