بارهای کاری هوش مصنوعی معنای «سرور» را تغییر میدهند: راهنمای عملی مشخصات فنی سرورهای GPU
مشخصات فنی یک سرور برای بارهای کاری هوش مصنوعی، فرآیندی متفاوت از مشخصات فنی برای پایگاه داده یا مجازیسازی است. گلوگاهها متفاوت هستند، الزامات برق و خنکسازی متفاوت است، و خرید بر اساس مشخصات سنتی سرور (تعداد هسته، سرعت کلاک) منجر به سیستمی میشود که با کار واقعی همخوانی ندارد. در ادامه آنچه باید پیش از خرید بررسی کنید آمده است.
گلوگاه معمولاً CPU نیست
برای بارهای کاری سنتی، تعداد هسته CPU و سرعت کلاک اغلب مشخصه اصلی هستند. برای آموزش و استنتاج هوش مصنوعی، CPU اغلب فقط یک هماهنگکننده است — کار واقعی روی GPU انجام میشود، و سؤالات مهم بر همین اساس تغییر میکنند:
- حافظه GPU (VRAM)، نه فقط تعداد GPU — مدلی که در حافظه یک GPU جا نمیشود، یا باید بین چند GPU تقسیم شود یا روی کارتهایی با VRAM بیشتر اجرا شود. این معمولاً اولین دیواری است که پروژهها با آن برخورد میکنند، نه توان محاسباتی خام.
- اتصال بین GPUها (Interconnect) — برای آموزش چند-GPU، نحوه ارتباط GPUها با یکدیگر (و اینکه آیا این اتصال گلوگاه است) اهمیت بیشتری نسبت به هر عدد خام در برگه مشخصات یک GPU دارد.
- توان عملیاتی ذخیرهسازی — بارهای کاری آموزش، مجموعه دادههای بزرگ را بهطور مکرر میخوانند؛ یک زیرسیستم ذخیرهسازی که نتواند GPUها را تغذیه کند، محاسبات گرانقیمت را بیکار نگه میدارد.
آموزش در برابر استنتاج: سیستمهای متفاوت، اولویتهای متفاوت
این دو اغلب بهعنوان یک تصمیم خرید یکسان در نظر گرفته میشوند، اما نقطه بهینه متفاوتی دارند:
- بارهای کاری آموزش: از نظر محاسبات و پهنای باند حافظه سنگین هستند، برای دورههای طولانی اجرا میشوند، و بیشترین سود را از GPUهای رده بالا با VRAM بیشتر و اتصالات سریعتر میبرند — هزینه اولیه بالاتر است اما بیکاری، پرهزینهترین حالت شکست است.
- بارهای کاری استنتاج (اجرای مدلی که قبلاً آموزش دیده برای ارائه پیشبینی) معمولاً بهازای هر درخواست کمتوقعتر هستند اما باید درخواستهای همزمان را بهطور کارآمد مدیریت کنند — در اینجا تعداد GPU و دستهبندی کارآمد اغلب مهمتر از داشتن قدرتمندترین کارت موجود است.
خرید تجهیزات رده آموزش برای یک استقرار خالص استنتاج، یک اشتباه رایج و پرهزینه در تعیین مشخصات بیشازحد است.
برق و خنکسازی: بخشی که دستکم گرفته میشود
سرورهای GPU رده بالا بهازای هر واحد رک، برق قابلتوجهی بیشتر از گرههای محاسباتی سنتی مصرف میکنند، و این دو اثر جانبی دارد که بهراحتی در بودجهبندی اولیه نادیده گرفته میشوند:
- تأمین برق به رک — مدارهای برق دیتاسنتر یا اتاق سرور موجود که برای سرورهای سنتی طراحی شدهاند، ممکن است بدون ارتقای برق از یک استقرار متراکم GPU پشتیبانی نکنند.
- ظرفیت خنکسازی — خنکسازی هوایی که برای یک رک سنتی کافی بود، ممکن است با رکهای متراکم از GPU همگام نباشد؛ خنکسازی مایع در مقیاس بزرگ بهطور فزاینده رایج میشود، که یک تصمیم در سطح تأسیسات است، نه فقط سطح سرور.
تأیید برق و ظرفیت خنکسازی رک پیش از سفارش تجهیزات، از سناریوی پرهزینه رسیدن تجهیزاتی که اتاق واقعاً نمیتواند از آنها پشتیبانی کند، جلوگیری میکند.
پیش از تعیین مشخصات فنی واقعاً چه بپرسیم
- بزرگترین مدل (بر اساس تعداد پارامتر یا حجم حافظه موردنیاز) که این سیستم باید امروز و طی ۱ تا ۲ سال آینده اجرا کند، چیست؟
- بار کاری آموزش است، استنتاج، یا هر دو — و آیا این موضوع رده GPU مناسب را تغییر میدهد؟
- آیا زیرساخت برق و خنکسازی موجود اتاق سرور از تراکم هدف رک پشتیبانی میکند، یا این موضوع ابتدا باید ارزیابی شود؟
- الگوی بهرهبرداری واقعی چیست — سیستمی برای آزمایش گاهبهگاه اقتصاد بسیار متفاوتی نسبت به سیستمی دارد که بهطور مداوم استنتاج تولیدی اجرا میکند؟
جمعبندی
سؤالات سنتی خرید سرور (تعداد هسته، سرعت کلاک) برای بارهای کاری هوش مصنوعی در درجه دوم اهمیت قرار دارند. کار واقعی تعیین مشخصات فنی با حجم حافظه موردنیاز مدل، اینکه کار آموزش است یا استنتاج، و اینکه آیا فضای فیزیکی واقعاً میتواند از تراکم برق و خنکسازی موردنیاز تجهیزات پشتیبانی کند، آغاز میشود.
برای ملاحظات کلی تأمین سرور پیش از رسیدن به جزئیات مخصوص GPU، راهنمای تأمین سرور سازمانی ما را ببینید، یا مجموعه فعلی سختافزار IT و سرور ناد را مرور کنید.