ناد توسعه پایدار درخواست استعلام
بازگشت به وبلاگ
تاریخ انتشار 2026/09/05 · NAD Trading

بارهای کاری هوش مصنوعی معنای «سرور» را تغییر می‌دهند: راهنمای عملی مشخصات فنی سرورهای GPU

مشخصات فنی یک سرور برای بارهای کاری هوش مصنوعی، فرآیندی متفاوت از مشخصات فنی برای پایگاه داده یا مجازی‌سازی است. گلوگاه‌ها متفاوت هستند، الزامات برق و خنک‌سازی متفاوت است، و خرید بر اساس مشخصات سنتی سرور (تعداد هسته، سرعت کلاک) منجر به سیستمی می‌شود که با کار واقعی هم‌خوانی ندارد. در ادامه آنچه باید پیش از خرید بررسی کنید آمده است.

گلوگاه معمولاً CPU نیست

برای بارهای کاری سنتی، تعداد هسته CPU و سرعت کلاک اغلب مشخصه اصلی هستند. برای آموزش و استنتاج هوش مصنوعی، CPU اغلب فقط یک هماهنگ‌کننده است — کار واقعی روی GPU انجام می‌شود، و سؤالات مهم بر همین اساس تغییر می‌کنند:

  • حافظه GPU (VRAM)، نه فقط تعداد GPU — مدلی که در حافظه یک GPU جا نمی‌شود، یا باید بین چند GPU تقسیم شود یا روی کارت‌هایی با VRAM بیشتر اجرا شود. این معمولاً اولین دیواری است که پروژه‌ها با آن برخورد می‌کنند، نه توان محاسباتی خام.
  • اتصال بین GPUها (Interconnect) — برای آموزش چند-GPU، نحوه ارتباط GPUها با یکدیگر (و اینکه آیا این اتصال گلوگاه است) اهمیت بیشتری نسبت به هر عدد خام در برگه مشخصات یک GPU دارد.
  • توان عملیاتی ذخیره‌سازی — بارهای کاری آموزش، مجموعه داده‌های بزرگ را به‌طور مکرر می‌خوانند؛ یک زیرسیستم ذخیره‌سازی که نتواند GPUها را تغذیه کند، محاسبات گران‌قیمت را بی‌کار نگه می‌دارد.

آموزش در برابر استنتاج: سیستم‌های متفاوت، اولویت‌های متفاوت

این دو اغلب به‌عنوان یک تصمیم خرید یکسان در نظر گرفته می‌شوند، اما نقطه بهینه متفاوتی دارند:

  • بارهای کاری آموزش: از نظر محاسبات و پهنای باند حافظه سنگین هستند، برای دوره‌های طولانی اجرا می‌شوند، و بیشترین سود را از GPUهای رده بالا با VRAM بیشتر و اتصالات سریع‌تر می‌برند — هزینه اولیه بالاتر است اما بی‌کاری، پرهزینه‌ترین حالت شکست است.
  • بارهای کاری استنتاج (اجرای مدلی که قبلاً آموزش دیده برای ارائه پیش‌بینی) معمولاً به‌ازای هر درخواست کم‌توقع‌تر هستند اما باید درخواست‌های همزمان را به‌طور کارآمد مدیریت کنند — در اینجا تعداد GPU و دسته‌بندی کارآمد اغلب مهم‌تر از داشتن قدرتمندترین کارت موجود است.

خرید تجهیزات رده آموزش برای یک استقرار خالص استنتاج، یک اشتباه رایج و پرهزینه در تعیین مشخصات بیش‌ازحد است.

برق و خنک‌سازی: بخشی که دست‌کم گرفته می‌شود

سرورهای GPU رده بالا به‌ازای هر واحد رک، برق قابل‌توجهی بیشتر از گره‌های محاسباتی سنتی مصرف می‌کنند، و این دو اثر جانبی دارد که به‌راحتی در بودجه‌بندی اولیه نادیده گرفته می‌شوند:

  • تأمین برق به رک — مدارهای برق دیتاسنتر یا اتاق سرور موجود که برای سرورهای سنتی طراحی شده‌اند، ممکن است بدون ارتقای برق از یک استقرار متراکم GPU پشتیبانی نکنند.
  • ظرفیت خنک‌سازی — خنک‌سازی هوایی که برای یک رک سنتی کافی بود، ممکن است با رک‌های متراکم از GPU همگام نباشد؛ خنک‌سازی مایع در مقیاس بزرگ به‌طور فزاینده رایج می‌شود، که یک تصمیم در سطح تأسیسات است، نه فقط سطح سرور.

تأیید برق و ظرفیت خنک‌سازی رک پیش از سفارش تجهیزات، از سناریوی پرهزینه رسیدن تجهیزاتی که اتاق واقعاً نمی‌تواند از آن‌ها پشتیبانی کند، جلوگیری می‌کند.

پیش از تعیین مشخصات فنی واقعاً چه بپرسیم

  • بزرگ‌ترین مدل (بر اساس تعداد پارامتر یا حجم حافظه موردنیاز) که این سیستم باید امروز و طی ۱ تا ۲ سال آینده اجرا کند، چیست؟
  • بار کاری آموزش است، استنتاج، یا هر دو — و آیا این موضوع رده GPU مناسب را تغییر می‌دهد؟
  • آیا زیرساخت برق و خنک‌سازی موجود اتاق سرور از تراکم هدف رک پشتیبانی می‌کند، یا این موضوع ابتدا باید ارزیابی شود؟
  • الگوی بهره‌برداری واقعی چیست — سیستمی برای آزمایش گاه‌به‌گاه اقتصاد بسیار متفاوتی نسبت به سیستمی دارد که به‌طور مداوم استنتاج تولیدی اجرا می‌کند؟

جمع‌بندی

سؤالات سنتی خرید سرور (تعداد هسته، سرعت کلاک) برای بارهای کاری هوش مصنوعی در درجه دوم اهمیت قرار دارند. کار واقعی تعیین مشخصات فنی با حجم حافظه موردنیاز مدل، اینکه کار آموزش است یا استنتاج، و اینکه آیا فضای فیزیکی واقعاً می‌تواند از تراکم برق و خنک‌سازی موردنیاز تجهیزات پشتیبانی کند، آغاز می‌شود.

برای ملاحظات کلی تأمین سرور پیش از رسیدن به جزئیات مخصوص GPU، راهنمای تأمین سرور سازمانی ما را ببینید، یا مجموعه فعلی سخت‌افزار IT و سرور ناد را مرور کنید.