صرف نظر و مشاهده محتوا

خنک‌سازی و برق در سرورهای GPU: از TDP تا Liquid Cooling و طراحی رک

در این مقاله از تسهیل گستر، واقعیت‌های برق و خنک‌سازی در سرورهای GPU را بررسی می‌کنیم؛ از پیک مصرف، انتخاب PSU با Headroom مناسب و مقایسه Air Cooling و Liquid Cooling تا جلوگیری از Throttling، طراحی رک و مانیتورینگ اتاق سرور.
8 مرداد 1405

چرا برق و خنک‌سازی در سرورهای GPU فقط یک موضوع سخت‌افزاری نیست؟

در بسیاری از پروژه‌های زیرساختی، وقتی صحبت از سرورهای GPU می‌شود، تمرکز اصلی معمولاً روی مدل GPU، تعداد کارت‌ها، ظرفیت حافظه، توان پردازشی، یا سرعت اجرای بارهای هوش مصنوعی و تحلیل داده قرار می‌گیرد. اما در عمل، مخصوصاً در مقیاس سازمانی و دیتاسنتری، مسئله اصلی فقط خرید یا نصب GPU نیست. آنچه موفقیت واقعی یک زیرساخت پردازشی را تعیین می‌کند، توان الکتریکی قابل اتکا و خنک‌سازی پایدار و مهندسی‌شده است.

در تسهیل گستر، نگاه به زیرساخت همیشه باید فراتر از مشخصات اسمی تجهیزات باشد. یک سرور GPU ممکن است روی کاغذ بسیار قدرتمند به نظر برسد، اما اگر منبع تغذیه برای پیک‌های مصرف آن درست انتخاب نشده باشد یا طراحی مسیر هوا در رک و اتاق سرور اصولی نباشد، نتیجه چیزی جز افت عملکرد، ناپایداری، خاموشی ناگهانی، کاهش عمر تجهیزات و افزایش هزینه‌های عملیاتی نخواهد بود.

به همین دلیل، در این مقاله تلاش می‌کنیم مسئله را نه از زاویه تبلیغاتی، بلکه از منظر واقعیت‌های دیتاسنتری بررسی کنیم؛ یعنی همان چیزهایی که هنگام راه‌اندازی، توسعه یا نگهداری سرورهای GPU در سازمان‌ها واقعاً دردسرساز می‌شوند. در این مسیر به این موضوعات می‌پردازیم:

  • چرا GPUها مصرفی یکنواخت ندارند و در لحظات خاص دچار پیک مصرف می‌شوند
  • چرا PSU باید Headroom داشته باشد و انتخاب مرزی، تصمیمی پرریسک است
  • تفاوت Air Cooling و Liquid Cooling در عمل چیست و هرکدام در چه سناریویی مناسب‌تر هستند
  • دما چگونه باعث Throttling می‌شود و این مسئله چه اثری بر پایداری پردازش و آموزش مدل‌ها دارد
  • در اتاق سرور، چه نکات عملی درباره چیدمان رک، مسیر هوا و مانیتورینگ باید رعایت شود

اگر قرار است سازمان شما روی بارهای مبتنی بر GPU مانند هوش مصنوعی، یادگیری ماشین، پردازش تصویر، شبیه‌سازی، تحلیل داده‌های سنگین یا محاسبات مهندسی سرمایه‌گذاری کند، این مقاله می‌تواند دیدی واقع‌بینانه برای طراحی بهتر زیرساخت در اختیارتان بگذارد.

چرا برق در سرورهای GPU مهم‌تر از چیزی است که معمولاً تصور می‌شود؟

چرا برق در سرورهای GPU مهم‌تر از چیزی است که معمولاً تصور می‌شود؟

در سرورهای سنتی، مصرف انرژی معمولاً تا حد زیادی قابل پیش‌بینی است. اما در سرورهای GPU، خصوصاً در زمان اجرای workloadهای سنگین، شرایط متفاوت است. GPUها بسته به نوع پردازش، الگوی دسترسی به حافظه، استفاده از هسته‌های پردازشی، ارتباطات بین‌کارت‌ها و رفتار نرم‌افزار، می‌توانند الگوی مصرفی بسیار پویایی داشته باشند.

این یعنی اگرچه مشخصات فنی یک GPU ممکن است عدد مشخصی را برای توان مصرفی معرفی کند، اما مصرف واقعی همیشه به همان عدد محدود نمی‌ماند. در نتیجه، طراحی برق برای چنین سرورهایی نباید صرفاً بر پایه یک عدد اسمی انجام شود.

TDP چیست و چرا کافی نیست؟

TDP معمولاً به‌عنوان شاخصی برای طراحی حرارتی شناخته می‌شود؛ یعنی عددی که به ما می‌گوید سیستم خنک‌کننده باید تقریباً چه میزان گرما را بتواند دفع کند. اما در بسیاری از تصمیم‌های خرید یا طراحی، TDP به اشتباه معادل «مصرف واقعی برق» در نظر گرفته می‌شود.

درحالی‌که در محیط‌های واقعی دیتاسنتری، TDP فقط نقطه شروع تحلیل است، نه پاسخ نهایی.

چند دلیل برای این موضوع وجود دارد:

  • GPUها در زمان اجرای برخی workloadها دچار نوسان مصرف می‌شوند
  • بارهای آموزشی و پردازش‌های موازی می‌توانند دوره‌هایی از فشار بسیار بالا ایجاد کنند
  • مصرف کل سرور فقط محدود به GPU نیست و شامل CPU، حافظه، ذخیره‌سازی، فن‌ها، کارت شبکه و مادربرد نیز می‌شود
  • در برخی معماری‌ها، رفتار Boost و مدیریت توان باعث می‌شود مصرف در بازه‌هایی از مقدار اسمی فراتر برود

در نتیجه، اگر کسی برای طراحی برق فقط تعداد GPU را در TDP هرکدام ضرب کند، احتمال زیادی وجود دارد که در مرحله بهره‌برداری با مشکل مواجه شود.

Transient Power Spikes

پیک مصرف در GPUها: واقعیتی که نباید نادیده گرفته شود

یکی از مهم‌ترین تفاوت‌های سرور GPU با بسیاری از سرورهای عمومی، وجود Transient Power Spikes یا همان پیک‌های لحظه‌ای مصرف است. این پیک‌ها معمولاً زمانی رخ می‌دهند که GPU از یک فاز پردازشی به فاز دیگر وارد می‌شود یا ترکیب خاصی از پردازش، دسترسی به حافظه و ارتباطات داخلی را تجربه می‌کند.

این پیک‌ها ممکن است کوتاه‌مدت باشند، اما اثر آن‌ها کوتاه‌مدت نیست. اگر منبع تغذیه برای چنین شرایطی آماده نباشد، احتمال بروز این مشکلات وجود دارد:

  • افت ولتاژ لحظه‌ای
  • ناپایداری در عملکرد GPU
  • کرش نرم‌افزارهای محاسباتی
  • ریست شدن ناگهانی سرور
  • خطا در ارتباطات بین GPUها
  • توقف آموزش یا از دست رفتن اجرای چندساعته یا چندروزه

در دنیای دیتاسنتر، چنین اتفاقاتی فقط یک اختلال ساده نیستند. هر بار توقف پردازش می‌تواند به معنی از دست رفتن زمان، انرژی، هزینه پردازش و اعتماد تیم فنی باشد.

چرا PSU باید Headroom داشته باشد؟

Headroom یعنی منبع تغذیه را دقیقاً لب مرز مصرف انتخاب نکنیم. در زیرساخت‌های GPU، این موضوع از حالت توصیه خارج می‌شود و به یک اصل طراحی تبدیل می‌شود.

وقتی PSU بدون حاشیه اطمینان انتخاب شود، سیستم در شرایطی که همه چیز ایده‌آل است شاید کار کند، اما دیتاسنتر محیطی ایده‌آل و ثابت نیست. شرایط واقعی شامل این موارد است:

  • افزایش دمای محیط
  • بارهای ناگهانی و پیک مصرف
  • تغییر رفتار workloadها در زمان‌های مختلف
  • استهلاک تدریجی تجهیزات
  • نیاز به تحمل خرابی یکی از پاورها در ساختار Redundant
  • افزایش مصرف ناشی از فن‌ها در دمای بالاتر

بنابراین، Headroom به این دلیل ضروری است که سیستم فقط در حالت عادی پایدار نباشد، بلکه در شرایط غیرایده‌آل هم عملکرد قابل اتکا داشته باشد.

Liquid_Cooling

Headroom چه مزیت‌هایی ایجاد می‌کند؟

وجود Headroom مناسب در PSU باعث می‌شود:

  • سرور در مواجهه با پیک‌های لحظه‌ای پایدار بماند
  • احتمال خاموشی ناگهانی کاهش پیدا کند
  • عملکرد پاورها در محدوده مناسب‌تری از راندمان انجام شود
  • در سناریوهای Redundancy، یک PSU بتواند بار را موقتاً پوشش دهد
  • عمر تجهیزات افزایش پیدا کند
  • زیرساخت برای توسعه آینده انعطاف بیشتری داشته باشد

در عمل، بسیاری از مشکلاتی که در پروژه‌های GPU به «ناسازگاری نرم‌افزاری» یا «ضعف سخت‌افزار» نسبت داده می‌شوند، ریشه در انتخاب نادرست پاور یا طراحی ضعیف توزیع توان دارند.

ارتباط مستقیم برق و خنک‌سازی در طراحی سرور GPU

در سرورهای GPU، برق و خنک‌سازی دو موضوع مجزا نیستند. هر وات انرژی مصرف‌شده، در نهایت تقریباً به گرما تبدیل می‌شود و این گرما باید از سیستم خارج شود. بنابراین، اگر مصرف برق بالا می‌رود، نیاز به خنک‌سازی نیز به همان نسبت افزایش پیدا می‌کند.

این ارتباط مستقیم چند نتیجه مهم دارد:

  • افزایش توان مصرفی یعنی افزایش بار حرارتی
  • افزایش دما باعث افزایش دور فن‌ها می‌شود
  • افزایش دور فن‌ها مصرف برق و نویز را بالا می‌برد
  • دمای بالا می‌تواند باعث افت فرکانس GPU شود
  • افت فرکانس به معنی طولانی‌تر شدن زمان پردازش است
  • طولانی‌تر شدن پردازش می‌تواند انرژی کل مصرفی پروژه را بیشتر کند

به بیان ساده، طراحی ضعیف برق و کولینگ فقط ریسک خرابی را بالا نمی‌برد، بلکه روی بهره‌وری انرژی، زمان اجرای پروژه‌ها و هزینه نهایی سازمان هم اثر مستقیم دارد.

در همین زمینه، اگر بخواهید معماری زیرساخت را عمیق‌تر بررسی کنید، می‌توانید از بخش سیستم خنک‌کننده و منبع تغذیه به این مقاله لینک بدهید تا پیوستگی محتوایی در بلاگ حفظ شود.

Air Cooling یا Liquid Cooling؟

Air Cooling یا Liquid Cooling؟ تصمیمی که باید بر اساس واقعیت گرفته شود

Air Cooling: انتخاب رایج، قابل اعتماد و اقتصادی‌تر

خنک‌سازی با هوا همچنان متداول‌ترین روش در بسیاری از دیتاسنترهاست. دلیل آن هم روشن است: سادگی بیشتر، هزینه اولیه کمتر، نگهداری آسان‌تر و ریسک عملیاتی پایین‌تر.

در بسیاری از سناریوها، Air Cooling کاملاً پاسخگوست؛ به‌ویژه زمانی که:

  • تعداد GPUها در هر نود محدود و کنترل‌شده است
  • چگالی حرارتی رک‌ها از حد بحرانی عبور نکرده است
  • مسیر هوای سرد و گرم در اتاق سرور اصولی طراحی شده است
  • رک‌ها به‌درستی چیده شده‌اند
  • مدیریت کابل و انسداد مسیر هوا به‌خوبی انجام شده است

مزایای Air Cooling:

  • پیاده‌سازی ساده‌تر
  • هزینه اولیه پایین‌تر
  • نگهداری آسان‌تر
  • عدم نیاز به مدار مایع و تجهیزات وابسته
  • مناسب برای بسیاری از اتاق‌های سرور سازمانی

اما این روش محدودیت‌های خود را نیز دارد. هرچه چگالی توان بیشتر شود، هوا در انتقال گرما با محدودیت بیشتری روبه‌رو می‌شود. در این شرایط، افزایش صرفِ فن یا سرمایش محیط لزوماً راه‌حل بهینه‌ای نیست.

Liquid Cooling: راهکار پیشرفته برای چگالی بالا و پایداری بیشتر

Liquid Cooling زمانی اهمیت پیدا می‌کند که بار حرارتی به حدی بالا می‌رود که خنک‌سازی با هوا دیگر با راندمان مناسب جواب نمی‌دهد یا هزینه و پیچیدگی Air Cooling بیش از حد افزایش می‌یابد.

در این روش، مایع به دلیل ظرفیت بهتر در انتقال حرارت، گرما را مؤثرتر از قطعات می‌گیرد و از سیستم خارج می‌کند. این موضوع در سرورهای GPU پرچگالی می‌تواند مزایای مهمی ایجاد کند:

  • کنترل بهتر دما
  • کاهش احتمال throttling
  • کاهش نیاز به جریان هوای بسیار شدید
  • کاهش مصرف فن
  • امکان افزایش چگالی توان در رک

با این حال، Liquid Cooling یک انتخاب صرفاً فناورانه نیست؛ بلکه یک تصمیم زیرساختی است. چون اجرای موفق آن به این عوامل وابسته است:

  • کیفیت طراحی و نصب
  • وجود زیرساخت مناسب در ساختمان یا دیتاسنتر
  • سیستم پایش نشتی و نگهداری
  • توان تیم فنی برای بهره‌برداری و سرویس
  • برنامه‌ریزی دقیق برای تعمیرات و توسعه

در نتیجه، Liquid Cooling زمانی بهترین تصمیم است که سازمان از نظر مقیاس، بار پردازشی و بلوغ عملیاتی واقعاً به آن نیاز داشته باشد.

در چه سناریویی Air Cooling مناسب‌تر است؟

در چه سناریویی Air Cooling مناسب‌تر است؟

Air Cooling معمولاً در این شرایط انتخاب منطقی‌تری است:

  • پروژه هنوز در فاز آغازین یا توسعه تدریجی است
  • رک‌ها تراکم حرارتی خیلی بالایی ندارند
  • تیم زیرساخت به دنبال راهکاری کم‌ریسک‌تر و ساده‌تر است
  • هزینه سرمایه‌گذاری اولیه اهمیت بالایی دارد
  • نگهداری و تعمیر سریع اولویت دارد
  • اتاق سرور از نظر راهروی سرد و گرم وضعیت قابل قبولی دارد

برای بسیاری از سازمان‌ها، اگر طراحی اتاق سرور اصولی باشد، Air Cooling می‌تواند سال‌ها بدون مشکل جدی پاسخگو باشد.

در چه سناریویی Liquid Cooling انتخاب بهتری است؟

در چه سناریویی Liquid Cooling انتخاب بهتری است؟

Liquid Cooling بیشتر در این موقعیت‌ها توجیه دارد:

  • چگالی GPU در هر رک بالاست
  • بارهای پردازشی سنگین و مداوم اجرا می‌شوند
  • کوچک‌ترین افت عملکرد روی زمان و هزینه پروژه اثر زیادی دارد
  • دمای پایدار برای آموزش‌های طولانی حیاتی است
  • سازمان به دنبال استفاده حداکثری از فضای رک است
  • زیرساخت دیتاسنتری برای این مدل از خنک‌سازی آمادگی دارد

به‌خصوص در محیط‌هایی که چندین نود GPU به‌صورت پیوسته و با بار بالا کار می‌کنند، Liquid Cooling می‌تواند از یک گزینه خاص به یک ضرورت عملیاتی تبدیل شود.

دما چگونه باعث Throttling می‌شود؟

یکی از مهم‌ترین پیامدهای خنک‌سازی نامناسب، Throttling است. Throttling یعنی سیستم برای جلوگیری از افزایش بیش از حد دما یا عبور از محدودیت توان، فرکانس و گاهی عملکرد قطعات را کاهش می‌دهد.

در ظاهر، سیستم همچنان روشن است و پردازش ادامه دارد، اما واقعیت این است که کار با سرعت مطلوب انجام نمی‌شود. در سرورهای GPU، این اتفاق می‌تواند اثرات جدی داشته باشد:

  • کاهش throughput
  • افزایش زمان هر iteration یا batch
  • افزایش زمان کل آموزش مدل
  • برهم خوردن توازن در پردازش‌های چند GPU
  • کاهش راندمان استفاده از منابع

در بارهای توزیع‌شده، حتی اگر فقط یک GPU زودتر وارد throttling شود، ممکن است کل فرآیند هماهنگ‌سازی کند شود. به همین دلیل، ثبات دمایی در سرورهای GPU فقط برای سلامت سخت‌افزار مهم نیست، بلکه مستقیماً روی ارزش تجاری زیرساخت اثر می‌گذارد.

پروژه‌های AI و HPC

پایداری آموزش مدل‌ها چرا به مدیریت دما وابسته است؟

در پروژه‌های AI و HPC، آموزش مدل‌ها اغلب چندساعته یا چندروزه هستند. در چنین شرایطی، مسئله فقط دمای لحظه‌ای نیست؛ مهم‌تر از آن، پایداری دما در طول زمان است.

ممکن است سرور در دقایق اول عملکرد خوبی داشته باشد، اما پس از چند ساعت به‌دلیل تجمع گرما، ضعف airflow، recirculation یا فشار بیش از حد روی فن‌ها، وارد محدوده‌ای شود که:

  • کلاک GPU افت کند
  • خطاهای نرم‌افزاری بیشتر شوند
  • ارتباط بین GPUها ناپایدار شود
  • اجرای job متوقف گردد

برای همین، در طراحی زیرساخت GPU باید به «دوام عملکرد» فکر کرد، نه فقط «روشن شدن سیستم».

نکات عملی برای اتاق سرور: از مسیر هوا تا چیدمان رک

مسیر هوا را مهندسی کنید، نه اینکه فقط سرمایش را بیشتر کنید

بسیاری از مشکلات گرمایی در اتاق سرور ناشی از کمبود سرمایش نیست، بلکه ناشی از توزیع نامناسب هواست. اگر هوای گرم و سرد با هم مخلوط شوند، حتی سیستم سرمایشی قوی هم راندمان مطلوب نخواهد داشت.

چند اصل مهم:

  • هوای سرد باید به‌صورت مؤثر به ورودی سرورها برسد
  • هوای گرم باید بدون بازگشت به ورودی‌ها از محیط خارج شود
  • جلوی رک‌ها باید در راهروی سرد قرار بگیرد
  • پشت رک‌ها باید به راهروی گرم باز شود
  • مسیرهای بازگشت هوای گرم نباید باعث recirculation شوند

در بسیاری از مواقع، اصلاح همین موارد ساده می‌تواند اثر بیشتری از افزایش ظرفیت سرمایش داشته باشد.

چیدمان رک

چیدمان رک در سرورهای GPU اهمیت ویژه دارد

رک فقط محل نصب تجهیزات نیست. در زیرساخت‌های GPU، نحوه چیدمان می‌تواند مستقیماً روی دما و پایداری اثر بگذارد.

نکات مهم در چیدمان رک:

  • تمرکز بیش از حد نودهای پرمصرف در یک رک بدون بررسی ظرفیت حرارتی ریسک‌زاست
  • کابل‌کشی باید طوری انجام شود که مانع جریان هوا نشود
  • فضای عبور هوا در جلو و پشت تجهیزات باید حفظ شود
  • باید به نقاط داغ احتمالی در ارتفاع‌های مختلف رک توجه شود
  • توزیع بار روی PDUها و خطوط برق رک باید متعادل باشد

در بسیاری از پروژه‌ها، مشکل از کیفیت خود سرور نیست، بلکه از نحوه استقرار آن در رک و اتاق سرور ناشی می‌شود.

مانیتورینگ: مهم‌ترین ابزار پیشگیری از اختلال

در محیط‌های GPU، مانیتورینگ یک قابلیت لوکس نیست؛ یک ضرورت است. بدون مانیتورینگ، شما معمولاً زمانی متوجه مشکل می‌شوید که job متوقف شده، سرور throttling کرده یا دما از حد مجاز عبور کرده است.

چه چیزهایی باید مانیتور شوند؟

در سطح اتاق و رک:

  • دمای ورودی رک
  • دمای خروجی رک
  • وضعیت راهروی سرد و گرم
  • عملکرد سیستم سرمایش محیط

در سطح سرور:

  • دمای GPU
  • دمای CPU
  • سرعت فن‌ها
  • توان مصرفی لحظه‌ای
  • وضعیت PSU
  • هشدارهای BMC یا IPMI

در سطح نرم‌افزار و workload:

  • throughput پردازش
  • زمان هر iteration
  • خطاهای پردازشی یا ارتباطی
  • رخدادهای throttling
  • نوسان غیرعادی عملکرد در طول زمان

هدف از مانیتورینگ این است که قبل از تبدیل شدن یک ناهنجاری کوچک به اختلال عملیاتی، علت را شناسایی و اصلاح کنید.

تست بار قبل از بهره‌برداری واقعی را جدی بگیرید

تست بار قبل از بهره‌برداری واقعی را جدی بگیرید

یکی از خطاهای رایج این است که اگر سرور روشن شد و چند تست کوتاه را گذراند، آماده بهره‌برداری فرض شود. اما بارهای واقعی GPU معمولاً با تست‌های کوتاه آشکار نمی‌شوند.

بهتر است پیش از ورود به فاز تولید:

  • تست بار طولانی‌مدت اجرا شود
  • مصرف برق در شرایط مختلف پایش شود
  • دمای GPUها و رک در چند ساعت متوالی بررسی شود
  • رفتار فن‌ها و PSUها تحت فشار سنجیده شود
  • عملکرد workload واقعی یا نزدیک به واقعیت تحلیل شود

این مرحله می‌تواند ایرادهایی را آشکار کند که در تست‌های سطحی اصلاً دیده نمی‌شوند.

نگاه تسهیل گستر به طراحی زیرساخت GPU

در تسهیل گستر، هر تصمیم زیرساختی زمانی ارزشمند است که علاوه بر توان فنی، از نظر پایداری عملیاتی، هزینه نگهداری، توسعه‌پذیری و ریسک کسب‌وکار نیز منطقی باشد. در مورد سرورهای GPU، این نگاه به‌خوبی نشان می‌دهد که انتخاب GPU بدون توجه به برق، کولینگ، رک و مانیتورینگ، تصمیمی ناقص است.

سازمان‌ها معمولاً زمانی به این واقعیت پی می‌برند که یا با افت عملکرد روبه‌رو شده‌اند، یا هزینه‌های انرژی و اختلالات عملیاتی از حد انتظار فراتر رفته است. درحالی‌که با طراحی اصولی از ابتدا، می‌توان بسیاری از این مشکلات را پیشگیری کرد.

جمع‌بندی

در سرورهای GPU، قدرت پردازشی فقط بخشی از معادله است. بخش دیگر، که در عمل تعیین‌کننده پایداری و بازده واقعی سیستم است، به طراحی درست برق و خنک‌سازی برمی‌گردد. GPUها به‌دلیل ماهیت workloadهای خود، مصرفی یکنواخت ندارند و در لحظات خاص می‌توانند دچار پیک مصرف شوند. به همین دلیل، PSU باید با Headroom مناسب انتخاب شود تا سرور در شرایط واقعی و نه فقط روی کاغذ پایدار بماند.

از سوی دیگر، مدیریت دما در این سرورها فقط برای حفظ سلامت سخت‌افزار نیست؛ بلکه مستقیماً روی سرعت پردازش، جلوگیری از throttling، پایداری آموزش مدل‌ها و هزینه نهایی عملیات اثر می‌گذارد. انتخاب بین Air Cooling و Liquid Cooling نیز باید براساس سناریوی واقعی سازمان، چگالی رک، بودجه، توان تیم عملیاتی و برنامه توسعه زیرساخت انجام شود.

اگر سازمانی قصد دارد از GPU در مقیاس جدی استفاده کند، باید برق، کولینگ، طراحی رک، مسیر هوا و مانیتورینگ را به‌عنوان یک سیستم یکپارچه ببیند. این همان نقطه‌ای است که زیرساخت از یک خرید سخت‌افزاری ساده، به یک سرمایه‌گذاری مهندسی‌شده و پایدار تبدیل می‌شود.

مقاله پیشنهادی: معرفی انواع HTTP Status code

FAQ

آیا TDP برای انتخاب منبع تغذیه کافی است؟

خیر. TDP فقط یک شاخص مرجع برای طراحی حرارتی است و مصرف واقعی GPU می‌تواند بسته به workload، رفتار Boost و سایر اجزای سرور متفاوت باشد. برای انتخاب PSU باید پیک مصرف، مصرف سایر قطعات و Headroom نیز در نظر گرفته شود.

چرا Headroom در PSU این‌قدر مهم است؟

چون سرور GPU مصرفی کاملاً یکنواخت ندارد. در زمان پیک‌های لحظه‌ای، اگر PSU نزدیک سقف ظرفیت خود کار کند، احتمال افت ولتاژ، ناپایداری یا خاموشی ناگهانی بیشتر می‌شود.

Air Cooling برای سرور GPU مناسب است یا نه؟

در بسیاری از سناریوها بله. اگر چگالی حرارتی خیلی بالا نباشد و اتاق سرور از نظر مسیر هوا، راهروی سرد و گرم و چیدمان رک درست طراحی شده باشد، Air Cooling می‌تواند کاملاً مؤثر و قابل اعتماد باشد.

Liquid Cooling چه زمانی توصیه می‌شود؟

زمانی که بار حرارتی بالا باشد، رک‌ها چگالی توان زیادی داشته باشند، پایداری دمایی بسیار مهم باشد یا Air Cooling دیگر نتواند با راندمان مناسب پاسخگو باشد.

throttling چه اثری روی پردازش‌های GPU دارد؟

throttling باعث کاهش فرکانس و افت عملکرد GPU می‌شود. در نتیجه، سرعت پردازش کم می‌شود، زمان آموزش مدل‌ها بالا می‌رود و در پردازش‌های چند GPU، کل workload ممکن است کندتر شود.

در اتاق سرور چه چیزهایی را باید مانیتور کنیم؟

حداقل باید دمای ورودی رک، دمای GPU و CPU، وضعیت فن‌ها، مصرف برق، سلامت PSUها و شاخص‌های عملکردی workload را مانیتور کنید تا بتوانید قبل از بروز اختلال، مشکل را تشخیص دهید.

آیا افزایش سرمایش همیشه مشکل دما را حل می‌کند؟

نه لزوماً. در بسیاری از موارد، مشکل اصلی از طراحی نادرست airflow، اختلاط هوای گرم و سرد، یا چیدمان نامناسب رک‌هاست. ابتدا باید مسیر هوا اصلاح شود، سپس در صورت نیاز ظرفیت سرمایش افزایش یابد.

اگر نیازمند مشاوره، تحلیل و دموی تمام امکانات سازمان‌یار (نسخه بومی‌سازی شده Odoo ERP) هستید، می‌توانید به رایگان در جلسه‌ای آنلاین با ما همراه باشید.

وارد حساب کاربری شوید تا بتوانید نظر خود را ثبت کنید
آموزش کامل حذف تبلیغات آپارات و یوتیوب با افزونه AdGuard | نصب و پیکربندی گام‌به‌گام
از تبلیغات ابتدای ویدیوهای آپارات کلافه شده‌اید؟ در این راهنمای جامع، نحوه نصب و تنظیم افزونه AdGuard AdBlocker را برای حذف دائمی تبلیغات آزاردهنده در تمامی پلتفرم‌ها آموزش می‌دهیم.