سرور, سوئیچ شبکه, وبلاگ

شبکه AI در دیتاسنتر؛ پیش از خرید سرور و سوئیچ چه چیزهایی را بسنجیم؟

شبکه AI در دیتاسنتر با سرورهای پردازشی و سوئیچ شبکه

پاسخ کوتاه: شبکه AI در دیتاسنتر فقط با افزودن GPU آماده نمی‌شود. پیش از خرید سرور یا سوئیچ باید حجم ترافیک شرق به غرب، تاخیر، افزونگی، ظرفیت uplink، مدیریت‌پذیری و توان برق و خنک‌سازی را در یک طرح مشترک بسنجید. در غیر این صورت، پردازنده‌های گران‌قیمت در انتظار داده می‌مانند و توسعه بعدی شبکه با اختلال و هزینه بیشتر همراه می‌شود.

چرا شبکه AI در دیتاسنتر به یک پروژه مستقل تبدیل شده است؟

در بارهای سنتی، بخش بزرگی از ترافیک میان کاربر و برنامه جابه‌جا می‌شود. اما در آموزش و استقرار مدل‌های هوش مصنوعی، سرورها و شتاب‌دهنده‌ها پیوسته داده، پارامتر و خروجی میانی را با هم تبادل می‌کنند. این الگوی «شرق به غرب» باعث می‌شود ظرفیت و پایداری شبکه، مستقیماً بر زمان اجرای کار و استفاده واقعی از توان محاسباتی اثر بگذارد.

گزارش تازه Network World درباره روند سرمایه‌گذاری HPE در شبکه‌های AI نیز همین تغییر را برجسته می‌کند: شبکه، رایانش و ذخیره‌سازی دیگر اجزای جداگانه یک خرید نیستند؛ باید مانند یک سامانه واحد طراحی شوند. این خبر را نباید به معنای انتخاب قطعی یک برند دانست، اما برای مدیر شبکه یک پیام عملی دارد: قبل از نهایی کردن فهرست تجهیزات، مسیرهای ترافیک و نقطه‌های گلوگاه را مدل‌سازی کنید.

برای انتخاب سرور و سوئیچ چه معیارهایی مهم‌ترند؟

ابتدا نوع بار کاری را مشخص کنید: آموزش مدل، استنتاج، تحلیل ویدئو، جست‌وجوی برداری یا پردازش داده، الگوهای متفاوتی از شبکه می‌سازند. سپس برای هر خوشه، تعداد گره‌ها، کارت شبکه هر گره، سرعت پورت، oversubscription قابل قبول و رشد 12 تا 24 ماه آینده را روی کاغذ بیاورید.

  • ظرفیت عملی: فقط سرعت یک پورت مهم نیست؛ مجموع uplink، نسبت تراکم و توان عبور ترافیک سوئیچ باید با تعداد سرورها هم‌خوان باشد.
  • تاخیر و ازدحام: برای ترافیک‌های حساس، صف‌بندی، کنترل ازدحام و پایداری latency را در سناریوی پرترافیک بررسی کنید؛ آزمایش کوتاه در ساعت خلوت کافی نیست.
  • افزونگی: خرابی یک لینک، ماژول یا سوئیچ نباید کل خوشه را متوقف کند. طراحی مسیر جایگزین و تست failover باید بخشی از تحویل پروژه باشد.
  • مدیریت و مشاهده‌پذیری: تله‌متری، لاگ، هشدار و امکان مقایسه عملکرد قبل و بعد از تغییر، زمان عیب‌یابی را کم می‌کند.

برای انتخاب سخت‌افزار، دسته سرور شبکه و قطعات مرتبط را در کنار نیاز پردازشی ببینید، نه جدا از شبکه. در لایه دسترسی و تجمیع نیز بررسی مدل‌ها و قابلیت‌های سوئیچ سیسکو می‌تواند نقطه شروع خوبی برای مقایسه سرعت پورت، uplink و امکانات مدیریتی باشد.

چک‌لیست استقرار AI در دیتاسنتر

1. از ترافیک واقعی شروع کنید

نام محصول یا تعداد GPU نباید مبنای اصلی طراحی باشد. نمونه داده، اندازه batch، تعداد کاربر هم‌زمان و نیازهای backup را استخراج کنید. اگر این داده‌ها آماده نیستند، دو سناریوی حداقل و رشد را بنویسید و سقف هرکدام را روشن کنید.

2. برق و خنک‌سازی را هم‌زمان با شبکه طراحی کنید

رک‌های AI معمولاً چگالی توان بیشتری دارند. افزایش تعداد سرور بدون بررسی UPS، PDU، ظرفیت رک، جریان هوا و دمای ورودی می‌تواند پایداری کل سرویس را کاهش دهد. ظرفیت شبکه عالی، جای توان و خنک‌سازی کافی را نمی‌گیرد.

3. تغییرات را قابل بازگشت کنید

پیش از تغییر firmware، سیاست QoS، VLAN یا مسیرهای routing، پیکربندی قبلی را ثبت و معیار بازگشت تعیین کنید. نگه‌داری نسخه پیکربندی، پنجره تغییر و تست پس از تغییر، برای محیطی که داده و سرویس هم‌زمان در حرکت‌اند ضروری است.

4. با یک پایلوت کوچک اعتبارسنجی کنید

پیش از توسعه سراسری، یک خوشه کوچک با ترافیک نزدیک به واقعیت بسازید. در پایلوت باید throughput، تاخیر، رفتار در قطع لینک و زمان بازیابی را اندازه‌گیری کنید. نتیجه پایلوت مبنای دقیق‌تری برای خرید مرحله بعد می‌دهد.

چه اشتباهاتی هزینه پروژه را بالا می‌برند؟

خرید سرور و سوئیچ از دو فهرست مستقل، انتخاب uplink فقط بر اساس قیمت اولیه، نادیده گرفتن مسیر بازگشت ترافیک و بی‌توجهی به مستندسازی، چهار خطای رایج‌اند. مشکل معمولاً روز اول دیده نمی‌شود؛ هنگام رشد بار، جابه‌جایی داده یا خرابی یک جزء ظاهر می‌شود. بنابراین بهتر است بودجه‌ای برای ظرفیت رزرو، ماژول‌های جایگزین و مانیتورینگ پیش‌بینی شود.

سوالات متداول

آیا برای هر پروژه AI به شبکه بسیار پرسرعت نیاز است؟

خیر. نیاز به سرعت به نوع بار، حجم داده، تعداد گره‌ها و حساسیت به تاخیر بستگی دارد. یک سرویس استنتاج کوچک با خوشه آموزش چندگرهی یکسان نیست.

آیا می‌توان ابتدا سرور خرید و بعداً شبکه را ارتقا داد؟

ممکن است، اما اگر تعداد پورت، جای uplink، توان رک یا مسیر کابل‌کشی از ابتدا دیده نشود، ارتقا می‌تواند با قطعی سرویس و هزینه دوباره‌کاری همراه شود.

جمع‌بندی

شبکه AI در دیتاسنتر یک قابلیت مجزا از سرور نیست؛ بخشی از عملکرد واقعی همان سرور است. طراحی مرحله‌ای، اندازه‌گیری ترافیک، افزونگی و مشاهده‌پذیری، تصمیم خرید را از یک فهرست کالا به یک معماری قابل توسعه تبدیل می‌کند.

منبع

Network World، مقاله HPE’s Rahim: Pace of change in the data center is “extraordinary” – مطالعه مقاله اصلی در Network World

دیدگاهتان را بنویسید