شبکه AI در دیتاسنتر؛ پیش از خرید سرور و سوئیچ چه چیزهایی را بسنجیم؟

پاسخ کوتاه: شبکه AI در دیتاسنتر فقط با افزودن GPU آماده نمیشود. پیش از خرید سرور یا سوئیچ باید حجم ترافیک شرق به غرب، تاخیر، افزونگی، ظرفیت uplink، مدیریتپذیری و توان برق و خنکسازی را در یک طرح مشترک بسنجید. در غیر این صورت، پردازندههای گرانقیمت در انتظار داده میمانند و توسعه بعدی شبکه با اختلال و هزینه بیشتر همراه میشود.
چرا شبکه AI در دیتاسنتر به یک پروژه مستقل تبدیل شده است؟
در بارهای سنتی، بخش بزرگی از ترافیک میان کاربر و برنامه جابهجا میشود. اما در آموزش و استقرار مدلهای هوش مصنوعی، سرورها و شتابدهندهها پیوسته داده، پارامتر و خروجی میانی را با هم تبادل میکنند. این الگوی «شرق به غرب» باعث میشود ظرفیت و پایداری شبکه، مستقیماً بر زمان اجرای کار و استفاده واقعی از توان محاسباتی اثر بگذارد.
گزارش تازه Network World درباره روند سرمایهگذاری HPE در شبکههای AI نیز همین تغییر را برجسته میکند: شبکه، رایانش و ذخیرهسازی دیگر اجزای جداگانه یک خرید نیستند؛ باید مانند یک سامانه واحد طراحی شوند. این خبر را نباید به معنای انتخاب قطعی یک برند دانست، اما برای مدیر شبکه یک پیام عملی دارد: قبل از نهایی کردن فهرست تجهیزات، مسیرهای ترافیک و نقطههای گلوگاه را مدلسازی کنید.
برای انتخاب سرور و سوئیچ چه معیارهایی مهمترند؟
ابتدا نوع بار کاری را مشخص کنید: آموزش مدل، استنتاج، تحلیل ویدئو، جستوجوی برداری یا پردازش داده، الگوهای متفاوتی از شبکه میسازند. سپس برای هر خوشه، تعداد گرهها، کارت شبکه هر گره، سرعت پورت، oversubscription قابل قبول و رشد 12 تا 24 ماه آینده را روی کاغذ بیاورید.
- ظرفیت عملی: فقط سرعت یک پورت مهم نیست؛ مجموع uplink، نسبت تراکم و توان عبور ترافیک سوئیچ باید با تعداد سرورها همخوان باشد.
- تاخیر و ازدحام: برای ترافیکهای حساس، صفبندی، کنترل ازدحام و پایداری latency را در سناریوی پرترافیک بررسی کنید؛ آزمایش کوتاه در ساعت خلوت کافی نیست.
- افزونگی: خرابی یک لینک، ماژول یا سوئیچ نباید کل خوشه را متوقف کند. طراحی مسیر جایگزین و تست failover باید بخشی از تحویل پروژه باشد.
- مدیریت و مشاهدهپذیری: تلهمتری، لاگ، هشدار و امکان مقایسه عملکرد قبل و بعد از تغییر، زمان عیبیابی را کم میکند.
برای انتخاب سختافزار، دسته سرور شبکه و قطعات مرتبط را در کنار نیاز پردازشی ببینید، نه جدا از شبکه. در لایه دسترسی و تجمیع نیز بررسی مدلها و قابلیتهای سوئیچ سیسکو میتواند نقطه شروع خوبی برای مقایسه سرعت پورت، uplink و امکانات مدیریتی باشد.
چکلیست استقرار AI در دیتاسنتر
1. از ترافیک واقعی شروع کنید
نام محصول یا تعداد GPU نباید مبنای اصلی طراحی باشد. نمونه داده، اندازه batch، تعداد کاربر همزمان و نیازهای backup را استخراج کنید. اگر این دادهها آماده نیستند، دو سناریوی حداقل و رشد را بنویسید و سقف هرکدام را روشن کنید.
2. برق و خنکسازی را همزمان با شبکه طراحی کنید
رکهای AI معمولاً چگالی توان بیشتری دارند. افزایش تعداد سرور بدون بررسی UPS، PDU، ظرفیت رک، جریان هوا و دمای ورودی میتواند پایداری کل سرویس را کاهش دهد. ظرفیت شبکه عالی، جای توان و خنکسازی کافی را نمیگیرد.
3. تغییرات را قابل بازگشت کنید
پیش از تغییر firmware، سیاست QoS، VLAN یا مسیرهای routing، پیکربندی قبلی را ثبت و معیار بازگشت تعیین کنید. نگهداری نسخه پیکربندی، پنجره تغییر و تست پس از تغییر، برای محیطی که داده و سرویس همزمان در حرکتاند ضروری است.
4. با یک پایلوت کوچک اعتبارسنجی کنید
پیش از توسعه سراسری، یک خوشه کوچک با ترافیک نزدیک به واقعیت بسازید. در پایلوت باید throughput، تاخیر، رفتار در قطع لینک و زمان بازیابی را اندازهگیری کنید. نتیجه پایلوت مبنای دقیقتری برای خرید مرحله بعد میدهد.
چه اشتباهاتی هزینه پروژه را بالا میبرند؟
خرید سرور و سوئیچ از دو فهرست مستقل، انتخاب uplink فقط بر اساس قیمت اولیه، نادیده گرفتن مسیر بازگشت ترافیک و بیتوجهی به مستندسازی، چهار خطای رایجاند. مشکل معمولاً روز اول دیده نمیشود؛ هنگام رشد بار، جابهجایی داده یا خرابی یک جزء ظاهر میشود. بنابراین بهتر است بودجهای برای ظرفیت رزرو، ماژولهای جایگزین و مانیتورینگ پیشبینی شود.
سوالات متداول
آیا برای هر پروژه AI به شبکه بسیار پرسرعت نیاز است؟
خیر. نیاز به سرعت به نوع بار، حجم داده، تعداد گرهها و حساسیت به تاخیر بستگی دارد. یک سرویس استنتاج کوچک با خوشه آموزش چندگرهی یکسان نیست.
آیا میتوان ابتدا سرور خرید و بعداً شبکه را ارتقا داد؟
ممکن است، اما اگر تعداد پورت، جای uplink، توان رک یا مسیر کابلکشی از ابتدا دیده نشود، ارتقا میتواند با قطعی سرویس و هزینه دوبارهکاری همراه شود.
جمعبندی
شبکه AI در دیتاسنتر یک قابلیت مجزا از سرور نیست؛ بخشی از عملکرد واقعی همان سرور است. طراحی مرحلهای، اندازهگیری ترافیک، افزونگی و مشاهدهپذیری، تصمیم خرید را از یک فهرست کالا به یک معماری قابل توسعه تبدیل میکند.
منبع
Network World، مقاله HPE’s Rahim: Pace of change in the data center is “extraordinary” – مطالعه مقاله اصلی در Network World



رک شبکه