شبکه دیتاسنتر هوش مصنوعی؛ HPE چه تغییری را پیشبینی میکند؟

پاسخ کوتاه: شبکه دیتاسنتر هوش مصنوعی باید برای ترافیک سنگین شرقبهغرب، تأخیر کم و توسعه سریع خوشههای پردازشی طراحی شود. افزودن GPU یا سرور قدرتمند بدون ظرفیت کافی در سوئیچ، لینک، مسیریابی، برق و خنکسازی میتواند بخش مهمی از سرمایهگذاری را کماثر کند.
شبکه دیتاسنتر هوش مصنوعی چرا با شبکه سنتی تفاوت دارد؟
در بسیاری از شبکههای سازمانی، بخش بزرگی از ترافیک میان کاربران و سرویسهای مرکزی جابهجا میشود. در خوشههای هوش مصنوعی، سرورها و شتابدهندهها باید حجم زیادی از داده را با یکدیگر مبادله کنند؛ بنابراین ترافیک شرقبهغرب، رفتار انفجاری بار، تأخیر و افت بسته اهمیت بیشتری پیدا میکند. اگر لینکهای بالادستی یا معماری Leaf-Spine برای بار واقعی اندازهگذاری نشده باشند، پردازندههای گرانقیمت بخشی از زمان خود را در انتظار داده میگذرانند.
این تفاوت به معنی خرید خودکار سریعترین تجهیزات بازار نیست. معماری درست از شناخت بار کاری آغاز میشود: آموزش مدل، استنتاج، تحلیل داده یا ذخیرهسازی توزیعشده هرکدام الگوی ترافیکی متفاوتی دارند. اندازه خوشه، نسبت اشتراک پهنای باند، فاصله میان رکها و امکان رشد نیز باید پیش از انتخاب تجهیزات مشخص شوند.
پیشبینی HPE درباره رشد شبکه دیتاسنتر هوش مصنوعی چیست؟
Network World در گفتوگویی با فیل موترام، مدیر شبکه HPE، گزارش کرده است که این شرکت انتظار دارد سفارشهای تجمعی شبکه هوش مصنوعی در سال مالی ۲۰۲۶ از ۳ میلیارد دلار عبور کند. HPE همچنین برای کسبوکار شبکه دیتاسنتر خود تا سال مالی ۲۰۲۹ رشد مرکب سالانه حدود ۵۰ درصد را پیشبینی کرده است. این ارقام برآورد خود شرکت هستند، نه تضمین رشد کل بازار یا نتیجه قطعی برای هر پروژه.
پیام عملی این پیشبینی برای مدیر شبکه روشن است: شبکه دیگر بخش فرعی پروژه هوش مصنوعی نیست. طراحی شبکه باید همزمان با انتخاب سرور، ذخیرهساز و شتابدهنده انجام شود. اگر شبکه پس از خرید سختافزار محاسباتی بررسی شود، اصلاح توپولوژی، کابلکشی یا ظرفیت پورت میتواند هزینه و زمان بیشتری تحمیل کند.
ادغام HPE و Juniper چه تغییری در معماری ایجاد میکند؟
HPE پس از ادغام با Juniper Networks تلاش میکند رایانش، خنکسازی و شبکه را در طراحی یکپارچهتری قرار دهد. در گزارش Network World سه لایه ارتباطی مطرح میشود: ارتباط بسیار نزدیک درون سامانه، ارتباط میان سرورها و شتابدهندههای یک خوشه، و مسیریابی میان خوشههایی که ممکن است در ساختمانها یا مناطق متفاوت قرار داشته باشند.
در نمونه AMD Helios، HPE و Juniper یک سوئیچ اختصاصی مبتنی بر تراشه Broadcom Tomahawk 6 با ظرفیت اسمی ۱۰۲٫۴ ترابیتبرثانیه معرفی کردهاند و از UALoE برای ارتباطات مقیاسبالا نام بردهاند. این عدد مربوط به یک معماری و پیکربندی مشخص است و نباید به همه سوئیچها یا پروژهها تعمیم داده شود. سازمان باید سازگاری کارت شبکه، کابل و ماژول نوری، سیستمعامل شبکه، ابزار پایش و استانداردهای مورد استفاده را در همان راهکار پیشنهادی بررسی کند.
مدیر شبکه ایرانی پیش از خرید چه معیارهایی را بررسی کند؟
۱. بار کاری و مسیر واقعی داده را اندازهگیری کنید
مشخص کنید داده از کجا وارد میشود، میان کدام گرهها جابهجا میشود و چه بخشی از پردازش به ذخیرهساز وابسته است. میانگین پهنای باند به تنهایی کافی نیست؛ اوج مصرف، تأخیر، افت بسته و مدت اشباع نیز باید ثبت شوند. برای پروژهای که هنوز اجرا نشده است، از یک پایلوت محدود یا دادههای بار کاری مشابه استفاده کنید.
۲. نسبت اشتراک پهنای باند را آگاهانه انتخاب کنید
نسبت Oversubscription نشان میدهد مجموع ظرفیت پورتهای دسترسی چه نسبتی با ظرفیت لینکهای بالادستی دارد. نسبت مناسب به نوع بار و بودجه بستگی دارد. آموزش توزیعشده حساستر از بسیاری از سرویسهای اداری است، اما طراحی بدون اشتراک نیز همیشه اقتصادی یا ضروری نیست. برای مقایسه تعداد پورت، ظرفیت Uplink و قابلیت افزونگی میتوانید گزینههای موجود در دسته سوئیچ شبکه را بررسی کنید و سپس سازگاری هر مدل را با توپولوژی پروژه بسنجید.
۳. سرور و شبکه را جدا از هم خرید نکنید
نوع PCIe، کارت شبکه، تعداد اسلات، توان منبع تغذیه و مسیر جریان هوا روی انتخاب شبکه اثر میگذارند. در بخش سرور شبکه میتوان مدلهای پردازشی را مقایسه کرد، اما تطبیق نهایی باید بر اساس مستندات همان سرور، کارت شبکه و تجهیزات رک انجام شود. وجود پورت پرسرعت روی کاغذ، عملکرد انتهابهانتها را تضمین نمیکند.
۴. کابل، اپتیک و فاصله را بخشی از طراحی بدانید
ماژولهای نوری، کابلهای DAC یا AOC و فیبر مناسب باید بر اساس سرعت، فاصله، نوع کانکتور و فهرست سازگاری فروشنده انتخاب شوند. هزینه این اقلام در مقیاس چند رک قابل توجه است. پیش از سفارش، یک جدول Port Map تهیه کنید تا نوع لینک، طول، ماژول دو سر و مسیر جایگزین مشخص باشد.
۵. پایش و خودکارسازی را پیش از توسعه تعریف کنید
در خوشههای بزرگ، بررسی دستی تکتک پورتها کافی نیست. Telemetry، ثبت تغییرات، هشداردهی، کنترل پیکربندی و مشاهده الگوی ترافیک باید از ابتدا طراحی شوند. ابزار مدیریتی نیز باید در شرایط واقعی ایران ارزیابی شود: شیوه دریافت مجوز، امکان استفاده بدون سرویس ابری، دسترسی به بهروزرسانی و روش بازیابی در قطعی ارتباط خارجی اهمیت دارند.
۶. برق، خنکسازی و نگهداری را همزمان برآورد کنید
افزایش ظرفیت محاسباتی و شبکه میتواند مصرف برق و گرمای هر رک را بالا ببرد. توان قابل استفاده، ظرفیت UPS، افزونگی منبع تغذیه، مسیر هوای سرد و گرم و امکان تعمیر بدون توقف باید پیش از استقرار بررسی شوند. این ارزیابی باید بر اساس مشخصات واقعی تجهیزات و توسط متخصص واجد صلاحیت انجام شود.
آیا هر سازمانی به شبکه مخصوص هوش مصنوعی نیاز دارد؟
خیر. بسیاری از سازمانها سرویسهایی مانند تلفن ویپ، ERP، فایلسرور، مجازیسازی عمومی و استنتاج سبک را بدون ساخت یک پارچه اختصاصی AI اجرا میکنند. اگر بار کاری به تبادل همزمان داده میان تعداد زیادی شتابدهنده نیاز ندارد، ارتقای هدفمند Uplink، افزونگی یا پایش ممکن است منطقیتر از بازطراحی کامل باشد.
نشانه نیاز به بازنگری جدی، اندازه برند یا تعداد GPU نیست؛ شواهد عملکرد است. اشباع مداوم لینکها، صفهای طولانی، افت بسته، زمان بیکاری شتابدهندهها و ناتوانی توپولوژی فعلی در توسعه، دلایل فنی قابل دفاعتری هستند. تصمیم خرید باید به اندازهگیری و آزمون متکی باشد.
برنامه مهاجرت کمریسک چگونه طراحی میشود؟
- خط مبنا: وضعیت فعلی پهنای باند، تأخیر، خطاها و مصرف منابع را ثبت کنید.
- پایلوت: یک بار کاری واقعی و محدود را روی چند گره اجرا کنید.
- آزمون خرابی: قطع لینک، خرابی یک سوئیچ و بازیابی پیکربندی را در محیط کنترلشده آزمایش کنید.
- معیار پذیرش: پیش از خرید، شاخصهای عملکرد، ظرفیت رشد و زمان بازیابی را مکتوب کنید.
- توسعه مرحلهای: پس از تأیید پایلوت، هر مرحله را با داده مرحله قبل اندازهگذاری کنید.
پرسشهای متداول
آیا برای هوش مصنوعی حتماً باید از InfiniBand استفاده کرد؟
خیر. Ethernet نیز در بسیاری از معماریهای هوش مصنوعی استفاده میشود. انتخاب میان فناوریها به اندازه خوشه، حساسیت بار به تأخیر، اکوسیستم نرمافزاری، مهارت تیم، دسترسپذیری تجهیزات و هزینه مالکیت بستگی دارد.
ارتقای سرور بدون ارتقای شبکه چه ریسکی دارد؟
اگر شبکه نتواند داده را با سرعت و پایداری لازم منتقل کند، سرور یا شتابدهنده جدید به ظرفیت واقعی خود نمیرسد. نتیجه میتواند زمان اجرای طولانیتر، نوسان عملکرد و هزینه بیشتر برای اصلاح دیرهنگام کابلکشی و توپولوژی باشد.
جمعبندی
شبکه دیتاسنتر هوش مصنوعی زمانی ارزش سرمایهگذاری دارد که بار کاری، مسیر داده و معیار پذیرش آن مشخص باشند. پیشبینیهای HPE از رشد سریع این حوزه خبر میدهند، اما انتخاب تجهیزات باید با اندازهگیری، پایلوت و تحلیل هزینه مالکیت انجام شود. طراحی همزمان سرور، سوئیچ، اپتیک، برق و پایش، ریسک گلوگاه و خرید بیش از نیاز را کاهش میدهد.
منبع
Network World؛ Michael Cooney؛ ۱ اکتبر ۲۰۲۶. عنوان اصلی: HPE’s Rahim: Pace of change in the data center is ‘extraordinary’. مطالعه مقاله اصلی در Network World



رک شبکه