شبکه, سرور

شبکه دیتاسنتر هوش مصنوعی؛ HPE چه تغییری را پیش‌بینی می‌کند؟

شبکه دیتاسنتر هوش مصنوعی با سرورها، سوئیچ‌های اترنت و فیبر نوری، با لوگوی نت یک

پاسخ کوتاه: شبکه دیتاسنتر هوش مصنوعی باید برای ترافیک سنگین شرق‌به‌غرب، تأخیر کم و توسعه سریع خوشه‌های پردازشی طراحی شود. افزودن GPU یا سرور قدرتمند بدون ظرفیت کافی در سوئیچ، لینک، مسیریابی، برق و خنک‌سازی می‌تواند بخش مهمی از سرمایه‌گذاری را کم‌اثر کند.

شبکه دیتاسنتر هوش مصنوعی چرا با شبکه سنتی تفاوت دارد؟

در بسیاری از شبکه‌های سازمانی، بخش بزرگی از ترافیک میان کاربران و سرویس‌های مرکزی جابه‌جا می‌شود. در خوشه‌های هوش مصنوعی، سرورها و شتاب‌دهنده‌ها باید حجم زیادی از داده را با یکدیگر مبادله کنند؛ بنابراین ترافیک شرق‌به‌غرب، رفتار انفجاری بار، تأخیر و افت بسته اهمیت بیشتری پیدا می‌کند. اگر لینک‌های بالادستی یا معماری Leaf-Spine برای بار واقعی اندازه‌گذاری نشده باشند، پردازنده‌های گران‌قیمت بخشی از زمان خود را در انتظار داده می‌گذرانند.

این تفاوت به معنی خرید خودکار سریع‌ترین تجهیزات بازار نیست. معماری درست از شناخت بار کاری آغاز می‌شود: آموزش مدل، استنتاج، تحلیل داده یا ذخیره‌سازی توزیع‌شده هرکدام الگوی ترافیکی متفاوتی دارند. اندازه خوشه، نسبت اشتراک پهنای باند، فاصله میان رک‌ها و امکان رشد نیز باید پیش از انتخاب تجهیزات مشخص شوند.

پیش‌بینی HPE درباره رشد شبکه دیتاسنتر هوش مصنوعی چیست؟

Network World در گفت‌وگویی با فیل موترام، مدیر شبکه HPE، گزارش کرده است که این شرکت انتظار دارد سفارش‌های تجمعی شبکه هوش مصنوعی در سال مالی ۲۰۲۶ از ۳ میلیارد دلار عبور کند. HPE همچنین برای کسب‌وکار شبکه دیتاسنتر خود تا سال مالی ۲۰۲۹ رشد مرکب سالانه حدود ۵۰ درصد را پیش‌بینی کرده است. این ارقام برآورد خود شرکت هستند، نه تضمین رشد کل بازار یا نتیجه قطعی برای هر پروژه.

پیام عملی این پیش‌بینی برای مدیر شبکه روشن است: شبکه دیگر بخش فرعی پروژه هوش مصنوعی نیست. طراحی شبکه باید هم‌زمان با انتخاب سرور، ذخیره‌ساز و شتاب‌دهنده انجام شود. اگر شبکه پس از خرید سخت‌افزار محاسباتی بررسی شود، اصلاح توپولوژی، کابل‌کشی یا ظرفیت پورت می‌تواند هزینه و زمان بیشتری تحمیل کند.

ادغام HPE و Juniper چه تغییری در معماری ایجاد می‌کند؟

HPE پس از ادغام با Juniper Networks تلاش می‌کند رایانش، خنک‌سازی و شبکه را در طراحی یکپارچه‌تری قرار دهد. در گزارش Network World سه لایه ارتباطی مطرح می‌شود: ارتباط بسیار نزدیک درون سامانه، ارتباط میان سرورها و شتاب‌دهنده‌های یک خوشه، و مسیریابی میان خوشه‌هایی که ممکن است در ساختمان‌ها یا مناطق متفاوت قرار داشته باشند.

در نمونه AMD Helios، HPE و Juniper یک سوئیچ اختصاصی مبتنی بر تراشه Broadcom Tomahawk 6 با ظرفیت اسمی ۱۰۲٫۴ ترابیت‌برثانیه معرفی کرده‌اند و از UALoE برای ارتباطات مقیاس‌بالا نام برده‌اند. این عدد مربوط به یک معماری و پیکربندی مشخص است و نباید به همه سوئیچ‌ها یا پروژه‌ها تعمیم داده شود. سازمان باید سازگاری کارت شبکه، کابل و ماژول نوری، سیستم‌عامل شبکه، ابزار پایش و استانداردهای مورد استفاده را در همان راهکار پیشنهادی بررسی کند.

مدیر شبکه ایرانی پیش از خرید چه معیارهایی را بررسی کند؟

۱. بار کاری و مسیر واقعی داده را اندازه‌گیری کنید

مشخص کنید داده از کجا وارد می‌شود، میان کدام گره‌ها جابه‌جا می‌شود و چه بخشی از پردازش به ذخیره‌ساز وابسته است. میانگین پهنای باند به تنهایی کافی نیست؛ اوج مصرف، تأخیر، افت بسته و مدت اشباع نیز باید ثبت شوند. برای پروژه‌ای که هنوز اجرا نشده است، از یک پایلوت محدود یا داده‌های بار کاری مشابه استفاده کنید.

۲. نسبت اشتراک پهنای باند را آگاهانه انتخاب کنید

نسبت Oversubscription نشان می‌دهد مجموع ظرفیت پورت‌های دسترسی چه نسبتی با ظرفیت لینک‌های بالادستی دارد. نسبت مناسب به نوع بار و بودجه بستگی دارد. آموزش توزیع‌شده حساس‌تر از بسیاری از سرویس‌های اداری است، اما طراحی بدون اشتراک نیز همیشه اقتصادی یا ضروری نیست. برای مقایسه تعداد پورت، ظرفیت Uplink و قابلیت افزونگی می‌توانید گزینه‌های موجود در دسته سوئیچ شبکه را بررسی کنید و سپس سازگاری هر مدل را با توپولوژی پروژه بسنجید.

۳. سرور و شبکه را جدا از هم خرید نکنید

نوع PCIe، کارت شبکه، تعداد اسلات، توان منبع تغذیه و مسیر جریان هوا روی انتخاب شبکه اثر می‌گذارند. در بخش سرور شبکه می‌توان مدل‌های پردازشی را مقایسه کرد، اما تطبیق نهایی باید بر اساس مستندات همان سرور، کارت شبکه و تجهیزات رک انجام شود. وجود پورت پرسرعت روی کاغذ، عملکرد انتهابه‌انتها را تضمین نمی‌کند.

۴. کابل، اپتیک و فاصله را بخشی از طراحی بدانید

ماژول‌های نوری، کابل‌های DAC یا AOC و فیبر مناسب باید بر اساس سرعت، فاصله، نوع کانکتور و فهرست سازگاری فروشنده انتخاب شوند. هزینه این اقلام در مقیاس چند رک قابل توجه است. پیش از سفارش، یک جدول Port Map تهیه کنید تا نوع لینک، طول، ماژول دو سر و مسیر جایگزین مشخص باشد.

۵. پایش و خودکارسازی را پیش از توسعه تعریف کنید

در خوشه‌های بزرگ، بررسی دستی تک‌تک پورت‌ها کافی نیست. Telemetry، ثبت تغییرات، هشداردهی، کنترل پیکربندی و مشاهده الگوی ترافیک باید از ابتدا طراحی شوند. ابزار مدیریتی نیز باید در شرایط واقعی ایران ارزیابی شود: شیوه دریافت مجوز، امکان استفاده بدون سرویس ابری، دسترسی به به‌روزرسانی و روش بازیابی در قطعی ارتباط خارجی اهمیت دارند.

۶. برق، خنک‌سازی و نگهداری را هم‌زمان برآورد کنید

افزایش ظرفیت محاسباتی و شبکه می‌تواند مصرف برق و گرمای هر رک را بالا ببرد. توان قابل استفاده، ظرفیت UPS، افزونگی منبع تغذیه، مسیر هوای سرد و گرم و امکان تعمیر بدون توقف باید پیش از استقرار بررسی شوند. این ارزیابی باید بر اساس مشخصات واقعی تجهیزات و توسط متخصص واجد صلاحیت انجام شود.

آیا هر سازمانی به شبکه مخصوص هوش مصنوعی نیاز دارد؟

خیر. بسیاری از سازمان‌ها سرویس‌هایی مانند تلفن ویپ، ERP، فایل‌سرور، مجازی‌سازی عمومی و استنتاج سبک را بدون ساخت یک پارچه اختصاصی AI اجرا می‌کنند. اگر بار کاری به تبادل هم‌زمان داده میان تعداد زیادی شتاب‌دهنده نیاز ندارد، ارتقای هدفمند Uplink، افزونگی یا پایش ممکن است منطقی‌تر از بازطراحی کامل باشد.

نشانه نیاز به بازنگری جدی، اندازه برند یا تعداد GPU نیست؛ شواهد عملکرد است. اشباع مداوم لینک‌ها، صف‌های طولانی، افت بسته، زمان بیکاری شتاب‌دهنده‌ها و ناتوانی توپولوژی فعلی در توسعه، دلایل فنی قابل دفاع‌تری هستند. تصمیم خرید باید به اندازه‌گیری و آزمون متکی باشد.

برنامه مهاجرت کم‌ریسک چگونه طراحی می‌شود؟

  • خط مبنا: وضعیت فعلی پهنای باند، تأخیر، خطاها و مصرف منابع را ثبت کنید.
  • پایلوت: یک بار کاری واقعی و محدود را روی چند گره اجرا کنید.
  • آزمون خرابی: قطع لینک، خرابی یک سوئیچ و بازیابی پیکربندی را در محیط کنترل‌شده آزمایش کنید.
  • معیار پذیرش: پیش از خرید، شاخص‌های عملکرد، ظرفیت رشد و زمان بازیابی را مکتوب کنید.
  • توسعه مرحله‌ای: پس از تأیید پایلوت، هر مرحله را با داده مرحله قبل اندازه‌گذاری کنید.

پرسش‌های متداول

آیا برای هوش مصنوعی حتماً باید از InfiniBand استفاده کرد؟

خیر. Ethernet نیز در بسیاری از معماری‌های هوش مصنوعی استفاده می‌شود. انتخاب میان فناوری‌ها به اندازه خوشه، حساسیت بار به تأخیر، اکوسیستم نرم‌افزاری، مهارت تیم، دسترس‌پذیری تجهیزات و هزینه مالکیت بستگی دارد.

ارتقای سرور بدون ارتقای شبکه چه ریسکی دارد؟

اگر شبکه نتواند داده را با سرعت و پایداری لازم منتقل کند، سرور یا شتاب‌دهنده جدید به ظرفیت واقعی خود نمی‌رسد. نتیجه می‌تواند زمان اجرای طولانی‌تر، نوسان عملکرد و هزینه بیشتر برای اصلاح دیرهنگام کابل‌کشی و توپولوژی باشد.

جمع‌بندی

شبکه دیتاسنتر هوش مصنوعی زمانی ارزش سرمایه‌گذاری دارد که بار کاری، مسیر داده و معیار پذیرش آن مشخص باشند. پیش‌بینی‌های HPE از رشد سریع این حوزه خبر می‌دهند، اما انتخاب تجهیزات باید با اندازه‌گیری، پایلوت و تحلیل هزینه مالکیت انجام شود. طراحی هم‌زمان سرور، سوئیچ، اپتیک، برق و پایش، ریسک گلوگاه و خرید بیش از نیاز را کاهش می‌دهد.

منبع

Network World؛ Michael Cooney؛ ۱ اکتبر ۲۰۲۶. عنوان اصلی: HPE’s Rahim: Pace of change in the data center is ‘extraordinary’. مطالعه مقاله اصلی در Network World

دیدگاهتان را بنویسید