معماری روبین انویدیا: جهشی بیسابقه در عملکرد و کارایی استنتاج هوش مصنوعی
پلتفرم آتی ورا روبین (Vera Rubin) انویدیا، که قرار است اواخر امسال عرضه شود، در حالی روی صحنه خواهد آمد که دنیای هوش مصنوعی به سمت عصری حرکت میکند که نه توسط اجرای آموزشهای پیشرفته، بلکه توسط تقاضاهای استنتاج هوش مصنوعی عاملمحور (agentic AI inference) در مقیاس وسیع، تسلط یافته است. عطش برای توکنهای تولید شده در جریانهای کاری عاملمحور و نیاز به ارائه سریع، کارآمد و با هزینه واحد پایین آنها، اکنون بر بحثها غالب است.
ما قبلاً به جزئیات دادههای عملکرد جدید پیرامون CPU ورا و چگونگی کمک آن به تسریع بارهای کاری هوش مصنوعی عاملمحور پرداختهایم، اما این تمام چیزی نیست که انویدیا امروز به اشتراک میگذارد. این شرکت همچنین در حال تشریح برخی ویژگیهای جدید معماری روبین و چگونگی افزایش کارایی استنتاج از سطح GPU تا پیادهسازیهای در مقیاس رک و دیتاسنتر این پلتفرم شتابدهنده است.
سیستم کامل مقیاس رک Vera Rubin NVL72 از 36 CPU ورا و 72 GPU روبین تشکیل شده است، اما تمرکز امروز ما بر خود GPU است. روبین دو دای محاسباتی را با استفاده از رابط پهنای باند بالای انویدیا (Nvidia High Bandwidth Interface) روی یک پکیج واحد ترکیب میکند. تراشه حاصل 224 پردازنده جریانی (SM) شامل مجموعاً 896 هسته تنسور (Tensor Cores) را در کنار 288 گیگابایت حافظه HBM4 با پهنای باند 22 ترابایت بر ثانیه ارائه میدهد.
انویدیا به عنوان یک شتابدهنده متمرکز بر استنتاج، توان عملیاتی استنتاج 50 PFLOPS پراکنده NVFP4 روبین را به عنوان رقم عملکرد اصلی خود معرفی میکند، اگرچه این تنها یکی از طیف وسیعی از انواع دادههایی است که این تراشه میتواند مدیریت کند. در اینجا برخی از نرخهای کلیدی که باید برای این تراشه در نظر داشته باشید، آورده شده است:
بیایید به برخی از بهبودهای روبین برای بارهای کاری استنتاج بپردازیم تا بفهمیم انویدیا چگونه قصد دارد تمام این منابع را به طور کامل مورد استفاده قرار دهد.
شتابدهنده حافظه تنسور روبین، مدلهای MoE در حال رشد را به طور کارآمد مدیریت میکند
ابتدا، انویدیا بهبودهای کارایی در شتابدهنده حافظه تنسور (TMA) را برجسته میکند که به تغذیه هستههای تنسور با داده کمک میکند. TMA یک موتور اختصاصی است که برای انجام محاسبات آدرس حافظه و بارگذاری مستقیم دادههای آرایه در حافظه محلی مشترک GPU ساخته شده است.
معماریهای پیشرو مدلهای هوش مصنوعی از مدلهای متراکم که در آنها هر پارامتر به ازای هر توکن خروجی فعال میشود، به معماری ترکیب متخصصان (MoE) تغییر کردهاند که در آن تنها زیرشبکههای تخصصی خاصی به ازای هر توکن فعال میشوند، بر اساس راهنمایی یک روتر که به قضاوت در مورد اینکه کدام متخصصان برای پردازش یک ورودی معین مناسبتر هستند، کمک میکند.
وزنهای متخصص MoE را میتوان در سراسر GPUها توزیع کرد تا از ظرفیت محدود HBM هر GPU به طور کارآمد استفاده شود. انویدیا میگوید TMA روبین برای مقابله با چالشهای مدیریت تعداد فزاینده متخصصان در مدلهای پیشرو امروزی بهبود یافته است.
TMA در GPUهای بلکول (Blackwell) نیاز داشت تا توصیفگرهای MoE جداگانه را در حافظه برای مکان هر متخصص نگهداری کند، به این معنی که سربار یافتن و جابجایی این وزنهای متخصص با افزایش تعداد متخصصان، به منابع محاسباتی بیشتری نیاز داشت.
TMA روبین اکنون از کرنلهای GPU پشتیبانی میکند که یک توصیفگر MoE واحد و یکپارچه را مستقیماً در دستورالعمل TMA در زمان اجرا نگهداری و بهروزرسانی میکنند، که محاسبات فراداده توصیفگر MoE را کاهش داده و سربار محاسباتی کمتری برای جابجایی دادهها نیاز دارد. این رویکرد چرخههای GPU را برای محاسبات استنتاج آزاد میکند، که البته، جایی است که شما میخواهید شتابدهنده هوش مصنوعی گرانقیمت شما بخش عمدهای از زمان خود را در آن صرف کند.
توان عملیاتی دوبرابر شده در بعد K، خروجی دوبرابر هسته تنسور
روبین همچنین عملکرد اساسی عملیات ماتریسی را در هسته تنسور با دو برابر کردن میزان کاری که این هستهها میتوانند در بعد K، یا بعد داخلی مشترک یک جفت ماتریس برای ضرب، انجام دهند، بهبود میبخشد. بدون ورود عمیق به ریاضیات، اندازه بعد K مستقیماً با تعداد دفعاتی که هسته تنسور باید روی عناصر دو ماتریس ضرب شده حلقه بزند، مرتبط است.
بنابراین، در مثال انویدیا، محاسبه یک ماتریس نتیجه که در بلکول به چهار تکرار حلقه نیاز داشت، در روبین تنها در دو تکرار قابل انجام است. انویدیا میگوید این بهبود مزایای گستردهای برای کرنلهای محدود به توان عملیاتی، حافظه و تأخیر دارد و برای هر دو فاز پردازش زمینه و رمزگشایی استنتاج مفید است.
سافتمکس در روبین تا 4 برابر در مقایسه با بلکول افزایش مییابد
روبین همچنین بر بهبود عملکرد مکانیزم توجه (attention mechanism) تمرکز دارد که اساس LLMهای مبتنی بر ترانسفورمر است. مدلهای پیشرفتهتر اکنون از طولهای زمینه تا یک میلیون توکن پشتیبانی میکنند، و انجام سریع محاسبات توجه بر روی چنین توالیهای ورودی طولانی، یک عامل کلیدی برای بهبود عملکرد استنتاج است.
سافتمکس یک عملیات ضروری در محاسبات توجه است، و برای همگام شدن با توان عملیاتی بهبود یافته هسته تنسور در روبین، انویدیا بار دیگر توان عملیاتی سافتمکس را در واحد عملکرد ویژه (SFU) SM GPU افزایش داده است.
از آنجایی که به قابلیتهای ریاضی متعالی SFU متکی است، توان عملیاتی سافتمکس میتواند به یک گلوگاه برای کارهای استنتاج بعدی تبدیل شود، و این محدودیتی است که انویدیا قبلاً با بهبودهای SFU بلکول اولترا (Blackwell Ultra) به دنبال رفع آن بود. بلکول اولترا توان عملیاتی نمایی FP32 و BF16/FP16 را در مقایسه با بلکول GB200 نسل اول دو برابر کرد.
روبین سرعت 2 برابری بلکول اولترا نسبت به بلکول را در ریاضیات نمایی FP32 حفظ میکند، و محاسبات نمایی BF16/FP16 را دوباره در مقایسه با بلکول اولترا دو برابر میکند، که منجر به بهبود 4 برابری در توان عملیاتی نسبت به بلکول برای آن انواع داده با دقت پایینتر میشود.
مدیریت وابستگی با جزئیات بیشتر، اشغال بهتر هسته تنسور
روبین همچنین با فراهم کردن فرصتهای دقیقتر برای هماهنگی بین کرنلهای وابسته نسبت به بلکول، اشغال هسته تنسور را افزایش میدهد. یکی از مواردی که انویدیا به آن اشاره میکند که این وابستگیها در آن ایجاد میشوند، تولید فعالسازیها برای یک LLM است، جایی که یک کرنل دادهها را تولید و ذخیره میکند که سپس توسط یک کرنل بعدی با پیشروی یک پرامپت در یک شبکه عصبی استفاده میشود.
در GPUهای بلکول، یک کرنل تولیدکننده طولانیمدت در یک بلوک رشته (شاید در یک ساختار CUDA مانند یک خوشه) ممکن است اجرای یک کرنل مصرفکننده بعدی را در آن بلوکهای رشته به تأخیر بیندازد، حتی در حالی که سایر بلوکهای رشته کرنل تولیدکننده کار خود را به پایان رساندهاند.
روبین وضوح وابستگی دقیقتری بین کرنلها ارائه میدهد، به طوری که یک کرنل مصرفکننده میتواند به محض در دسترس قرار گرفتن خروجی کرنل تولیدکننده از هر بلوک رشته، اجرای خود را در بلوکهای رشته جداگانه آغاز کند، به جای اینکه منتظر در دسترس قرار گرفتن کل دسته دادههای کرنل تولیدکننده بماند. این مدیریت دقیقتر منجر به استفاده بهتر از GPU، تأخیر کمتر بین کرنلها و در نهایت افزایش توکن در ثانیه به ازای هر کاربر میشود.
ارتباط کارآمدتر بین GPUها، سربار کمتر NVLink
تمام بهبودهایی که تاکنون مورد بحث قرار دادیم مربوط به نحوه انجام کار بر روی یک GPU است، اما شتابدهنده مقیاس رک Vera Rubin NVL72 شامل بسیاری از GPUها است که از طریق یک شبکه NVLink در داخل رک به هم متصل شدهاند. وزنهای مدل، دادههای کش کلید-مقدار و پیامهای همگامسازی بین GPUها همگی از طریق این شبکه حرکت میکنند، بنابراین پایین نگه داشتن سربار و تأخیر برای دستیابی به حداکثر عملکرد کلیدی است.
GPUهایی که کرنلهای CUDA را اجرا میکنند، میتوانند مستقیماً با سایر GPUهای موجود در رک با استفاده از API کتابخانه ارتباطات جمعی انویدیا (NCCL) ارتباط برقرار کنند و سربار را کاهش دهند. انویدیا اشاره میکند که از آنجایی که GPU این عملیات را مستقیماً به عنوان بخشی از کرنل محاسباتی انجام میدهد، اجرای کارآمد این ارتباطات برای عملکرد حیاتی میشود.
در یک سیستم بلکول، انتقال NVLink بین GPUها ممکن است به عملیات ذخیرهسازی داده و سپس یک مانع حافظه (memory barrier) و یک پرچم اتمی (atomic flag) نیاز داشته باشد. معماری روبین قابلیتی به نام “نوشتههای شمارششده” (counted writes) را معرفی میکند که میزان ترافیک هماهنگی و همگامسازی لازم برای به اشتراک گذاشتن دادهها بین GPUها در سراسر شبکه را کاهش میدهد.
در روبین، مانع حافظه و عملیات اتمی با یک بهروزرسانی شمارنده نوشتن واحد در GPU گیرنده جایگزین میشوند، که ترافیک شبکه و تأخیر را کاهش داده و با کاهش زمان صرف شده برای انتظار سربار هماهنگی، استفاده از محاسبات را بهبود میبخشد.
در مجموع، همراه با عملکرد بالای تکرشتهای CPU ورا برای مهار عاملها، فراخوانی ابزار، کامپایل کد و موارد دیگر، بهبودهای GPU روبین برای عملکرد در عملیات حیاتی استنتاج، و همچنین کارایی بهبود یافته برای جابجایی دادهها روی تراشه و در سراسر رک، نویدبخش ایجاد یک سیستم در مقیاس رک و دیتاسنتر است که هم عملکرد استنتاج را افزایش میدهد و هم هزینههای استنتاج به ازای هر توکن را در آیندهای که انویدیا آن را به طور فزایندهای عاملمحور میبیند، کاهش خواهد داد. ما مشتاقانه منتظریم تا با آغاز تحویل سیستمهای ورا روبین در پاییز امسال، قابلیتهای بیشتری از این GPU را مشاهده کنیم.
- کولبات
- تیر 30, 1405
- 11 بازدید






