Nvidia details Rubin architectural optimizations for inference – improvements target better performance and efficiency from the GPU to the rack | Tom's HardwareTom's Hardware

معماری روبین انویدیا: جهشی بی‌سابقه در عملکرد و کارایی استنتاج هوش مصنوعی

پلتفرم آتی ورا روبین (Vera Rubin) انویدیا، که قرار است اواخر امسال عرضه شود، در حالی روی صحنه خواهد آمد که دنیای هوش مصنوعی به سمت عصری حرکت می‌کند که نه توسط اجرای آموزش‌های پیشرفته، بلکه توسط تقاضاهای استنتاج هوش مصنوعی عامل‌محور (agentic AI inference) در مقیاس وسیع، تسلط یافته است. عطش برای توکن‌های تولید شده در جریان‌های کاری عامل‌محور و نیاز به ارائه سریع، کارآمد و با هزینه واحد پایین آن‌ها، اکنون بر بحث‌ها غالب است.

ما قبلاً به جزئیات داده‌های عملکرد جدید پیرامون CPU ورا و چگونگی کمک آن به تسریع بارهای کاری هوش مصنوعی عامل‌محور پرداخته‌ایم، اما این تمام چیزی نیست که انویدیا امروز به اشتراک می‌گذارد. این شرکت همچنین در حال تشریح برخی ویژگی‌های جدید معماری روبین و چگونگی افزایش کارایی استنتاج از سطح GPU تا پیاده‌سازی‌های در مقیاس رک و دیتاسنتر این پلتفرم شتاب‌دهنده است.

Vera rubin

سیستم کامل مقیاس رک Vera Rubin NVL72 از 36 CPU ورا و 72 GPU روبین تشکیل شده است، اما تمرکز امروز ما بر خود GPU است. روبین دو دای محاسباتی را با استفاده از رابط پهنای باند بالای انویدیا (Nvidia High Bandwidth Interface) روی یک پکیج واحد ترکیب می‌کند. تراشه حاصل 224 پردازنده جریانی (SM) شامل مجموعاً 896 هسته تنسور (Tensor Cores) را در کنار 288 گیگابایت حافظه HBM4 با پهنای باند 22 ترابایت بر ثانیه ارائه می‌دهد.

انویدیا به عنوان یک شتاب‌دهنده متمرکز بر استنتاج، توان عملیاتی استنتاج 50 PFLOPS پراکنده NVFP4 روبین را به عنوان رقم عملکرد اصلی خود معرفی می‌کند، اگرچه این تنها یکی از طیف وسیعی از انواع داده‌هایی است که این تراشه می‌تواند مدیریت کند. در اینجا برخی از نرخ‌های کلیدی که باید برای این تراشه در نظر داشته باشید، آورده شده است:

بیایید به برخی از بهبودهای روبین برای بارهای کاری استنتاج بپردازیم تا بفهمیم انویدیا چگونه قصد دارد تمام این منابع را به طور کامل مورد استفاده قرار دهد.

شتاب‌دهنده حافظه تنسور روبین، مدل‌های MoE در حال رشد را به طور کارآمد مدیریت می‌کند

ابتدا، انویدیا بهبودهای کارایی در شتاب‌دهنده حافظه تنسور (TMA) را برجسته می‌کند که به تغذیه هسته‌های تنسور با داده کمک می‌کند. TMA یک موتور اختصاصی است که برای انجام محاسبات آدرس حافظه و بارگذاری مستقیم داده‌های آرایه در حافظه محلی مشترک GPU ساخته شده است.

معماری‌های پیشرو مدل‌های هوش مصنوعی از مدل‌های متراکم که در آن‌ها هر پارامتر به ازای هر توکن خروجی فعال می‌شود، به معماری ترکیب متخصصان (MoE) تغییر کرده‌اند که در آن تنها زیرشبکه‌های تخصصی خاصی به ازای هر توکن فعال می‌شوند، بر اساس راهنمایی یک روتر که به قضاوت در مورد اینکه کدام متخصصان برای پردازش یک ورودی معین مناسب‌تر هستند، کمک می‌کند.

وزن‌های متخصص MoE را می‌توان در سراسر GPUها توزیع کرد تا از ظرفیت محدود HBM هر GPU به طور کارآمد استفاده شود. انویدیا می‌گوید TMA روبین برای مقابله با چالش‌های مدیریت تعداد فزاینده متخصصان در مدل‌های پیشرو امروزی بهبود یافته است.

Vera rubin

TMA در GPUهای بلک‌ول (Blackwell) نیاز داشت تا توصیف‌گرهای MoE جداگانه را در حافظه برای مکان هر متخصص نگهداری کند، به این معنی که سربار یافتن و جابجایی این وزن‌های متخصص با افزایش تعداد متخصصان، به منابع محاسباتی بیشتری نیاز داشت.

TMA روبین اکنون از کرنل‌های GPU پشتیبانی می‌کند که یک توصیف‌گر MoE واحد و یکپارچه را مستقیماً در دستورالعمل TMA در زمان اجرا نگهداری و به‌روزرسانی می‌کنند، که محاسبات فراداده توصیف‌گر MoE را کاهش داده و سربار محاسباتی کمتری برای جابجایی داده‌ها نیاز دارد. این رویکرد چرخه‌های GPU را برای محاسبات استنتاج آزاد می‌کند، که البته، جایی است که شما می‌خواهید شتاب‌دهنده هوش مصنوعی گران‌قیمت شما بخش عمده‌ای از زمان خود را در آن صرف کند.

Nvidia Nvidia Rubin Ultra with NVL576 Kyber racks and infrastructure Rubin racks render

توان عملیاتی دوبرابر شده در بعد K، خروجی دوبرابر هسته تنسور

روبین همچنین عملکرد اساسی عملیات ماتریسی را در هسته تنسور با دو برابر کردن میزان کاری که این هسته‌ها می‌توانند در بعد K، یا بعد داخلی مشترک یک جفت ماتریس برای ضرب، انجام دهند، بهبود می‌بخشد. بدون ورود عمیق به ریاضیات، اندازه بعد K مستقیماً با تعداد دفعاتی که هسته تنسور باید روی عناصر دو ماتریس ضرب شده حلقه بزند، مرتبط است.

Vera rubin

بنابراین، در مثال انویدیا، محاسبه یک ماتریس نتیجه که در بلک‌ول به چهار تکرار حلقه نیاز داشت، در روبین تنها در دو تکرار قابل انجام است. انویدیا می‌گوید این بهبود مزایای گسترده‌ای برای کرنل‌های محدود به توان عملیاتی، حافظه و تأخیر دارد و برای هر دو فاز پردازش زمینه و رمزگشایی استنتاج مفید است.

سافت‌مکس در روبین تا 4 برابر در مقایسه با بلک‌ول افزایش می‌یابد

روبین همچنین بر بهبود عملکرد مکانیزم توجه (attention mechanism) تمرکز دارد که اساس LLMهای مبتنی بر ترانسفورمر است. مدل‌های پیشرفته‌تر اکنون از طول‌های زمینه تا یک میلیون توکن پشتیبانی می‌کنند، و انجام سریع محاسبات توجه بر روی چنین توالی‌های ورودی طولانی، یک عامل کلیدی برای بهبود عملکرد استنتاج است.

سافت‌مکس یک عملیات ضروری در محاسبات توجه است، و برای همگام شدن با توان عملیاتی بهبود یافته هسته تنسور در روبین، انویدیا بار دیگر توان عملیاتی سافت‌مکس را در واحد عملکرد ویژه (SFU) SM GPU افزایش داده است.

از آنجایی که به قابلیت‌های ریاضی متعالی SFU متکی است، توان عملیاتی سافت‌مکس می‌تواند به یک گلوگاه برای کارهای استنتاج بعدی تبدیل شود، و این محدودیتی است که انویدیا قبلاً با بهبودهای SFU بلک‌ول اولترا (Blackwell Ultra) به دنبال رفع آن بود. بلک‌ول اولترا توان عملیاتی نمایی FP32 و BF16/FP16 را در مقایسه با بلک‌ول GB200 نسل اول دو برابر کرد.

روبین سرعت 2 برابری بلک‌ول اولترا نسبت به بلک‌ول را در ریاضیات نمایی FP32 حفظ می‌کند، و محاسبات نمایی BF16/FP16 را دوباره در مقایسه با بلک‌ول اولترا دو برابر می‌کند، که منجر به بهبود 4 برابری در توان عملیاتی نسبت به بلک‌ول برای آن انواع داده با دقت پایین‌تر می‌شود.

مدیریت وابستگی با جزئیات بیشتر، اشغال بهتر هسته تنسور

روبین همچنین با فراهم کردن فرصت‌های دقیق‌تر برای هماهنگی بین کرنل‌های وابسته نسبت به بلک‌ول، اشغال هسته تنسور را افزایش می‌دهد. یکی از مواردی که انویدیا به آن اشاره می‌کند که این وابستگی‌ها در آن ایجاد می‌شوند، تولید فعال‌سازی‌ها برای یک LLM است، جایی که یک کرنل داده‌ها را تولید و ذخیره می‌کند که سپس توسط یک کرنل بعدی با پیشروی یک پرامپت در یک شبکه عصبی استفاده می‌شود.

Vera rubin

در GPUهای بلک‌ول، یک کرنل تولیدکننده طولانی‌مدت در یک بلوک رشته (شاید در یک ساختار CUDA مانند یک خوشه) ممکن است اجرای یک کرنل مصرف‌کننده بعدی را در آن بلوک‌های رشته به تأخیر بیندازد، حتی در حالی که سایر بلوک‌های رشته کرنل تولیدکننده کار خود را به پایان رسانده‌اند.

روبین وضوح وابستگی دقیق‌تری بین کرنل‌ها ارائه می‌دهد، به طوری که یک کرنل مصرف‌کننده می‌تواند به محض در دسترس قرار گرفتن خروجی کرنل تولیدکننده از هر بلوک رشته، اجرای خود را در بلوک‌های رشته جداگانه آغاز کند، به جای اینکه منتظر در دسترس قرار گرفتن کل دسته داده‌های کرنل تولیدکننده بماند. این مدیریت دقیق‌تر منجر به استفاده بهتر از GPU، تأخیر کمتر بین کرنل‌ها و در نهایت افزایش توکن در ثانیه به ازای هر کاربر می‌شود.

ارتباط کارآمدتر بین GPUها، سربار کمتر NVLink

تمام بهبودهایی که تاکنون مورد بحث قرار دادیم مربوط به نحوه انجام کار بر روی یک GPU است، اما شتاب‌دهنده مقیاس رک Vera Rubin NVL72 شامل بسیاری از GPUها است که از طریق یک شبکه NVLink در داخل رک به هم متصل شده‌اند. وزن‌های مدل، داده‌های کش کلید-مقدار و پیام‌های همگام‌سازی بین GPUها همگی از طریق این شبکه حرکت می‌کنند، بنابراین پایین نگه داشتن سربار و تأخیر برای دستیابی به حداکثر عملکرد کلیدی است.

GPUهایی که کرنل‌های CUDA را اجرا می‌کنند، می‌توانند مستقیماً با سایر GPUهای موجود در رک با استفاده از API کتابخانه ارتباطات جمعی انویدیا (NCCL) ارتباط برقرار کنند و سربار را کاهش دهند. انویدیا اشاره می‌کند که از آنجایی که GPU این عملیات را مستقیماً به عنوان بخشی از کرنل محاسباتی انجام می‌دهد، اجرای کارآمد این ارتباطات برای عملکرد حیاتی می‌شود.

Vera rubin

در یک سیستم بلک‌ول، انتقال NVLink بین GPUها ممکن است به عملیات ذخیره‌سازی داده و سپس یک مانع حافظه (memory barrier) و یک پرچم اتمی (atomic flag) نیاز داشته باشد. معماری روبین قابلیتی به نام “نوشته‌های شمارش‌شده” (counted writes) را معرفی می‌کند که میزان ترافیک هماهنگی و همگام‌سازی لازم برای به اشتراک گذاشتن داده‌ها بین GPUها در سراسر شبکه را کاهش می‌دهد.

در روبین، مانع حافظه و عملیات اتمی با یک به‌روزرسانی شمارنده نوشتن واحد در GPU گیرنده جایگزین می‌شوند، که ترافیک شبکه و تأخیر را کاهش داده و با کاهش زمان صرف شده برای انتظار سربار هماهنگی، استفاده از محاسبات را بهبود می‌بخشد.

در مجموع، همراه با عملکرد بالای تک‌رشته‌ای CPU ورا برای مهار عامل‌ها، فراخوانی ابزار، کامپایل کد و موارد دیگر، بهبودهای GPU روبین برای عملکرد در عملیات حیاتی استنتاج، و همچنین کارایی بهبود یافته برای جابجایی داده‌ها روی تراشه و در سراسر رک، نویدبخش ایجاد یک سیستم در مقیاس رک و دیتاسنتر است که هم عملکرد استنتاج را افزایش می‌دهد و هم هزینه‌های استنتاج به ازای هر توکن را در آینده‌ای که انویدیا آن را به طور فزاینده‌ای عامل‌محور می‌بیند، کاهش خواهد داد. ما مشتاقانه منتظریم تا با آغاز تحویل سیستم‌های ورا روبین در پاییز امسال، قابلیت‌های بیشتری از این GPU را مشاهده کنیم.

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *

جستجو در سایت

سبد خرید

درحال بارگذاری ...
بستن
مقایسه
مقایسه محصولات
لیست مقایسه محصولات شما خالی می باشد!