پلتفرم آتی ورا روبین انویدیا، که اواخر امسال عرضه میشود، با هدف بهبود عملکرد و کارایی استنتاج هوش مصنوعی در مقیاس وسیع، به ویژه برای بارهای کاری عاملمحور و مدلهای زبان بزرگ (LLM)، معرفی شده است. این معماری جدید، بهینهسازیهای قابل توجهی را از سطح GPU تا سیستمهای در مقیاس رک ارائه میدهد. انویدیا بر افزایش سرعت و کاهش هزینه واحد توکنهای تولید شده در جریانهای کاری هوش مصنوعی عاملمحور تأکید دارد.
از جمله نوآوریهای کلیدی روبین میتوان به شتابدهنده حافظه تنسور (TMA) بهبود یافته برای مدیریت کارآمد مدلهای MoE، دو برابر شدن توان عملیاتی بعد K در هستههای تنسور، افزایش 4 برابری عملکرد سافتمکس نسبت به بلکول، مدیریت وابستگی دقیقتر برای بهرهوری بهتر GPU، و ارتباطات کارآمدتر بین GPUها از طریق NVLink اشاره کرد. این پیشرفتها در مجموع به منظور افزایش عملکرد استنتاج و کاهش هزینهها در کاربردهای هوش مصنوعی آینده طراحی شدهاند و نویدبخش یک جهش بزرگ در این حوزه هستند.
پلتفرم ورا روبین انویدیا، که قرار است اواخر سال 2025 عرضه شود، نسل بعدی معماری محاسباتی هوش مصنوعی و HPC این شرکت است. این پلتفرم بسیار پیچیده، شامل پردازنده 88 هستهای Vera با معماری Armv9 و پهنای باند حافظه 1.2 ترابایت بر ثانیه، پردازنده گرافیکی Rubin با فناوری 3 نانومتری TSMC، 288 گیگابایت حافظه HBM4 و عملکردی تا 3.3 برابر Blackwell Ultra است. همچنین، پردازنده گرافیکی Rubin CPX با حافظه GDDR7 برای بارهای کاری استنتاج تخصصی و DPU BlueField-4 برای ارکستراسیون، شبکهسازی و ذخیرهسازی در آن گنجانده شدهاند.
این پلتفرم از اتصالات پیشرفتهای مانند NVLink 6.0/7.0 و اپتیکهای بستهبندی مشترک (CPO) برای اترنت Spectrum-X و InfiniBand Quantum-X با سرعت 1.6 ترابیت بر ثانیه بهره میبرد. SuperNICهای ConnectX-9 نیز برای خوشههای هوش مصنوعی در مقیاس بزرگ طراحی شدهاند. نسخه بهروزرسانی Rubin Ultra که برای سال 2027 هدفگذاری شده، با چهار چیپلت محاسباتی و 1 ترابایت HBM4E، عملکرد را دو برابر خواهد کرد و نیاز به سیستمهای خنککننده و رکهای جدیدی خواهد داشت.