رازگشایی از پردازنده Vera انویدیا: نبرد در دیتاسنترهای هوش مصنوعی با معماری Olympus و بنچمارکهای SPEC CPU 2026
پردازنده Vera انویدیا اولین تلاش این شرکت برای تبدیل شدن به یک بازیگر کلیدی در بازار پردازندههای دیتاسنتر است. اگرچه Grace موفقیتهایی داشته (به ویژه با استقرار مستقل Grace در متا)، اما Vera اولین پردازنده انویدیا با طراحی هسته سفارشی است. این پردازنده در زمان ایدهآلی نیز عرضه میشود، زیرا بازار پردازندههای سرور در چند ماه اخیر به دلیل تقاضای هوش مصنوعی عاملمحور (agentic AI) به شدت رشد کرده است.
Vera تراشهای نیست که برای کاهش سهم بازار AMD و اینتل در فضای ابری ساخته شده باشد. این پردازنده برای کسب سهم در بازاری رو به رشد طراحی شده است، زیرا هایپراسکیلرها به دنبال گسترش زیرساختهای هوش مصنوعی فراتر از ابرهای سنتی هستند. به همین دلیل، طراحی آن بسیار متفاوت از رقبای x86 انویدیا است و حتی در مقایسه با طیف وسیعی از طراحیهای مبتنی بر Arm، نقاط طراحی معماری منحصربهفردی دارد.
انویدیا به تدریج جزئیات بیشتری درباره Vera را فاش کرده است، زیرا این پردازنده در حال آمادهسازی برای عرضه عمومی در نیمه دوم سال جاری است. اکنون، ما تصویر کاملی از این تراشه داریم. انویدیا وایتپیپر Vera خود را به همراه نتایج غیررسمی SPEC CPU 2026 که Vera را با Epyc 9755 مبتنی بر Turin از AMD مقایسه میکند، به اشتراک گذاشت.
در اینجا به بررسی وایتپیپر خواهیم پرداخت، از جمله تمام جزئیات مربوط به هسته Olympus و نگاهی به بنچمارکهایی که انویدیا اجرا کرده است. در پایان این مطلب، نگاهی کوتاه نیز به زمینه گستردهتر Vera و چگونگی جایگیری آن در اکوسیستم هوش مصنوعی وسیعتر انویدیا در مقایسه با استقرار مستقل خواهیم داشت.
اما جوهر زیادی درباره قابلیتهای فنی Vera و چشمانداز زیرساخت هوش مصنوعی نسل بعدی انویدیا ریخته شده است. بیایید با چیز مهم شروع کنیم: بنچمارکها.
بنچمارکهای پردازنده Vera انویدیا
ما قبلاً Vera را در عمل دیدهایم، هرچند تنها از طریق مجموعهای از بنچمارکهای انتخابی که توسط Phoronix در مقر انویدیا اجرا شده بود. در وایتپیپر Vera، انویدیا بنچمارکهای SPEC CPU 2026، به ویژه مجموعه اعداد صحیح از SPECrate را در برابر Epyc 9755 AMD به اشتراک گذاشت، که هر دو تراشه در پیکربندی دو سوکته اجرا میشدند. قبل از ورود به نتایج، نکات مهمی در مورد نحوه عملکرد تستهای SPEC و معیارهای گزارشدهی آنها وجود دارد.
اجرای انویدیا در اینجا رسمی نیست، زیرا Vera در یک سیستم مرجع آزمایش شده است به دلیل اینکه هنوز به طور گسترده در دسترس نیست. این پردازنده برای عرضه عمومی در نیمه دوم سال در حال آمادهسازی است. به همین دلیل، انویدیا قادر به گزارش نتایج خود نیست. به همین دلیل است که در برخی از نمودارهای زیر “تخمینی” را مشاهده میکنید. انویدیا SPEC CPU 2026 را اجرا کرد؛ این شرکت عملکرد مورد انتظار را مانند آنچه تاکنون از AMD دیدهایم با تراشههای آتی Venice خود، برونیابی نمیکند.
SPEC CPU 2026 به چهار مجموعه تقسیم میشود، اما انویدیا مجموعه اعداد صحیح SPECrate را آزمایش کرد که بر توان عملیاتی سیستم با بارهای کاری مبتنی بر اعداد صحیح تمرکز دارد. نتیجه “rate” به این میپردازد که چه مقدار کار در مدت زمان مشخصی تکمیل میشود. در اینجا، هر رشته در سیستم یک کپی از بار کاری را دارد. امتیاز نشاندهنده مدت زمان لازم برای تکمیل آن بارها است، صرف نظر از تعداد رشتهها، که به طور طبیعی به تراشههایی با هستههای بیشتر مزیت میدهد.
اگر جزئیات بیشتری در مورد بنچمارکهای موجود در این مجموعه میخواهید، حتماً پوشش اصلی ما از SPEC CPU 2026 را مطالعه کنید. در اینجا نتایج کلی آورده شده است:
انویدیا نتایج دقیق 9755 را که آزمایش کرده بود، به جز امتیاز کلی 898، به اشتراک نگذاشت. با در نظر گرفتن این امتیاز کلی، Vera 3% از 9755 جلوتر است. قابل ذکر است که Vera در اینجا با وجود تعداد رشتههای کمتر، پیشتاز است. امتیاز کلی 898 برای یک سیستم Epyc 9755 دو سوکته در مقایسه با تستهای SPEC CPU 2026 که به صورت عمومی ارسال شدهاند، غیرمنطقی نیست، اگرچه نتایج بالاتری نیز منتشر شده است. SPEC CPU به صورت کد منبع عرضه میشود که آزمایشکننده باید آن را با کامپایلر انتخابی خود کامپایل کند، و این میتواند به شدت بر نتایج تأثیر بگذارد (به ویژه با کامپایلرهای خاص فروشنده). انویدیا از GNU 15.2 با هر دو سیستم استفاده کرد.
در بالا، میتوانید نتایج Vera را در مقایسه با 9755 مشاهده کنید، اما اینها اعداد را مستقیماً مقایسه نمیکنند. انویدیا عملکرد هر هسته را نرمالسازی کرده است، که روش معمول به اشتراکگذاری نتایج SPECrate نیست. طبق اعداد کلی، Vera همچنان کار بیشتری را در همان مدت زمان تکمیل میکند، با وجود تعداد رشتههای کمتر، اما حاشیههای سود در محدوده 70% یا 80% نیستند، آنطور که نمودار بالا نشان میدهد.
ما از انویدیا در مورد نتایج پرسیدیم، با توجه به اینکه آنها با مقایسه مبهم شدهاند؛ ما نتوانستیم امتیازات Epyc 9755 را با اطلاعات ارائه شده توسط انویدیا مهندسی معکوس کنیم. در اینجا پاسخی که داده شد: “عملکرد هر هسته تحت یک سوکت کاملاً بارگذاری شده مهم است زیرا هوش مصنوعی عاملمحور (agentic AI) و یادگیری تقویتی (RL) بسیاری از محیطهای شبیهسازی (sandboxes) را به طور همزمان اجرا میکنند، در حالی که هر گام عامل متوالی و حساس به تأخیر باقی میماند. این معیار نشان میدهد که هر هسته چقدر عملکرد را در میان رقابت برای توان، حافظه، کش و فابریک مشترک حفظ میکند. بنابراین، ما بر اساس هسته فیزیکی نرمالسازی میکنیم، با SMT فعال در هر دو سیستم.”
بارهای کاری “عاملمحور” که انویدیا در اینجا برجسته کرده است، بارهای کاری کامپایل و تفسیر کد هستند، که کاری است که یک عامل اغلب انجام میدهد، یعنی پرسوجو از مخازن برای وابستگیها و ساخت کد منبع. در ادامه بارهای کاری علم داده (یا تحلیل دادههای اکتشافی) و پس از آن بارهای کاری پردازش داده مانند مدیریت پایگاه داده SQLite قرار دارند. نتایج در اینجا با پیام کلی انویدیا در مورد Vera همخوانی دارد، مبنی بر اینکه این پردازنده در عملیات بکاند (backend) غنی از داده، بسیار توانمند است.
اگرچه انویدیا نتایج هر رشته را به اشتراک میگذارد، اما استدلال میکند که SPECrate همچنان بنچمارک صحیح برای اجرا است. نتایج هر رشته در اینجا در بستر یک سوکت کاملاً بارگذاری شده قرار دارند. در اینجا توجیه از وایتپیپر آورده شده است: “این معیار برای سیستمهای هوش مصنوعی عاملمحور و یادگیری تقویتی، که در آن بسیاری از محیطهای شبیهسازی، ابزارها و محیطها به طور همزمان اجرا میشوند و نه به عنوان تستهای تک رشتهای ایزوله، بیاهمیت نیست. عملکرد هر هسته در حالت بارگذاری کامل نشان میدهد که هر هسته چقدر توان عملیاتی را در حین به اشتراکگذاری توان در سطح سوکت، پهنای باند حافظه، کش و منابع فابریک حفظ میکند.”
علاوه بر اجرای بارهای کاری، انویدیا اجرای کد را برای بنچمارکهای معماری تحلیل کرد که میتوانید در گالری بالا مشاهده کنید. انویدیا ادعا میکند که افزایش کلی IPC تا 1.9 برابر در مقایسه با Turin، تا 2.3 برابر پیشبینی شاخه بیشتر و 3.5 برابر شاخههای گرفته شده در هر سیکل، و تا 2.4 برابر عملیات واکشی دستورالعمل بالاتر در هر سیکل را به دست آورده است.
خارج از SPEC، انویدیا چند بنچمارک را به اشتراک گذاشت که قابلیتهای هسته Olympus را برجسته میکند. اولین مورد PageRank است، الگوریتمی که توسط گوگل برای رتبهبندی صفحات وب توسعه یافته بود و موتور پیشواکشی (prefetch engine) Olympus را برجسته میکند. انویدیا این بار کاری را به تعداد هستههای بالاتر مقیاسبندی کرد و نشان داد که Vera بخش زیادی از عملکرد تک هستهای خود را تا 32 هسته حفظ میکند، در حالی که تراشه Turin در حدود 20 هسته به محدودیت میرسد.
علاوه بر نتایج فوق، انویدیا برخی تستهای سیستم حافظه Vera را در مقایسه با Turin به اشتراک گذاشت. این میکروبنچمارکها برای اعتبارسنجی مشخصات انویدیا خوب هستند، اما آنها به عملکرد معماری نگاه میکنند، نه عملکرد برنامه. یک مزیت معماری به مزیت عملکردی تبدیل میشود، اما نه همیشه به روشی خطی و مورد انتظار.
انویدیا از ابزارهای توسعهیافته داخلی برای تستهای حافظه استفاده کرد، اگرچه آنها در GitHub برای اجرا توسط هر کسی در دسترس هستند.
اولین مورد، تأخیر حافظه تحت بار است که زیرسیستم حافظه را با افزایش مصرف پهنای باند تحت فشار قرار میدهد. Vera به طور کلی پهنای باند بسیار بالاتری دارد، اما میتوانید ببینید که تراشه Turin قبل از حداکثر خود به یک دیوار تأخیر برخورد میکند، که انویدیا آن را به پیمایش دامنه دسترسی غیریکنواخت حافظه (NUMA) و تأخیر CCD به CCD نسبت میدهد.
با نگاهی به پهنای باند هر هسته، انویدیا ادعا میکند که Vera بیش از چهار برابر پهنای باند 9755 AMD را ارائه میدهد. پیشنهاد در اینجا این است که پهنای باند “دنیای واقعی” هر هسته حتی بهتر از آنچه مشخصات انویدیا نشان میدهد (یا شاید بدتر از AMD) است.
شاید مهمترین این تستها، موردی باشد که در بالا مشاهده میکنید، یعنی تأخیر هسته به هسته. بر کسی پوشیده نیست که عبور از CCD در معماری مبتنی بر چیپلت AMD، جریمه تأخیر زیادی را به همراه دارد. این را حتی در بررسی Ryzen 9 9950X3D2 ما نیز میتوانید مشاهده کنید، و این جریمهها با افزایش تعداد CCDها تشدید میشوند.
برای انصاف در مورد AMD، طراحیهای مبتنی بر چیپلت برای این نوع پیمایش بین CCDها ساخته نشدهاند و ترجیح میدهند بارهای کاری را محلی نگه دارند و برای چگالی هسته بهینهسازی کنند. هدف طراحی Vera به وضوح حفظ تأخیرهای ثابت در سراسر دای و قربانی کردن چگالی هسته در این فرآیند است. یان باک از انویدیا به ما گفت که این مصالحه طراحی “به قیمت بارهای کاری قدیمی تمام خواهد شد”، زمانی که ما اخیراً از مقر انویدیا بازدید کردیم.
این یک زمینه مهم است. انویدیا به دنبال دزدیدن سهم بازار موجود از AMD و اینتل نیست، بلکه بیشتر در تلاش است تا قبل از AMD و اینتل، سهم بازار را در یک بازار رو به رشد به دست آورد. برخی از موسسات مالی (از جمله مورگان استنلی و بانک آو آمریکا) پیشنهاد میکنند که بازار پردازندههای سرور میتواند تا سال 2030 دو برابر (یا حتی بیشتر) شود. این زمینه مهم است زیرا تقاضای مداومی برای پردازندههایی وجود خواهد داشت که میتوانند بارهای کاری را که Vera برای آنها بهینهسازی نشده است، مدیریت کنند، و جالب خواهد بود که ببینیم AMD و اینتل چگونه با محصولات آینده خود با این پویایی مقابله میکنند و سعی میکنند پایگاه مشتریان قدیمی را حفظ کرده و در عین حال به سمت بازار گستردهتر پیش بروند.
انویدیا به وضوح چشماندازی از چگونگی این بازار گسترده دارد، و به همین دلیل، نتایج ممیز شناور SPEC CPU را به اشتراک نگذاشته است. احتمالاً این به دلیل این واقعیت است که مجموعه وکتورایز شده SPEC عمدتاً بر بارهای کاری HPC تمرکز دارد، در حالی که انویدیا بر آنچه که معتقد است بارهای کاری عاملمحور حیاتی و مبتنی بر اعداد صحیح هستند، تمرکز کرده است. Vera دارای یک موتور وکتور کامل با SVE است، اما به نظر نمیرسد که این تمرکز انویدیا باشد.
در یک سیستم کامل انویدیا، آن بارهای کاری وکتورایز شده به یک GPU Rubin منتقل میشوند. با این حال، ما هنوز هیچ نتیجه وکتوری برای Vera نداریم. تا این لحظه، ما فقط نتایج اعداد صحیح را دیدهایم، که با توجه به سیستم حافظه موجود در Vera عجیب است.
- کولبات
- تیر 30, 1405
- 50 بازدید






