Nvidia deep dives Vera CPU for AI data centers — SPEC CPU 2026 benchmarks revealed, Olympus architecture specifics, and more | Tom's HardwareTom's Hardware

رازگشایی از پردازنده Vera انویدیا: نبرد در دیتاسنترهای هوش مصنوعی با معماری Olympus و بنچمارک‌های SPEC CPU 2026

پردازنده Vera انویدیا اولین تلاش این شرکت برای تبدیل شدن به یک بازیگر کلیدی در بازار پردازنده‌های دیتاسنتر است. اگرچه Grace موفقیت‌هایی داشته (به ویژه با استقرار مستقل Grace در متا)، اما Vera اولین پردازنده انویدیا با طراحی هسته سفارشی است. این پردازنده در زمان ایده‌آلی نیز عرضه می‌شود، زیرا بازار پردازنده‌های سرور در چند ماه اخیر به دلیل تقاضای هوش مصنوعی عامل‌محور (agentic AI) به شدت رشد کرده است.

Vera تراشه‌ای نیست که برای کاهش سهم بازار AMD و اینتل در فضای ابری ساخته شده باشد. این پردازنده برای کسب سهم در بازاری رو به رشد طراحی شده است، زیرا هایپراسکیلرها به دنبال گسترش زیرساخت‌های هوش مصنوعی فراتر از ابرهای سنتی هستند. به همین دلیل، طراحی آن بسیار متفاوت از رقبای x86 انویدیا است و حتی در مقایسه با طیف وسیعی از طراحی‌های مبتنی بر Arm، نقاط طراحی معماری منحصربه‌فردی دارد.

انویدیا به تدریج جزئیات بیشتری درباره Vera را فاش کرده است، زیرا این پردازنده در حال آماده‌سازی برای عرضه عمومی در نیمه دوم سال جاری است. اکنون، ما تصویر کاملی از این تراشه داریم. انویدیا وایت‌پیپر Vera خود را به همراه نتایج غیررسمی SPEC CPU 2026 که Vera را با Epyc 9755 مبتنی بر Turin از AMD مقایسه می‌کند، به اشتراک گذاشت.

در اینجا به بررسی وایت‌پیپر خواهیم پرداخت، از جمله تمام جزئیات مربوط به هسته Olympus و نگاهی به بنچمارک‌هایی که انویدیا اجرا کرده است. در پایان این مطلب، نگاهی کوتاه نیز به زمینه گسترده‌تر Vera و چگونگی جای‌گیری آن در اکوسیستم هوش مصنوعی وسیع‌تر انویدیا در مقایسه با استقرار مستقل خواهیم داشت.

اما جوهر زیادی درباره قابلیت‌های فنی Vera و چشم‌انداز زیرساخت هوش مصنوعی نسل بعدی انویدیا ریخته شده است. بیایید با چیز مهم شروع کنیم: بنچمارک‌ها.

بنچمارک‌های پردازنده Vera انویدیا

ما قبلاً Vera را در عمل دیده‌ایم، هرچند تنها از طریق مجموعه‌ای از بنچمارک‌های انتخابی که توسط Phoronix در مقر انویدیا اجرا شده بود. در وایت‌پیپر Vera، انویدیا بنچمارک‌های SPEC CPU 2026، به ویژه مجموعه اعداد صحیح از SPECrate را در برابر Epyc 9755 AMD به اشتراک گذاشت، که هر دو تراشه در پیکربندی دو سوکته اجرا می‌شدند. قبل از ورود به نتایج، نکات مهمی در مورد نحوه عملکرد تست‌های SPEC و معیارهای گزارش‌دهی آن‌ها وجود دارد.

اجرای انویدیا در اینجا رسمی نیست، زیرا Vera در یک سیستم مرجع آزمایش شده است به دلیل اینکه هنوز به طور گسترده در دسترس نیست. این پردازنده برای عرضه عمومی در نیمه دوم سال در حال آماده‌سازی است. به همین دلیل، انویدیا قادر به گزارش نتایج خود نیست. به همین دلیل است که در برخی از نمودارهای زیر “تخمینی” را مشاهده می‌کنید. انویدیا SPEC CPU 2026 را اجرا کرد؛ این شرکت عملکرد مورد انتظار را مانند آنچه تاکنون از AMD دیده‌ایم با تراشه‌های آتی Venice خود، برون‌یابی نمی‌کند.

SPEC CPU 2026 به چهار مجموعه تقسیم می‌شود، اما انویدیا مجموعه اعداد صحیح SPECrate را آزمایش کرد که بر توان عملیاتی سیستم با بارهای کاری مبتنی بر اعداد صحیح تمرکز دارد. نتیجه “rate” به این می‌پردازد که چه مقدار کار در مدت زمان مشخصی تکمیل می‌شود. در اینجا، هر رشته در سیستم یک کپی از بار کاری را دارد. امتیاز نشان‌دهنده مدت زمان لازم برای تکمیل آن بارها است، صرف نظر از تعداد رشته‌ها، که به طور طبیعی به تراشه‌هایی با هسته‌های بیشتر مزیت می‌دهد.

اگر جزئیات بیشتری در مورد بنچمارک‌های موجود در این مجموعه می‌خواهید، حتماً پوشش اصلی ما از SPEC CPU 2026 را مطالعه کنید. در اینجا نتایج کلی آورده شده است:

انویدیا نتایج دقیق 9755 را که آزمایش کرده بود، به جز امتیاز کلی 898، به اشتراک نگذاشت. با در نظر گرفتن این امتیاز کلی، Vera 3% از 9755 جلوتر است. قابل ذکر است که Vera در اینجا با وجود تعداد رشته‌های کمتر، پیشتاز است. امتیاز کلی 898 برای یک سیستم Epyc 9755 دو سوکته در مقایسه با تست‌های SPEC CPU 2026 که به صورت عمومی ارسال شده‌اند، غیرمنطقی نیست، اگرچه نتایج بالاتری نیز منتشر شده است. SPEC CPU به صورت کد منبع عرضه می‌شود که آزمایش‌کننده باید آن را با کامپایلر انتخابی خود کامپایل کند، و این می‌تواند به شدت بر نتایج تأثیر بگذارد (به ویژه با کامپایلرهای خاص فروشنده). انویدیا از GNU 15.2 با هر دو سیستم استفاده کرد.

پردازنده دیتاسنتر Vera انویدیا پردازنده Vera انویدیا یک پردازنده Vera انویدیا پردازنده Vera انویدیا

در بالا، می‌توانید نتایج Vera را در مقایسه با 9755 مشاهده کنید، اما اینها اعداد را مستقیماً مقایسه نمی‌کنند. انویدیا عملکرد هر هسته را نرمال‌سازی کرده است، که روش معمول به اشتراک‌گذاری نتایج SPECrate نیست. طبق اعداد کلی، Vera همچنان کار بیشتری را در همان مدت زمان تکمیل می‌کند، با وجود تعداد رشته‌های کمتر، اما حاشیه‌های سود در محدوده 70% یا 80% نیستند، آنطور که نمودار بالا نشان می‌دهد.

ما از انویدیا در مورد نتایج پرسیدیم، با توجه به اینکه آنها با مقایسه مبهم شده‌اند؛ ما نتوانستیم امتیازات Epyc 9755 را با اطلاعات ارائه شده توسط انویدیا مهندسی معکوس کنیم. در اینجا پاسخی که داده شد: “عملکرد هر هسته تحت یک سوکت کاملاً بارگذاری شده مهم است زیرا هوش مصنوعی عامل‌محور (agentic AI) و یادگیری تقویتی (RL) بسیاری از محیط‌های شبیه‌سازی (sandboxes) را به طور همزمان اجرا می‌کنند، در حالی که هر گام عامل متوالی و حساس به تأخیر باقی می‌ماند. این معیار نشان می‌دهد که هر هسته چقدر عملکرد را در میان رقابت برای توان، حافظه، کش و فابریک مشترک حفظ می‌کند. بنابراین، ما بر اساس هسته فیزیکی نرمال‌سازی می‌کنیم، با SMT فعال در هر دو سیستم.”

بارهای کاری “عامل‌محور” که انویدیا در اینجا برجسته کرده است، بارهای کاری کامپایل و تفسیر کد هستند، که کاری است که یک عامل اغلب انجام می‌دهد، یعنی پرس‌وجو از مخازن برای وابستگی‌ها و ساخت کد منبع. در ادامه بارهای کاری علم داده (یا تحلیل داده‌های اکتشافی) و پس از آن بارهای کاری پردازش داده مانند مدیریت پایگاه داده SQLite قرار دارند. نتایج در اینجا با پیام کلی انویدیا در مورد Vera همخوانی دارد، مبنی بر اینکه این پردازنده در عملیات بک‌اند (backend) غنی از داده، بسیار توانمند است.

اگرچه انویدیا نتایج هر رشته را به اشتراک می‌گذارد، اما استدلال می‌کند که SPECrate همچنان بنچمارک صحیح برای اجرا است. نتایج هر رشته در اینجا در بستر یک سوکت کاملاً بارگذاری شده قرار دارند. در اینجا توجیه از وایت‌پیپر آورده شده است: “این معیار برای سیستم‌های هوش مصنوعی عامل‌محور و یادگیری تقویتی، که در آن بسیاری از محیط‌های شبیه‌سازی، ابزارها و محیط‌ها به طور همزمان اجرا می‌شوند و نه به عنوان تست‌های تک رشته‌ای ایزوله، بی‌اهمیت نیست. عملکرد هر هسته در حالت بارگذاری کامل نشان می‌دهد که هر هسته چقدر توان عملیاتی را در حین به اشتراک‌گذاری توان در سطح سوکت، پهنای باند حافظه، کش و منابع فابریک حفظ می‌کند.”

IPC پردازنده Vera انویدیا IPC پردازنده Vera انویدیا IPC پردازنده Vera انویدیا IPC پردازنده Vera انویدیا IPC پردازنده Vera انویدیا IPC پردازنده Vera انویدیا IPC پردازنده Vera انویدیا IPC پردازنده Vera انویدیا IPC پردازنده Vera انویدیا IPC پردازنده Vera انویدیا

علاوه بر اجرای بارهای کاری، انویدیا اجرای کد را برای بنچمارک‌های معماری تحلیل کرد که می‌توانید در گالری بالا مشاهده کنید. انویدیا ادعا می‌کند که افزایش کلی IPC تا 1.9 برابر در مقایسه با Turin، تا 2.3 برابر پیش‌بینی شاخه بیشتر و 3.5 برابر شاخه‌های گرفته شده در هر سیکل، و تا 2.4 برابر عملیات واکشی دستورالعمل بالاتر در هر سیکل را به دست آورده است.

پیج‌رنک پردازنده Vera انویدیا پیج‌رنک پردازنده Vera انویدیا پیج‌رنک پردازنده Vera انویدیا پیج‌رنک پردازنده Vera انویدیا

خارج از SPEC، انویدیا چند بنچمارک را به اشتراک گذاشت که قابلیت‌های هسته Olympus را برجسته می‌کند. اولین مورد PageRank است، الگوریتمی که توسط گوگل برای رتبه‌بندی صفحات وب توسعه یافته بود و موتور پیش‌واکشی (prefetch engine) Olympus را برجسته می‌کند. انویدیا این بار کاری را به تعداد هسته‌های بالاتر مقیاس‌بندی کرد و نشان داد که Vera بخش زیادی از عملکرد تک هسته‌ای خود را تا 32 هسته حفظ می‌کند، در حالی که تراشه Turin در حدود 20 هسته به محدودیت می‌رسد.

علاوه بر نتایج فوق، انویدیا برخی تست‌های سیستم حافظه Vera را در مقایسه با Turin به اشتراک گذاشت. این میکروبنچمارک‌ها برای اعتبارسنجی مشخصات انویدیا خوب هستند، اما آنها به عملکرد معماری نگاه می‌کنند، نه عملکرد برنامه. یک مزیت معماری به مزیت عملکردی تبدیل می‌شود، اما نه همیشه به روشی خطی و مورد انتظار.

انویدیا از ابزارهای توسعه‌یافته داخلی برای تست‌های حافظه استفاده کرد، اگرچه آنها در GitHub برای اجرا توسط هر کسی در دسترس هستند.

پردازنده Vera انویدیا

اولین مورد، تأخیر حافظه تحت بار است که زیرسیستم حافظه را با افزایش مصرف پهنای باند تحت فشار قرار می‌دهد. Vera به طور کلی پهنای باند بسیار بالاتری دارد، اما می‌توانید ببینید که تراشه Turin قبل از حداکثر خود به یک دیوار تأخیر برخورد می‌کند، که انویدیا آن را به پیمایش دامنه دسترسی غیریکنواخت حافظه (NUMA) و تأخیر CCD به CCD نسبت می‌دهد.

پردازنده Vera انویدیا

با نگاهی به پهنای باند هر هسته، انویدیا ادعا می‌کند که Vera بیش از چهار برابر پهنای باند 9755 AMD را ارائه می‌دهد. پیشنهاد در اینجا این است که پهنای باند “دنیای واقعی” هر هسته حتی بهتر از آنچه مشخصات انویدیا نشان می‌دهد (یا شاید بدتر از AMD) است.

پردازنده Vera انویدیا

شاید مهم‌ترین این تست‌ها، موردی باشد که در بالا مشاهده می‌کنید، یعنی تأخیر هسته به هسته. بر کسی پوشیده نیست که عبور از CCD در معماری مبتنی بر چیپلت AMD، جریمه تأخیر زیادی را به همراه دارد. این را حتی در بررسی Ryzen 9 9950X3D2 ما نیز می‌توانید مشاهده کنید، و این جریمه‌ها با افزایش تعداد CCDها تشدید می‌شوند.

برای انصاف در مورد AMD، طراحی‌های مبتنی بر چیپلت برای این نوع پیمایش بین CCDها ساخته نشده‌اند و ترجیح می‌دهند بارهای کاری را محلی نگه دارند و برای چگالی هسته بهینه‌سازی کنند. هدف طراحی Vera به وضوح حفظ تأخیرهای ثابت در سراسر دای و قربانی کردن چگالی هسته در این فرآیند است. یان باک از انویدیا به ما گفت که این مصالحه طراحی “به قیمت بارهای کاری قدیمی تمام خواهد شد”، زمانی که ما اخیراً از مقر انویدیا بازدید کردیم.

این یک زمینه مهم است. انویدیا به دنبال دزدیدن سهم بازار موجود از AMD و اینتل نیست، بلکه بیشتر در تلاش است تا قبل از AMD و اینتل، سهم بازار را در یک بازار رو به رشد به دست آورد. برخی از موسسات مالی (از جمله مورگان استنلی و بانک آو آمریکا) پیشنهاد می‌کنند که بازار پردازنده‌های سرور می‌تواند تا سال 2030 دو برابر (یا حتی بیشتر) شود. این زمینه مهم است زیرا تقاضای مداومی برای پردازنده‌هایی وجود خواهد داشت که می‌توانند بارهای کاری را که Vera برای آنها بهینه‌سازی نشده است، مدیریت کنند، و جالب خواهد بود که ببینیم AMD و اینتل چگونه با محصولات آینده خود با این پویایی مقابله می‌کنند و سعی می‌کنند پایگاه مشتریان قدیمی را حفظ کرده و در عین حال به سمت بازار گسترده‌تر پیش بروند.

انویدیا به وضوح چشم‌اندازی از چگونگی این بازار گسترده دارد، و به همین دلیل، نتایج ممیز شناور SPEC CPU را به اشتراک نگذاشته است. احتمالاً این به دلیل این واقعیت است که مجموعه وکتورایز شده SPEC عمدتاً بر بارهای کاری HPC تمرکز دارد، در حالی که انویدیا بر آنچه که معتقد است بارهای کاری عامل‌محور حیاتی و مبتنی بر اعداد صحیح هستند، تمرکز کرده است. Vera دارای یک موتور وکتور کامل با SVE است، اما به نظر نمی‌رسد که این تمرکز انویدیا باشد.

در یک سیستم کامل انویدیا، آن بارهای کاری وکتورایز شده به یک GPU Rubin منتقل می‌شوند. با این حال، ما هنوز هیچ نتیجه وکتوری برای Vera نداریم. تا این لحظه، ما فقط نتایج اعداد صحیح را دیده‌ایم، که با توجه به سیستم حافظه موجود در Vera عجیب است.

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *

جستجو در سایت

سبد خرید

درحال بارگذاری ...
بستن
مقایسه
مقایسه محصولات
لیست مقایسه محصولات شما خالی می باشد!