AMD Epyc 9996 Venice با ۲۵۶ هسته و معماری Zen 6 معرفی شد
AMD سرانجام جزئیاتی از اولین پردازنده Zen 6 خود را ارائه میدهد که بیش از یک سال است آن را معرفی کرده است. Epyc 9996 یک تراشه ۲۵۶ هستهای / ۵۱۲ رشتهای است که معماری جدید Zen 6 ایامدی را در خود جای داده و اولین محصولی است که در آنچه AMD آن را “مجموعه گسترده” برای Venice توصیف میکند، عرضه میشود. علاوه بر ادعای مزایای عملکردی قابل توجه نسبت به Nvidia Vera و Intel Xeon 6، ایامدی میگوید که در طول سال آینده به توسعه سری Venice با طراحیهای سفارشی ادامه خواهد داد.
راوی کوپوسوامی، معاون ارشد شرکت در بخش راهحلهای محاسباتی و سازمانی AMD، گفت: “این فقط یک پردازنده نیست، بلکه یک مجموعه است.” AMD میگوید که راهحلهای هدفمند ساخته است و محصولات خود را بسته به کاربرد تقسیمبندی میکند، شبیه به نحوه تقسیمبندی سریهای Xeon اینتل در چند نسل گذشته (و همچنین نحوه تقسیمبندی نرم AMD برای محصولات Epyc خود). نقشه راه با خط تولید اصلی Venice بر روی سوکت SP7 آغاز میشود، همان چیزی که AMD مدتهاست آن را معرفی کرده است. این پردازنده تا ۲۵۶ هسته و ۵۱۲ رشته، پهنای باند حافظه ۱.۶ ترابایت بر ثانیه با MRDIMMهای سریع و ۱۲۸ خط PCIe 6 در پیکربندی 1P (۱۶۰ خط در 2P) را پشتیبانی میکند.
توجه: هنگام افزایش مقیاس تا ۲۵۶ هسته، AMD از طراحی “متراکم” Zen 6c خود استفاده میکند. با طراحی استاندارد Zen 6، AMD میگوید Venice تا ۱۲۸ هسته و ۲۵۶ رشته مقیاسپذیر است، در حالی که نسخههای با فرکانس بالا حداکثر ۹۶ هسته دارند.
در نیمه اول سال آینده، AMD قصد دارد Venice را بر روی سوکت SP8 خود عرضه کند که از هشت هسته تا ۱۲۸ هسته را ارائه میدهد و بر روی استقرارهای کوچکتر تمرکز دارد. این تراشهها از حافظه هشت کاناله با دو DIMM در هر کانال و همان ۱۲۸ خط PCIe 6 پشتیبانی میکنند.
Venice-X در نیمه دوم سال ۲۰۲۷، بر روی سوکت SP7 مورد انتظار است. ما Turin-X را ندیدیم، اما Genoa-X نسل قبلی با ۹۶ هسته و تا ۱۱۵۲ مگابایت کش L3 انباشته عرضه شد. این مشخصات (به جز ریزمعماری Zen 6) تغییر نکردهاند، اما AMD میگوید که Venice-X را میتواند تا ۵.۱۵ گیگاهرتز کلاک کند.
در نهایت، Verano باید در نیمه دوم سال آینده بر روی سوکت SP8 عرضه شود و به نظر میرسد مستقیمترین رقیب Vera باشد (کوپوسوامی از AMD با نامگذاری آن “Vera-No” کمی شوخی کرد). AMD میگوید این پردازنده برای گرههای میزبان هوش مصنوعی بهینهسازی شده و تا ۷۲ هسته و کلاکهای اوج ۵ گیگاهرتز را در خود جای داده است. نکته مهم این است که این پردازنده با یک سیستم حافظه LPDDR5X ۲۴ کاناله عرضه میشود که از ماژولهای SOCAMM2 بهره میبرد.
یکی از مزایایی که انویدیا برای تراشه Vera خود ادعا میکند، پهنای باند حافظه زیاد از طریق سیستم LPDDR5X است. رویکرد AMD با Venice SP7 متفاوت است. این پردازنده با Venice SP7 تا حافظه ۱۶ کاناله مقیاسپذیر است، با پشتیبانی از MRDIMMهایی که با سرعت ۱۲۸۰۰ MT/s کار میکنند، یا RDIMMهای استاندارد DDR5 که با سرعت ۸۰۰۰ MT/s کار میکنند.
این یک جهش قابل توجه نسبت به Turin است که از حافظه ۱۲ کاناله با پشتیبانی از RDIMMهایی که با سرعت ۶۴۰۰ MT/s کار میکنند، استفاده میکند. AMD پهنای باند ۱.۶ ترابایت بر ثانیه در هر سوکت را ادعا میکند که به طور قابل توجهی بالاتر از ۱.۲ ترابایت بر ثانیه موجود در Vera و تقریباً سه برابر پهنای باند ۵۷۶ گیگابایت بر ثانیه در هر سوکت Turin است. اینتل اخیراً RDIMMهای ۸۰۰۰ MT/s را در SKUهای منتخب Granite Rapids و Clearwater Forest فعال کرده و میگوید پشتیبانی از MRDIMMها با سرعت تا ۸۸۰۰ MT/s در سه ماهه اول ۲۰۲۷ ارائه خواهد شد.
AMD لیستی از SKUها یا مشخصات دقیق Venice را ارائه نکرد. ما واقعاً فقط در مورد Epyc 9996، طراحی متراکم ۲۵۶ هستهای، اطلاعات داریم و حتی در این مورد نیز ابهامات زیادی وجود دارد. با این حال، ما چند جزئیات حیاتی در مورد Venice به طور کلیتر آموختیم که شایعات و گزارشهای قبلی را تأیید میکند.
Zen 6 بر روی فناوری N2 شرکت TSMC ساخته شده است (این قبلاً تأیید شده بود). AMD تأیید کرد که ۳۲ هسته بر روی یک CCD، همراه با دو IOD وجود دارد. به خاطر داشته باشید که CCD ۳۲ هستهای از Zen 6c استفاده میکند، نه Zen 6 کامل. گمانهزنیهای زیادی در مورد CCDهای ۳۲ هستهای در پردازندههای Zen 6 مصرفکننده وجود داشته است، اما این بعید به نظر میرسد.
پیکربندی ۲۵۶ هستهای با ۱.۰۲۴ مگابایت کش L3 عظیم عرضه میشود که تقریباً سه برابر مقدار Epyc 9965 است. این کش انباشته نیست؛ کش انباشته با Venice-X ارائه خواهد شد. هر CCD به ۱۲۸ مگابایت کش L3، یا ۴ مگابایت به ازای هر هسته دسترسی دارد که دو برابر مقدار موجود در Turin است.
اگرچه AMD بسیاری از معرفیهای خود را بر روی Venice ۲۵۶ هستهای متمرکز کرده است، اما محصولات اولیه SP7 همچنین شامل یک مدل ۹۶ هستهای با فرکانس بالا خواهد بود که میتواند تا ۵ گیگاهرتز کلاک شود.
AMD اولین بنچمارکهای Epyc ‘Venice’ ۲۵۶ هستهای را به اشتراک میگذارد
برخلاف عملکرد برونیابی شدهای که AMD چند هفته پیش به اشتراک گذاشت، اکنون بنچمارکهای مشخصی برای Epyc 9996 داریم. AMD، جای تعجب نیست، بارهای کاری را بر روی هوش مصنوعی عاملمحور (agentic AI) متمرکز کرده است. با این حال، بسیاری از بارهای کاری قابل اجرا برای هوش مصنوعی عاملمحور در جاهای دیگر نیز کاربرد دارند، از جمله وظایف شبکهسازی با همزمانی بالا، کامپایل کد و پردازش رسانه.
توجه داشته باشید که AMD فقط Epyc 9965 را به عنوان نقطه مقایسه نسل به نسل در نمودارهای بالا گنجانده است. این یک طراحی “متراکم” Zen 5 با ۱۹۲ هسته است. نتایج برای مدل ۱۲۸ هستهای ۹۷۵۵ در جداول زیر گنجانده شده است.
با شروع عملیات فرانتاند، AMD ادعای بهبود ۱.۲ برابری نسل به نسل و بهبود ۲.۸ برابری نسبت به Intel Xeon 6980P را دارد، با استفاده از وب سرور NGINX و ابزار تولید بار WRK. برخلاف اکثر این ارقام عملکرد رقابتی، AMD اعداد واقعی بنچمارکهای اجرا شده را در پاورقیها گنجانده است که میتوانید در جدول زیر مشاهده کنید.
در بارهای کاری سنگین دادهای که در میان عوامل هوش مصنوعی رایج هستند، AMD ادعای بهبود ۱.۷ برابری نسبت به Turin و بهبود عظیم ۳.۴ برابری نسبت به Xeon 6980P را دارد. AMD از بنچمارک TPCx-AI برای جمعآوری این نتایج استفاده کرد. معیار اصلی برای این آزمایش، موارد استفاده هوش مصنوعی در دقیقه (AIUCpm) است که AMD نتیجه میانه آن را به اشتراک گذاشت. اگر به اطلاعات بیشتری در مورد گزارش این بنچمارک علاقهمند هستید، دل یک تحلیل جامع منتشر کرده است.
در بارهای کاری وکتورایز شده، AMD ادعای بهبود ۱.۶ برابری نسل به نسل و بهبود ۲.۳ برابری نسبت به Xeon 6980P را دارد. برای این آزمایش، AMD از کتابخانه متنباز FAISS (Facebook AI Similarity Search) متا برای جستجوی وکتورهای مشابه در مجموعه داده siftm1 استفاده کرد. معیار در اینجا QPS، یا پرسوجوهای پردازش شده در ثانیه است که به توان عملیاتی کلی پرسوجو نگاه میکند.
برای بنچمارکهای “ابزارهای سازمانی” خود، AMD چندین آزمایش از جمله TPC-H، TPC-C و Redis را اجرا کرد و نتایج را به عنوان “توان عملیاتی میانگین هندسی” گزارش میدهد. ما در اینجا اعداد واقعی را داریم، اما آنها یک میانگین هندسی هستند که چندین آزمایش مختلف را به جای یک بنچمارک واحد نشان میدهند. با این حال، به طور کلی، AMD ادعای بهبود ۱.۶ برابری نسل به نسل در این بارهای کاری و بهبود ۲.۶ برابری نسبت به اینتل را دارد.
بسیاری از بارهای کاری عاملمحور در خارج از عوامل نیز کاربرد دارند، اما AMD چند عامل را نیز مستقیماً آزمایش کرد. این شرکت پنج شخصیت عامل مختلف را بر روی تراشهها بازپخش کرد و بار دیگر یک میانگین هندسی توان عملیاتی را جمعآوری کرد. ما در اینجا معیارهای این آزمایش و همچنین بنچمارک قبلی را نداریم، بنابراین ممکن است زاویهای از عملکرد وجود داشته باشد که با دادههای ارائه شده توسط AMD مشاهده نمیکنیم.
صرف نظر از این، این شرکت ادعای بهبود ۱.۵ برابری نسل به نسل در این آزمایش و بهبود ۲.۵ برابری نسبت به 6980P را دارد.
AMD این آزمایشها را اوایل ماه جاری انجام داد. اما تنها چند روز پیش، انویدیا اولین نتایج SPEC CPU 2026 خود را برای Vera منتشر کرد. AMD نیز آزمایشهای خود را با استفاده از همان کامپایلر برای مقایسه بین Vera و Venice انجام داد. کوپوسوامی از AMD میگوید: “همه چیز مقایسه سیب به سیب است، همان کامپایلر.” اگر کنجکاو هستید، این کامپایلر GNU 15.2 است.
در توان عملیاتی، AMD ادعای بهبود ۲.۲ برابری در مجموعه اعداد صحیح SPECrate را دارد، در مقایسه با Vera با استفاده از طراحی متراکم Venice با ۲۵۶ هسته Zen 6c. مهمتر از آن، AMD ادعای بهبود ۱.۲ برابری در عملکرد هر هسته را هنگام مقایسه Vera با تراشه ۹۶ هستهای “فرکانس بالا” Venice دارد. AMD میگوید از نتایج انویدیا به عنوان مبنای مقایسه استفاده کرده است. با هر دو طراحی Venice، AMD از TDP ۶۰۰ وات استفاده کرد.
در SPEC CPU 2017 (باز هم با استفاده از SPECrate با بارهای کاری اعداد صحیح)، AMD دادههایی را برای مقایسه Venice با 6980P اینتل و AGI جدید Arm دارد که توان عملیاتی ۲ برابری نسبت به اینتل و عملکرد ۱.۳ برابری در هر هسته را نشان میدهد. به تعداد هستهها در اینجا برای AMD توجه کنید. SPECrate یک آزمایش توان عملیاتی است و کاهش AMD به مدل ۱۲۸ هستهای نشان میدهد که عملکرد احتمالاً با افزایش تعداد هستهها کاهش مییابد.
اگرچه AMD میخواهد عملکرد Venice را بر روی بارهای کاری عاملمحور متمرکز کند، اما طیفی از آنچه اکنون “بارهای کاری قدیمی” در سراسر فضای ابری و HPC نامیده میشوند را به اشتراک گذاشت. برخی از نتایج از اسلایدهای قبلی تکرار شدهاند، مانند Redis و NGINX، اما نقاط داده اضافی نیز وجود دارد، از جمله NAMD و SQL. بهبودهای عملکرد در اینجا بزرگ هستند، اگرچه تعجبآور نیستند. میتوانید ببینید که در تمام این آزمایشها، حتی Turin نیز رقابت اینتل و AWS را شکست میدهد.
- کولبات
- مرداد 1, 1405
- 39 بازدید






