China's 2.8-trillion-parameter Kimi K3 beats Claude Fable 5 in Frontend Code Arena benchmark—  Moonshot AI delivers largest open-weight AI model ever, as China works around U.S. compute limits | Tom's HardwareTom's Hardware

Kimi K3 چین: غول 2.8 تریلیون پارامتری که Claude Fable 5 را در کدنویسی شکست داد؛ بزرگترین مدل هوش مصنوعی متن‌باز جهان و پاسخ پکن به محدودیت‌های آمریکا

شرکت هوش مصنوعی Moonshot مستقر در پکن، مدل Kimi K3 را با 2.8 تریلیون پارامتر منتشر کرده است که این شرکت در وبلاگ فنی خود آن را اولین سیستم باز کلاس 3T جهان و بزرگترین مدل هوش مصنوعی با وزن باز تا به امروز توصیف می‌کند. Moonshot اعلام کرد که K3 هنوز از نظر عملکرد کلی پشت Claude Fable 5 از Anthropic و GPT 5.6 Sol از OpenAI قرار دارد، اما در مجموعه ارزیابی این شرکت، از جمله Claude Opus 4.8 و GPT 5.5، در معیارهای کدنویسی و عامل‌محور بنچمارک‌ها، از هر مدل دیگری بهتر عمل کرده است. این مدل دارای پنجره متنی 1 میلیون توکنی، بینایی بومی است و تنها 16 از 896 متخصص خود را به ازای هر توکن فعال می‌کند که تقریباً 1.8 درصد از کل مجموعه است. وزن‌های کامل تا 27 جولای منتشر خواهند شد.

Microsoft data center in Mount Pleasant, Wisconsin

Arena در ارزیابی کد فرانت‌اند خود، K3 را با 1,679 امتیاز، بالاتر از Fable 5، در آزمایش توسعه‌دهندگان کور، در رتبه اول قرار داد. قیمت‌گذاری API برای هر میلیون توکن ورودی با کش فعال 0.30 دلار، برای هر میلیون توکن ورودی با کش غیرفعال 3 دلار و برای هر میلیون توکن خروجی 15 دلار است. Kimi K2 یک سال پیش با قیمت 0.60 دلار برای هر میلیون توکن ورودی عرضه شد، بنابراین هزینه ورودی K3 بدون کش پنج برابر بیشتر است.

Moonshot ادعا می‌کند که کارایی مقیاس‌پذیری Kimi K3 نسبت به Kimi K2 تقریباً 2.5 برابر بهبود یافته است که به دو تغییر معماری نسبت داده می‌شود: Kimi Delta Attention، یک طرح توجه خطی هیبریدی، و Attention Residuals، که نحوه حرکت اطلاعات بین لایه‌ها را تغییر می‌دهد. آموزش آگاه از کوانتیزاسیون در مرحله تنظیم دقیق نظارت‌شده آغاز می‌شود، با استفاده از وزن‌های MXFP4 و فعال‌سازی‌های MXFP8، ترکیبی که Moonshot می‌گوید برای سازگاری گسترده سخت‌افزاری انتخاب کرده است. تحلیلگران Bank of America به رهبری الکس لیو در یادداشتی که توسط CNBC نقل شده است، گفتند که K3 نشان می‌دهد پیش‌آموزش در مقیاس بزرگ به علاوه کار معماری همچنان می‌تواند با وجود محدودیت‌های محاسباتی، پیشرفت‌های چشمگیری را برای مدل‌های پرچمدار چینی به ارمغان بیاورد.

بنچمارک بهینه‌سازی هسته Moonshot بر روی Nvidia H200 و آنچه وبلاگ تنها به عنوان “GPGPU از یک فروشنده جایگزین” شناسایی می‌کند (که شرکت نامی از آن نبرد) اجرا شد. MiniTriton، یک کامپایلر شبیه Triton که K3 از ابتدا ساخته است، در برابر Triton بر روی Nvidia L20، کارت مبتنی بر Ada که تحت قوانین صادراتی ایالات متحده به چین فروخته می‌شود، نمودار شده است. Moonshot توصیه می‌کند K3 را بر روی سوپرنودهایی با 64 یا بیشتر شتاب‌دهنده سرویس‌دهی کند و ترافیک موازی متخصص را در یک دامنه با پهنای باند بالا نگه دارد. وبلاگ نمی‌گوید سخت‌افزار H200 کجاست؛ کنگره در ژانویه لایحه‌ای را برای بستن شکاف اجاره ابری فراساحلی تصویب کرد که به شرکت‌های چینی دسترسی از راه دور به شتاب‌دهنده‌های محدود شده را می‌داد.

در یک مطالعه موردی، K3 یک اجرای مستقل 48 ساعته را صرف طراحی یک تراشه استنتاج شبیه‌سازی شده برای یک مدل نانو کرد که بر اساس معماری خود آن ساخته شده بود، با استفاده از ابزارهای EDA متن‌باز و کتابخانه Nangate 45nm. این طراحی زمان‌بندی را در 100 مگاهرتز در مساحت 4 میلی‌متر مربع به پایان رساند، 1.46 میلیون سلول استاندارد و یک آرایه MAC INT4 را در خود جای داد و بیش از 8,700 توکن در ثانیه رمزگشایی شبیه‌سازی شده را حفظ کرد.

در حال حاضر، هر عدد منتشر شده K3 ادعایی است که توسط Moonshot گزارش شده یا از طریق دسترسی API به دست آمده و تا زمانی که وزن‌ها در 27 جولای عمومی نشوند، قابل تأیید نیست. Anthropic در فوریه Moonshot را متهم کرد که از 3.4 میلیون تبادل Claude برای آموزش مدل‌های خود از طریق تقطیر استفاده کرده است، و K3 اکنون در بنچمارک‌ها در چند امتیاز از مدل‌های ذکر شده در آن شکایت قرار دارد.

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *

جستجو در سایت

سبد خرید

درحال بارگذاری ...
بستن
مقایسه
مقایسه محصولات
لیست مقایسه محصولات شما خالی می باشد!