Moonshot AI مدل Kimi K3 را با وزنهای باز و هزینه کمتر منتشر کرد
خب، گربه هوش مصنوعی از کیسه بیرون آمد. پس از انتشار یک پست وبلاگی و مستندات API برای مدل جدید کیمی K3، شرکت چینی Moonshot AI به وعده خود مبنی بر انتشار رایگان وزنهای مدل عمل کرد، به این معنی که تقریباً هر کسی با یک مجموعه مدرن از پردازندههای گرافیکی هوش مصنوعی میتواند آن را اجرا کرده و با محدودیتهای کمی از آن کسب درآمد کند.
این یک ضربه جدی به رقبای بزرگ هوش مصنوعی، به ویژه Anthropic و OpenAI، محسوب میشود. جدیدترین مدلهای این شرکتها به ترتیب Claude Fable و GPT-5.6 Sol هستند، و اتفاقاً قابلیتهای Kimi K3 در بنچمارکهای Moonshot به وضوح نسلهای قبلی Claude و GPT را شکست میدهد و از Fable و Sol نیز عقب نمیماند – همه اینها در حالی است که به نظر میرسد اجرای آن حدود ۲ تا ۳ برابر ارزانتر است، و اگر یک درخواست خاص در حافظه کش قرار گیرد، تا ۱۰ برابر نیز ارزانتر میشود. گزارش فنی Moonshot ظاهراً بنچمارکهای منتشر شده هفته گذشته را تأیید میکند، زیرا این شرکت نرمافزار دقیقی را که برای آزمایش استفاده شده بود، فاش میکند.
برای مقایسه هزینههای استنتاج، Moonshot میگوید که هزینههای آن “به صورت داخلی اندازهگیری شدهاند” در مقایسه با قیمتگذاری توکنهای عمومی سایر شرکتها، اما ارقام بسیار چشمگیر هستند. برای ورودی، Moonshot برای Kimi K3 به ازای هر میلیون توکن ۳ دلار دریافت میکند. در همین حال، Fable ۱۰ دلار به ازای هر میلیون توکن و Sol ۵ دلار به ازای هر میلیون توکن هزینه دارد. این رقم برای ورودی استاندارد بدون کش است و از قبل بسیار خوب به نظر میرسد، اما ساختار کشینگ Kimi K3 ظاهراً دارای نرخ موفقیت ۹۰ درصدی برای وظایف کدنویسی است، که در صورت استفاده مکرر از کش، آن ۳ دلار را به ۰.۳۰ دلار به ازای هر میلیون توکن تبدیل میکند. این وضعیت برای توکنهای خروجی نیز تقریباً مشابه است.
یکی از دلایل احتمالی کارایی بالای Kimi K3 این است که از ترکیبی از MXFP4 برای وزنها و MXFP8 برای فعالسازی ورودی استفاده میکند، که هر دو از انواع داده با دقت نسبتاً پایین هستند و بنابراین برای اجرا با VRAM بسیار کمتری مناسباند. از ۲.۸ تریلیون پارامتر کیمی، تنها ۱۰۴.۲ میلیارد پارامتر در هر زمان فعال میشوند.
جالب اینجاست که گزارش Moonshot تنها به استفاده از Nvidia H20 برای اجرای Kimi در برخی تستهای کدنویسی اشاره میکند، که یک تراشه نسبتاً پایینرده با استانداردهای امروزی است. آن پردازنده گرافیکی برخلاف تراشههای سری Blackwell B که تحت کنترل صادرات هستند، از انواع ممیز شناور MX پشتیبانی بومی ندارد.
به نوبه خود، این میتواند به این معنی باشد که بهینهسازیهای Kimi K3 آن را به ویژه برای اجرا بر روی سختافزارهای پایینرده مناسب میسازد، اما حدس زدن اینکه اجرای آن بر روی چیزی مانند Nvidia Blackwell یا سایر سیلیکونهای بومی MXFP میتواند آن را حتی مقرونبهصرفهتر از بنچمارکهای ارائه شده کند، به همان اندازه منطقی است. برای تأیید این گمانهزنی باید منتظر ارقام رسمی بیشتری باشیم.
علاوه بر این، Kimi K3 از یک ذخیرهساز کلید-مقدار (KV) معمولی که دائماً در حال گسترش است، استفاده نمیکند، بلکه به یک کنترلکننده حالت با اندازه ثابت به نام Kimi Delta Attention متکی است که باز هم از نظر تئوری هم در VRAM و هم در زمان اجرا صرفهجویی میکند. ترکیب متخصصان (MoE) آن به ویژه پراکنده است و تنها ۱۶ مورد از ۸۹۶ مورد در هر زمان فعال میشوند که بیشتر به کاهش هزینههای استنتاج کمک میکند. به طور کلی، Moonshot برای بهینهسازی در هر لایه از استنتاج تلاش کرده تا از سربار غیرضروری جلوگیری کرده و هزینه استنتاج را کاهش دهد.
این میتواند خبر بدی برای OpenAI و Anthropic باشد، با توجه به اینکه اکنون تقریباً هر کسی با پردازندههای گرافیکی هوش مصنوعی مناسب میتواند رقیب مستقیم آنها شود، و این واقعیت که Kimi K3 با وزنهای باز (open-weight) منتشر شده است، این تصور را ایجاد میکند که نرمافزار “رایگان” تقریباً به همان خوبی و بسیار ارزانتر از رقبای اختصاصی خود است. لازم به ذکر است که وزنهای باز به معنای متنباز (open-source) نیست؛ فرآیند آموزش و مجموعه داده همچنان راز ویژه Moonshot باقی میماند.
- کولبات
- مرداد 5, 1405
- 16 بازدید






