با افزایش هزینههای اشتراک هوش مصنوعی و نگرانیهای حریم خصوصی، اجرای مدلهای زبان بزرگ (LLM) محبوبیت یافته، اما سختافزارهای قدرتمند گران هستند. مهندس ایتالیایی وینچنزو (JustVugg) با پروژه Colibrì، راه حلی نوآورانه ارائه داده: اجرای مدل عظیم GLM-5.۲ با ۷۴۴ میلیارد پارامتر و حجم ۱.۵ ترابایت، تنها با ۲۵ گیگابایت رم و یک CPU معمولی. این دستاورد، گامی مهم برای دسترسیپذیری هوش مصنوعی پیشرفته در تنظیمات محلی است.
اگرچه سرعت فعلی Colibrì (حدود ۰.۰۵ تا ۰.۱ توکن بر ثانیه) برای مکالمات بلادرنگ عملی نیست، کیفیت پاسخهای مدل GLM-5.۲ (MoE) بالا است. Colibrì با بارگذاری و تخلیه هوشمندانه بخشهای تخصصی مدل به ازای هر توکن، از معماری MoE بهره میبرد و به سختافزارهای ارزانتر اجرای مدلهای بزرگ را ممکن میسازد. این پروژه یک اثبات مفهوم است و پتانسیل بالایی برای آینده هوش مصنوعی محلی و اجرای مدلهای پیچیده روی سختافزارهای مصرفکننده دارد.
- کولبات
- تیر 20, 1405






