Colibrì: گامی بلند برای هوش مصنوعی محلی؛ اجرای مدل ۱.۵ ترابایتی با تنها ۲۵ گیگابایت رم
اجرای مدلهای زبان بزرگ (LLM) و عاملهای هوش مصنوعی در تنظیمات آزمایشگاه خانگی به دلیل افزایش هزینه اشتراک رباتهای هوش مصنوعی و نگرانیها در مورد حریم خصوصی دادهها، به طور پیوسته در حال افزایش محبوبیت است. متأسفانه، یک رک Nvidia NVL72 کمی فراتر از توان مالی اکثر مردم است، بنابراین علاقهمندان مجبورند با مدلهایی کار کنند که میتوانند با مقدار محدودی حافظه اجرا شوند. مهندس ایتالیایی وینچنزو (معروف به JustVugg) ظاهراً میخواست هم کیک خود را داشته باشد و هم آن را بخورد، بنابراین او Colibrì را ایجاد کرد تا مدل GLM-5.2 با ۷۴۴ میلیارد پارامتر و حجم ۱.۵ ترابایت را روی یک CPU معمولی، تنها ۲۵ گیگابایت رم و یک درایو NVMe مجازی با سرعت ۱ گیگابایت بر ثانیه اجرا کند.
بیایید به نکته اصلی بپردازیم: سرعت Colibrì در تنظیمات وینچنزو به طور متوسط تنها حدود ۰.۰۵ تا ۰.۱ توکن در ثانیه است، معیاری که برای مکالمات عملی غیرقابل استفاده است — تصور کنید پاسخ دادن به یک سوال ساعتها طول بکشد. تنظیمات پیشرفتهتر ارقام بسیار بهتری ارائه میدهند، اما در حال حاضر، هنوز به ۲۰ تا ۳۰ توکن در ثانیه مورد نیاز برای استفاده بلادرنگ نمیرسند.
با این حال، GLM-5.2 یک مدل Mixture-of-Experts (MoE) با قابلیتهای سطح پیشرفته است، حداقل در فاصله دید بهترین محصولات Anthropic، OpenAI و غیره. این بدان معناست که کیفیت پاسخها باید عالی باشد و خود وینچنزو میگوید آزمایشهای محدود او نتایج چشمگیری به همراه داشته است. نحوه کار Colibrì به اندازه کافی ساده است که بتوان آن را توصیف کرد، اما انجام صحیح آن دشوار است: بارگذاری مدل به صورت قطعات در رم. ما برای وضوح بیشتر، آن را بیش از حد سادهسازی میکنیم.
یک مدل MoE مانند GLM-5.2 شامل صدها زیرمدل متخصص برای پاسخگویی به موضوعات مختلف است، و اینها به ازای هر توکن انتخاب میشوند، نه به ازای هر پرس و جو — به این معنی که وقتی سوالی میپرسید، کلمات شما به توکنها (قطعات) تقسیم میشوند. برای هر توکن، ربات بهترین متخصصان را برای آن فعال میکند. متخصصان ممکن است همیشه برای کل سوال یکسان باشند، اما اغلب اوقات، یک پرس و جو ممکن است دهها متخصص را به کار گیرد، که احتمالاً به سه رقم نیز میرسد.
در حالی که معمولاً بخشهای بزرگی از مدل، یا کل مدل، روی GPUهای مرکز داده متصل بارگذاری میشوند، Colibrì از معماری MoE بهره میبرد و متخصصان مورد نیاز برای هر توکن را به طور مکرر بارگذاری/تخلیه میکند، که به یک ماشین ارزانقیمت نیز اجازه میدهد تا یک مدل بزرگ را با کاهش شدید عملکرد استفاده کند. برای سرعت و سادگی، کد انتخاب متخصص Colibrì یک فایل C واحد با وابستگیهای بسیار کم است. علاوه بر این، مدل GLM-5.2 کوانتیزه شده (سادهسازی شده با کدگذاری با اتلاف) تا فضای کمتری را اشغال کند.
اگر فکر میکنید که بارگذاری و تخلیه دادهها برای هر بخش از کلمات یک سوال، ضربه سختی به ورودی/خروجی ذخیرهسازی و پهنای باند حافظه وارد میکند، کاملاً درست فکر میکنید. در این نوع تنظیمات، سرعت ذخیرهسازی NVMe اولین گلوگاه اصلی است، اما این “قیف” معروف در پیکربندیهای مختلف متفاوت است. پهنای باند ذخیرهسازی کافی به آن بدهید، سپس با محدودیتهای رم مواجه میشوید. آن را برطرف کنید، سپس به هستههای CPU بیشتری نیاز دارید و الی آخر.
Colibrì در حال حاضر یک اثبات مفهوم است و هنوز روی GPUها اجرا نمیشود، اگرچه لازم به ذکر است که حتی در آن صورت، جابجایی دادهها به/از کارت تقریباً مطمئناً بزرگترین محدودیت خواهد بود. با این حال، این پروژه به تازگی منتشر شده و در حال حاضر بسیار محبوب است. وینچنزو در حال جمعآوری دادههای بنچمارک و اعمال اصلاحات است، بنابراین حتماً از مخزن بازدید کنید تا در صورت امکان مشارکت داشته باشید. شاید در مقطعی امکانپذیر باشد که یک مدل واقعاً هوشمند را روی سختافزار مصرفکننده رده بالا با سرعت کافی اجرا کرد.
- کولبات
- تیر 20, 1405
- 55 بازدید






