Colibrì proof-of-concept gains frontier-level 1.5-TB AI model — novel approach runs on only 25GB of RAM and shows promise for local AI setups | Tom's HardwareTom's Hardware

Colibrì: گامی بلند برای هوش مصنوعی محلی؛ اجرای مدل ۱.۵ ترابایتی با تنها ۲۵ گیگابایت رم

اجرای مدل‌های زبان بزرگ (LLM) و عامل‌های هوش مصنوعی در تنظیمات آزمایشگاه خانگی به دلیل افزایش هزینه اشتراک ربات‌های هوش مصنوعی و نگرانی‌ها در مورد حریم خصوصی داده‌ها، به طور پیوسته در حال افزایش محبوبیت است. متأسفانه، یک رک Nvidia NVL72 کمی فراتر از توان مالی اکثر مردم است، بنابراین علاقه‌مندان مجبورند با مدل‌هایی کار کنند که می‌توانند با مقدار محدودی حافظه اجرا شوند. مهندس ایتالیایی وینچنزو (معروف به JustVugg) ظاهراً می‌خواست هم کیک خود را داشته باشد و هم آن را بخورد، بنابراین او Colibrì را ایجاد کرد تا مدل GLM-5.2 با ۷۴۴ میلیارد پارامتر و حجم ۱.۵ ترابایت را روی یک CPU معمولی، تنها ۲۵ گیگابایت رم و یک درایو NVMe مجازی با سرعت ۱ گیگابایت بر ثانیه اجرا کند.

Nvidia

بیایید به نکته اصلی بپردازیم: سرعت Colibrì در تنظیمات وینچنزو به طور متوسط تنها حدود ۰.۰۵ تا ۰.۱ توکن در ثانیه است، معیاری که برای مکالمات عملی غیرقابل استفاده است — تصور کنید پاسخ دادن به یک سوال ساعت‌ها طول بکشد. تنظیمات پیشرفته‌تر ارقام بسیار بهتری ارائه می‌دهند، اما در حال حاضر، هنوز به ۲۰ تا ۳۰ توکن در ثانیه مورد نیاز برای استفاده بلادرنگ نمی‌رسند.

با این حال، GLM-5.2 یک مدل Mixture-of-Experts (MoE) با قابلیت‌های سطح پیشرفته است، حداقل در فاصله دید بهترین محصولات Anthropic، OpenAI و غیره. این بدان معناست که کیفیت پاسخ‌ها باید عالی باشد و خود وینچنزو می‌گوید آزمایش‌های محدود او نتایج چشمگیری به همراه داشته است. نحوه کار Colibrì به اندازه کافی ساده است که بتوان آن را توصیف کرد، اما انجام صحیح آن دشوار است: بارگذاری مدل به صورت قطعات در رم. ما برای وضوح بیشتر، آن را بیش از حد ساده‌سازی می‌کنیم.

یک مدل MoE مانند GLM-5.2 شامل صدها زیرمدل متخصص برای پاسخگویی به موضوعات مختلف است، و این‌ها به ازای هر توکن انتخاب می‌شوند، نه به ازای هر پرس و جو — به این معنی که وقتی سوالی می‌پرسید، کلمات شما به توکن‌ها (قطعات) تقسیم می‌شوند. برای هر توکن، ربات بهترین متخصصان را برای آن فعال می‌کند. متخصصان ممکن است همیشه برای کل سوال یکسان باشند، اما اغلب اوقات، یک پرس و جو ممکن است ده‌ها متخصص را به کار گیرد، که احتمالاً به سه رقم نیز می‌رسد.

در حالی که معمولاً بخش‌های بزرگی از مدل، یا کل مدل، روی GPUهای مرکز داده متصل بارگذاری می‌شوند، Colibrì از معماری MoE بهره می‌برد و متخصصان مورد نیاز برای هر توکن را به طور مکرر بارگذاری/تخلیه می‌کند، که به یک ماشین ارزان‌قیمت نیز اجازه می‌دهد تا یک مدل بزرگ را با کاهش شدید عملکرد استفاده کند. برای سرعت و سادگی، کد انتخاب متخصص Colibrì یک فایل C واحد با وابستگی‌های بسیار کم است. علاوه بر این، مدل GLM-5.2 کوانتیزه شده (ساده‌سازی شده با کدگذاری با اتلاف) تا فضای کمتری را اشغال کند.

اگر فکر می‌کنید که بارگذاری و تخلیه داده‌ها برای هر بخش از کلمات یک سوال، ضربه سختی به ورودی/خروجی ذخیره‌سازی و پهنای باند حافظه وارد می‌کند، کاملاً درست فکر می‌کنید. در این نوع تنظیمات، سرعت ذخیره‌سازی NVMe اولین گلوگاه اصلی است، اما این “قیف” معروف در پیکربندی‌های مختلف متفاوت است. پهنای باند ذخیره‌سازی کافی به آن بدهید، سپس با محدودیت‌های رم مواجه می‌شوید. آن را برطرف کنید، سپس به هسته‌های CPU بیشتری نیاز دارید و الی آخر.

Colibrì در حال حاضر یک اثبات مفهوم است و هنوز روی GPUها اجرا نمی‌شود، اگرچه لازم به ذکر است که حتی در آن صورت، جابجایی داده‌ها به/از کارت تقریباً مطمئناً بزرگترین محدودیت خواهد بود. با این حال، این پروژه به تازگی منتشر شده و در حال حاضر بسیار محبوب است. وینچنزو در حال جمع‌آوری داده‌های بنچمارک و اعمال اصلاحات است، بنابراین حتماً از مخزن بازدید کنید تا در صورت امکان مشارکت داشته باشید. شاید در مقطعی امکان‌پذیر باشد که یک مدل واقعاً هوشمند را روی سخت‌افزار مصرف‌کننده رده بالا با سرعت کافی اجرا کرد.

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *

جستجو در سایت

سبد خرید

درحال بارگذاری ...
بستن
مقایسه
مقایسه محصولات
لیست مقایسه محصولات شما خالی می باشد!