برای بیشتر سازمانهای ایرانی، استفاده از مدلهای زبانی بزرگ از راه سرویسهای خارجی سه مانع دارد: دادهی سازمان باید از کشور خارج شود، دسترسی به این سرویسها پایدار نیست و پرداخت و ساخت حساب کاربری دردسر دارد. مدل محلی، یعنی مدلی که روی سرور خود سازمان اجرا میشود، هر سه را حل میکند.
اما مدل محلی جایگزین کامل بزرگترین مدلهای تجاری نیست. تصمیم درست از اینجا شروع میشود که بدانید برای چه کاری میخواهیدش.
کجا خوب کار میکند
- پاسخ از روی اسناد داخلی — آییننامهها، مستندات فنی، قراردادها. مدل فقط از متنی که به آن داده میشود پاسخ میدهد و منبع پاسخ را هم نشان میدهد. به این روش RAG میگویند.
- دستهبندی و استخراج — تشخیص موضوع ایمیل یا تیکت، بیرون کشیدن مبلغ و تاریخ از فاکتور، خلاصه کردن یک گزارش طولانی.
- پیشنویس — پاسخ اولیه به درخواستهای تکراری، که یک نفر پیش از ارسال بازبینیاش میکند.
کجا باید مراقب بود
- استدلال طولانی و چندمرحلهای — مدلهای کوچکتر در زنجیرههای طولانی استدلال زودتر اشتباه میکنند.
- زبان فارسی — کیفیت مدلها در فارسی با هم تفاوت زیادی دارد و معمولاً از انگلیسی ضعیفتر است. پیش از انتخاب، مدل را روی نمونهی واقعی اسناد خودتان بسنجید، نه روی جدول امتیازها.
- تصمیم نهایی — در هر کاری که پول، قرارداد یا دسترسی را جابهجا میکند، خروجی مدل پیشنهاد است و یک نفر تأییدش میکند. تأیید انسانی در اتوماسیون را ببینید.
چه سختافزاری لازم است
محدودیت اصلی، حافظه است. مدلها معمولاً بهصورت فشرده (کوانتیزه، مثلاً ۴ بیتی) اجرا میشوند و در این حالت هر میلیارد پارامتر تقریباً نیم تا دو سوم گیگابایت حافظه میگیرد، بهعلاوهی حافظهای که متن ورودی لازم دارد.
| اندازهی مدل | حافظهی تقریبی در حالت ۴ بیتی | مناسب برای |
|---|---|---|
| ۷ تا ۸ میلیارد پارامتر | حدود ۵ تا ۶ گیگابایت | دستهبندی، استخراج، خلاصه |
| ۱۳ تا ۱۴ میلیارد پارامتر | حدود ۹ تا ۱۰ گیگابایت | پاسخ از روی اسناد با کیفیت بهتر |
| حدود ۷۰ میلیارد پارامتر | ۴۰ گیگابایت و بیشتر | کارهای پیچیدهتر، با کارت گرافیک قوی یا چند کارت |
مدلهای کوچک روی CPU و حافظهی معمولی سرور هم اجرا میشوند، اما کند. برای کار تعاملی با چند کاربر همزمان، کارت گرافیک با حافظهی کافی تفاوت اصلی را میسازد. برای شروع، llama.cpp و Ollama رایجاند؛ برای سرویسدهی به کاربران زیاد روی GPU، vLLM.
محلی بودن، امن بودن نیست
- مدل فقط به اسنادی دسترسی داشته باشد که کاربرِ پرسنده اجازهی دیدنشان را دارد. سامانهی RAG که همهی اسناد را برای همه جستجو میکند، خودش یک نشت اطلاعات است.
- متنی که از بیرون میآید، مثل ایمیل، پیوست یا صفحهی وب، میتواند دستورهای پنهان برای مدل داشته باشد. به مدلی که چنین متنی را میخواند، اجازهی انجام کار حساس ندهید.
- پرسشها و پاسخها را ثبت کنید؛ هم برای بهتر کردن کیفیت و هم برای پیگیری.
از کجا شروع کنیم
یک کار مشخص و محدود انتخاب کنید، مثلاً «پاسخ به پرسشهای کارکنان از روی آییننامهی منابع انسانی». پنجاه پرسش واقعی جمع کنید، پاسخ درستشان را بنویسید و دو یا سه مدل را روی همین پنجاه پرسش بسنجید. این آزمون کوچک، بیشتر از هر جدول مقایسهای به شما میگوید مدل محلی برای کارتان کافی است یا نه.