برای بیشتر سازمان‌های ایرانی، استفاده از مدل‌های زبانی بزرگ از راه سرویس‌های خارجی سه مانع دارد: داده‌ی سازمان باید از کشور خارج شود، دسترسی به این سرویس‌ها پایدار نیست و پرداخت و ساخت حساب کاربری دردسر دارد. مدل محلی، یعنی مدلی که روی سرور خود سازمان اجرا می‌شود، هر سه را حل می‌کند.

اما مدل محلی جایگزین کامل بزرگ‌ترین مدل‌های تجاری نیست. تصمیم درست از اینجا شروع می‌شود که بدانید برای چه کاری می‌خواهیدش.

کجا خوب کار می‌کند

  • پاسخ از روی اسناد داخلی — آیین‌نامه‌ها، مستندات فنی، قراردادها. مدل فقط از متنی که به آن داده می‌شود پاسخ می‌دهد و منبع پاسخ را هم نشان می‌دهد. به این روش RAG می‌گویند.
  • دسته‌بندی و استخراج — تشخیص موضوع ایمیل یا تیکت، بیرون کشیدن مبلغ و تاریخ از فاکتور، خلاصه کردن یک گزارش طولانی.
  • پیش‌نویس — پاسخ اولیه به درخواست‌های تکراری، که یک نفر پیش از ارسال بازبینی‌اش می‌کند.

کجا باید مراقب بود

  • استدلال طولانی و چندمرحله‌ای — مدل‌های کوچک‌تر در زنجیره‌های طولانی استدلال زودتر اشتباه می‌کنند.
  • زبان فارسی — کیفیت مدل‌ها در فارسی با هم تفاوت زیادی دارد و معمولاً از انگلیسی ضعیف‌تر است. پیش از انتخاب، مدل را روی نمونه‌ی واقعی اسناد خودتان بسنجید، نه روی جدول امتیازها.
  • تصمیم نهایی — در هر کاری که پول، قرارداد یا دسترسی را جابه‌جا می‌کند، خروجی مدل پیشنهاد است و یک نفر تأییدش می‌کند. تأیید انسانی در اتوماسیون را ببینید.

چه سخت‌افزاری لازم است

محدودیت اصلی، حافظه است. مدل‌ها معمولاً به‌صورت فشرده (کوانتیزه، مثلاً ۴ بیتی) اجرا می‌شوند و در این حالت هر میلیارد پارامتر تقریباً نیم تا دو سوم گیگابایت حافظه می‌گیرد، به‌علاوه‌ی حافظه‌ای که متن ورودی لازم دارد.

اندازه‌ی مدلحافظه‌ی تقریبی در حالت ۴ بیتیمناسب برای
۷ تا ۸ میلیارد پارامترحدود ۵ تا ۶ گیگابایتدسته‌بندی، استخراج، خلاصه
۱۳ تا ۱۴ میلیارد پارامترحدود ۹ تا ۱۰ گیگابایتپاسخ از روی اسناد با کیفیت بهتر
حدود ۷۰ میلیارد پارامتر۴۰ گیگابایت و بیشترکارهای پیچیده‌تر، با کارت گرافیک قوی یا چند کارت

مدل‌های کوچک روی CPU و حافظه‌ی معمولی سرور هم اجرا می‌شوند، اما کند. برای کار تعاملی با چند کاربر هم‌زمان، کارت گرافیک با حافظه‌ی کافی تفاوت اصلی را می‌سازد. برای شروع، llama.cpp و Ollama رایج‌اند؛ برای سرویس‌دهی به کاربران زیاد روی GPU، vLLM.

محلی بودن، امن بودن نیست

  • مدل فقط به اسنادی دسترسی داشته باشد که کاربرِ پرسنده اجازه‌ی دیدنشان را دارد. سامانه‌ی RAG که همه‌ی اسناد را برای همه جستجو می‌کند، خودش یک نشت اطلاعات است.
  • متنی که از بیرون می‌آید، مثل ایمیل، پیوست یا صفحه‌ی وب، می‌تواند دستورهای پنهان برای مدل داشته باشد. به مدلی که چنین متنی را می‌خواند، اجازه‌ی انجام کار حساس ندهید.
  • پرسش‌ها و پاسخ‌ها را ثبت کنید؛ هم برای بهتر کردن کیفیت و هم برای پیگیری.

از کجا شروع کنیم

یک کار مشخص و محدود انتخاب کنید، مثلاً «پاسخ به پرسش‌های کارکنان از روی آیین‌نامه‌ی منابع انسانی». پنجاه پرسش واقعی جمع کنید، پاسخ درستشان را بنویسید و دو یا سه مدل را روی همین پنجاه پرسش بسنجید. این آزمون کوچک، بیشتر از هر جدول مقایسه‌ای به شما می‌گوید مدل محلی برای کارتان کافی است یا نه.