کدام GPU برای کدام مدل هوش مصنوعی؟ راهنمای کامل انتخاب کارت گرافیک

یکی از پرتکرارترین سؤالها در دنیای هوش مصنوعی این است: «چه کارت گرافیکی برای اجرای فلان مدل لازم دارم؟» جوابِ کوتاه، به یک عددِ ساده برمیگردد: VRAM (حافظهی کارت گرافیک). اما جوابِ کاملْ کمی پیچیدهتر است، چون به این بستگی دارد که میخواهید مدل را فقط اجرا (inference) کنید، فاینتیون کنید، یا از صفر آموزش بدهید؛ و اینکه از کوانتیزیشن استفاده میکنید یا نه.
این مقاله یک مرجعِ کامل و کاربردی است: از فرمولِ محاسبهی VRAM و مفاهیم پایه گرفته تا یک جدولِ جامع «کدام مدل → چه منابعی → کدام GPU»، راهنمای انتخاب بر اساس بودجه و کاربرد، مدلهای تصویری و صوتی، فاینتیون، و در نهایت اینکه بخرید یا از ابر اجاره کنید. هدف این است که بعد از خواندنش، بتوانید برای هر پروژهی هوش مصنوعی، مطمئن و بدون حدسوگمان GPU درست را انتخاب کنید.
پاسخ سریع: مهمترین عدد، VRAM است
برای اجرای یک مدل زبانی، بهطور تقریبی به این مقدار VRAM نیاز دارید: هر ۱ میلیارد پارامتر ≈ ۲ گیگ در دقت FP16، حدود ۱ گیگ در INT8، و حدود ۰٫۵ گیگ در INT4/Q4 — بهعلاوهی ۱۵ تا ۲۰٪ سرریز برای KV cache و overhead. پس یک مدلِ ۷ میلیاردی با کوانتیزیشن Q4 روی یک کارت ۱۲ گیگی مثل RTX 3060 اجرا میشود، اما یک مدلِ ۷۰ میلیاردی حتی با Q4 حدود ۴۰ گیگ میخواهد (یعنی دو کارت ۲۴ گیگی یا یک کارت ۴۸ گیگی). VRAM تعیین میکند که آیا مدل اصلاً اجرا میشود؛ پهنای باندِ حافظه تعیین میکند چقدر سریع.

چرا VRAM مهمترین عدد است؟
وقتی یک مدل هوش مصنوعی اجرا میشود، باید کلِ «وزنهای» آن (یعنی پارامترها) بهطور همزمان در حافظهای بارگذاری شوند که پردازندهی گرافیکی بتواند با سرعتِ بالا به آنها دسترسی داشته باشد. این حافظه، همان VRAM روی کارت گرافیک است. اگر مدل در VRAM جا نشود، یا اصلاً اجرا نمیشود، یا مجبور میشوید بخشی از آن را به رَمِ سیستم بریزید که سرعت را بهشدت — گاهی تا ۳۰ برابر — پایین میآورد.
سه عاملِ سختافزاری در کارِ هوش مصنوعی نقش دارند و بهتر است از همان ابتدا نقش هرکدام را بدانید:
- ظرفیت VRAM (چند گیگ): تعیین میکند آیا مدل جا میشود. مهمترین عامل.
- پهنای باند حافظه (چند گیگابایت بر ثانیه): تعیین میکند چقدر سریع توکن تولید میشود. برای اجرا (inference) این عامل، گلوگاهِ اصلی است.
- توان محاسباتی (TFLOPS): بیشتر در آموزش و پردازشِ دستهایِ سنگین اهمیت دارد.
یک تشبیه ساده: VRAM مثل «میز کار» شماست. مدل و همهی برگههای کاریاش باید روی میز جا شوند تا سریع کار کنید. اگر روی میز جا نشد و مجبور شوید هر بار به کمدِ اتاقِ بغلی (رَمِ سیستم) بروید و برگردید، کار به کندی میخزد.
مفاهیم پایه: پارامتر، دقت (Precision) و بایت
قبل از فرمولها، چند مفهوم را روشن کنیم:
- پارامتر (Parameter): عددهایی که «دانشِ» مدل در آنها ذخیره شده است. وقتی میگوییم «مدلِ ۷ میلیاردی» یعنی ۷ میلیارد پارامتر دارد. هرچه بیشتر، باهوشتر اما سنگینتر.
- دقت / Precision: اینکه هر پارامتر با چند بیت ذخیره میشود. رایجترینها: FP32 (۴ بایت)، FP16/BF16 (۲ بایت)، INT8/FP8 (۱ بایت)، INT4 (نیم بایت).
- VRAM در برابر RAM: VRAM حافظهی روی خودِ کارت گرافیک است (سریع، اما محدود). RAM حافظهی سیستم است (بزرگتر اما بسیار کندتر برای این کار). مدل باید در VRAM باشد.
پس مصرفِ حافظهی وزنهای مدل، حاصلضربِ سرراستِ «تعداد پارامتر × بایتبهازای هر پارامتر» است:
| دقت (Precision) | بایت بهازای هر پارامتر | مصرف برای هر ۱ میلیارد پارامتر |
|---|---|---|
| FP32 | ۴ بایت | ~۴ گیگابایت |
| FP16 / BF16 | ۲ بایت | ~۲ گیگابایت |
| INT8 / FP8 | ~۱ بایت | ~۱ گیگابایت |
| INT4 / Q4 | ~۰٫۵ بایت | ~۰٫۵ گیگابایت |
فرمول تخمین VRAM (که باید حفظ کنید)
یک فرمولِ ساده و پذیرفتهشده در صنعت برای تخمینِ VRAMِ لازم برای اجرا این است:
VRAM (GB) ≈ پارامتر (میلیارد) × (بیت ÷ 8) × 1.2
ضریب ۱٫۲ یعنی حدود ۲۰٪ اضافه برای KV cache، فعالسازیها و overheadِ فریمورک.
یا سادهتر، با قاعدهی سرانگشتی: ۲ گیگ بهازای هر میلیارد پارامتر در FP16، نصف آن در INT8، و یکچهارم در INT4. چند مثالِ واقعی:
| مدل | FP16 | INT8 | INT4 / Q4 |
|---|---|---|---|
| ۷ میلیاردی (مثل Mistral 7B) | ~۱۴ تا ۱۶ گیگ | ~۸ گیگ | ~۵ گیگ |
| ۱۳–۱۴ میلیاردی (مثل Phi-4) | ~۲۸ گیگ | ~۱۴ گیگ | ~۸–۹ گیگ |
| ۷۰ میلیاردی (مثل Llama 3.3 70B) | ~۱۴۰ گیگ | ~۷۰ گیگ | ~۴۰ گیگ |
یک نکتهی طلایی: حجمِ فایلِ مدل (مثلاً در Ollama) حداقلِ VRAMِ شماست؛ حدود ۱۰ تا ۲۰٪ به آن اضافه کنید تا جای KV cache هم باز شود.
کوانتیزیشن: کلیدی که قفلِ VRAM را باز میکند
اگر VRAM «دروازه» است، کوانتیزیشن «کلید» آن است. کوانتیزیشن یعنی ذخیرهی وزنهای مدل با بیتِ کمتر (مثلاً بهجای ۱۶ بیت، ۴ بیت). این کار حافظهی موردنیاز را چند برابر کم میکند و کیفیت را فقط کمی افت میدهد — دقیقاً مثل فشردهسازیِ یک عکس با فرمت JPEG که حجم را بسیار کم میکند اما چشمِ شما تفاوت را بهسختی میبیند.
روشها و فرمتهای رایج کوانتیزیشن
- GGUF (و مخصوصاً Q4_K_M): محبوبترین فرمت برای اجرای محلی با llama.cpp و Ollama و LM Studio. روشِ ترکیبیِ ۴ و ۶ بیت که لایههای حساس را با دقتِ بالاتر نگه میدارد. تعادلِ عالیِ حجم به کیفیت.
- AWQ: کوانتیزیشنِ «آگاه از فعالسازی» که کانالهای مهمِ وزنها را حفظ میکند؛ کیفیت را بهتر از GPTQ نگه میدارد. گزینهی پیشنهادیِ INT4 برای استقرار روی GPU.
- GPTQ: فقط روی GPU، سریع، اما در برخی بنچمارکها روی کدنویسی افتِ کیفیتِ بیشتری نشان میدهد.
- FP8: استانداردِ محیطهای تولیدی روی کارتهای H100/H200؛ حدود ۳۳٪ سریعتر از FP16 با افتِ کیفیتِ تقریباً صفر.
| دقت | بایت/پارامتر | حفظ کیفیت (تقریبی) | توصیه |
|---|---|---|---|
| FP16 / BF16 | ۲ | ۱۰۰٪ (مبنا) | بالاترین کیفیت؛ آموزش و محیطهای حساس |
| FP8 / INT8 | ~۱ | ~۹۸–۹۹٪ | تعادلِ عالیِ کیفیت و حافظه |
| Q4_K_M / INT4-AWQ | ~۰٫۵ | ~۹۳٪ | «نقطهی شیرین» برای اجرای محلی |
| Q3 و پایینتر | <۰٫۵ | افتِ محسوس | فقط اگر واقعاً مجبورید |
توصیهی عملی: برای کارهای عمومی و گفتوگو، Q4_K_M بهترین انتخاب است. اما برای کارهای ریاضی، کدنویسی و استدلالِ سنگین که به دقت حساساند، به Q8 یا FP16 نزدیک بمانید، چون افتِ کیفیتِ INT4 دقیقاً همانجاها بیشتر خودش را نشان میدهد.
KV cache و طول کانتکست: هزینهی پنهانِ حافظه
وقتی مدل متن تولید میکند، برای هر توکن یک حافظهی موقت به نام KV cache نگه میدارد تا مجبور نباشد محاسبات را از اول تکرار کند. این حافظه مستقل از کوانتیزیشنِ وزنها و خطی با طول کانتکست رشد میکند — و در کانتکستهای طولانی میتواند از خودِ وزنها هم بزرگتر شود.
برای یک مدلِ ۷۰ میلیاردی، هر توکن حدود ۰٫۳۳ مگابایت KV cache میخواهد:
| طول کانتکست | KV cache اضافه (مدل ۷۰B) |
|---|---|
| ۴٬۰۰۰ توکن | ~۱٫۳ گیگ |
| ۳۲٬۰۰۰ توکن | ~۱۰ گیگ |
| ۱۲۸٬۰۰۰ توکن | ~۴۲ گیگ |
| ۲۵۶٬۰۰۰ توکن | ~۸۴ گیگ |
یعنی یک مدلِ ۷۰B با Q4 (وزنها ~۴۰ گیگ) که کانتکستِ ۱۲۸ هزارتایی اجرا میکند، مجموعاً حدود ۸۲ گیگ میخواهد — نیمی وزنها، نیمی KV cache. اگر چند کاربرِ همزمان داشته باشید، این عدد ضرب میشود. راهکارها: کوانتیزیشنِ خودِ KV cache (FP8/INT8) و محدود کردنِ کانتکست به چیزی که واقعاً لازم دارید.
جدول اصلی: کدام GPU برای کدام مدل زبانی؟
این جدول، قلبِ مقاله است. برای هر اندازهی مدل، مقدار VRAM در دقتهای مختلف و پیشنهادِ کارت گرافیک را میبینید. ستونِ «حداقل GPU» یعنی ارزانترین گزینهای که با Q4 مدل را اجرا میکند، و «GPU پیشنهادی» یعنی گزینهای که با حاشیهی امنِ راحت کار میکند.
| مدل | پارامتر | FP16 | Q8 | Q4 | حداقل GPU (Q4) | GPU پیشنهادی |
|---|---|---|---|---|---|---|
| Llama 3.2 / Gemma 3 | ۱–۳B | ~۳–۷ گیگ | ~۲–۳٫۵ | ~۱–۳ گیگ | هر کارت / حتی CPU | RTX 3060 12GB |
| Llama 3.1 / Mistral / Qwen | ۷–۸B | ~۱۶ گیگ | ~۸ | ~۵ گیگ | RTX 3060 12GB | RTX 4060 Ti 16GB |
| Phi-4 / Qwen3 / R1-Distill | ۱۴B | ~۲۸ گیگ | ~۱۴ | ~۸–۹ گیگ | RTX 3060 12GB (تنگ) | RTX 4070 Ti Super 16GB |
| Gemma 3 27B | ۲۷B | ~۵۵ گیگ | ~۲۷ | ~۱۴–۱۵ گیگ | RTX 3090/4090 24GB | RTX 4090 24GB |
| Qwen3 32B / R1-Distill 32B | ۳۲B | ~۶۴ گیگ | ~۳۲ | ~۱۹–۲۰ گیگ | RTX 3090/4090 24GB | RTX 5090 32GB |
| Mixtral 8x7B (MoE) | ۴۷B | ~۹۴ گیگ | ~۵۰ | ~۲۸ گیگ | RTX 5090 32GB / ۲×۲۴ | A6000 48GB / L40S |
| Llama 3.3 70B / R1-Distill 70B | ۷۰B | ~۱۴۰ گیگ | ~۷۰ | ~۴۰ گیگ | ۲×۲۴GB یا ۱×۴۸GB | A100 80GB / H100 |
| Qwen3 235B (MoE) | ۲۳۵B | ~۴۷۰ گیگ | ~۲۳۵ | ~۱۳۲ گیگ | چند GPU | ۲× H100/H200 |
| Llama 3.1 405B | ۴۰۵B | ~۸۱۰ گیگ | ~۴۰۵ | ~۲۳۰ گیگ | ۸× H100 | ۸× H200 |
| DeepSeek V3 / R1 (MoE) | ۶۷۱B | ~۱٫۳ ترابایت | ~۷۰۰ | ~۳۷۶ گیگ | ۸× H200 | ۸× H200 (یک نود) |
نکتهی مهم دربارهی مدلهای MoE: مدلهایی مثل Mixtral و DeepSeek و Qwen3-235B «ترکیبی از متخصصها» (Mixture of Experts) هستند. هرچند در هر توکن فقط بخشی از پارامترها فعال میشوند و سرعتشان خوب است، اما همهی متخصصها باید در VRAM حاضر باشند. پس حافظهی موردنیازشان به کلِ پارامترها بستگی دارد، نه پارامترهای فعال. این بزرگترین اشتباهِ رایج دربارهی MoE است.
دستهبندی بر اساس ظرفیت VRAM: با کارتِ شما چه میشود اجرا کرد؟

۸ تا ۱۲ گیگ — ردهی ورودی
کارتهایی مثل RTX 3060 12GB. مناسبِ مدلهای ۷ تا ۸ میلیاردی با Q4، تولید تصویر با Stable Diffusion، و مدلهای صوتی. نقطهی شروعِ عملی برای اجرای محلی. RTX 3060 12GB بهخاطر قیمتِ پایین و ۱۲ گیگ حافظه، محبوبترین کارتِ «شروع هوش مصنوعی» است.
۱۶ تا ۲۴ گیگ — ردهی شیرین (Sweet Spot)
کارتهایی مثل RTX 4060 Ti 16GB، RTX 3090 و RTX 4090 (هر دو ۲۴ گیگ). این رده، بهترین تعادلِ قیمت به قابلیت را دارد: مدلهای تا ۳۲ میلیاردی با Q4، مدلهای تصویریِ سنگین مثل FLUX، و فاینتیونِ QLoRA روی مدلهای ۱۳ میلیاردی. RTX 3090 دستدوم، بهترین ارزشِ خرید برای ۲۴ گیگ است.
۳۲ تا ۴۸ گیگ — ردهی حرفهای
RTX 5090 (۳۲ گیگ)، RTX A6000 و RTX 6000 Ada (هر دو ۴۸ گیگ). با ۴۸ گیگ میتوانید یک مدلِ ۷۰ میلیاردی را با Q4 روی یک کارت اجرا کنید و فاینتیونِ جدی انجام دهید.
۸۰ تا ۱۴۱ گیگ و بالاتر — ردهی دیتاسنتر
A100 (۴۰/۸۰ گیگ)، H100 (۸۰ گیگ)، H200 (۱۴۱ گیگ) و B200 (۱۹۲ گیگ). اینها برای اجرای مدلهای ۷۰B با دقتِ کامل، سرویسدهی به کاربرانِ زیاد، و آموزش/فاینتیونِ سنگیناند. برای مدلهای غولپیکر مثل ۴۰۵B و DeepSeek 671B هم به چند کارت از این رده بهصورتِ خوشهای نیاز دارید.
راهنمای GPUها: کارت مصرفی در برابر کارت دیتاسنتر
این جدول، مشخصاتِ کلیدیِ رایجترین کارتهای هوش مصنوعی را کنار هم میگذارد. به دو ستونِ «VRAM» و «پهنای باند» بیشتر دقت کنید — این دو، سرنوشتِ کارِ شما را تعیین میکنند.
| GPU | VRAM | پهنای باند | قیمت تقریبی (۲۰۲۶) | کاربرد معمول |
|---|---|---|---|---|
| RTX 3060 | ۱۲ گیگ GDDR6 | ۳۶۰ GB/s | $۲۵۰–۳۲۰ | شروع؛ مدل ۷–۸B، تصویر |
| RTX 4060 Ti | ۱۶ گیگ GDDR6 | ۲۸۸ GB/s | $۴۳۰–۵۰۰ | ارزانترین ۱۶ گیگ؛ مدل ۱۳B |
| RTX 3090 | ۲۴ گیگ GDDR6X | ۹۳۶ GB/s | $۷۰۰–۹۵۰ (دستدوم) | بهترین ارزشِ ۲۴ گیگ؛ مدل ۳۲B |
| RTX 4090 | ۲۴ گیگ GDDR6X | ۱٬۰۰۸ GB/s | $۲٬۲۰۰–۲٬۸۰۰ | سریعترین ۲۴ گیگ مصرفی |
| RTX 5090 | ۳۲ گیگ GDDR7 | ۱٬۷۹۲ GB/s | $۲٬۷۰۰–۳٬۷۰۰ | پرچمدار مصرفی؛ ۳۲B با دقت بالاتر |
| RTX A6000 | ۴۸ گیگ GDDR6 | ۷۶۸ GB/s | ~$۴٬۰۰۰+ | ورکاستیشن؛ ۷۰B تککارت (Q4) |
| L4 | ۲۴ گیگ GDDR6 | ۳۰۰ GB/s | ابری $۰٫۴–۰٫۸/ساعت | اجرای کممصرف (۷۲ وات) |
| L40S | ۴۸ گیگ GDDR6 | ۸۶۴ GB/s | ابری ~$۱٫۶/ساعت | کارت همهکارهی دیتاسنتر |
| A100 80GB | ۸۰ گیگ HBM2e | ۲٬۰۳۹ GB/s | ابری $۱٫۴–۲٫۸/ساعت | آموزش و اجرای مدلهای بزرگ |
| H100 80GB | ۸۰ گیگ HBM3 | ۳٬۳۵۰ GB/s | ابری $۲٫۷–۴٫۳/ساعت | پرچمدارِ آموزش/اجرا، FP8 |
| H200 | ۱۴۱ گیگ HBM3e | ۴٬۸۰۰ GB/s | ابری $۳٫۶–۶/ساعت | کانتکستِ بلند، مدلهای بزرگ |
| B200 | ۱۹۲ گیگ HBM3e | ۸٬۰۰۰ GB/s | ابری $۵–۸/ساعت | مرزِ آموزش + اجرای FP4 |
| AMD MI300X | ۱۹۲ گیگ HBM3 | ۵٬۳۲۵ GB/s | ابری ~$۱٫۷–۳/ساعت | حافظهی بالا؛ اکوسیستم ROCm |
تفاوتهای کلیدیِ کارتِ مصرفی و دیتاسنتر فقط قیمت نیست: کارتهای دیتاسنتر حافظهی ECC (تصحیحِ خطا)، اتصالِ پرسرعتِ NVLink بین کارتها، قابلیتِ تقسیمِ کارت (MIG)، و مجوزِ کارِ ۲۴ ساعته دارند. کارتهای GeForce برای بازی طراحی شدهاند اما برای اجرای محلی و پروژههای کوچکتر عالیاند.
انتخاب بر اساس کاربردِ شما
بهجای اینکه بپرسید «بهترین کارت چیست؟»، بپرسید «کارِ من چیست؟». پاسخ برای هر کاربرد فرق میکند:
گفتوگو و کدنویسیِ شخصی (Hobbyist)
یک مدلِ ۷ تا ۱۴ میلیاردی با Q4 روی RTX 3060 12GB یا 4060 Ti 16GB. اگر مدلِ ۳۲B میخواهید، RTX 3090/4090 24GB.
تولید تصویر (Stable Diffusion / FLUX)
برای تولید تصویر، VRAM از سرعت مهمتر است. SDXL روی ۱۲ گیگ راحت است؛ FLUX.1 (مدل ۱۲ میلیاردیِ تصویری) با نسخهی FP8 روی ۱۲–۱۶ گیگ و با نسخهی GGUF روی ۸ گیگ هم اجرا میشود، اما برای راحتی RTX 3090/4090 24GB ایدهآل است.
RAG و امبدینگ
مدلهای امبدینگ و reranker سبکاند (۲ تا ۴ گیگ) و حتی روی CPU هم قابلاجرا. اگر امبدینگ و reranker و یک LLM کوچک را با هم روی یک کارت میخواهید، ۲۴ گیگ حاشیهی خوبی میدهد.
سرویسدهی به کاربرانِ زیاد (Production)
اینجا KV cache و پردازشِ دستهای (batching) تعیینکنندهاند. کارتهای دیتاسنتر با VRAM و پهنای باندِ بالا (L40S، A100، H100) و ابزارهایی مثل vLLM لازماند.
فاینتیون
با تکنیکِ QLoRA میتوانید حتی یک مدلِ ۱۳ میلیاردی را روی یک RTX 4090 فاینتیون کنید. جزئیاتش را در بخشِ بعد میبینید.
مدلهای غیرزبانی: تصویر، ویدیو، صوت و امبدینگ
هوش مصنوعی فقط مدلهای زبانی نیست. این جدول، نیازمندیِ رایجترین مدلهای دیگر را نشان میدهد:
| نوع | مدل نمونه | حداقل VRAM | VRAM پیشنهادی | GPU پیشنهادی |
|---|---|---|---|---|
| تصویر (سبک) | Stable Diffusion 1.5 | ۴ گیگ | ۶–۸ گیگ | RTX 3050/3060 |
| تصویر (متوسط) | SDXL | ۶–۸ گیگ | ۱۲ گیگ | RTX 3060 12GB |
| تصویر (بزرگ) | FLUX.1 dev (۱۲B) | ۸ گیگ (GGUF) / ۱۲ (FP8) | ۱۶–۲۴ گیگ | RTX 4090 / 3090 |
| ویدیو | HunyuanVideo / Wan 2.1 | ۸ گیگ (نسخهی کوچک FP8) | ۴۰–۸۰ گیگ (کامل) | H100 80GB |
| گفتار به متن | Whisper large-v3 | ~۳ گیگ (FP16) | ۸–۱۰ گیگ (خط تولید) | RTX 3060 / 4060 |
| متن به گفتار | XTTS-v2 | ۴ گیگ | ۶–۸ گیگ | RTX 4060 |
| امبدینگ | BGE / sentence-transformers | ۲–۴ گیگ | ۴–۸ گیگ | هر کارت / CPU هم میشود |
نکته: مدلهای ویدیویی سنگینترین بارِ کاریِ هوش مصنوعیِ محلیاند و نسخهی کاملشان کارتِ دیتاسنتر میخواهد، اما نسخههای کوانتیزهشده و کوچکترشان روی کارتهای ۱۲ تا ۲۴ گیگ (با کیفیت و رزولوشنِ کمتر) هم اجرا میشوند.
اجرا در برابر فاینتیون در برابر آموزش: چرا فرق دارند؟

وقتی مدل را فقط اجرا میکنید، تنها یک چیز در حافظه است: وزنها (و KV cache). اما وقتی مدل را آموزش میدهید، حافظه باید چهار چیز را همزمان نگه دارد:
- وزنها (~۲ بایت/پارامتر)
- گرادیانها — یک مقدار برای هر پارامتر (~۲ بایت/پارامتر)
- حالتهای بهینهساز — بهینهساز Adam دو مقدار برای هر پارامتر نگه میدارد (~۸ بایت/پارامتر)
- فعالسازیها — نتایجِ میانیِ هر لایه که برای محاسبهی گرادیان لازماند و با اندازهی batch و طولِ ورودی بزرگ میشوند
به همین دلیل، آموزشِ کاملِ یک مدل حدود ۱۶ تا ۲۰ بایت بهازای هر پارامتر حافظه میخواهد — یعنی تقریباً ۳ تا ۴ برابرِ اجرا (و بیشتر با batchهای بزرگ). خبرِ خوب این است که برای بیشترِ کاربردها لازم نیست مدل را از صفر آموزش دهید؛ فقط فاینتیونش میکنید. سه روش وجود دارد:
- Full Fine-tune: همهی وزنها بهروز میشوند. سنگینترین روش. یک مدلِ ۷۰B به بیش از ۸۰۰ گیگ حافظه (خوشهی چندکارتی) نیاز دارد.
- LoRA: وزنهای اصلی ثابت (frozen) میمانند و فقط آداپتورهای کوچکی آموزش میبینند. مصرف را چند برابر کم میکند.
- QLoRA: وزنهای اصلی بهصورتِ ۴ بیتی ثابت میمانند و آداپتورها آموزش میبینند. کممصرفترین روش — میتوانید یک مدلِ ۷۰B را روی یک کارتِ ۴۸ گیگی فاینتیون کنید.
| روش | مدل ۷B | مدل ۱۳B | مدل ۷۰B |
|---|---|---|---|
| اجرا (Q4) | ~۵ گیگ | ~۹ گیگ | ~۴۰ گیگ |
| QLoRA (۴ بیتی) | ~۶–۸ گیگ | ~۱۰–۱۶ گیگ | ~۴۶–۵۲ گیگ |
| LoRA (۱۶ بیتی) | ~۲۰ گیگ | ~۳۰ گیگ | ~۱۵۹ گیگ |
| Full Fine-tune | ~۸۸ گیگ | ~۱۶۰ گیگ | ~۸۶۰ گیگ |
پیامِ کلیدی: QLoRA بازی را عوض کرد. کاری که قبلاً خوشهی گرانقیمت میخواست، حالا با یک کارتِ خوب انجام میشود. برای مثال، فاینتیونِ یک مدلِ ۱۳ میلیاردی با QLoRA روی یک RTX 4090 کاملاً شدنی است.
وقتی از VRAM سرریز میکنید: پرتگاهِ سرعت
مهمترین درسِ عملی: هیچوقت اجازه ندهید مدل از VRAM سرریز کند. وقتی مدل جا نمیشود و بخشی به رَمِ سیستم منتقل میشود، سرعت بهطرزِ فاجعهباری افت میکند — در یک آزمایشِ معروف، از ۴۶ توکن بر ثانیه به ۱٫۵ توکن بر ثانیه رسید، یعنی حدود ۳۰ برابر کندتر. چند قاعده:
- همیشه ۱٫۵ تا ۲ گیگ حاشیهی خالی برای KV cache و بافرها نگه دارید.
- رَمِ سیستمتان دستِکم ۲ برابرِ کلِ VRAM باشد.
- اگر مدل کمی بزرگتر از کارتِ شماست، بهجای سرریز، یک سطح کوانتیزیشن پایینتر بروید (مثلاً از Q8 به Q4).
چند کارت گرافیک (Multi-GPU): اگر مدل روی یک کارت جا نمیشود، میتوانید آن را بین چند کارت تقسیم کنید (مثلاً دو RTX 3090 = ۴۸ گیگ برای یک مدلِ ۷۰B). اما برای تقسیمِ کاراییِ لایهها (Tensor Parallelism) به اتصالِ پرسرعتِ NVLink نیاز دارید؛ روی کارتهای بدون NVLink بهتر است از Pipeline Parallelism استفاده کنید. بله، دو کارت VRAM را جمع میکنند، اما مدیریتش پیچیدگی دارد.
سرعت و بنچمارک: چرا اجرا به «پهنای باند» وابسته است؟
یک واقعیتِ کلیدی که کمتر گفته میشود: در تولیدِ متن (وقتی توکنها یکییکی ساخته میشوند)، گلوگاه توانِ محاسباتی نیست، پهنای باندِ حافظه است. چون برای تولیدِ هر توکن، کلِ وزنهای مدل باید یک بار از حافظه خوانده شوند. یک قاعدهی سرانگشتیِ مفید:
توکن بر ثانیه ≈ (پهنای باند ÷ حجم مدل) × ~0.7
مثال: یک مدلِ ۷۰B با Q4 (~۴۰ گیگ) روی کارتی با پهنای باندِ ۱۰۰۰ GB/s، حدوداً ۱۸ توکن بر ثانیه تولید میکند. به همین دلیل است که کارتِ H200 با وجودِ توانِ محاسباتیِ برابر با H100، در تولیدِ توکن سریعتر است — چون پهنای باندش بیشتر است. و به همین دلیل، پردازشِ دستهای (batching) کاراییِ سرویسدهی را بالا میبرد: وزنها یک بار خوانده میشوند و برای چند درخواست استفاده میشوند.
NVIDIA در برابر AMD در برابر Apple Silicon
- NVIDIA: پادشاهِ بلامنازعِ هوش مصنوعی بهخاطرِ اکوسیستمِ نرمافزاریِ CUDA. تقریباً همهی ابزارها اول برای NVIDIA ساخته میشوند. انتخابِ پیشفرضِ امن.
- AMD (MI300X): از نظرِ سختافزاری قوی است — ۱۹۲ گیگ حافظه و پهنای باندِ بالاتر از H100. با نرمافزارِ ROCm و پشتیبانیِ بومیِ PyTorch کار میکند. وقتی «تراکمِ حافظه» محدودیتِ اصلی است برنده میشود، اما اکوسیستمش هنوز به پختگیِ CUDA نرسیده.
- Apple Silicon: بهخاطرِ «حافظهی یکپارچه» (Unified Memory) گزینهی جالبی برای اجرای محلی است. یک مکِ M3 Ultra با ۵۱۲ گیگ حافظهی یکپارچه میتواند مدلهایی را اجرا کند که هیچ کارتِ گرافیکِ مصرفیای نمیتواند. پهنای باندش کمتر از کارتهای ردیفبالای NVIDIA است، اما برای اجرای محلیِ مدلهای متوسط و بزرگ، مقرونبهصرفه است. ابزارها: MLX و llama.cpp با Metal.
میخواهید تفاوتِ بنیادیِ CPU و GPU را عمیقتر بفهمید؟ مقالهی تفاوت CPU و GPU را بخوانید.
بخرید یا اجاره کنید؟
سؤالِ نهاییِ بسیاری از کاربران این است. پاسخ به الگوی استفادهی شما بستگی دارد:
- اجاره (ابری) وقتی بهتر است که: کارِ شما پروژهای، آزمایشی یا نوسانی است؛ به کارتِ گرانقیمتی مثل H100 فقط چند ساعت نیاز دارید؛ یا نمیخواهید هزینهی اولیهی سنگین و دردسرِ برق و خنککاری را بپذیرید.
- خرید وقتی بهتر است که: استفادهی شما مداوم و ۲۴ ساعته است. یک کارتِ ~۲٬۵۰۰ دلاری مثل RTX 4090 با استفادهی سنگین، ظرفِ چند هفته هزینهاش را در برابر ابر جبران میکند.
برای کاربرانِ ایرانی، اجارهی ابری معمولاً منطقیتر است: هم قیمتِ واردات و نوسانِ ارز روی کارتهای ردیفبالا سنگین است، هم دسترسیِ ۲۴ ساعته به کارتهایی مثل A100 و H100 بهصورتِ خرید برای اغلب افراد و کسبوکارها صرفه ندارد.
🚀 GPU ابری هاستینو — بدون دردسرِ خرید و راهاندازی
اگر میخواهید همین امروز یک مدل هوش مصنوعی را اجرا، فاینتیون یا آموزش دهید بدون اینکه میلیونها تومان صرفِ خرید کارت گرافیک کنید، سرویس GPU ابری هاستینو کارتهای قدرتمند را ساعتی و ماهانه در اختیارتان میگذارد — با پرداختِ ریالی و دسترسی از داخل ایران. کارت را متناسب با مدلی که در این مقاله انتخاب کردید بردارید و در چند دقیقه شروع کنید.
برای آشنایی بیشتر با اجرای مدلها روی زیرساختِ ابری، مقالهی اجرای مدلهای هوش مصنوعی روی GPU ابری را هم ببینید.
ماشینحسابها و ابزارهای مفید
بهجای حدس زدن، از این ابزارهای رایگان برای محاسبهی دقیقِ VRAM استفاده کنید:
- Hugging Face Model Memory Utility — ابزارِ رسمیِ محاسبهی حافظهی مدل.
- NyxKrage LLM VRAM Calculator — محبوبِ جامعه؛ کوانتیزیشن و کانتکست را هم حساب میکند.
- ApX «Can You Run This LLM?» — از ۷۵ مدل پشتیبانی میکند و تخمینِ توکن بر ثانیه میدهد.
- oobabooga Accurate GGUF VRAM Calculator — دقیق برای فرمتهای GGUF.
جدول تقلب: پیشنهادِ سریع بر اساس بودجه
| رده | کارت نمونه | چه کاری میکند |
|---|---|---|
| شروع / سرگرمی | RTX 3060 12GB | مدل ۷–۸B با Q4، تولید تصویر، Whisper |
| میانرده | RTX 3090 / 4090 24GB | مدل ۳۲B با Q4، FLUX، فاینتیونِ QLoRA تا ۱۳B |
| حرفهای | RTX A6000 / L40S 48GB | مدل ۷۰B با Q4، فاینتیونِ جدی |
| سازمانی | A100 / H100 / H200 | مدل ۷۰B با دقتِ کامل، سرویسدهی انبوه، آموزش |
| کلان (چندکارتی/ابری) | ۸× H100/H200 | مدل ۴۰۵B و DeepSeek 671B، آموزشِ سنگین |
سوالات متداول
برای اجرای یک مدل ۷ میلیاردی چقدر VRAM لازم است؟
با کوانتیزیشن Q4 حدود ۵ گیگ کافی است، پس یک کارتِ ۸ تا ۱۲ گیگی مثل RTX 3060 بهراحتی اجرایش میکند. در دقتِ کاملِ FP16 حدود ۱۴ تا ۱۶ گیگ لازم است.
آیا بدون کارت گرافیک و فقط با CPU میشود مدل زبانی اجرا کرد؟
بله، مدلهای کوچک (۱ تا ۸ میلیاردی با کوانتیزیشن) روی CPU و رَمِ سیستم اجرا میشوند، اما بسیار کندتر. برای مدلهای کوچک، امبدینگ و کارهای بدونِ حساسیت به سرعت، CPU قابلقبول است؛ برای تولید تصویر و سرویسدهیِ سریع، GPU لازم است.
Q4 بهتر است یا Q8؟
Q4_K_M حدود ۹۳٪ کیفیت را با یکچهارمِ حافظه نگه میدارد و برای بیشترِ کارها «نقطهی شیرین» است. اما برای ریاضی، کدنویسی و استدلالِ دقیق، Q8 (نزدیک به بدونِ افت) بهتر است.
RTX 4090 بهتر است یا 3090 برای هوش مصنوعی؟
هر دو ۲۴ گیگ حافظه دارند، پس همان مدلها را اجرا میکنند. تفاوت در سرعت است: 4090 بهخاطرِ پهنای باند و توانِ محاسباتیِ بالاتر سریعتر است، اما 3090 دستدوم بهترین ارزشِ خرید برای ۲۴ گیگ است.
آیا دو کارت گرافیک، VRAM را با هم جمع میکنند؟
بله، برای بارگذاریِ مدلِ بزرگتر میتوانید مدل را بین دو کارت تقسیم کنید (مثلاً ۲×۲۴ گیگ = ۴۸ گیگ برای یک مدلِ ۷۰B). اما برای سرعتِ بهینه به NVLink نیاز دارید و راهاندازیاش پیچیدهتر است.
برای فاینتیون چقدر VRAM لازم است؟
با روشِ QLoRA بسیار کم: یک مدلِ ۷B با ~۶–۸ گیگ و یک ۱۳B با ~۱۰–۱۶ گیگ فاینتیون میشود. آموزشِ کامل (Full) اما ۳ تا ۴ برابرِ اجرا حافظه میخواهد.
اگر مدل در VRAM جا نشود چه میشود؟
بخشی به رَمِ سیستم منتقل میشود و سرعت تا حدودِ ۳۰ برابر افت میکند. بهتر است بهجای سرریز، یک سطح کوانتیزیشن پایینتر بروید یا کارتِ بزرگتر/دومی تهیه کنید.
مک (Apple Silicon) برای اجرای مدل خوب است؟
بله، بهخاطرِ حافظهی یکپارچه میتواند مدلهای بزرگتری از یک کارتِ مصرفیِ همرده اجرا کند و برای اجرای محلی مقرونبهصرفه است، اما در پردازشِ سنگین و آموزش، از کارتهای NVIDIA کندتر است.
طول کانتکست چطور روی حافظه اثر میگذارد؟
کانتکستِ طولانیتر یعنی KV cache بزرگتر. برای یک مدلِ ۷۰B، کانتکستِ ۱۲۸ هزارتایی حدود ۴۲ گیگ حافظهی اضافه بر وزنها میخواهد. پس اگر به کانتکستِ بلند نیاز ندارید، محدودش کنید تا VRAM آزاد شود.
جمعبندی
انتخابِ GPU برای هوش مصنوعی، وقتی چند اصلِ ساده را بدانید، دیگر پیچیده نیست. مسیرِ تصمیمگیری این است: (۱) مدلی که میخواهید اجرا کنید را مشخص کنید، (۲) با قاعدهی «۲ گیگ بهازای هر میلیارد پارامتر در FP16، نصف در INT8، یکچهارم در INT4» VRAMِ لازم را تخمین بزنید، (۳) ۲۰٪ برای KV cache اضافه کنید، و (۴) کوچکترین کارتی را بردارید که مدلِ شما را با حاشیهی امنِ راحت اجرا میکند.
یادتان باشد: بهترین کارت، بزرگترین کارتی که میتوانید بخرید نیست؛ کوچکترین کارتی است که کارِ شما را با کمی حاشیه انجام میدهد. و اگر نمیخواهید درگیرِ خرید و راهاندازی شوید، اجارهی GPU ابری راهِ سریع و کمریسک برای شروع است. حالا جدولِ اصلیِ این مقاله را باز کنید، مدلتان را پیدا کنید، و با خیالِ راحت انتخاب کنید.

اهورا دربارهی فناوریهای نوین، هوش مصنوعی و تأثیر آنها بر کسبوکارهای آنلاین مینویسد. هدف او سادهکردن مفاهیم پیچیده است تا خوانندگان بدون پیشزمینهی فنی هم بتوانند از این فناوریها بهره ببرند.
مقالههای بیشتر از اهورا سپندار ←

