هوش مصنوعی

کدام GPU برای کدام مدل هوش مصنوعی؟ راهنمای کامل انتخاب کارت گرافیک

اهورا سپنداراهورا سپندار۲۶ تیر ۱۴۰۵۱۸ دقیقه مطالعه
کدام GPU برای کدام مدل هوش مصنوعی؟ راهنمای کامل انتخاب کارت گرافیک

یکی از پرتکرارترین سؤال‌ها در دنیای هوش مصنوعی این است: «چه کارت گرافیکی برای اجرای فلان مدل لازم دارم؟» جوابِ کوتاه، به یک عددِ ساده برمی‌گردد: VRAM (حافظه‌ی کارت گرافیک). اما جوابِ کاملْ کمی پیچیده‌تر است، چون به این بستگی دارد که می‌خواهید مدل را فقط اجرا (inference) کنید، فاین‌تیون کنید، یا از صفر آموزش بدهید؛ و اینکه از کوانتیزیشن استفاده می‌کنید یا نه.

این مقاله یک مرجعِ کامل و کاربردی است: از فرمولِ محاسبه‌ی VRAM و مفاهیم پایه گرفته تا یک جدولِ جامع «کدام مدل → چه منابعی → کدام GPU»، راهنمای انتخاب بر اساس بودجه و کاربرد، مدل‌های تصویری و صوتی، فاین‌تیون، و در نهایت اینکه بخرید یا از ابر اجاره کنید. هدف این است که بعد از خواندنش، بتوانید برای هر پروژه‌ی هوش مصنوعی، مطمئن و بدون حدس‌وگمان GPU درست را انتخاب کنید.

پاسخ سریع: مهم‌ترین عدد، VRAM است

برای اجرای یک مدل زبانی، به‌طور تقریبی به این مقدار VRAM نیاز دارید: هر ۱ میلیارد پارامتر ≈ ۲ گیگ در دقت FP16، حدود ۱ گیگ در INT8، و حدود ۰٫۵ گیگ در INT4/Q4 — به‌علاوه‌ی ۱۵ تا ۲۰٪ سرریز برای KV cache و overhead. پس یک مدلِ ۷ میلیاردی با کوانتیزیشن Q4 روی یک کارت ۱۲ گیگی مثل RTX 3060 اجرا می‌شود، اما یک مدلِ ۷۰ میلیاردی حتی با Q4 حدود ۴۰ گیگ می‌خواهد (یعنی دو کارت ۲۴ گیگی یا یک کارت ۴۸ گیگی). VRAM تعیین می‌کند که آیا مدل اصلاً اجرا می‌شود؛ پهنای باندِ حافظه تعیین می‌کند چقدر سریع.

مقایسه‌ی مصرف VRAM یک مدل ۷۰ میلیاردی در دقت‌های FP16، INT8 و INT4
کوانتیزیشن، مصرف VRAM را چند برابر کم می‌کند: یک مدل ۷۰B از ۱۴۰ گیگ در FP16 به حدود ۴۰ گیگ در Q4 می‌رسد.

چرا VRAM مهم‌ترین عدد است؟

وقتی یک مدل هوش مصنوعی اجرا می‌شود، باید کلِ «وزن‌های» آن (یعنی پارامترها) به‌طور هم‌زمان در حافظه‌ای بارگذاری شوند که پردازنده‌ی گرافیکی بتواند با سرعتِ بالا به آن‌ها دسترسی داشته باشد. این حافظه، همان VRAM روی کارت گرافیک است. اگر مدل در VRAM جا نشود، یا اصلاً اجرا نمی‌شود، یا مجبور می‌شوید بخشی از آن را به رَمِ سیستم بریزید که سرعت را به‌شدت — گاهی تا ۳۰ برابر — پایین می‌آورد.

سه عاملِ سخت‌افزاری در کارِ هوش مصنوعی نقش دارند و بهتر است از همان ابتدا نقش هرکدام را بدانید:

  • ظرفیت VRAM (چند گیگ): تعیین می‌کند آیا مدل جا می‌شود. مهم‌ترین عامل.
  • پهنای باند حافظه (چند گیگابایت بر ثانیه): تعیین می‌کند چقدر سریع توکن تولید می‌شود. برای اجرا (inference) این عامل، گلوگاهِ اصلی است.
  • توان محاسباتی (TFLOPS): بیشتر در آموزش و پردازشِ دسته‌ایِ سنگین اهمیت دارد.
یک تشبیه ساده: VRAM مثل «میز کار» شماست. مدل و همه‌ی برگه‌های کاری‌اش باید روی میز جا شوند تا سریع کار کنید. اگر روی میز جا نشد و مجبور شوید هر بار به کمدِ اتاقِ بغلی (رَمِ سیستم) بروید و برگردید، کار به کندی می‌خزد.

مفاهیم پایه: پارامتر، دقت (Precision) و بایت

قبل از فرمول‌ها، چند مفهوم را روشن کنیم:

  • پارامتر (Parameter): عددهایی که «دانشِ» مدل در آن‌ها ذخیره شده است. وقتی می‌گوییم «مدلِ ۷ میلیاردی» یعنی ۷ میلیارد پارامتر دارد. هرچه بیشتر، باهوش‌تر اما سنگین‌تر.
  • دقت / Precision: اینکه هر پارامتر با چند بیت ذخیره می‌شود. رایج‌ترین‌ها: FP32 (۴ بایت)، FP16/BF16 (۲ بایت)، INT8/FP8 (۱ بایت)، INT4 (نیم بایت).
  • VRAM در برابر RAM: VRAM حافظه‌ی روی خودِ کارت گرافیک است (سریع، اما محدود). RAM حافظه‌ی سیستم است (بزرگ‌تر اما بسیار کندتر برای این کار). مدل باید در VRAM باشد.

پس مصرفِ حافظه‌ی وزن‌های مدل، حاصل‌ضربِ سرراستِ «تعداد پارامتر × بایت‌به‌ازای هر پارامتر» است:

دقت (Precision)بایت به‌ازای هر پارامترمصرف برای هر ۱ میلیارد پارامتر
FP32۴ بایت~۴ گیگابایت
FP16 / BF16۲ بایت~۲ گیگابایت
INT8 / FP8~۱ بایت~۱ گیگابایت
INT4 / Q4~۰٫۵ بایت~۰٫۵ گیگابایت

فرمول تخمین VRAM (که باید حفظ کنید)

یک فرمولِ ساده و پذیرفته‌شده در صنعت برای تخمینِ VRAMِ لازم برای اجرا این است:

VRAM (GB) ≈ پارامتر (میلیارد) × (بیت ÷ 8) × 1.2

ضریب ۱٫۲ یعنی حدود ۲۰٪ اضافه برای KV cache، فعال‌سازی‌ها و overheadِ فریم‌ورک.

یا ساده‌تر، با قاعده‌ی سرانگشتی: ۲ گیگ به‌ازای هر میلیارد پارامتر در FP16، نصف آن در INT8، و یک‌چهارم در INT4. چند مثالِ واقعی:

مدلFP16INT8INT4 / Q4
۷ میلیاردی (مثل Mistral 7B)~۱۴ تا ۱۶ گیگ~۸ گیگ~۵ گیگ
۱۳–۱۴ میلیاردی (مثل Phi-4)~۲۸ گیگ~۱۴ گیگ~۸–۹ گیگ
۷۰ میلیاردی (مثل Llama 3.3 70B)~۱۴۰ گیگ~۷۰ گیگ~۴۰ گیگ

یک نکته‌ی طلایی: حجمِ فایلِ مدل (مثلاً در Ollama) حداقلِ VRAMِ شماست؛ حدود ۱۰ تا ۲۰٪ به آن اضافه کنید تا جای KV cache هم باز شود.

کوانتیزیشن: کلیدی که قفلِ VRAM را باز می‌کند

اگر VRAM «دروازه» است، کوانتیزیشن «کلید» آن است. کوانتیزیشن یعنی ذخیره‌ی وزن‌های مدل با بیتِ کمتر (مثلاً به‌جای ۱۶ بیت، ۴ بیت). این کار حافظه‌ی موردنیاز را چند برابر کم می‌کند و کیفیت را فقط کمی افت می‌دهد — دقیقاً مثل فشرده‌سازیِ یک عکس با فرمت JPEG که حجم را بسیار کم می‌کند اما چشمِ شما تفاوت را به‌سختی می‌بیند.

روش‌ها و فرمت‌های رایج کوانتیزیشن

  • GGUF (و مخصوصاً Q4_K_M): محبوب‌ترین فرمت برای اجرای محلی با llama.cpp و Ollama و LM Studio. روشِ ترکیبیِ ۴ و ۶ بیت که لایه‌های حساس را با دقتِ بالاتر نگه می‌دارد. تعادلِ عالیِ حجم به کیفیت.
  • AWQ: کوانتیزیشنِ «آگاه از فعال‌سازی» که کانال‌های مهمِ وزن‌ها را حفظ می‌کند؛ کیفیت را بهتر از GPTQ نگه می‌دارد. گزینه‌ی پیشنهادیِ INT4 برای استقرار روی GPU.
  • GPTQ: فقط روی GPU، سریع، اما در برخی بنچمارک‌ها روی کدنویسی افتِ کیفیتِ بیشتری نشان می‌دهد.
  • FP8: استانداردِ محیط‌های تولیدی روی کارت‌های H100/H200؛ حدود ۳۳٪ سریع‌تر از FP16 با افتِ کیفیتِ تقریباً صفر.
دقتبایت/پارامترحفظ کیفیت (تقریبی)توصیه
FP16 / BF16۲۱۰۰٪ (مبنا)بالاترین کیفیت؛ آموزش و محیط‌های حساس
FP8 / INT8~۹۸–۹۹٪تعادلِ عالیِ کیفیت و حافظه
Q4_K_M / INT4-AWQ~۰٫۵~۹۳٪«نقطه‌ی شیرین» برای اجرای محلی
Q3 و پایین‌تر<۰٫۵افتِ محسوسفقط اگر واقعاً مجبورید

توصیه‌ی عملی: برای کارهای عمومی و گفت‌وگو، Q4_K_M بهترین انتخاب است. اما برای کارهای ریاضی، کدنویسی و استدلالِ سنگین که به دقت حساس‌اند، به Q8 یا FP16 نزدیک بمانید، چون افتِ کیفیتِ INT4 دقیقاً همان‌جاها بیشتر خودش را نشان می‌دهد.

KV cache و طول کانتکست: هزینه‌ی پنهانِ حافظه

وقتی مدل متن تولید می‌کند، برای هر توکن یک حافظه‌ی موقت به نام KV cache نگه می‌دارد تا مجبور نباشد محاسبات را از اول تکرار کند. این حافظه مستقل از کوانتیزیشنِ وزن‌ها و خطی با طول کانتکست رشد می‌کند — و در کانتکست‌های طولانی می‌تواند از خودِ وزن‌ها هم بزرگ‌تر شود.

برای یک مدلِ ۷۰ میلیاردی، هر توکن حدود ۰٫۳۳ مگابایت KV cache می‌خواهد:

طول کانتکستKV cache اضافه (مدل ۷۰B)
۴٬۰۰۰ توکن~۱٫۳ گیگ
۳۲٬۰۰۰ توکن~۱۰ گیگ
۱۲۸٬۰۰۰ توکن~۴۲ گیگ
۲۵۶٬۰۰۰ توکن~۸۴ گیگ

یعنی یک مدلِ ۷۰B با Q4 (وزن‌ها ~۴۰ گیگ) که کانتکستِ ۱۲۸ هزارتایی اجرا می‌کند، مجموعاً حدود ۸۲ گیگ می‌خواهد — نیمی وزن‌ها، نیمی KV cache. اگر چند کاربرِ هم‌زمان داشته باشید، این عدد ضرب می‌شود. راهکارها: کوانتیزیشنِ خودِ KV cache (FP8/INT8) و محدود کردنِ کانتکست به چیزی که واقعاً لازم دارید.

جدول اصلی: کدام GPU برای کدام مدل زبانی؟

این جدول، قلبِ مقاله است. برای هر اندازه‌ی مدل، مقدار VRAM در دقت‌های مختلف و پیشنهادِ کارت گرافیک را می‌بینید. ستونِ «حداقل GPU» یعنی ارزان‌ترین گزینه‌ای که با Q4 مدل را اجرا می‌کند، و «GPU پیشنهادی» یعنی گزینه‌ای که با حاشیه‌ی امنِ راحت کار می‌کند.

مدلپارامترFP16Q8Q4حداقل GPU (Q4)GPU پیشنهادی
Llama 3.2 / Gemma 3۱–۳B~۳–۷ گیگ~۲–۳٫۵~۱–۳ گیگهر کارت / حتی CPURTX 3060 12GB
Llama 3.1 / Mistral / Qwen۷–۸B~۱۶ گیگ~۵ گیگRTX 3060 12GBRTX 4060 Ti 16GB
Phi-4 / Qwen3 / R1-Distill۱۴B~۲۸ گیگ~۱۴~۸–۹ گیگRTX 3060 12GB (تنگ)RTX 4070 Ti Super 16GB
Gemma 3 27B۲۷B~۵۵ گیگ~۲۷~۱۴–۱۵ گیگRTX 3090/4090 24GBRTX 4090 24GB
Qwen3 32B / R1-Distill 32B۳۲B~۶۴ گیگ~۳۲~۱۹–۲۰ گیگRTX 3090/4090 24GBRTX 5090 32GB
Mixtral 8x7B (MoE)۴۷B~۹۴ گیگ~۵۰~۲۸ گیگRTX 5090 32GB / ۲×۲۴A6000 48GB / L40S
Llama 3.3 70B / R1-Distill 70B۷۰B~۱۴۰ گیگ~۷۰~۴۰ گیگ۲×۲۴GB یا ۱×۴۸GBA100 80GB / H100
Qwen3 235B (MoE)۲۳۵B~۴۷۰ گیگ~۲۳۵~۱۳۲ گیگچند GPU۲× H100/H200
Llama 3.1 405B۴۰۵B~۸۱۰ گیگ~۴۰۵~۲۳۰ گیگ۸× H100۸× H200
DeepSeek V3 / R1 (MoE)۶۷۱B~۱٫۳ ترابایت~۷۰۰~۳۷۶ گیگ۸× H200۸× H200 (یک نود)

نکته‌ی مهم درباره‌ی مدل‌های MoE: مدل‌هایی مثل Mixtral و DeepSeek و Qwen3-235B «ترکیبی از متخصص‌ها» (Mixture of Experts) هستند. هرچند در هر توکن فقط بخشی از پارامترها فعال می‌شوند و سرعتشان خوب است، اما همه‌ی متخصص‌ها باید در VRAM حاضر باشند. پس حافظه‌ی موردنیازشان به کلِ پارامترها بستگی دارد، نه پارامترهای فعال. این بزرگ‌ترین اشتباهِ رایج درباره‌ی MoE است.

دسته‌بندی بر اساس ظرفیت VRAM: با کارتِ شما چه می‌شود اجرا کرد؟

نردبان ظرفیت VRAM و مدل‌هایی که در هر رده اجرا می‌شوند
هرچه VRAM بالاتر می‌رود، مدل‌های بزرگ‌تری در دسترس قرار می‌گیرند.

۸ تا ۱۲ گیگ — رده‌ی ورودی

کارت‌هایی مثل RTX 3060 12GB. مناسبِ مدل‌های ۷ تا ۸ میلیاردی با Q4، تولید تصویر با Stable Diffusion، و مدل‌های صوتی. نقطه‌ی شروعِ عملی برای اجرای محلی. RTX 3060 12GB به‌خاطر قیمتِ پایین و ۱۲ گیگ حافظه، محبوب‌ترین کارتِ «شروع هوش مصنوعی» است.

۱۶ تا ۲۴ گیگ — رده‌ی شیرین (Sweet Spot)

کارت‌هایی مثل RTX 4060 Ti 16GB، RTX 3090 و RTX 4090 (هر دو ۲۴ گیگ). این رده، بهترین تعادلِ قیمت به قابلیت را دارد: مدل‌های تا ۳۲ میلیاردی با Q4، مدل‌های تصویریِ سنگین مثل FLUX، و فاین‌تیونِ QLoRA روی مدل‌های ۱۳ میلیاردی. RTX 3090 دست‌دوم، بهترین ارزشِ خرید برای ۲۴ گیگ است.

۳۲ تا ۴۸ گیگ — رده‌ی حرفه‌ای

RTX 5090 (۳۲ گیگ)، RTX A6000 و RTX 6000 Ada (هر دو ۴۸ گیگ). با ۴۸ گیگ می‌توانید یک مدلِ ۷۰ میلیاردی را با Q4 روی یک کارت اجرا کنید و فاین‌تیونِ جدی انجام دهید.

۸۰ تا ۱۴۱ گیگ و بالاتر — رده‌ی دیتاسنتر

A100 (۴۰/۸۰ گیگ)، H100 (۸۰ گیگ)، H200 (۱۴۱ گیگ) و B200 (۱۹۲ گیگ). این‌ها برای اجرای مدل‌های ۷۰B با دقتِ کامل، سرویس‌دهی به کاربرانِ زیاد، و آموزش/فاین‌تیونِ سنگین‌اند. برای مدل‌های غول‌پیکر مثل ۴۰۵B و DeepSeek 671B هم به چند کارت از این رده به‌صورتِ خوشه‌ای نیاز دارید.

راهنمای GPUها: کارت مصرفی در برابر کارت دیتاسنتر

این جدول، مشخصاتِ کلیدیِ رایج‌ترین کارت‌های هوش مصنوعی را کنار هم می‌گذارد. به دو ستونِ «VRAM» و «پهنای باند» بیشتر دقت کنید — این دو، سرنوشتِ کارِ شما را تعیین می‌کنند.

GPUVRAMپهنای باندقیمت تقریبی (۲۰۲۶)کاربرد معمول
RTX 3060۱۲ گیگ GDDR6۳۶۰ GB/s$۲۵۰–۳۲۰شروع؛ مدل ۷–۸B، تصویر
RTX 4060 Ti۱۶ گیگ GDDR6۲۸۸ GB/s$۴۳۰–۵۰۰ارزان‌ترین ۱۶ گیگ؛ مدل ۱۳B
RTX 3090۲۴ گیگ GDDR6X۹۳۶ GB/s$۷۰۰–۹۵۰ (دست‌دوم)بهترین ارزشِ ۲۴ گیگ؛ مدل ۳۲B
RTX 4090۲۴ گیگ GDDR6X۱٬۰۰۸ GB/s$۲٬۲۰۰–۲٬۸۰۰سریع‌ترین ۲۴ گیگ مصرفی
RTX 5090۳۲ گیگ GDDR7۱٬۷۹۲ GB/s$۲٬۷۰۰–۳٬۷۰۰پرچم‌دار مصرفی؛ ۳۲B با دقت بالاتر
RTX A6000۴۸ گیگ GDDR6۷۶۸ GB/s~$۴٬۰۰۰+ورک‌استیشن؛ ۷۰B تک‌کارت (Q4)
L4۲۴ گیگ GDDR6۳۰۰ GB/sابری $۰٫۴–۰٫۸/ساعتاجرای کم‌مصرف (۷۲ وات)
L40S۴۸ گیگ GDDR6۸۶۴ GB/sابری ~$۱٫۶/ساعتکارت همه‌کاره‌ی دیتاسنتر
A100 80GB۸۰ گیگ HBM2e۲٬۰۳۹ GB/sابری $۱٫۴–۲٫۸/ساعتآموزش و اجرای مدل‌های بزرگ
H100 80GB۸۰ گیگ HBM3۳٬۳۵۰ GB/sابری $۲٫۷–۴٫۳/ساعتپرچم‌دارِ آموزش/اجرا، FP8
H200۱۴۱ گیگ HBM3e۴٬۸۰۰ GB/sابری $۳٫۶–۶/ساعتکانتکستِ بلند، مدل‌های بزرگ
B200۱۹۲ گیگ HBM3e۸٬۰۰۰ GB/sابری $۵–۸/ساعتمرزِ آموزش + اجرای FP4
AMD MI300X۱۹۲ گیگ HBM3۵٬۳۲۵ GB/sابری ~$۱٫۷–۳/ساعتحافظه‌ی بالا؛ اکوسیستم ROCm

تفاوت‌های کلیدیِ کارتِ مصرفی و دیتاسنتر فقط قیمت نیست: کارت‌های دیتاسنتر حافظه‌ی ECC (تصحیحِ خطا)، اتصالِ پرسرعتِ NVLink بین کارت‌ها، قابلیتِ تقسیمِ کارت (MIG)، و مجوزِ کارِ ۲۴ ساعته دارند. کارت‌های GeForce برای بازی طراحی شده‌اند اما برای اجرای محلی و پروژه‌های کوچک‌تر عالی‌اند.

انتخاب بر اساس کاربردِ شما

به‌جای اینکه بپرسید «بهترین کارت چیست؟»، بپرسید «کارِ من چیست؟». پاسخ برای هر کاربرد فرق می‌کند:

گفت‌وگو و کدنویسیِ شخصی (Hobbyist)

یک مدلِ ۷ تا ۱۴ میلیاردی با Q4 روی RTX 3060 12GB یا 4060 Ti 16GB. اگر مدلِ ۳۲B می‌خواهید، RTX 3090/4090 24GB.

تولید تصویر (Stable Diffusion / FLUX)

برای تولید تصویر، VRAM از سرعت مهم‌تر است. SDXL روی ۱۲ گیگ راحت است؛ FLUX.1 (مدل ۱۲ میلیاردیِ تصویری) با نسخه‌ی FP8 روی ۱۲–۱۶ گیگ و با نسخه‌ی GGUF روی ۸ گیگ هم اجرا می‌شود، اما برای راحتی RTX 3090/4090 24GB ایده‌آل است.

RAG و امبدینگ

مدل‌های امبدینگ و reranker سبک‌اند (۲ تا ۴ گیگ) و حتی روی CPU هم قابل‌اجرا. اگر امبدینگ و reranker و یک LLM کوچک را با هم روی یک کارت می‌خواهید، ۲۴ گیگ حاشیه‌ی خوبی می‌دهد.

سرویس‌دهی به کاربرانِ زیاد (Production)

اینجا KV cache و پردازشِ دسته‌ای (batching) تعیین‌کننده‌اند. کارت‌های دیتاسنتر با VRAM و پهنای باندِ بالا (L40S، A100، H100) و ابزارهایی مثل vLLM لازم‌اند.

فاین‌تیون

با تکنیکِ QLoRA می‌توانید حتی یک مدلِ ۱۳ میلیاردی را روی یک RTX 4090 فاین‌تیون کنید. جزئیاتش را در بخشِ بعد می‌بینید.

مدل‌های غیرزبانی: تصویر، ویدیو، صوت و امبدینگ

هوش مصنوعی فقط مدل‌های زبانی نیست. این جدول، نیازمندیِ رایج‌ترین مدل‌های دیگر را نشان می‌دهد:

نوعمدل نمونهحداقل VRAMVRAM پیشنهادیGPU پیشنهادی
تصویر (سبک)Stable Diffusion 1.5۴ گیگ۶–۸ گیگRTX 3050/3060
تصویر (متوسط)SDXL۶–۸ گیگ۱۲ گیگRTX 3060 12GB
تصویر (بزرگ)FLUX.1 dev (۱۲B)۸ گیگ (GGUF) / ۱۲ (FP8)۱۶–۲۴ گیگRTX 4090 / 3090
ویدیوHunyuanVideo / Wan 2.1۸ گیگ (نسخه‌ی کوچک FP8)۴۰–۸۰ گیگ (کامل)H100 80GB
گفتار به متنWhisper large-v3~۳ گیگ (FP16)۸–۱۰ گیگ (خط تولید)RTX 3060 / 4060
متن به گفتارXTTS-v2۴ گیگ۶–۸ گیگRTX 4060
امبدینگBGE / sentence-transformers۲–۴ گیگ۴–۸ گیگهر کارت / CPU هم می‌شود

نکته: مدل‌های ویدیویی سنگین‌ترین بارِ کاریِ هوش مصنوعیِ محلی‌اند و نسخه‌ی کاملشان کارتِ دیتاسنتر می‌خواهد، اما نسخه‌های کوانتیزه‌شده و کوچک‌ترشان روی کارت‌های ۱۲ تا ۲۴ گیگ (با کیفیت و رزولوشنِ کمتر) هم اجرا می‌شوند.

اجرا در برابر فاین‌تیون در برابر آموزش: چرا فرق دارند؟

مقایسه‌ی مصرف حافظه در اجرا و آموزش مدل
اجرا فقط وزن‌ها را نگه می‌دارد؛ آموزش باید وزن‌ها، گرادیان‌ها، حالت‌های بهینه‌ساز و فعال‌سازی‌ها را هم‌زمان نگه دارد.

وقتی مدل را فقط اجرا می‌کنید، تنها یک چیز در حافظه است: وزن‌ها (و KV cache). اما وقتی مدل را آموزش می‌دهید، حافظه باید چهار چیز را هم‌زمان نگه دارد:

  1. وزن‌ها (~۲ بایت/پارامتر)
  2. گرادیان‌ها — یک مقدار برای هر پارامتر (~۲ بایت/پارامتر)
  3. حالت‌های بهینه‌ساز — بهینه‌ساز Adam دو مقدار برای هر پارامتر نگه می‌دارد (~۸ بایت/پارامتر)
  4. فعال‌سازی‌ها — نتایجِ میانیِ هر لایه که برای محاسبه‌ی گرادیان لازم‌اند و با اندازه‌ی batch و طولِ ورودی بزرگ می‌شوند

به همین دلیل، آموزشِ کاملِ یک مدل حدود ۱۶ تا ۲۰ بایت به‌ازای هر پارامتر حافظه می‌خواهد — یعنی تقریباً ۳ تا ۴ برابرِ اجرا (و بیشتر با batchهای بزرگ). خبرِ خوب این است که برای بیشترِ کاربردها لازم نیست مدل را از صفر آموزش دهید؛ فقط فاین‌تیونش می‌کنید. سه روش وجود دارد:

  • Full Fine-tune: همه‌ی وزن‌ها به‌روز می‌شوند. سنگین‌ترین روش. یک مدلِ ۷۰B به بیش از ۸۰۰ گیگ حافظه (خوشه‌ی چندکارتی) نیاز دارد.
  • LoRA: وزن‌های اصلی ثابت (frozen) می‌مانند و فقط آداپتورهای کوچکی آموزش می‌بینند. مصرف را چند برابر کم می‌کند.
  • QLoRA: وزن‌های اصلی به‌صورتِ ۴ بیتی ثابت می‌مانند و آداپتورها آموزش می‌بینند. کم‌مصرف‌ترین روش — می‌توانید یک مدلِ ۷۰B را روی یک کارتِ ۴۸ گیگی فاین‌تیون کنید.
روشمدل ۷Bمدل ۱۳Bمدل ۷۰B
اجرا (Q4)~۵ گیگ~۹ گیگ~۴۰ گیگ
QLoRA (۴ بیتی)~۶–۸ گیگ~۱۰–۱۶ گیگ~۴۶–۵۲ گیگ
LoRA (۱۶ بیتی)~۲۰ گیگ~۳۰ گیگ~۱۵۹ گیگ
Full Fine-tune~۸۸ گیگ~۱۶۰ گیگ~۸۶۰ گیگ

پیامِ کلیدی: QLoRA بازی را عوض کرد. کاری که قبلاً خوشه‌ی گران‌قیمت می‌خواست، حالا با یک کارتِ خوب انجام می‌شود. برای مثال، فاین‌تیونِ یک مدلِ ۱۳ میلیاردی با QLoRA روی یک RTX 4090 کاملاً شدنی است.

وقتی از VRAM سرریز می‌کنید: پرتگاهِ سرعت

مهم‌ترین درسِ عملی: هیچ‌وقت اجازه ندهید مدل از VRAM سرریز کند. وقتی مدل جا نمی‌شود و بخشی به رَمِ سیستم منتقل می‌شود، سرعت به‌طرزِ فاجعه‌باری افت می‌کند — در یک آزمایشِ معروف، از ۴۶ توکن بر ثانیه به ۱٫۵ توکن بر ثانیه رسید، یعنی حدود ۳۰ برابر کندتر. چند قاعده:

  • همیشه ۱٫۵ تا ۲ گیگ حاشیه‌ی خالی برای KV cache و بافرها نگه دارید.
  • رَمِ سیستمتان دستِ‌کم ۲ برابرِ کلِ VRAM باشد.
  • اگر مدل کمی بزرگ‌تر از کارتِ شماست، به‌جای سرریز، یک سطح کوانتیزیشن پایین‌تر بروید (مثلاً از Q8 به Q4).

چند کارت گرافیک (Multi-GPU): اگر مدل روی یک کارت جا نمی‌شود، می‌توانید آن را بین چند کارت تقسیم کنید (مثلاً دو RTX 3090 = ۴۸ گیگ برای یک مدلِ ۷۰B). اما برای تقسیمِ کاراییِ لایه‌ها (Tensor Parallelism) به اتصالِ پرسرعتِ NVLink نیاز دارید؛ روی کارت‌های بدون NVLink بهتر است از Pipeline Parallelism استفاده کنید. بله، دو کارت VRAM را جمع می‌کنند، اما مدیریتش پیچیدگی دارد.

سرعت و بنچمارک: چرا اجرا به «پهنای باند» وابسته است؟

یک واقعیتِ کلیدی که کمتر گفته می‌شود: در تولیدِ متن (وقتی توکن‌ها یکی‌یکی ساخته می‌شوند)، گلوگاه توانِ محاسباتی نیست، پهنای باندِ حافظه است. چون برای تولیدِ هر توکن، کلِ وزن‌های مدل باید یک بار از حافظه خوانده شوند. یک قاعده‌ی سرانگشتیِ مفید:

توکن بر ثانیه ≈ (پهنای باند ÷ حجم مدل) × ~0.7

مثال: یک مدلِ ۷۰B با Q4 (~۴۰ گیگ) روی کارتی با پهنای باندِ ۱۰۰۰ GB/s، حدوداً ۱۸ توکن بر ثانیه تولید می‌کند. به همین دلیل است که کارتِ H200 با وجودِ توانِ محاسباتیِ برابر با H100، در تولیدِ توکن سریع‌تر است — چون پهنای باندش بیشتر است. و به همین دلیل، پردازشِ دسته‌ای (batching) کاراییِ سرویس‌دهی را بالا می‌برد: وزن‌ها یک بار خوانده می‌شوند و برای چند درخواست استفاده می‌شوند.

NVIDIA در برابر AMD در برابر Apple Silicon

  • NVIDIA: پادشاهِ بلامنازعِ هوش مصنوعی به‌خاطرِ اکوسیستمِ نرم‌افزاریِ CUDA. تقریباً همه‌ی ابزارها اول برای NVIDIA ساخته می‌شوند. انتخابِ پیش‌فرضِ امن.
  • AMD (MI300X): از نظرِ سخت‌افزاری قوی است — ۱۹۲ گیگ حافظه و پهنای باندِ بالاتر از H100. با نرم‌افزارِ ROCm و پشتیبانیِ بومیِ PyTorch کار می‌کند. وقتی «تراکمِ حافظه» محدودیتِ اصلی است برنده می‌شود، اما اکوسیستمش هنوز به پختگیِ CUDA نرسیده.
  • Apple Silicon: به‌خاطرِ «حافظه‌ی یکپارچه» (Unified Memory) گزینه‌ی جالبی برای اجرای محلی است. یک مکِ M3 Ultra با ۵۱۲ گیگ حافظه‌ی یکپارچه می‌تواند مدل‌هایی را اجرا کند که هیچ کارتِ گرافیکِ مصرفی‌ای نمی‌تواند. پهنای باندش کمتر از کارت‌های ردیف‌بالای NVIDIA است، اما برای اجرای محلیِ مدل‌های متوسط و بزرگ، مقرون‌به‌صرفه است. ابزارها: MLX و llama.cpp با Metal.

می‌خواهید تفاوتِ بنیادیِ CPU و GPU را عمیق‌تر بفهمید؟ مقاله‌ی تفاوت CPU و GPU را بخوانید.

بخرید یا اجاره کنید؟

سؤالِ نهاییِ بسیاری از کاربران این است. پاسخ به الگوی استفاده‌ی شما بستگی دارد:

  • اجاره (ابری) وقتی بهتر است که: کارِ شما پروژه‌ای، آزمایشی یا نوسانی است؛ به کارتِ گران‌قیمتی مثل H100 فقط چند ساعت نیاز دارید؛ یا نمی‌خواهید هزینه‌ی اولیه‌ی سنگین و دردسرِ برق و خنک‌کاری را بپذیرید.
  • خرید وقتی بهتر است که: استفاده‌ی شما مداوم و ۲۴ ساعته است. یک کارتِ ~۲٬۵۰۰ دلاری مثل RTX 4090 با استفاده‌ی سنگین، ظرفِ چند هفته هزینه‌اش را در برابر ابر جبران می‌کند.

برای کاربرانِ ایرانی، اجاره‌ی ابری معمولاً منطقی‌تر است: هم قیمتِ واردات و نوسانِ ارز روی کارت‌های ردیف‌بالا سنگین است، هم دسترسیِ ۲۴ ساعته به کارت‌هایی مثل A100 و H100 به‌صورتِ خرید برای اغلب افراد و کسب‌وکارها صرفه ندارد.

🚀 GPU ابری هاستینو — بدون دردسرِ خرید و راه‌اندازی

اگر می‌خواهید همین امروز یک مدل هوش مصنوعی را اجرا، فاین‌تیون یا آموزش دهید بدون اینکه میلیون‌ها تومان صرفِ خرید کارت گرافیک کنید، سرویس GPU ابری هاستینو کارت‌های قدرتمند را ساعتی و ماهانه در اختیارتان می‌گذارد — با پرداختِ ریالی و دسترسی از داخل ایران. کارت را متناسب با مدلی که در این مقاله انتخاب کردید بردارید و در چند دقیقه شروع کنید.

مشاهده‌ی سرویس GPU ابری هاستینو ←

برای آشنایی بیشتر با اجرای مدل‌ها روی زیرساختِ ابری، مقاله‌ی اجرای مدل‌های هوش مصنوعی روی GPU ابری را هم ببینید.

ماشین‌حساب‌ها و ابزارهای مفید

به‌جای حدس زدن، از این ابزارهای رایگان برای محاسبه‌ی دقیقِ VRAM استفاده کنید:

  • Hugging Face Model Memory Utility — ابزارِ رسمیِ محاسبه‌ی حافظه‌ی مدل.
  • NyxKrage LLM VRAM Calculator — محبوبِ جامعه؛ کوانتیزیشن و کانتکست را هم حساب می‌کند.
  • ApX «Can You Run This LLM?» — از ۷۵ مدل پشتیبانی می‌کند و تخمینِ توکن بر ثانیه می‌دهد.
  • oobabooga Accurate GGUF VRAM Calculator — دقیق برای فرمت‌های GGUF.

جدول تقلب: پیشنهادِ سریع بر اساس بودجه

ردهکارت نمونهچه کاری می‌کند
شروع / سرگرمیRTX 3060 12GBمدل ۷–۸B با Q4، تولید تصویر، Whisper
میان‌ردهRTX 3090 / 4090 24GBمدل ۳۲B با Q4، FLUX، فاین‌تیونِ QLoRA تا ۱۳B
حرفه‌ایRTX A6000 / L40S 48GBمدل ۷۰B با Q4، فاین‌تیونِ جدی
سازمانیA100 / H100 / H200مدل ۷۰B با دقتِ کامل، سرویس‌دهی انبوه، آموزش
کلان (چندکارتی/ابری)۸× H100/H200مدل ۴۰۵B و DeepSeek 671B، آموزشِ سنگین

سوالات متداول

برای اجرای یک مدل ۷ میلیاردی چقدر VRAM لازم است؟
با کوانتیزیشن Q4 حدود ۵ گیگ کافی است، پس یک کارتِ ۸ تا ۱۲ گیگی مثل RTX 3060 به‌راحتی اجرایش می‌کند. در دقتِ کاملِ FP16 حدود ۱۴ تا ۱۶ گیگ لازم است.

آیا بدون کارت گرافیک و فقط با CPU می‌شود مدل زبانی اجرا کرد؟
بله، مدل‌های کوچک (۱ تا ۸ میلیاردی با کوانتیزیشن) روی CPU و رَمِ سیستم اجرا می‌شوند، اما بسیار کندتر. برای مدل‌های کوچک، امبدینگ و کارهای بدونِ حساسیت به سرعت، CPU قابل‌قبول است؛ برای تولید تصویر و سرویس‌دهیِ سریع، GPU لازم است.

Q4 بهتر است یا Q8؟
Q4_K_M حدود ۹۳٪ کیفیت را با یک‌چهارمِ حافظه نگه می‌دارد و برای بیشترِ کارها «نقطه‌ی شیرین» است. اما برای ریاضی، کدنویسی و استدلالِ دقیق، Q8 (نزدیک به بدونِ افت) بهتر است.

RTX 4090 بهتر است یا 3090 برای هوش مصنوعی؟
هر دو ۲۴ گیگ حافظه دارند، پس همان مدل‌ها را اجرا می‌کنند. تفاوت در سرعت است: 4090 به‌خاطرِ پهنای باند و توانِ محاسباتیِ بالاتر سریع‌تر است، اما 3090 دست‌دوم بهترین ارزشِ خرید برای ۲۴ گیگ است.

آیا دو کارت گرافیک، VRAM را با هم جمع می‌کنند؟
بله، برای بارگذاریِ مدلِ بزرگ‌تر می‌توانید مدل را بین دو کارت تقسیم کنید (مثلاً ۲×۲۴ گیگ = ۴۸ گیگ برای یک مدلِ ۷۰B). اما برای سرعتِ بهینه به NVLink نیاز دارید و راه‌اندازی‌اش پیچیده‌تر است.

برای فاین‌تیون چقدر VRAM لازم است؟
با روشِ QLoRA بسیار کم: یک مدلِ ۷B با ~۶–۸ گیگ و یک ۱۳B با ~۱۰–۱۶ گیگ فاین‌تیون می‌شود. آموزشِ کامل (Full) اما ۳ تا ۴ برابرِ اجرا حافظه می‌خواهد.

اگر مدل در VRAM جا نشود چه می‌شود؟
بخشی به رَمِ سیستم منتقل می‌شود و سرعت تا حدودِ ۳۰ برابر افت می‌کند. بهتر است به‌جای سرریز، یک سطح کوانتیزیشن پایین‌تر بروید یا کارتِ بزرگ‌تر/دومی تهیه کنید.

مک (Apple Silicon) برای اجرای مدل خوب است؟
بله، به‌خاطرِ حافظه‌ی یکپارچه می‌تواند مدل‌های بزرگ‌تری از یک کارتِ مصرفیِ هم‌رده اجرا کند و برای اجرای محلی مقرون‌به‌صرفه است، اما در پردازشِ سنگین و آموزش، از کارت‌های NVIDIA کندتر است.

طول کانتکست چطور روی حافظه اثر می‌گذارد؟
کانتکستِ طولانی‌تر یعنی KV cache بزرگ‌تر. برای یک مدلِ ۷۰B، کانتکستِ ۱۲۸ هزارتایی حدود ۴۲ گیگ حافظه‌ی اضافه بر وزن‌ها می‌خواهد. پس اگر به کانتکستِ بلند نیاز ندارید، محدودش کنید تا VRAM آزاد شود.

جمع‌بندی

انتخابِ GPU برای هوش مصنوعی، وقتی چند اصلِ ساده را بدانید، دیگر پیچیده نیست. مسیرِ تصمیم‌گیری این است: (۱) مدلی که می‌خواهید اجرا کنید را مشخص کنید، (۲) با قاعده‌ی «۲ گیگ به‌ازای هر میلیارد پارامتر در FP16، نصف در INT8، یک‌چهارم در INT4» VRAMِ لازم را تخمین بزنید، (۳) ۲۰٪ برای KV cache اضافه کنید، و (۴) کوچک‌ترین کارتی را بردارید که مدلِ شما را با حاشیه‌ی امنِ راحت اجرا می‌کند.

یادتان باشد: بهترین کارت، بزرگ‌ترین کارتی که می‌توانید بخرید نیست؛ کوچک‌ترین کارتی است که کارِ شما را با کمی حاشیه انجام می‌دهد. و اگر نمی‌خواهید درگیرِ خرید و راه‌اندازی شوید، اجاره‌ی GPU ابری راهِ سریع و کم‌ریسک برای شروع است. حالا جدولِ اصلیِ این مقاله را باز کنید، مدلتان را پیدا کنید، و با خیالِ راحت انتخاب کنید.

برچسب‌ها:GPUکارت گرافیکهوش مصنوعیVRAMکوانتیزیشناجرای مدل
اهورا سپندار
نویسنده
اهورا سپندار
نویسنده‌ی حوزه‌ی فناوری و هوش مصنوعی

اهورا درباره‌ی فناوری‌های نوین، هوش مصنوعی و تأثیر آن‌ها بر کسب‌وکارهای آنلاین می‌نویسد. هدف او ساده‌کردن مفاهیم پیچیده است تا خوانندگان بدون پیش‌زمینه‌ی فنی هم بتوانند از این فناوری‌ها بهره ببرند.

مقاله‌های بیشتر از اهورا سپندار ←

مقاله‌های مرتبط

به کمک نیاز دارید؟

تیم پشتیبانی ما ۲۴ ساعته آماده پاسخگویی به سوالات شما و ارائه راهنمایی‌های تخصصی است.

کمک فروش هاستینو

۲۴/۷/۳۶۵ از طریق ویجت چت

گفتگو کنید

چت پشتیبانی مشتریان

۲۴/۷/۳۶۵ از طریق پنل

برو به پنل

ایمیل پشتیبانی مشتریان

۲۴/۷/۳۶۵ از طریق پنل

برو به پنل

پشتیبانی با هوش مصنوعی

۲۴/۷/۳۶۵ کمک فوری هوش مصنوعی

امتحان دستیار هوشمند

ما باور داشتیم دنیای هاستینگ نیاز به یک تحول بزرگ دارد — و افتخار می‌کنیم آغازگر این تغییر بوده‌ایم.