在本機執行 LLM 需要多少 VRAM?
在本機執行 LLM 時,主要問題很簡單:它能否裝進你的 GPU?答案取決於模型規模、量化和上下文長度。本指南為你選擇合適的 VRAM 提供實用的起點。
量化如何影響 VRAM
量化會降低儲存模型權重時使用的精度。較低位元量化會讓模型更小並使用較少 VRAM,但會損失一些品質。
| 量化 | 每個權重的位元數 | 典型用途 |
|---|---|---|
| Q8_0 | 8 | 非常高的品質 |
| Q6_K | ~6.6 | 非常好的品質 |
| Q5_K_M | ~5.5 | 良好的品質和大小 |
| Q4_K_M | ~4.5 | 大小和品質的良好平衡 |
| Q3_K_M | ~3.5 | 較低 VRAM,品質損失較多 |
當 VRAM 有限時,Q4_K_M 是常見選擇。如果你有更多 VRAM,Q5 或 Q6 可讓你在量化較少的情況下執行相同模型。
依模型規模的近似 VRAM
這些是模型權重的粗略估計。實際所需的 VRAM 更高,因為執行階段、KV 快取和上下文也會使用記憶體。
| 模型規模 | Q8_0 | Q6_K | Q4_K_M | Q3_K_M |
|---|---|---|---|---|
| 4B | ~5 GB | ~4 GB | ~3 GB | ~2.5 GB |
| 8B | ~9 GB | ~7 GB | ~5.5 GB | ~4.5 GB |
| 12B | ~13 GB | ~10 GB | ~8 GB | ~6.5 GB |
| 14B | ~16 GB | ~12 GB | ~9 GB | ~7.5 GB |
| 27B | ~30 GB | ~22 GB | ~17 GB | ~13 GB |
| 32B | ~36 GB | ~27 GB | ~20 GB | ~16 GB |
| 70B | ~80 GB | ~60 GB | ~42 GB | ~34 GB |
這些是估計值,不是嚴格限制。不同的模型架構和量化格式可能改變實際大小。
不同 VRAM 數量可執行的內容
| VRAM | 實用範圍 | 目前範例 |
|---|---|---|
| 8 GB | 約 4B 到 9B 的小型模型 | Gemma 4 E4B, Qwen3.5 9B |
| 12 GB | 約 9B 到 14B 的小型到中型模型 | Gemma 4 12B, Qwen3.5 9B |
| 16 GB | 12B 到 27B,使用較低量化 | Gemma 4 26B-A4B, Qwen3.6 27B at Q4 |
| 24 GB | 27B 到 35B,使用 Q4 到 Q6 | Qwen3.8 27B, Gemma 4 31B |
| 32 GB | 27B 到 35B,使用較高量化 | Qwen3.8 27B, Gemma 4 31B |
| 48 GB | 大型密集模型,使用較低量化 | 70B 級模型,使用 Q3 到 Q4 |
| 80 GB | 大型密集模型,使用較高量化 | 70B 級模型,使用 Q4 到 Q6 |
這些範圍適用於權重可放入 GPU 的模型。大型 MoE 模型不同:每個 token 只有部分參數處於活動狀態,但模型仍需儲存完整的權重集。因此,總參數為 100B 或更多的模型,不會因為活動參數較少而僅需 100B 大小的 VRAM 預算。
MoE 模型
專家混合模型包含多組稱為專家的參數群組。每個 token 只使用部分專家,這可使推論比相同總參數數量的密集模型更有效率。
然而,非活動的專家仍是模型的一部分。因此,大型 MoE 模型可能需要的記憶體遠多於其活動參數數量所暗示的。非常大的模型可能需要多個 GPU 或系統 RAM 卸載。
上下文長度也會使用 VRAM
模型權重只是記憶體需求的一部分。KV 快取會隨上下文變長而成長,因此在 64K 上下文執行相同模型,可能比在 4K 執行需要更多 VRAM。
- 較長的上下文需要更多 VRAM。
- KV 快取精度會影響記憶體使用。
- 批次大小和並行使用者也會增加記憶體使用。
- 保留一些 VRAM 給執行階段,而不是用模型權重完全填滿 GPU。
實用提示
- 檢查你想執行的量化模型的實際大小。
- 不要將模型檔案大小視為確切 VRAM 需求。為 KV 快取和執行階段留出空間。
- 如果模型無法完全放入 VRAM,部分可卸載到系統 RAM,但推論通常會較慢。
- 對於長上下文或代理型工作負載,請規劃比模型權重本身需求更多的 VRAM。
- 當單一 GPU 沒有足夠 VRAM 時,多個 GPU 可分割模型。
在 DaDesktop 上執行
你不需要購買 GPU 來執行本機 LLM。DaDesktop 提供你所需的 VRAM 的雲端桌面,讓你可以直接執行模型,而無需擁有硬體。
選擇符合你模型的 VRAM 等級,載入它,然後開始使用。無需設定、無需購買硬體、無需驅動程式問題。請參閱可用的 GPU以了解選項。