在本機執行 LLM 需要多少 VRAM?

在本機執行 LLM 時,主要問題很簡單:它能否裝進你的 GPU?答案取決於模型規模、量化和上下文長度。本指南為你選擇合適的 VRAM 提供實用的起點。

量化如何影響 VRAM

量化會降低儲存模型權重時使用的精度。較低位元量化會讓模型更小並使用較少 VRAM,但會損失一些品質。

量化 每個權重的位元數 典型用途
Q8_0 8 非常高的品質
Q6_K ~6.6 非常好的品質
Q5_K_M ~5.5 良好的品質和大小
Q4_K_M ~4.5 大小和品質的良好平衡
Q3_K_M ~3.5 較低 VRAM,品質損失較多

當 VRAM 有限時,Q4_K_M 是常見選擇。如果你有更多 VRAM,Q5 或 Q6 可讓你在量化較少的情況下執行相同模型。

依模型規模的近似 VRAM

這些是模型權重的粗略估計。實際所需的 VRAM 更高,因為執行階段、KV 快取和上下文也會使用記憶體。

模型規模 Q8_0 Q6_K Q4_K_M Q3_K_M
4B ~5 GB ~4 GB ~3 GB ~2.5 GB
8B ~9 GB ~7 GB ~5.5 GB ~4.5 GB
12B ~13 GB ~10 GB ~8 GB ~6.5 GB
14B ~16 GB ~12 GB ~9 GB ~7.5 GB
27B ~30 GB ~22 GB ~17 GB ~13 GB
32B ~36 GB ~27 GB ~20 GB ~16 GB
70B ~80 GB ~60 GB ~42 GB ~34 GB

這些是估計值,不是嚴格限制。不同的模型架構和量化格式可能改變實際大小。

不同 VRAM 數量可執行的內容

VRAM 實用範圍 目前範例
8 GB 約 4B 到 9B 的小型模型 Gemma 4 E4B, Qwen3.5 9B
12 GB 約 9B 到 14B 的小型到中型模型 Gemma 4 12B, Qwen3.5 9B
16 GB 12B 到 27B,使用較低量化 Gemma 4 26B-A4B, Qwen3.6 27B at Q4
24 GB 27B 到 35B,使用 Q4 到 Q6 Qwen3.8 27B, Gemma 4 31B
32 GB 27B 到 35B,使用較高量化 Qwen3.8 27B, Gemma 4 31B
48 GB 大型密集模型,使用較低量化 70B 級模型,使用 Q3 到 Q4
80 GB 大型密集模型,使用較高量化 70B 級模型,使用 Q4 到 Q6

這些範圍適用於權重可放入 GPU 的模型。大型 MoE 模型不同:每個 token 只有部分參數處於活動狀態,但模型仍需儲存完整的權重集。因此,總參數為 100B 或更多的模型,不會因為活動參數較少而僅需 100B 大小的 VRAM 預算。

MoE 模型

專家混合模型包含多組稱為專家的參數群組。每個 token 只使用部分專家,這可使推論比相同總參數數量的密集模型更有效率。

然而,非活動的專家仍是模型的一部分。因此,大型 MoE 模型可能需要的記憶體遠多於其活動參數數量所暗示的。非常大的模型可能需要多個 GPU 或系統 RAM 卸載。

上下文長度也會使用 VRAM

模型權重只是記憶體需求的一部分。KV 快取會隨上下文變長而成長,因此在 64K 上下文執行相同模型,可能比在 4K 執行需要更多 VRAM。

  • 較長的上下文需要更多 VRAM。
  • KV 快取精度會影響記憶體使用。
  • 批次大小和並行使用者也會增加記憶體使用。
  • 保留一些 VRAM 給執行階段,而不是用模型權重完全填滿 GPU。

實用提示

  • 檢查你想執行的量化模型的實際大小。
  • 不要將模型檔案大小視為確切 VRAM 需求。為 KV 快取和執行階段留出空間。
  • 如果模型無法完全放入 VRAM,部分可卸載到系統 RAM,但推論通常會較慢。
  • 對於長上下文或代理型工作負載,請規劃比模型權重本身需求更多的 VRAM。
  • 當單一 GPU 沒有足夠 VRAM 時,多個 GPU 可分割模型。

在 DaDesktop 上執行

你不需要購買 GPU 來執行本機 LLM。DaDesktop 提供你所需的 VRAM 的雲端桌面,讓你可以直接執行模型,而無需擁有硬體。

選擇符合你模型的 VRAM 等級,載入它,然後開始使用。無需設定、無需購買硬體、無需驅動程式問題。請參閱可用的 GPU以了解選項。