Ollama 模型 VRAM 估算器
估算 Ollama 模型的顯存需求:內建近期熱門本地模型(Qwen3 各尺寸含 A3B 系列、Llama 3.x、Mistral/Mixtral 等),稠密/MoE 自動分算,選完模型+量化+上下文就出結果。
選個模型,馬上估算
估算結果
--GB
預估所需顯存
權重
KV cache
runtime 開銷
--
權重(GB)
--
KV cache(GB)
--
runtime 開銷(GB)
--
判定
建議
估算基於常見 GGUF 量化的實際檔案系數;實際占用會因 Ollama 版本、層分配與系統記憶體而略有出入。判斷「放不放得下」已足夠,請勿直接作為採購依據。
怎麼算的?
- 預設模型:下拉選單內含近期熱門的本地模型(Qwen3 各尺寸含 A3B 系列、Llama 3.x、Mistral / Mixtral、Phi-4、DeepSeek R1 蒸留版),架構參數已填好,直接選就夠。
- 稠密模型:權重 = 總參數 × 每參數字節數(Q4_K_M ≈ 0.62 B、Q8_0 ≈ 1.07 B、F16 ≈ 2.08 B,取 GGUF 實際檔案大小系數)。
- MoE 模型:記憶體要裝下全部專家,所以權重仍用總參數計算;但推理速度主要取決於 active 參數,結果頁會附上「速度約等於稠密 XXB」的參照。
- KV cache = 2 × 層數 × KV 頭數 × head 維度 × 上下文長度 × 精度,長上下文是大模型常見的隱藏記憶體殺手。
- 另加 0.5 GB 的 runtime 開銷(運算緩衝、embedding 等),與你的 GPU 顯存比較後給出換量化/offload 建議。