Skip to content

Best AI Models for 48 GB VRAM

Professional — large 70B models at higher quality quants. Here are all 90 models you can run locally with 48 GB of memory.

Hardware with 48 GB Memory

Runs Comfortably (82)

These models fit with room to spare for context window and OS overhead.

ModelParamsQuantizationVRAMQuality
Dolphin Mixtral 8x7B47BQ4_K_M26 GB4
Mixtral 8x7B47BQ5_K_M34.4 GB4
Command R 35B35BQ8_037 GB5
Qwen 3.5 35B A3B35BQ8_020 GB5
Nous Hermes 2 34B34BQ8_036 GB5
Yi 1.5 34B34BQ8_036 GB5
Laguna XS 2.133BQ8_039 GB5
WizardCoder 33B33BQ8_038.5 GB5
Aya Expanse 32B32BQ8_038 GB5
Cogito 32B32BQ8_037 GB4
DeepSeek R1 32B32BQ8_034 GB5
Qwen 2.5 32B32BQ8_034 GB5
Qwen 2.5 Coder 32B32BQ8_039 GB5
Qwen 3 32B32BQ8_039 GB5
QwQ 32B32BQ8_037 GB4
Gemma 4 31B31BQ8_038 GB5
Qwen 3 30B-A3B (MoE)30BQ8_037 GB5
Gemma 2 27B27BQ8_029 GB5
Gemma 3 27B27BQ8_034 GB5
Qwen 3.5 27B27BQ8_033 GB5
Qwen 3.6 27B27BQ8_034 GB5
Gemma 4 26B26BQ8_030 GB5
Devstral 24B24BQ8_029 GB5
Magistral Small 24B24BQ8_028 GB4
Mistral Small 3.1 24B24BQ8_030 GB5
Codestral 22B22BQ8_024 GB5
gpt-oss 20B21BMXFP415 GB4
StarCoder2 15B15BQ8_017 GB5
DeepSeek R1 14B14BQ8_016 GB5
Phi-4 14B14BQ8_016 GB5
Phi-4 Reasoning 14B14BF1632 GB5
Qwen 2.5 14B14BQ8_016 GB5
Qwen 2.5 Coder 14B14BF1633 GB5
Qwen 3 14B14BF1633 GB5
Gemma 3 12B12BF1628 GB5
Mistral Nemo 12B12BF1628 GB5
Llama 3.2 Vision 11B11BF1626 GB5
Falcon 3 10B10BF1624 GB5
Gemma 2 9B9BF1620 GB5
Qwen 3.5 9B9BQ8_011.5 GB5
Yi 1.5 9B9BF1620 GB5
Yi Coder 9B9BF1621 GB5
Aya Expanse 8B8BQ8_010.5 GB5
Cogito 8B8BF1619.5 GB5
DeepSeek R1 8B8BF1620 GB5
Dolphin 3 8B8BF1618 GB5
Granite 3.3 8B8BF1618 GB5
Llama 3.1 8B8BF1618 GB5
Nemotron 3 Nano 8B8BF1619.5 GB5
Nous Hermes 2 8B8BF1618 GB5
Qwen 3 8B8BF1620 GB5
Codestral Mamba 7B7BF1617 GB5
DeepSeek R1 7B7BF1616 GB5
Falcon 3 7B7BF1617.5 GB5
InternLM 2.5 7B7BF1616 GB5
Mistral 7B7BF1616 GB5
OpenChat 3.5 7B7BF1617 GB5
Qwen 2.5 7B7BF1616 GB5
Qwen 2.5 Coder 7B7BF1616 GB5
Qwen 2.5 VL 7B7BF1618.5 GB5
StarCoder2 7B7BF1616 GB5
WizardLM 2 7B7BF1617 GB5
Yi 1.5 6B6BF1614 GB5
Gemma 3 4B4BF1611.5 GB5
Gemma 3n E4B4BF1611 GB5
Gemma 4 E4B4BQ8_010 GB5
Qwen 3 4B4BF1611 GB5
Qwen 3.5 4B4BQ8_06.5 GB4
Phi-3 Mini 3.8B3.8BF169.6 GB5
Phi-4 Mini 3.8B3.8BF1610.5 GB5
Llama 3.2 3B3BF168 GB5
StarCoder2 3B3BF168 GB5
Gemma 2 2B2BF166 GB5
Gemma 3n E2B2BF166.5 GB5
Gemma 4 E2B2BQ8_06 GB5
Qwen 3.5 2B2BQ8_04.5 GB4
SmolLM2 1.7B1.7BF164.4 GB5
DeepSeek R1 1.5B1.5BF165 GB5
Gemma 3 1B1BF163.5 GB5
Llama 3.2 1B1BF164 GB5
Qwen 3.5 0.8B0.8BQ8_02 GB4
Qwen 3 0.6B0.6BF163.3 GB5

Tight Fit (8)

These models run but with limited context window. Close other apps to free memory.

ModelParamsQuantizationVRAMQuality
Qwen 2.5 72B72BQ4_K_M44.7 GB4
Qwen 2.5 VL 72B72BQ4_K_M41 GB4
Cogito 70B70BQ4_K_M43 GB4
DeepSeek R1 70B70BQ4_K_M43.5 GB4
Llama 3.1 70B70BQ4_K_M43.5 GB4
Llama 3.3 70B70BQ4_K_M43.5 GB4
Qwen 3.6 35B-A3B35BQ8_044 GB5
InternLM 2.5 20B20BF1642 GB5

Want to check a specific combination?

Use the compatibility checker to see exactly how a model runs on your specific hardware, with performance estimates.

Open Compatibility Checker
8 GBEntry-level local AI 12 GBThe minimum for a good experience 16 GBThe sweet spot 24 GBSerious local AI