Skip to content

Best AI Models for 8 GB VRAM

Entry-level local AI — 7B-8B models at Q4 quantization. Here are all 43 models you can run locally with 8 GB of memory.

Hardware with 8 GB Memory

Runs Comfortably (32)

These models fit with room to spare for context window and OS overhead.

ModelParamsQuantizationVRAMQuality
Yi 1.5 9B9BQ4_K_M6.5 GB4
Aya Expanse 8B8BQ4_K_M6.5 GB4
Dolphin 3 8B8BQ4_K_M6 GB4
Granite 3.3 8B8BQ4_K_M6 GB3
Llama 3.1 8B8BQ4_K_M6.3 GB3
Nous Hermes 2 8B8BQ4_K_M6 GB4
DeepSeek R1 7B7BQ4_K_M5.7 GB3
Falcon 3 7B7BQ4_K_M6.8 GB4
InternLM 2.5 7B7BQ4_K_M5.5 GB4
Mistral 7B7BQ4_K_M5.7 GB3
Qwen 2.5 7B7BQ4_K_M5.7 GB3
Qwen 2.5 Coder 7B7BQ4_K_M5.7 GB3
StarCoder2 7B7BQ4_K_M5.5 GB4
Yi 1.5 6B6BQ4_K_M5 GB4
Gemma 3n E4B4BQ8_06.5 GB4
Gemma 4 E4B4BQ4_K_M6 GB4
Qwen 3 4B4BQ8_06.5 GB4
Qwen 3.5 4B4BQ8_06.5 GB4
Phi-3 Mini 3.8B3.8BQ8_05.8 GB4
Phi-4 Mini 3.8B3.8BQ8_06.5 GB4
Llama 3.2 3B3BQ8_05 GB4
StarCoder2 3B3BQ8_05 GB5
Gemma 2 2B2BF166 GB5
Gemma 3n E2B2BF166.5 GB5
Gemma 4 E2B2BQ8_06 GB5
Qwen 3.5 2B2BQ8_04.5 GB4
SmolLM2 1.7B1.7BF164.4 GB5
DeepSeek R1 1.5B1.5BF165 GB5
Gemma 3 1B1BF163.5 GB5
Llama 3.2 1B1BF164 GB5
Qwen 3.5 0.8B0.8BQ8_02 GB4
Qwen 3 0.6B0.6BF163.3 GB5

Tight Fit (11)

These models run but with limited context window. Close other apps to free memory.

ModelParamsQuantizationVRAMQuality
Gemma 2 9B9BQ4_K_M6.9 GB3
Qwen 3.5 9B9BQ4_K_M7.5 GB4
Cogito 8B8BQ4_K_M7.5 GB4
DeepSeek R1 8B8BQ4_K_M7.5 GB4
Nemotron 3 Nano 8B8BQ4_K_M7.5 GB4
Qwen 3 8B8BQ4_K_M7.5 GB4
Codestral Mamba 7B7BQ4_K_M6.9 GB4
OpenChat 3.5 7B7BQ4_K_M6.9 GB4
Qwen 2.5 VL 7B7BQ4_K_M7 GB4
WizardLM 2 7B7BQ4_K_M6.9 GB4
Gemma 3 4B4BQ8_07.5 GB4

Want to check a specific combination?

Use the compatibility checker to see exactly how a model runs on your specific hardware, with performance estimates.

Open Compatibility Checker
12 GBThe minimum for a good experience 16 GBThe sweet spot 24 GBSerious local AI 32 GBPremium tier