Skip to content

NVIDIA GeForce RTX 5070

NVIDIA · 12GBGDDR7 · Can run 63 models

BuyAmazon
ManufacturerNVIDIA
VRAM12 GB
Memory TypeGDDR7
ArchitectureBlackwell
CUDA Cores6,144
Tensor Cores192
Bandwidth672 GB/s
TDP250W
MSRP$549
ReleasedMar 10, 2025

AI Notes

The RTX 5070 brings next-gen GDDR7 memory with 672 GB/s bandwidth to the mid-range. With 12GB VRAM, it handles 7B models at very fast speeds and runs 13B models with quantization. The Blackwell architecture's efficiency improvements make it one of the best value cards for local AI.

Compatible Models

ModelParametersBest QuantVRAM UsedFitEst. Speed
Qwen 3 0.6B600MQ4_K_M2.5 GBRuns~269 tok/s
Qwen 3.5 0.8B800MQ4_K_M1.5 GBRuns~448 tok/s
Gemma 3 1B1BQ8_02 GBRuns~336 tok/s
Llama 3.2 1B1BQ8_03 GBRuns~224 tok/s
DeepSeek R1 1.5B1.5BQ8_03 GBRuns~224 tok/s
SmolLM2 1.7B1.7BQ8_02.7 GBRuns~249 tok/s
Gemma 2 2B2BQ8_04 GBRuns~168 tok/s
Gemma 3n E2B2BQ4_K_M3.3 GBRuns~204 tok/s
Gemma 4 E2B2BQ4_K_M4 GBRuns~168 tok/s
Qwen 3.5 2B2BQ4_K_M3 GBRuns~224 tok/s
Llama 3.2 3B3BQ8_05 GBRuns~134 tok/s
StarCoder2 3B3BQ4_K_M3.5 GBRuns~192 tok/s
Phi-3 Mini 3.8B3.8BQ8_05.8 GBRuns~116 tok/s
Phi-4 Mini 3.8B3.8BQ4_K_M4.5 GBRuns~149 tok/s
Gemma 3 4B4BQ4_K_M5 GBRuns~134 tok/s
Gemma 3n E4B4BQ4_K_M4.5 GBRuns~149 tok/s
Gemma 4 E4B4BQ4_K_M6 GBRuns~112 tok/s
Qwen 3 4B4BQ4_K_M4.5 GBRuns~149 tok/s
Qwen 3.5 4B4BQ4_K_M4.5 GBRuns~149 tok/s
Yi 1.5 6B6BQ4_K_M5 GBRuns~134 tok/s
Codestral Mamba 7B7BQ4_K_M6.9 GBRuns~97 tok/s
DeepSeek R1 7B7BQ8_09 GBRuns~75 tok/s
Falcon 3 7B7BQ4_K_M6.8 GBRuns~99 tok/s
InternLM 2.5 7B7BQ4_K_M5.5 GBRuns~122 tok/s
Mistral 7B7BQ8_09 GBRuns~75 tok/s
OpenChat 3.5 7B7BQ4_K_M6.9 GBRuns~97 tok/s
Qwen 2.5 7B7BQ8_09 GBRuns~75 tok/s
Qwen 2.5 Coder 7B7BQ8_09 GBRuns~75 tok/s
Qwen 2.5 VL 7B7BQ4_K_M7 GBRuns~96 tok/s
StarCoder2 7B7BQ4_K_M5.5 GBRuns~122 tok/s
WizardLM 2 7B7BQ4_K_M6.9 GBRuns~97 tok/s
Aya Expanse 8B8BQ4_K_M6.5 GBRuns~103 tok/s
Cogito 8B8BQ4_K_M7.5 GBRuns~90 tok/s
DeepSeek R1 8B8BQ4_K_M7.5 GBRuns~90 tok/s
Dolphin 3 8B8BQ4_K_M6 GBRuns~112 tok/s
Granite 3.3 8B8BQ8_010 GBRuns~67 tok/s
Llama 3.1 8B8BQ8_010 GBRuns~67 tok/s
Nemotron 3 Nano 8B8BQ4_K_M7.5 GBRuns~90 tok/s
Nous Hermes 2 8B8BQ4_K_M6 GBRuns~112 tok/s
Qwen 3 8B8BQ4_K_M7.5 GBRuns~90 tok/s
Qwen 3.5 9B9BQ4_K_M7.5 GBRuns~90 tok/s
Yi 1.5 9B9BQ4_K_M6.5 GBRuns~103 tok/s
Yi Coder 9B9BQ4_K_M8 GBRuns~84 tok/s
Falcon 3 10B10BQ4_K_M8.5 GBRuns~79 tok/s
Llama 3.2 Vision 11B11BQ4_K_M8.5 GBRuns~79 tok/s
Mistral Nemo 12B12BQ4_K_M9.5 GBRuns~71 tok/s
DeepSeek R1 14B14BQ4_K_M9.9 GBRuns~68 tok/s
Phi-4 14B14BQ4_K_M9.9 GBRuns~68 tok/s
Qwen 2.5 14B14BQ4_K_M9.9 GBRuns~68 tok/s
Gemma 2 9B9BQ8_011 GBRuns (tight)~61 tok/s
Gemma 3 12B12BQ4_K_M10.5 GBRuns (tight)~64 tok/s
Phi-4 Reasoning 14B14BQ4_K_M11 GBRuns (tight)~61 tok/s
Qwen 2.5 Coder 14B14BQ4_K_M12 GBCPU Offload~17 tok/s
Qwen 3 14B14BQ4_K_M12 GBCPU Offload~17 tok/s
StarCoder2 15B15BQ8_017 GBCPU Offload~12 tok/s
InternLM 2.5 20B20BQ4_K_M12 GBCPU Offload~17 tok/s
gpt-oss 20B21BMXFP415 GBCPU Offload~14 tok/s
Codestral 22B22BQ4_K_M14.7 GBCPU Offload~14 tok/s
Devstral 24B24BQ4_K_M17 GBCPU Offload~12 tok/s
Magistral Small 24B24BQ4_K_M17 GBCPU Offload~12 tok/s
Mistral Small 3.1 24B24BQ4_K_M18 GBCPU Offload~11 tok/s
Gemma 2 27B27BQ4_K_M17.7 GBCPU Offload~11 tok/s
Qwen 3.5 35B A3B35BQ4_K_M12 GBCPU Offload~17 tok/s
51 model(s) are too large for this hardware.