Skip to content

NVIDIA GeForce RTX 5070 Ti

NVIDIA · 16GBGDDR7 · Can run 81 models

BuyAmazon
ManufacturerNVIDIA
VRAM16 GB
Memory TypeGDDR7
ArchitectureBlackwell
CUDA Cores8,960
Tensor Cores280
Bandwidth896 GB/s
TDP300W
MSRP$749
ReleasedMar 10, 2025

AI Notes

The RTX 5070 Ti offers an impressive 896 GB/s bandwidth with 16GB GDDR7 VRAM. It runs 13B models at very fast speeds and can handle 30B models with quantization. The combination of high bandwidth and 16GB capacity makes it one of the best cards for local AI at its price point.

Compatible Models

ModelParametersBest QuantVRAM UsedFitEst. Speed
Qwen 3 0.6B600MQ4_K_M2.5 GBRuns~358 tok/s
Qwen 3.5 0.8B800MQ4_K_M1.5 GBRuns~597 tok/s
Gemma 3 1B1BQ8_02 GBRuns~448 tok/s
Llama 3.2 1B1BQ8_03 GBRuns~299 tok/s
DeepSeek R1 1.5B1.5BQ8_03 GBRuns~299 tok/s
SmolLM2 1.7B1.7BQ8_02.7 GBRuns~332 tok/s
Gemma 2 2B2BQ8_04 GBRuns~224 tok/s
Gemma 3n E2B2BQ4_K_M3.3 GBRuns~272 tok/s
Gemma 4 E2B2BQ4_K_M4 GBRuns~224 tok/s
Qwen 3.5 2B2BQ4_K_M3 GBRuns~299 tok/s
Llama 3.2 3B3BQ8_05 GBRuns~179 tok/s
StarCoder2 3B3BQ4_K_M3.5 GBRuns~256 tok/s
Phi-3 Mini 3.8B3.8BQ8_05.8 GBRuns~154 tok/s
Phi-4 Mini 3.8B3.8BQ4_K_M4.5 GBRuns~199 tok/s
Gemma 3 4B4BQ4_K_M5 GBRuns~179 tok/s
Gemma 3n E4B4BQ4_K_M4.5 GBRuns~199 tok/s
Gemma 4 E4B4BQ4_K_M6 GBRuns~149 tok/s
Qwen 3 4B4BQ4_K_M4.5 GBRuns~199 tok/s
Qwen 3.5 4B4BQ4_K_M4.5 GBRuns~199 tok/s
Yi 1.5 6B6BQ4_K_M5 GBRuns~179 tok/s
Codestral Mamba 7B7BQ4_K_M6.9 GBRuns~130 tok/s
DeepSeek R1 7B7BQ8_09 GBRuns~100 tok/s
Falcon 3 7B7BQ4_K_M6.8 GBRuns~132 tok/s
InternLM 2.5 7B7BQ4_K_M5.5 GBRuns~163 tok/s
Mistral 7B7BQ8_09 GBRuns~100 tok/s
OpenChat 3.5 7B7BQ4_K_M6.9 GBRuns~130 tok/s
Qwen 2.5 7B7BQ8_09 GBRuns~100 tok/s
Qwen 2.5 Coder 7B7BQ8_09 GBRuns~100 tok/s
Qwen 2.5 VL 7B7BQ4_K_M7 GBRuns~128 tok/s
StarCoder2 7B7BQ4_K_M5.5 GBRuns~163 tok/s
WizardLM 2 7B7BQ4_K_M6.9 GBRuns~130 tok/s
Aya Expanse 8B8BQ4_K_M6.5 GBRuns~138 tok/s
Cogito 8B8BQ4_K_M7.5 GBRuns~119 tok/s
DeepSeek R1 8B8BQ4_K_M7.5 GBRuns~119 tok/s
Dolphin 3 8B8BQ4_K_M6 GBRuns~149 tok/s
Granite 3.3 8B8BQ8_010 GBRuns~90 tok/s
Llama 3.1 8B8BQ8_010 GBRuns~90 tok/s
Nemotron 3 Nano 8B8BQ4_K_M7.5 GBRuns~119 tok/s
Nous Hermes 2 8B8BQ4_K_M6 GBRuns~149 tok/s
Qwen 3 8B8BQ4_K_M7.5 GBRuns~119 tok/s
Gemma 2 9B9BQ8_011 GBRuns~81 tok/s
Qwen 3.5 9B9BQ4_K_M7.5 GBRuns~119 tok/s
Yi 1.5 9B9BQ4_K_M6.5 GBRuns~138 tok/s
Yi Coder 9B9BQ4_K_M8 GBRuns~112 tok/s
Falcon 3 10B10BQ4_K_M8.5 GBRuns~105 tok/s
Llama 3.2 Vision 11B11BQ4_K_M8.5 GBRuns~105 tok/s
Gemma 3 12B12BQ4_K_M10.5 GBRuns~85 tok/s
Mistral Nemo 12B12BQ4_K_M9.5 GBRuns~94 tok/s
DeepSeek R1 14B14BQ4_K_M9.9 GBRuns~91 tok/s
Phi-4 14B14BQ4_K_M9.9 GBRuns~91 tok/s
Phi-4 Reasoning 14B14BQ4_K_M11 GBRuns~81 tok/s
Qwen 2.5 14B14BQ4_K_M9.9 GBRuns~91 tok/s
Qwen 2.5 Coder 14B14BQ4_K_M12 GBRuns~75 tok/s
Qwen 3 14B14BQ4_K_M12 GBRuns~75 tok/s
InternLM 2.5 20B20BQ4_K_M12 GBRuns~75 tok/s
Qwen 3.5 35B A3B35BQ4_K_M12 GBRuns~75 tok/s
gpt-oss 20B21BMXFP415 GBRuns (tight)~60 tok/s
Codestral 22B22BQ4_K_M14.7 GBRuns (tight)~61 tok/s
StarCoder2 15B15BQ8_017 GBCPU Offload~16 tok/s
Devstral 24B24BQ4_K_M17 GBCPU Offload~16 tok/s
Magistral Small 24B24BQ4_K_M17 GBCPU Offload~16 tok/s
Mistral Small 3.1 24B24BQ4_K_M18 GBCPU Offload~15 tok/s
Gemma 4 26B26BQ4_K_M20 GBCPU Offload~14 tok/s
Gemma 2 27B27BQ4_K_M17.7 GBCPU Offload~15 tok/s
Gemma 3 27B27BQ4_K_M20 GBCPU Offload~14 tok/s
Qwen 3.5 27B27BQ4_K_M19 GBCPU Offload~14 tok/s
Qwen 3.6 27B27BQ4_K_M20 GBCPU Offload~14 tok/s
Qwen 3 30B-A3B (MoE)30BQ4_K_M22 GBCPU Offload~12 tok/s
Gemma 4 31B31BQ4_K_M22 GBCPU Offload~12 tok/s
Aya Expanse 32B32BQ4_K_M22 GBCPU Offload~12 tok/s
Cogito 32B32BQ4_K_M21.5 GBCPU Offload~13 tok/s
DeepSeek R1 32B32BQ4_K_M20.7 GBCPU Offload~13 tok/s
Qwen 2.5 32B32BQ4_K_M20.7 GBCPU Offload~13 tok/s
Qwen 2.5 Coder 32B32BQ4_K_M23 GBCPU Offload~12 tok/s
Qwen 3 32B32BQ4_K_M23 GBCPU Offload~12 tok/s
QwQ 32B32BQ4_K_M21.5 GBCPU Offload~13 tok/s
Laguna XS 2.133BQ4_K_M22 GBCPU Offload~12 tok/s
WizardCoder 33B33BQ4_K_M22 GBCPU Offload~12 tok/s
Nous Hermes 2 34B34BQ4_K_M19 GBCPU Offload~14 tok/s
Yi 1.5 34B34BQ4_K_M21 GBCPU Offload~13 tok/s
Command R 35B35BQ4_K_M22.5 GBCPU Offload~12 tok/s
33 model(s) are too large for this hardware.