Can It Run?
HomeModels › DeepSeek V4 Flash 0731

DeepSeek V4 Flash 0731 on a Mac

DeepSeek · 304.18B parameters · mit · released 2026-07

Weights @ Q4_K_M
173.5 GiB
the usual download size
KV cache
86 KB
per token, FP16
Max context
128K
tokens
Smallest Mac
256 GB
M3 Ultra
Short answerA M3 Ultra 256GB is the smallest Apple Silicon machine that loads DeepSeek V4 Flash 0731 at Q4_K_M with an 8K context, at roughly 4 tokens/sec. Mac Studio (M3 Ultra) is the cheapest way to get that configuration.

Every Mac, ranked

MacMemoryNeedsTok/sVerdict
M1 8GB8 GB183.7 GiB0No
M1 16GB16 GB183.7 GiB0No
M2 16GB16 GB183.7 GiB0No
M4 16GB16 GB183.7 GiB1No
M1 Pro 16GB16 GB183.7 GiB1No
M3 Pro 18GB18 GB183.7 GiB1No
M2 24GB24 GB183.7 GiB0No
M4 24GB24 GB183.7 GiB1No
M4 Pro 24GB24 GB183.7 GiB1No
M4 32GB32 GB183.7 GiB1No
M1 Max 32GB32 GB183.7 GiB2No
M2 Max 32GB32 GB183.7 GiB2No
M3 Max 36GB36 GB183.7 GiB1No
M4 Max 36GB36 GB183.7 GiB2No
M4 Pro 48GB48 GB183.7 GiB1No
M4 Max 48GB48 GB183.7 GiB2No
M4 Pro 64GB64 GB183.7 GiB1No
M1 Max 64GB64 GB183.7 GiB2No
M4 Max 64GB64 GB183.7 GiB2No
M2 Ultra 64GB64 GB183.7 GiB3No
M2 Max 96GB96 GB183.7 GiB2No
M3 Ultra 96GB96 GB183.7 GiB4No
M3 Max 128GB128 GB183.7 GiB2No
M4 Max 128GB128 GB183.7 GiB2No
M2 Ultra 192GB192 GB183.7 GiB3No
M3 Ultra 256GB256 GB183.7 GiB4Yes, comfortably
M3 Ultra 512GB512 GB183.7 GiB4Yes, comfortably

Download size by quantisation

Weight memory scales linearly with bits per parameter. Everything below assumes an 8K context on top.

QuantisationWeightsTotal @ 8KNotes
FP16566.6 GiB596.4 GiBFull precision. Reference quality, twice the memory of Q8.
Q8_0301.0 GiB317.5 GiBIndistinguishable from FP16 in practice, at half the size.
Q6_K233.7 GiB246.9 GiBNear-lossless. A good stop when you have memory to spare.
Q5_K_M201.8 GiB213.4 GiBSlightly better than Q4_K_M, noticeably bigger.
Q4_K_M173.5 GiB183.7 GiBThe default. Best quality-per-gigabyte for most people.
Q3_K_M138.1 GiB146.5 GiBVisible quality loss. Use to squeeze one size class up.
Q2_K106.2 GiB113.0 GiBLast resort. Often worse than a smaller model at Q4.
Partly estimatedThis model was added automatically from its published config. Its parameter count and KV cache size are exact, but the config did not expose the expert shapes needed to work out how many parameters are read per token — so the speed estimate assumes every parameter is read, and the real figure is likely faster. Memory numbers are unaffected.