| ▲ | theanonymousone 4 hours ago | |
That's my questions as well. DeepSeek v4 0731 is served dirt cheap and it needs 10 times more RAM. | ||
| ▲ | kmike84 3 hours ago | parent | next [-] | |
DeepSeek needs more RAM for weights, Qwen requires more compute. Also, DeepSeek's KV cache requires less RAM than Qwen's. In concurrent situations (on servers) you load model weights once, but you have different context in each parallel session. So, it can also need less RAM than Qwen to serve, even if it's a larger model. | ||
| ▲ | petu 3 hours ago | parent | prev [-] | |
> and it needs 10 times more RAM. More like 3-6. Qwen 27B full quality is FP16. So 54GB. In practice most inference providers would serve FP8, so 27GB. DeepSeek V4 Flash in full quality is mostly FP4. ~167GB official release. So Deepseek has 140GB model size overhead... which is shared between 100s of users single inference node serves, so not even a gigabyte of VRAM per user. Memory required for 200K of context per user: | ||