Se um modelo roda no seu computador é decidido primeiro pela memória da placa de vídeo: o arquivo do modelo precisa caber na VRAM com folga para a janela de contexto e o runtime. Os estados abaixo são calculados só pela memória; o suporte de software (CUDA, ROCm, Vulkan) é outro assunto.
Pacote padrão do Ollama de 3.4 GB
| VRAM | IA local | Por VRAM |
|---|---|---|
| 32 GB | Confortável | 1 placa |
| 24 GB | Confortável | 5 placas |
| 20 GB | Confortável | 1 placa |
| 16 GB | Confortável | 20 placas |
| 12 GB | Confortável | 15 placas |
| 11 GB | Confortável | 1 placa |
| 10 GB | Confortável | 2 placas |
| 8 GB | Confortável | 35 placas |
| 6 GB | Confortável | 8 placas |
| 4 GB | Roda | 11 placas |
Regra: 1.5 vezes a necessidade em memória é Confortável, 1.15 vezes Roda, 0.6 vezes Limitado; a necessidade é o tamanho do pacote padrão ou o mínimo indicado pelo fabricante quando existe (um mínimo indicado conta como cabendo exatamente nesse valor). Tamanhos de pacote da biblioteca Ollama, mínimos da declaração do próprio fabricante; lido em 2026-09-11. Fontes: ollama.com/library/qwen3.5