Se um modelo roda no seu computador é decidido primeiro pela memória da placa de vídeo: o arquivo do modelo precisa caber na VRAM com folga para a janela de contexto e o runtime. Os estados abaixo são calculados só pela memória; o suporte de software (CUDA, ROCm, Vulkan) é outro assunto.
Pacote padrão do Ollama de 65 GB · o fabricante indica um mínimo de 80 GB de memória
| VRAM | IA local | Por VRAM |
|---|---|---|
| 32 GB | Não adequado | 1 placa |
| 24 GB | Não adequado | 5 placas |
| 20 GB | Não adequado | 1 placa |
| 16 GB | Não adequado | 20 placas |
| 12 GB | Não adequado | 15 placas |
| 11 GB | Não adequado | 1 placa |
| 10 GB | Não adequado | 2 placas |
| 8 GB | Não adequado | 35 placas |
| 6 GB | Não adequado | 8 placas |
| 4 GB | Não adequado | 11 placas |
Regra: 1.5 vezes a necessidade em memória é Confortável, 1.15 vezes Roda, 0.6 vezes Limitado; a necessidade é o tamanho do pacote padrão ou o mínimo indicado pelo fabricante quando existe (um mínimo indicado conta como cabendo exatamente nesse valor). Tamanhos de pacote da biblioteca Ollama, mínimos da declaração do próprio fabricante; lido em 2026-09-11. Fontes: ollama.com/library/gpt-oss, openai.com/index/introducing-gpt-oss
Nenhum chip de GPU do catálogo roda este modelo confortável.