Se um modelo roda no seu computador é decidido primeiro pela memória da placa de vídeo: o arquivo do modelo precisa caber na VRAM com folga para a janela de contexto e o runtime. Os estados abaixo são calculados só pela memória; o suporte de software (CUDA, ROCm, Vulkan) é outro assunto.
Se um modelo roda no seu computador é decidido primeiro pela memória da placa de vídeo: o arquivo do modelo precisa caber na VRAM com folga para a janela de contexto e o runtime. Os estados abaixo são calculados só pela memória; o suporte de software (CUDA, ROCm, Vulkan) é outro assunto.
Maior modelo que roda confortável: Qwen3.5 4B
Regra: 1.5 vezes a necessidade em memória é Confortável, 1.15 vezes Roda, 0.6 vezes Limitado; a necessidade é o tamanho do pacote padrão ou o mínimo indicado pelo fabricante quando existe (um mínimo indicado conta como cabendo exatamente nesse valor). Tamanhos de pacote da biblioteca Ollama, mínimos da declaração do próprio fabricante; lido em 2026-09-11. Fontes: ollama.com/library/qwen3.5, ollama.com/library/gpt-oss, openai.com/index/introducing-gpt-oss