Que un modelo corra en tu equipo lo decide primero la memoria de la tarjeta gráfica: el archivo del modelo tiene que caber en la VRAM con margen para la ventana de contexto y el runtime. Los estados de abajo se calculan solo con la memoria; el soporte de software (CUDA, ROCm, Vulkan) es otro asunto.
Paquete por defecto de Ollama de 14 GB · el fabricante indica un mínimo de 16 GB de memoria
| VRAM | IA local | Por VRAM |
|---|---|---|
| 32 GB | Cómodo | 1 tarjeta |
| 24 GB | Cómodo | 5 tarjetas |
| 20 GB | Corre | 1 tarjeta |
| 16 GB | Corre | 20 tarjetas |
| 12 GB | Limitado | 15 tarjetas |
| 11 GB | Limitado | 1 tarjeta |
| 10 GB | Limitado | 2 tarjetas |
| 8 GB | No apto | 35 tarjetas |
| 6 GB | No apto | 8 tarjetas |
| 4 GB | No apto | 11 tarjetas |
Regla: 1.5 veces el requisito en memoria es Cómodo, 1.15 veces Corre, 0.6 veces Limitado; el requisito es el tamaño del paquete por defecto o el mínimo que indica el fabricante cuando lo hay (un mínimo indicado cuenta como que cabe justo con esa cifra). Tamaños de paquete de la biblioteca de Ollama, mínimos de la declaración del propio fabricante; leído el 2026-09-11. Fuentes: ollama.com/library/gpt-oss, openai.com/index/introducing-gpt-oss