Ob ein Modell auf deinem Rechner läuft, entscheidet zuerst der Speicher der Grafikkarte: Die Modelldatei muss in den VRAM passen, mit Reserve für das Kontextfenster und die Laufzeit. Die Stufen unten sind allein aus dem Speicher berechnet; die Softwareunterstützung (CUDA, ROCm, Vulkan) ist ein eigenes Thema.
Ollama-Standardpaket 24 GB
| VRAM | Lokale KI | Nach VRAM |
|---|---|---|
| 32 GB | Läuft | 1 Karte |
| 24 GB | Eingeschränkt | 5 Karten |
| 20 GB | Eingeschränkt | 1 Karte |
| 16 GB | Eingeschränkt | 20 Karten |
| 12 GB | Nicht geeignet | 15 Karten |
| 11 GB | Nicht geeignet | 1 Karte |
| 10 GB | Nicht geeignet | 2 Karten |
| 8 GB | Nicht geeignet | 35 Karten |
| 6 GB | Nicht geeignet | 8 Karten |
| 4 GB | Nicht geeignet | 11 Karten |
Regel: das 1.5-Fache des Bedarfs an Speicher ist Komfortabel, das 1.15-Fache Läuft, das 0.6-Fache Eingeschränkt; der Bedarf ist die Größe des Standardpakets oder das vom Hersteller genannte Minimum, wo es eines gibt (ein genanntes Minimum gilt bei genau diesem Wert als passend). Paketgrößen aus der Ollama-Bibliothek, Minima aus der Aussage des Herstellers; gelesen am 2026-09-11. Quellen: ollama.com/library/qwen3.5
Kein GPU-Chip im Katalog führt dieses Modell komfortabel aus.