Ob ein Modell auf deinem Rechner lĂ€uft, entscheidet zuerst der Speicher der Grafikkarte: Die Modelldatei muss in den VRAM passen, mit Reserve fĂŒr das Kontextfenster und die Laufzeit. Die Stufen unten sind allein aus dem Speicher berechnet; die SoftwareunterstĂŒtzung (CUDA, ROCm, Vulkan) ist ein eigenes Thema.
Ollama-Standardpaket 17 GB
| VRAM | Lokale KI | Nach VRAM |
|---|---|---|
| 32 GB | Komfortabel | 1 Karte |
| 24 GB | LĂ€uft | 5 Karten |
| 20 GB | LĂ€uft | 1 Karte |
| 16 GB | EingeschrÀnkt | 20 Karten |
| 12 GB | EingeschrÀnkt | 15 Karten |
| 11 GB | EingeschrÀnkt | 1 Karte |
| 10 GB | Nicht geeignet | 2 Karten |
| 8 GB | Nicht geeignet | 35 Karten |
| 6 GB | Nicht geeignet | 8 Karten |
| 4 GB | Nicht geeignet | 11 Karten |
Regel: das 1.5-Fache des Bedarfs an Speicher ist Komfortabel, das 1.15-Fache LĂ€uft, das 0.6-Fache EingeschrĂ€nkt; der Bedarf ist die GröĂe des Standardpakets oder das vom Hersteller genannte Minimum, wo es eines gibt (ein genanntes Minimum gilt bei genau diesem Wert als passend). PaketgröĂen aus der Ollama-Bibliothek, Minima aus der Aussage des Herstellers; gelesen am 2026-09-11. Quellen: ollama.com/library/qwen3.5