Ob ein Modell auf deinem Rechner läuft, entscheidet zuerst der Speicher der Grafikkarte: Die Modelldatei muss in den VRAM passen, mit Reserve für das Kontextfenster und die Laufzeit. Die Stufen unten sind allein aus dem Speicher berechnet; die Softwareunterstützung (CUDA, ROCm, Vulkan) ist ein eigenes Thema.
Ob ein Modell auf deinem Rechner läuft, entscheidet zuerst der Speicher der Grafikkarte: Die Modelldatei muss in den VRAM passen, mit Reserve für das Kontextfenster und die Laufzeit. Die Stufen unten sind allein aus dem Speicher berechnet; die Softwareunterstützung (CUDA, ROCm, Vulkan) ist ein eigenes Thema.
Größtes komfortabel laufendes Modell: gpt-oss-20b
Regel: das 1.5-Fache des Bedarfs an Speicher ist Komfortabel, das 1.15-Fache Läuft, das 0.6-Fache Eingeschränkt; der Bedarf ist die Größe des Standardpakets oder das vom Hersteller genannte Minimum, wo es eines gibt (ein genanntes Minimum gilt bei genau diesem Wert als passend). Paketgrößen aus der Ollama-Bibliothek, Minima aus der Aussage des Herstellers; gelesen am 2026-09-11. Quellen: ollama.com/library/qwen3.5, ollama.com/library/gpt-oss, openai.com/index/introducing-gpt-oss