Dedizierte GPU, Unified Memory oder CPU-only wählen und ein passendes Preset setzen.
Local AI Hardware Checker
GPU-VRAM, Unified Memory oder CPU wählen und sofort sehen, welche Modellgröße sinnvoll passt.
Für Nutzer, die vor Download oder GPU-Kauf wissen wollen, ob 3B, 8B, 14B, 32B oder 70B Modelle lokal praktikabel sind.
Tool öffnen
Speicherart und Modell wählen, klare Einschätzung sehen.
Ollama läuft langsam?
Grenze das Problem ein und vergleiche anschließend die Einstellungen im Rechner. Es werden keine Geräte- oder Logdaten ausgelesen.
Speicherdruck prüfen
- Prüfe RAM und Auslagerung im Task-Manager bzw. in der Aktivitätsanzeige.
- Schließe nicht benötigte speicherintensive Anwendungen. Prüfe mit ollama ps, welche Modelle geladen sind.
- Vergleiche ein kleineres Modell und einen kürzeren Kontext im Rechner. Ändere jeweils nur eine Einstellung.
Dein Setup
Drei Angaben reichen für eine erste Einschätzung.
Genaue HardwarewerteNur nötig, wenn kein Preset passt.
Der häufigste lokale Einstieg für Chat, Coding und einfache Agents.
Deine Einschätzung
Planungswert – kein Geräte-Benchmark.
Chat und Coding sollten angenehm reagieren.
So kommt die Schätzung zustande7B/8B Chat & Coding · Q4
Hardware-Empfehlung
Nur relevant, wenn du Hardware auswählst oder aufrüstest.
Datenstand & Methodik
Gut zu wissen
Was der Rechner kann, wo die Grenzen liegen und welche Quellen drinstecken.
VRAM-, Unified-Memory-, RAM-, Download- und KV-Cache-Schätzung für lokale LLMs
Kein echter Benchmark und keine Tokens-pro-Sekunde-Garantie
Kann mein PC lokale KI ausführen?
Reddit-Fragen zu lokalen LLMs beginnen fast immer mit GPU, VRAM, Quantisierung und „läuft das auf meinem Rechner?“. Der Checker übersetzt diese technischen Hebel in eine schnelle Ampel.
Modellspeicher zuerst
Für flüssige lokale Modelle zählt zuerst, ob Gewichte, KV-Cache und Runtime in dedizierten VRAM oder nutzbaren Unified Memory passen. Sobald Offload nötig wird, sinkt die Geschwindigkeit oft stark.
Quantisierung erklärt
Q4, Q5, Q8 und FP16 verändern Speicherbedarf und Qualität. Der Checker zeigt, welche Stufe für dein Setup realistisch wirkt.
Kontext kostet Speicher
Lange Kontextfenster erhöhen den KV-Cache. Genau dieser Punkt wird in vielen Hardware-Diskussionen unterschätzt.