Alle ToolsVerfügbar · Lokale AI

Local AI Hardware Checker

GPU-VRAM, Unified Memory oder CPU wählen und sofort sehen, welche Modellgröße sinnvoll passt.

LinkLoot AI Review 93/100Hardwaredaten bleiben lokal500 frei pro TagOhne Gem-Kosten

Für Nutzer, die vor Download oder GPU-Kauf wissen wollen, ob 3B, 8B, 14B, 32B oder 70B Modelle lokal praktikabel sind.

LinkLoot AI Review93/100

Kostenloser Local-AI-Rechner

Beleg

Tool öffnen

Speicherart und Modell wählen, klare Einschätzung sehen.

Ollama läuft langsam?

Grenze das Problem ein und vergleiche anschließend die Einstellungen im Rechner. Es werden keine Geräte- oder Logdaten ausgelesen.

Speicherdruck prüfen

  1. Prüfe RAM und Auslagerung im Task-Manager bzw. in der Aktivitätsanzeige.
  2. Schließe nicht benötigte speicherintensive Anwendungen. Prüfe mit ollama ps, welche Modelle geladen sind.
  3. Vergleiche ein kleineres Modell und einen kürzeren Kontext im Rechner. Ändere jeweils nur eine Einstellung.

Dein Setup

Drei Angaben reichen für eine erste Einschätzung.

Speicher-ArchitekturDedizierte GPUs haben eigenen VRAM. Bei Apple Silicon und manchen APUs teilen CPU und GPU den Arbeitsspeicher. CPU-only nutzt keinen GPU-Speicher.
Genaue HardwarewerteNur nötig, wenn kein Preset passt.
ModellgrößeDie Parameterzahl steht meist im Modellnamen, zum Beispiel 8B, 14B oder 32B.

Der häufigste lokale Einstieg für Chat, Coding und einfache Agents.

keine Datenübertragunglokale Schätzung

Deine Einschätzung

Planungswert – kein Geräte-Benchmark.

gute WahlDieses Setup sollte im Alltag gut funktionieren.

Chat und Coding sollten angenehm reagieren.

88/ 100
Modellspeicher7,3 GB
RAM empfohlen16 GB
Download6 GB
AusführungGPU
Erwartetes Gefühlflüssig
Speicherreserve0,7 GB
Bester nächster SchrittSetup unverändert verwenden
Andere Quantisierung testenQ4 spart am meisten Speicher; höhere Stufen brauchen mehr Platz.
So kommt die Schätzung zustande7B/8B Chat & Coding · Q4
Weights 4,5 GBKV cache 1,5 GBRuntime 1,4 GBSpeicherreserve 0,7 GB

Hardware-Empfehlung

Nur relevant, wenn du Hardware auswählst oder aufrüstest.

Gut zu wissen

Was der Rechner kann, wo die Grenzen liegen und welche Quellen drinstecken.

Schneller Check

Dedizierte GPU, Unified Memory oder CPU-only wählen und ein passendes Preset setzen.

Was zählt

VRAM-, Unified-Memory-, RAM-, Download- und KV-Cache-Schätzung für lokale LLMs

Grenze

Kein echter Benchmark und keine Tokens-pro-Sekunde-Garantie

Kann mein PC lokale KI ausführen?

Reddit-Fragen zu lokalen LLMs beginnen fast immer mit GPU, VRAM, Quantisierung und „läuft das auf meinem Rechner?“. Der Checker übersetzt diese technischen Hebel in eine schnelle Ampel.

Modellspeicher zuerst

Für flüssige lokale Modelle zählt zuerst, ob Gewichte, KV-Cache und Runtime in dedizierten VRAM oder nutzbaren Unified Memory passen. Sobald Offload nötig wird, sinkt die Geschwindigkeit oft stark.

Quantisierung erklärt

Q4, Q5, Q8 und FP16 verändern Speicherbedarf und Qualität. Der Checker zeigt, welche Stufe für dein Setup realistisch wirkt.

Kontext kostet Speicher

Lange Kontextfenster erhöhen den KV-Cache. Genau dieser Punkt wird in vielen Hardware-Diskussionen unterschätzt.