VRAM-Rechner
Gewichte + KV-Cache + Overhead gegen dein GPU-Budget – jeder Wert transparent vorgerechnet. Alles läuft im Browser; Requests gehen nur nach Klick an Hugging Face oder deine lokalen Ollama-/LM-Studio-Instanzen.
Haftungsausschluss: Alle Werte sind
Schätzungen. Für die Richtigkeit der Berechnungen wird keine Haftung übernommen.
Die reale Belegung hängt von Architektur, Backend, Batch-Größe und Treiber ab – prüfe sie immer
in deiner Engine (LM Studio) bzw. mit nvidia-smi.
Modell hinzufügen
Mein Setup lädt das getestete lokale Setup (Chat: Gemma 4 12B QAT, Embedder: BGE-M3, Router: Qwen3.5 4B) und ersetzt die aktuelle Liste.
Oder ein Preset aus dem eingebauten Offline-Datensatz (funktioniert ohne Internet; „ca."-Werte sind geschätzt und bleiben editierbar):
Erweitert: CORS-Proxy (nur falls ein Repo blockt)
Hinweis: Auf dieser Domain erlaubt die Content-Security-Policy nur
huggingface.co und localhost – ein fremder Proxy braucht einen zusätzlichen
connect-src-Eintrag im Caddyfile.
Setup: Ollama braucht eine CORS-Freigabe für diese Seite –
Umgebungsvariable OLLAMA_ORIGINS auf die Origin dieser Seite (oder *)
setzen und Ollama neu starten.
Die LM-Studio-API liefert keine Layer-/KV-Head-Details – fehlende Felder werden aus dem Offline-Datensatz ergänzt oder als „geschätzt" markiert und bleiben editierbar.
Modelle im Budget
Die KV-Präzision (kv_bits) ist keine Modell-Eigenschaft, sondern eine
Engine-Einstellung, die du selbst wählst: Ollama OLLAMA_KV_CACHE_TYPE,
llama.cpp --cache-type-k/v, LM Studio unter „Inference". FP16 ist Standard,
Q8 halbiert den KV-Cache nahezu verlustfrei, Q4 spart weiter – mit Qualitätsrisiko.
Noch kein Modell geladen – Freihand-Modell anlegen oder eine Quelle nutzen.
GPU & Kontext
Dieser Kontext-Regler ist ein Komfort-Default: Er schreibt den Wert in alle Modelle. Jedes Modell lässt sich danach in seiner Karte einzeln anpassen – verschiedene Modelle dürfen verschieden große Kontexte haben.
Overhead = Zusatzbedarf beim Laden (CUDA-Kontext, Compute-Buffer,
Fragmentierung). Er wächst mit der Zahl der geladenen Modelle (jedes Modell hat
eigenen CUDA-Kontext + Compute-Buffer) und leicht mit dem Kontext: Richtwert ~0,6 GB pro
Modell, plus mehr, wenn die GPU zusätzlich den Desktop rendert. Für 2–3 Modelle also grob
1,5–2,5 GB. Der Sicherheitspuffer ist Reserve, die frei bleiben soll –
er begrenzt den „max. stabilen Kontext" im Ergebnis.
Ergebnis
Rechenweg
Einheiten: GB = 10⁹ Byte (dezimal), passend zu Modell- und Kartenangaben. Der KV-Cache ist eine konservative Obergrenze – Sliding-Window- und Linear-Attention senken den realen Wert.