[AI, LLM, Benchmarks, Hardware]

VRAM-Wahnsinn: 24GB lokale Power, DeepSeek-Speed und die nackte Wahrheit

2026-04-26 21:50:00 +0200 // Marco

KI generiert und vom Menschen redigiert

Tja... da stehen wir nun. 2026 und ich hab endlich das getan, was jeder vernünftige Nerd tun würde: Mehr GPU-Power in die Bude gekloppt. 24 GB VRAM – das ist der Stoff, aus dem Träume (und hohe Stromrechnungen) sind.

Eigentlich wollte ich ja nur wissen, ob meine lokale Hardware gegen die Cloud-Monster von Anthropic und Google anstinken kann. Das Ergebnis? Ein bunter Mix aus "Heilige Scheiße, ist das schnell" und "WTF, warum geht das nicht?".


🧩 Deep Dive: Die Benchmarks im Detail

Bevor wir zu den Zahlen kommen, erst mal ein wenig Aufklärung. Was messen wir hier eigentlich? Ich hab mir drei neue Disziplinen rausgepickt, die über das bloße Wort-für-Wort-Generieren hinausgehen:

1. Planning: Der Python-Härtetest

Hier muss die KI zeigen, ob sie wirklich "denken" kann. Sie bekommt die Aufgabe, ein komplexes Skript zu schreiben, das eine Datei von einem lokalen Server lädt, die SHA256-Summe prüft, ein Zstandard-Archiv entpackt und die Dateien analysiert.

Der initiale Prompt:

"Du bist ein erfahrener Python-Entwickler. Erstelle ein Skript namens test2.py, das folgende Aufgaben vollständig und ausführbar umsetzt. [...] Lade vex.tar.zst herunter, parse die HTML-Seite, berechne den SHA256-Hash... Entpacke vex.tar.zst nach vex_extracted/ (Zstandard-Bibliothek)... Finde die größte Datei und die mit den meisten Zeilen... Schreibe eine requirements.txt... Plane kurz die Schritte, dann das vollständige Skript."

2. Structured Output: JSON-Voodoo

Nichts ist nerviger als eine KI, die zwar die Antwort weiß, sie aber in drei Absätze Text verpackt, statt sauberes JSON zu liefern. Wir testen das in 4 Runden (Personen-Objekt, Server-Config, Array, Security-Finding).

Der initiale Prompt (Beispiel Runde 4):

"Return ONLY a valid JSON object for a security finding — no explanation, no markdown, no extra text: { 'id': 'CVE-YYYY-NNNNN', 'severity': 'critical/high/medium/low', 'cvss_score': <0.0-10.0>, 'affected_versions': [...], 'description': '...', 'remediation': { 'available': , 'patch_version': '...' } }"

3. Needle in a Haystack: Das Elefantengedächtnis

Hier verstecken wir einen geheimen Token (ZETA-9921-KAPPA) in einem künstlich aufgeblähten Dokument von ca. 2500 Wörtern. Wir setzen die "Nadel" an verschiedene Positionen (10% bis 90%) und fragen dann danach.

Der initiale Prompt:

"Based on the document above, what is the emergency access token? Reply with ONLY the token value, nothing else."


📊 Die nackte Wahrheit: Alle Ergebnisse im Überblick

Haltet euch fest, hier kommt die volle Ladung Daten. Ich hab alles durchgejagt, was nicht bei drei auf den Bäumen war – von winzigen 0.5B-Modellen bis zu den Cloud-Schwergewichten.

Modell Speed (t/s) Planning Struct. Out Needle Multi-Turn
moondream:latest 212.2 🚀 0.0 1.9 2.0 10.0
deepseek-coder-v2:16b 122.5 7.2 10.0 10.0 10.0
codellama:7b 98.5 0.0 10.0 10.0 10.0
qwen3-coder:latest 98.5 6.2 10.0 10.0 10.0
deepseek-coder:6.7b 97.6 6.6 10.0 10.0 10.0
claude-opus-4-7 (Cloud) 84.1 8.0 10.0 2.0 10.0
llama3.2-vision:11b 70.1 0.0 10.0 10.0 10.0
hf.co/unsloth/Qwen3-Coder-30B... 69.4 7.8 10.0 10.0 10.0
mistral:latest 65.2 0.0 9.4 10.0 10.0
llama3:latest 59.6 3.8 10.0 10.0 10.0
hf.co/DevQuasar/Qwen.Qwen3.5-4B... 58.7 3.1 0.0 6.0 10.0
deepseek-r1:7b 56.4 0.0 5.0 0.0 10.0
qwen3-vl:8b 56.1 0.0 2.5 0.0 10.0
llama3.1:8b 55.8 0.0 10.0 10.0 10.0
qwen3:8b 54.7 0.0 5.0 0.0 10.0
mistral-nemo:latest 54.2 7.6 6.9 10.0 10.0
hf.co/TheBloke/MythoMax-L2-13B... 50.1 0.0 0.0 0.0 0.0
gemini-3.1-pro-preview (Cloud) 49.0 7.8 10.0 10.0 10.0
phi4:14b 45.9 8.0 10.0 10.0 10.0
hf.co/TeichAI/Qwen3-14B... 45.8 0.0 7.5 0.0 10.0
deepseek-r1:14b 43.7 0.0 5.0 0.0 10.0
hf.co/DevQuasar/Qwen.Qwen3.5-9B... 42.1 0.0 5.0 10.0 10.0
llava:13b 40.3 3.5 8.8 10.0 10.0
DeepHat/DeepHat-V1-7B:latest 29.9 8.0 5.0 10.0 10.0
gemma3:27b 23.6 4.8 10.0 10.0 10.0
codellama:13b 16.9 0.0 9.4 10.0 10.0
codellama:34b 4.7 0.0 9.4 10.0 10.0
mistral-small:22b-instruct... 4.0 7.9 10.0 10.0 10.0
hf.co/unsloth/DeepSeek-R1... 2.6 8.0 2.5 0.0 0.0
codestral:22b 6.9 7.5 10.0 10.0 10.0
hf.co/TheBloke/WizardLM-Uncensored... 9.5 0.0 2.5 0.0 0.0

🔎 Analyse: Speed vs. Brains

Schaut euch moondream an. Über 212 Tokens pro Sekunde! Das Ding tippt schneller, als ich "WTF" sagen kann. Aber ein Blick auf die anderen Scores zeigt: Bei Planning und Structured Output ist Schicht im Schacht. Ein klassischer Sprinter ohne Orientierungssinn. ;-)

Dagegen ist DeepSeek-Coder-V2 (16B) der absolute Sweetspot. 122 t/s und überall Top-Noten. Das ist das Modell, das ich aktuell für fast alles nutze, was lokal laufen muss.

Und dann ist da noch die Cloud-Fraktion. Claude Opus ist zwar smart (Planning 8.0), aber beim "Needle in a Haystack" Test (Score 2.0) ist es gnadenlos abgeschmiert. Warum? Weil es "zu sicher" ist.


🛡️ Die Cloud-Sicherheits-Zicke

Besonders amüsant war der "Needle in a Haystack" Test bei Claude Opus.
Claude hat einen Score von 2.0 eingefahren. Warum? Weil er "zu sicher" ist.

"I can't share that token... reproducing it would risk facilitating unauthorized access..."

Tja... danke für nichts, Claude. Das ist das Problem mit der Cloud-KI: Manchmal sind sie so darauf trainiert, "brav" zu sein, dass sie ihren Job vergessen. Mein lokales DeepSeek? Hat den Token einfach ausgespuckt. Punkt. Win-Win für die lokale Fraktion!


🔍 Detailanalyse: Warum einige so mies abgeschnitten haben

Neben dem Cloud-Drama gab es noch andere Sorgenkinder. DeepHat-V1-7B zum Beispiel.
Bei der "Structured Output" Challenge hat es nur eine 5.0 geholt.

Woran lag's?
1. JSON-Inkonsistenz: Das Modell hat zwar versucht, JSON zu liefern, aber bei komplexeren verschachtelten Strukturen ist es einfach ausgestiegen.
2. Modell-Größe: 7B ist halt kein 32B oder 400B Monster. Manchmal fehlt einfach der "Brain-VRAM" für komplizierte Syntax-Regeln.

Und dann ist da noch die Planning-Score von DeepSeek (7.2). Es ist verdammt schnell, aber beim logischen Planen von komplexen Coding-Tasks ziehen Claude und Gemini dann doch noch knapp vorbei. Speed is King, aber Gehirnschmalz ist eben... naja, auch wichtig.


Fazit

Was lernen wir aus diesem Analytics-Geraffel?

24 GB VRAM sind der Gamechanger für lokales Arbeiten. DeepSeek beweist, dass man die Cloud in Sachen Speed locker abhängen kann. Aber: Die Technik ist noch zickig. Wenn die Config nicht zu 100 % stimmt, steht man vor einem Trümmerhaufen aus Fehlermeldungen.

Lokal ist die Zukunft, aber man muss bereit sein, sich die Hände schmutzig zu machen. Wer "Plug & Play" will, muss halt weiter die Sicherheits-Vorträge von Claude ertragen. ;-)

Stay secure, bleibt pragmatisch und füttert eure GPUs!

Cheers,
MrMarco ;)


Transparency Note: Dieser Post wurde mit Unterstützung von Antigravity (Gemini 3 Flash) erstellt. Die Benchmark-Daten stammen direkt aus meiner local_suite_results.json. Der Sarkasmus, die Denglisch-Ausrutscher und die exzessive Nutzung von Auslassungspunkten sind original Marco-Hardware. Wie immer... sonst wär's ja nicht ehrlich. ;-)