LLMGui Benchmark Reloaded: Wenn die dicken Brocken das VRAM sprengen
Dieser Post wurde mit Hilfe von KI erstellt. Die Benchmarks sind real, die technischen Analysen wurden vom Menschen redigiert.
So, Kinder, wir legen nochmal nach. Wer dachte, der letzte Benchmark-Post war das Ende der Fahnenstange, hat die Rechnung ohne die neuen Coding-Monster gemacht. Wir haben dana mal ordentlich mit DeepSeek-R1, Codestral und Konsorten gequält.
Wer wissen will, warum wir überhaupt gewechselt sind und was sich hinter den Benchmarks im Detail verbirgt, schaut bitte in diesen Post: LLMGui Benchmark Evolution: Ollama vs. llama.cpp. Da habe ich das Ganze ausführlich bejammert und analysiert.
Das Ergebnis? Sagen wir mal so: Wer noch Ollama für dicke Modelle nutzt, hat wahrscheinlich auch noch ein 56k-Modem im Keller. ;)
Die neuen Messwerte im Überblick
Wir haben diesmal gezielt Coding-Modelle geladen, die eigentlich viel zu fett für die 12GB VRAM der RTX 3080 auf dana sind. Aber llama.cpp ist das herzlich egal. Hier ist der Vergleich zwischen der "guten alten Zeit" (Ollama) und dem neuen Goldstandard.
Speed Comparison: Tokens / Sekunde
Inference Speed: llama.cpp vs. Ollama
Dana (RTX 3080)Planning & Intelligence Score (0-10)
Wie schlagen sich die Biester in der echten Welt? (HTML-Scraping, SHA-Check, zst-Unpacking).
All Models: Planning Accuracy & Quality
Run: 2026-03-07Der interaktive Radar-Chart: Kein Widget-Geraffel nötig
Das visuelle Highlight ist der Radar-Chart. Er zeigt die Scores als Pentagon oder Hexagon. Jedes Modell hat eine eigene Farbe aus der Catppuccin Mocha Palette – weil wir ja auch was fürs Auge wollen. ;)
Das Besondere: Der Chart ist voll interaktiv, aber ohne externe Library!
- Hit-Detection: Klickt man in der Legende auf einen Modellnamen, wird dieses Modell ein- oder ausgeblendet.
- Cairo-Implementierung: Wir berechnen bei jedem Redraw Hit-Boxes (_radar_legend_rects) und prüfen im button-press-event, ob der User getroffen hat.
- Effekt: Das ausgeblendete Modell wird in der Legende durchgestrichen, die Farbfläche wird gedimmt und das Polygon verschwindet sofort vom Chart.
Man braucht keine aufgeblähten Widget-Bäume, wenn man direkt mit Cairo zeichnen kann. Das händische Zeichnen der Gitterringe (bei 2.5, 5.0, 7.5 und 10.0 Punkten) gibt dem Ganzen einen sehr wertigen Look. Es fühlt sich einfach "snappy" an.
Interaktiver Radar-Chart
Klicke auf ein Modell in der Legende, um es einzeln anzuzeigen oder auszublenden.
Technik-Check: Wie passt das 19GB-File in 12GB VRAM?
Das ist der eigentliche Zauber von llama.cpp. Während Ollama früher oft einfach die Segel gestrichen hat oder elendig langsam auf der CPU rumgekrebst ist, spielt llama.cpp das VRAM-Tetris für Profis.
- Layer Offloading:
llama.cppschiebt so viele Layer (Schichten) wie möglich in das VRAM. Wenn die 12GB voll sind, landet der Rest im normalen RAM. Da die Berechnungen aber zum Großteil auf der GPU passieren können, bleibt der Speed extrem hoch, solange die Kommunikation über PCIe nicht zum Flaschenhals wird. - mmap Magic: Das Modell wird nicht einfach "geladen", sondern als Memory-Mapped File behandelt. Das Betriebssystem managed das Paging. Wir können also Modelle laden, die größer als der physische Speicher sind, ohne dass alles sofort explodiert.
- K-Quants: Durch die exzellente Quantisierung (Q4_K_M) bleibt die Intelligenz erhalten, während der Speicherhunger um den Faktor 3-4 sinkt. Ein 32B-Modell wird so von ~64GB auf ~19GB gestutzt.
Warum die Werte trotzdem so nah beieinander liegen? dana scheint bei ~98 t/s an ein internes Limit zu stoßen (entweder CPU-Overhead oder API-Latency). Fakt ist aber: Wir kriegen die absolute Top-Intelligenz fast mit Lichtgeschwindigkeit serviert. :D
Mehr Details?
Wer wissen will, warum wir überhaupt gewechselt sind und was sich hinter den Benchmarks im Detail verbirgt, schaut bitte in diesen Post. Da habe ich das Ganze ausführlich bejammert und analysiert.
Technische Details zur Erstellung
- Benchmarks: Manuell auf
dana(RTX 3080) mitllama.cppundollamadurchgeführt. - Texte: Grobentwurf und Datenanalyse durch Antigravity (Advanced Agentic Coding), manuelles Editing und "Marco-fication" durch den Autor.
- Visuals: HTML/CSS Dashboards basierend auf Catppuccin Mocha Palette.
Transparency Note: Einige Inhalte, Code-Snippets und Beschreibungen in diesem Post wurden mittels KI (LLMs / Vibecoding) erstellt oder unterstützt, jedoch von mir persönlich kuratiert, überarbeitet und geprüft.
