Benchmark-Evolution: Warum wir Ollama in Rente geschickt haben
Hardware-Upgrade? Nein, Software-Evolution! Wer dana schon länger verfolgt, weiß, dass wir für die lokalen LLMs bisher auf Ollama gesetzt haben. Das war bequem, aber für Benchmarks und maximale Kontrolle eher... sagen wir mal, "suboptimal".
Wir haben den kompletten Stack auf llama.cpp umgestellt. Warum? Weil der Unterschied nicht nur messbar, sondern schlichtweg absurd ist.
Der Switch: Von 6 zu 96 Tokens pro Sekunde
Nehmen wir das Beispiel Phi-4. Unter Ollama kreuchte das Modell mit ca. 6.04 Tokens/Sekunde vor sich hin. Ein netter Chat, aber zum produktiven Coden eher ein Geduldsspiel.
Mit dem Wechsel auf den llama-server (llama.cpp) und sauberem Layer-Offloading auf die RTX 3080 schießt der Wert bei identischer Hardware auf über 96 Tokens/Sekunde hoch.
Performance Evolution: Der Stack-Vergleich
Dana MonitoringWarum ist das so viel schneller?
Ollama macht vieles automatisch, aber genau das war das Problem. llama.cpp erlaubt uns:
1. Präzises VRAM-Management: Wir bestimmen exakt, wie viele Layer auf die GPU wandern.
2. Flash Attention: Moderne Optimierungen werden direkt genutzt.
3. mmap: Die Modelle werden blitzschnell gemappt, anstatt sie jedes Mal mühsam in den RAM zu schaufeln.
Was ist mit den "alten" Modellen?
Ein paar Modelle wie Moondream oder die speziellen Vision-Modelle sind aktuell nicht im Benchmark-Suite. Warum? Weil wir uns auf die reine Coding-Performance und GGUF-Kompatibilität konzentriert haben. Wer sie vermisst: Keine Sorge, die kommen wieder, sobald wir die entsprechenden GGUF-Quants auf dana sortiert haben.
Wie sich die ganz neuen Coding-Monster (DeepSeek-R1-32B & Co.) in diesem neuen Setup schlagen, erfahrt ihr hier: LLMGui Benchmark Reloaded: Wenn die dicken Brocken das VRAM sprengen.
Technische Details zur Erstellung
- Daten: Benchmarks auf
dana(RTX 3080) durchgeführt. - KI-Unterstützung: Strukturierung und technische Textbausteine durch Antigravity.
- Review: Vollständige manuelle Prüfung und Korrektur der technischen Aussagen.
Transparency Note: Einige Inhalte, Code-Snippets und Beschreibungen in diesem Post wurden mittels KI (LLMs / Vibecoding) erstellt oder unterstützt, jedoch von mir persönlich kuratiert, überarbeitet und geprüft.
