Benchmarks und mehr: Coding, General & Vision
Tja... wer rastet, der rostet. Und wer nur Code-Snippets benchmarkt, der übersieht die halbe Miete.
Bisher haben wir uns in der LLMGui Benchmark Suite ja hauptsächlich darauf konzentriert, wie schnell die Modelle Python-Funktionen hinklatschen können. Aber hey... wir nutzen diese digitalen Gehirne doch für mehr, oder? Also hab ich das Ganze mal ordentlich aufgebohrt.
(Disclaimer: Yep, der KI-Stempel klebt wieder drauf. Der Text hier ist KI-unterstützt, aber von mir persönlich in Form geprügelt und auf meinen technischen Mist gewachsen. Mensch steuert, Maschine tippt. ;)
Mehr als nur Code: Die neue Benchmark-Generation
In der Version 2.5 von LLMGui haben wir die Benchmark-Logik massiv erweitert. Wir decken jetzt drei große Kategorien ab: Coding, General Purpose (Reasoning/Wissen) und – Trommelwirbel – Vision.
Warum? Weil es nichts bringt, wenn ein Modell in HumanEval 90% holt, aber bei der Frage "Wie viele Äpfel hast du noch, wenn ich dir zwei wegnehme?" völlig halluziniert oder ein Dashboard-Screenshot nicht von einem Foto meiner Kaffeetasse unterscheiden kann.
Das Test-Geraffel im Detail (15 neue Prompts)
In Zusammenarbeit mit einer LLM wurden 15 spezifische Testszenarien entwickelt (5 pro Kategorie). Diese orientieren sich an etablierten Standards wie MMLU oder MBPP, wurden jedoch gezielt auf die Anforderungen des LLMGui Control Centers optimiert:
1. Coding (Logik & Effizienz)
- Prime Logic: "Implement a function is_prime(n) in Python. Optimize for performance." – Checkt nicht nur Syntax, sondern ob das Modell an Optimierungen denkt.
- Refactoring: Verschachtelte Loops in List Comprehensions umwandeln. – Testet die Fähigkeit, "Pythonic Code" zu schreiben.
- SQL Generation: Top 3 Gehälter pro Abteilung finden. – Der Klassiker für Backend-Devs. Hier patzen viele bei den Window-Functions.
- Theory/Explanation: Unterschied zwischen
__init__und__new__. – Coding-Intelligenz statt nur Copy-Paste. - Bug Finding: Der typische
my_list=[]Default-Argument-Fehler. – Erkennt das Modell die Python-Fallstricke?
2. General (Brain & Common Sense)
- Simplification: Schrödinger's Katze für 10-Jährige erklären. – Transferleistung ist hier gefragt.
- Finance/Logic: Gold vs. Index-Fonds bei Inflation. – Abwägen von Argumenten, kein reines Fakten-Dumping.
- Common Sense Puzzle: Das Apfel-Rätsel. – Hier scheitern erstaunlich viele "große" Modelle an simpler Logik.
- Professional Writing: Formale Email wegen Krankheit. – Nützlichkeitscheck for den Alltag.
- Literature Analysis: 1984 vs. Brave New World. – Kultur und Kontext.
3. Vision (Multimodalität)
Hier nutzen wir jetzt echte Bild-Assets (von der nächtlichen Stadt bis zum Parkplatz-Check):
* Scene Description: Urbanes Foto im Detail beschreiben.
* Object Counting: Autos auf einem Parkplatz zählen. – Einer der härtesten Tests für Vision-Modelle.
* OCR / Text Extraction: Handschriftliche Einkaufsliste digitalisieren.
* UI Analysis: Dashboard-Elemente und deren Funktionen identifizieren. – Extrem wichtig für automatisierte Tests.
* Architecture/Context: Baustil einer Kathedrale erkennen + Fakten liefern.
Testsystem — dana
Performance Overview (Avg Tok/s)
Detailergebnisse
| Modell | ⌀ Gesamt | Coding | General | Vision | Load (s) | minctx | recctx | maxctx |
|---|
Was lernen wir daraus?
- Moondream ist ein Biest: Das kleine Vision-Modell zersägt alles, was die pure Geschwindigkeit angeht (> 450 Tok/s!). Für schnelle Bildbeschreibungen gibt es aktuell kaum was Besseres im lokalen Bereich.
- Multimodalität kostet Zeit: Wenn ihr euch die Load-Zeiten von Modellen wie Qwen3-VL anschaut, seht ihr, dass die Vision-Adapter ordentlich VRAM-Geraffel mitschleppen. Das Laden dauert länger, aber die Präzision steigt.
- Die 7b/8b-Klasse dominiert den Flow: Qwen 2.5 und Llama 3.1 bleiben die Könige für flüssiges Arbeiten. Mit 140+ Tok/s fühlt sich das Ganze einfach wie eine sofortige Antwort an.
Tja... wer also nur "coding" benchmarkt, sieht eben nur das halbe Bild. Vision ist gekommen, um zu bleiben.
Bleibt pragmatisch, testet eure Modelle und lasst euch nicht von Cloud-Marketing das Geld aus der Tasche ziehen – lokal geht auch einiges!
Stay secure,
MrMarco ;)
Footnote: Dieser Beitrag wurde mit Hilfe von KI-Modellen (Geraffel-Suite!) erstellt und anschließend durch einen echten Menschen (mich!) gesichtet, korrigiert und in meinen Stil übersetzt. KI als Werkzeug, Mensch als Hirn.