LLM Basics Update: Kapitel 1.5, Safeguards, Nanny-State und Jailbreaks
Tja... da sind wir wieder. Wer dachte, die LLM Basics Präsentation wäre langsam mal fertig, der hat die Rechnung ohne die Realität gemacht. Das Zeug dreht sich einfach zu schnell...
Letztens im Meeting fiel mir auf: Alle reden permanent über Token, VRAM und RAG. Aber kaum einer checkt eigentlich, wie die Wurst überhaupt gemacht wird. Wie entsteht eigentlich so ein Modell? Warum weigert es sich manchmal standhaft, mir einen simplen Keylogger zu schreiben? Und was zum Geier ist eigentlich diese "Alignment Tax", über die alle heulen?
Also hab ich mich wieder hingesetzt und die Slides ordentlich aufgebohrt. Willkommen in Phase 01.5: The Making Of & Safeguards.
Die Präsentation: Jetzt mit Phase 01.5
Was ist neu unter der Haube?
Ich habe ein komplett neues Kapitel eingeschoben, das sich mit den wirklichen Grundlagen des Trainings und vor allem den Security-Constraints beschäftigt:
- Vom Papagei zum Assistenten: Wir klären, was Pre-Training, SFT (Instruct Tuning) und RLHF bedeuten. Spoiler: Ohne das letzte Ding wäre die KI einfach nur ein stochastischer Papagei, der gnadenlos "Trash in, Trash out" aus dem Internet wiederholt.
- Safeguards & Nanny-State: Die großen Corporate-Modelle (Hallo OpenAI, Hallo Anthropic) sind mittlerweile heftig zensiert. "As an AI language model..." – ja, kennen wir, nervt wie Hölle. Das nennt sich Alignment Tax. Zu viel Sicherheitstraining macht das Modell nachweislich dümmer und weniger kreativ.
- Jailbreaks: Wie umgeht man den Bums? Tja... das "Roleplay-Loch" ist hierbei mein absoluter Favorit. Die KI weigert sich? Dann sag ihr einfach, sie soll ein fiktives Theaterstück schreiben, in dem ein Hacker einen Exploit codet. ZACK, Guardrails vergessen. Oder man versucht es mit Base64 und ROT13... die internen Filter sind nämlich meist nur auf Klartext-Englisch trainiert. ;)
- Groß vs. Frei (Open Source): Ein Plädoyer für uncensored Llama- und Mistral-Modelle. Wer echtes Cybersecurity-Research betreiben will, kommt um offene Modelle ohne Moralpredigt nicht herum.
Fazit
Die Slides sind jetzt noch runder und decken endlich auch die ganzen "Warum darf ich das nicht?"-Fragen ab, die in Trainings unweigerlich aufkommen.
Zieht euch das Update rein, drückt F11 für Vollbild und habt Spaß damit im nächsten Workshop. Und vergesst nicht das Buzzword-Bingo... das ist natürlich immer noch mit am Start. :-D
Stay secure und hostet lokal, was das Zeug hält!
Cheers,
MrMarco ;)
Transparency Note: Dieser Post wurde mit Unterstützung von Antigravity erstellt. Der Sarkasmus, die Nerd-Referenzen und die generelle Unzufriedenheit über zensierte KI-Modelle sind aber 100% original Marco. Alles andere wäre ja AI-Slop... und den wollen wir hier nicht. ;-)
