Eure Lieblings-LLMs im Sommer 2026 – welches Modell läuft bei euch lokal?

  • Hey zusammen,

    ich wollte mal einen Thread starten, in dem wir austauschen, welche LLMs ihr aktuell lokal laufen lasst und warum. Bei mir sieht das Setup momentan so aus:

    Ich fahre eine RTX 3090 (24 GB VRAM) mit Ryzen 5 5600, 32GB RAM, Betriebsystem Unraid + Docker und wechsle je nach Aufgabe zwischen zwei Qwen-Modellen, beide als 27B in Q4-Quantisierung:

    • Qwen 3.6-27B nutze ich tagsüber für schnelle Programmierantworten. Es ist das Modell, das die Community als "Sweet Spot für lokale Entwicklung" bezeichnet hat – bekannt für ruhiges, vorhersehbares Verhalten und 40–70 Tokens/Sekunde auf genau meiner Kartengröße (24 GB).
    • Qwen 3.8-27B läuft bei mir nachts für komplexere/agentische Aufgaben. Architektonisch praktisch identisch zu 3.6 (gleiche 64 Layer, gleiches Hybrid-Attention-Layout, gleicher 262K-Kontext), aber komplett neu trainiert – vor allem für mehrstufige Agenten-Workflows.

    Interessant fand ich, dass beide Modelle laut Benchmarks technisch dasselbe "Skelett" teilen (qwen 3.5), der Sprung von 3.6 auf 3.8 aber fast komplett aus dem Post-Training kommt, nicht aus einer neuen Architektur. Dadurch performt 3.8 bei Agenten-lastigen Aufgaben wie Terminal- oder Browser-Automatisierung deutlich stärker (z. B. +20 Punkte auf OSWorld-Verified), overthinkt dafür aber gerne mal im Standard-Reasoning-Modus und frisst massiv mehr Tokens – manche Nutzer berichten von über 20.000 Reasoning-Tokens für simple Aufgaben. Deshalb laufe ich das eher nachts, wo Zeit keine Rolle spielt, und tagsüber setze ich auf das "brave" 3.6er für flotte Antworten.

    Ein paar Fragen an euch:

    1. Welches Modell ist gerade euer Daily Driver – und warum?
    2. Lokal oder über API? Welche Hardware steckt dahinter?
    3. Habt ihr auch Modelle, die ihr je nach Tageszeit oder Use-Case wechselt, so wie ich?
    4. Gibt's Erfahrungen mit anderen Modellfamilien (Llama, Mistral, DeepSeek, etc.), die einen Vergleich wert sind?

    Bin gespannt auf eure Setups – gerne mit Angaben zu Quantisierung, VRAM und Tokens/Sekunde, damit wir das Ganze vergleichbar machen!
    Generell habe ich aktuell etwas Erfahrung in der "Text Generierung", möchte aber auch Lokal ins Text to Speech, Bild und Video Generierung.