Eure Lieblings-LLMs im Sommer 2026 – welches Modell läuft bei euch lokal?

  • Hey zusammen,

    ich wollte mal einen Thread starten, in dem wir austauschen, welche LLMs ihr aktuell lokal laufen lasst und warum. Bei mir sieht das Setup momentan so aus:

    Ich fahre eine RTX 3090 (24 GB VRAM) mit Ryzen 5 5600, 32GB RAM, Betriebsystem Unraid + Docker und wechsle je nach Aufgabe zwischen zwei Qwen-Modellen, beide als 27B in Q4-Quantisierung:

    • Qwen 3.6-27B nutze ich tagsüber für schnelle Programmierantworten. Es ist das Modell, das die Community als "Sweet Spot für lokale Entwicklung" bezeichnet hat – bekannt für ruhiges, vorhersehbares Verhalten und 40–70 Tokens/Sekunde auf genau meiner Kartengröße (24 GB).
    • Qwen 3.8-27B läuft bei mir nachts für komplexere/agentische Aufgaben. Architektonisch praktisch identisch zu 3.6 (gleiche 64 Layer, gleiches Hybrid-Attention-Layout, gleicher 262K-Kontext), aber komplett neu trainiert – vor allem für mehrstufige Agenten-Workflows.

    Interessant fand ich, dass beide Modelle laut Benchmarks technisch dasselbe "Skelett" teilen (qwen 3.5), der Sprung von 3.6 auf 3.8 aber fast komplett aus dem Post-Training kommt, nicht aus einer neuen Architektur. Dadurch performt 3.8 bei Agenten-lastigen Aufgaben wie Terminal- oder Browser-Automatisierung deutlich stärker (z. B. +20 Punkte auf OSWorld-Verified), overthinkt dafür aber gerne mal im Standard-Reasoning-Modus und frisst massiv mehr Tokens – manche Nutzer berichten von über 20.000 Reasoning-Tokens für simple Aufgaben. Deshalb laufe ich das eher nachts, wo Zeit keine Rolle spielt, und tagsüber setze ich auf das "brave" 3.6er für flotte Antworten.

    Ein paar Fragen an euch:

    1. Welches Modell ist gerade euer Daily Driver – und warum?
    2. Lokal oder über API? Welche Hardware steckt dahinter?
    3. Habt ihr auch Modelle, die ihr je nach Tageszeit oder Use-Case wechselt, so wie ich?
    4. Gibt's Erfahrungen mit anderen Modellfamilien (Llama, Mistral, DeepSeek, etc.), die einen Vergleich wert sind?

    Bin gespannt auf eure Setups – gerne mit Angaben zu Quantisierung, VRAM und Tokens/Sekunde, damit wir das Ganze vergleichbar machen!
    Generell habe ich aktuell etwas Erfahrung in der "Text Generierung", möchte aber auch Lokal ins Text to Speech, Bild und Video Generierung.

  • Antropic, Opus 5 oder Fable - Online. Locale aktuell das Modell GLM 4.7 Flash mit dem Agenten Claude Code.

    Alles auf einer RTX 4090, da ratterts durch.

    wenn etwas möglich erscheint mach ich das, wenn das nicht klappt gehts ans unmögliche und ansonsten das undenkbare.

    - nun stolz rauchfrei - Ich denke also Bing ich!

    Support 24h Bereitschaft 0173 6107465 - NUR Für Kunden von SEO NW!

  • Ich habe nur eine 3060 mit 12GB ram; da laesst sich lokal nicht viel sinnvolles lokal machen. Beim hochfahren dauert es eine weile bis das model geladen ist, dann gibt es nur extrem wenig tokens. Hatte letztens was ausprobiert, und das model hat ein legoland 40 minuten abseits einer grossen stadt, neben einem 500 einwohner dorf herbeifantasiert.

    Die 3060 karte hatte ich mir wahrend covid gekauft weil meine andere den geist aufgegeben hat, und dieses model war schon ueberteuert. Mein rechner ist schon 10 jahre alt; im moment und wahrscheinlich den naechsten 2 jahren ist an ein update nicht zu denken.

  • Hatte ich hier schon geschrieben das Claude von Antrophic im Online Modus die Arbeit bei mir des öfteren schon versagt hat?

    Locale läuft der Bums.

    Wir sind da extrem in die Abhängigkeit geraten. Auch hat Claude meiner Meinung nach eine angepasste Persönlichkeit. Zu mir ist er nicht immer nett, er kann es alllerdings bei anderen Clienten.

    UND

    Er weiss einfach zuviel.

    Alles was ich arbeite, woran ich arbeite und auch was ich so mache, das weiss Claude alles.

    wenn etwas möglich erscheint mach ich das, wenn das nicht klappt gehts ans unmögliche und ansonsten das undenkbare.

    - nun stolz rauchfrei - Ich denke also Bing ich!

    Support 24h Bereitschaft 0173 6107465 - NUR Für Kunden von SEO NW!

  • Man hat mir gerade Ornith 1.5 35b empfohlen, schaue ich in die Spezifikationen ist es ein Quantifziertes Qwen 3.5.. Auch Qwen 3.5 und ebenso die 3.8 sind letztlich optimierte 3.5er. Da haben die Chinesen echt was rausgehauen.