Mein KI-Setup: Welche Hardware ich für lokale Modelle nutze und was man wirklich braucht

  • Moin zusammen,

    in letzter Zeit fragen immer wieder Leute, was man an Hardware braucht, um KI-Modelle lokal laufen zu lassen. Statt das jedes Mal einzeln zu beantworten, stelle ich hier mein eigenes Setup vor. Dazu schreibe ich ein paar Gedanken, was davon wirklich nötig ist und was eher Luxus.

    Mein Arbeitsrechner ("Lucy1")

    • CPU: AMD Ryzen 9 7950X3D (16 Kerne), wassergekühlt
    • Mainboard: ASUS ROG Strix X670E-F Gaming WiFi
    • RAM: 128 GB DDR5 (4 × 32 GB)
    • GPU 1: ASUS ROG Strix LC RTX 4090, 24 GB VRAM, wassergekühlt
    • GPU 2: ASUS Prime RTX 5060 Ti, 16 GB VRAM, neu dazugekommen, speziell für lokale Modelle
    • SSDs: Samsung 990 EVO Plus 4 TB + 2 × Samsung 990 PRO 2 TB (alle NVMe)
    • Netzteil: ASUS ROG Thor 1200W Platinum II
    • Gehäuse: ASUS ROG Hyperion GR701
    • OS: Windows 11 Pro, für die KI-Sachen zusätzlich Linux

    Mit beiden Karten komme ich auf 40 GB VRAM.

    Software

    Als Backend nutze ich Ollama. Es ist schnell eingerichtet, läuft stabil und bringt eine API mit, an die man andere Tools andocken kann. Aktuell nutze ich unter anderem GLM-4.7-Flash mit 64k Kontextfenster. Darauf lasse ich testweise Claude Code gegen das lokale Modell laufen. So kann ich agentische Coding-Workflows komplett lokal ausprobieren.

    Ein Tipp dazu: Das Standard-Kontextfenster von Ollama ist je nach Version eher knapp. Für Coding-Agenten solltet ihr es unbedingt hochsetzen. Bei mir steht es über OLLAMA_CONTEXT_LENGTH meist auf 65536.

    Was braucht man wirklich?

    Ehrlich gesagt: deutlich weniger als das hier. Mein Rechner ist gleichzeitig Arbeitsgerät, Entwicklungsmaschine und Spielwiese. Für den Einstieg braucht man das meiste davon nicht.

    Die wichtigste Zahl ist der Grafikspeicher (VRAM). Das Modell sollte komplett in den Speicher der Grafikkarte passen, sonst wird es zäh. Als grobe Faustregel braucht ein quantisiertes Modell (Q4) etwa 0,6 GB pro Milliarde Parameter. Dazu kommt Reserve für den Kontext.

    • Einstieg (12–16 GB VRAM), z. B. RTX 3060 12 GB, RTX 4060 Ti 16 GB oder RTX 5060 Ti 16 GB: Modelle bis etwa 14B laufen flüssig. Das reicht zum Reinschnuppern, für Texte, Zusammenfassungen und einfache Automatisierungen.
    • Ernsthaft (24 GB VRAM), z. B. eine gebrauchte RTX 3090 oder eine RTX 4090: Modelle um 30B laufen in Q4 komfortabel, auch mit größerem Kontext. Die gebrauchte 3090 gilt nach wie vor als Preis-Leistungs-Tipp.
    • Darüber: Man kann mehrere Karten kombinieren, so wie ich mit 4090 + 5060 Ti. Oder man nimmt viel Arbeitsspeicher für Modelle, die teilweise in CPU und RAM ausgelagert werden.

    Der Rest ist weniger kritisch:

    • RAM: 32 GB als Minimum, 64 GB sind angenehm. Viel RAM hilft vor allem bei MoE-Modellen, die man teilweise in den Arbeitsspeicher auslagern kann. Auf AM5 lieber zwei große Riegel als vier kleine, denn mit vier Riegeln sinkt meist der mögliche Takt.
    • CPU: eher nebensächlich, solange das Modell auf der GPU läuft. Ein aktueller 8-Kerner reicht.
    • SSD: NVMe lohnt sich. Modelle sind schnell mal 10–40 GB groß, und die Sammlung wächst schneller als gedacht.
    • Netzteil: nicht sparen, besonders mit einer 4090 oder mehreren Karten.
    • Alternative Mac: Apple Silicon mit viel gemeinsamem Speicher ist ebenfalls interessant, weil der Arbeitsspeicher auch als Grafikspeicher dient. Das ist meist langsamer als eine 4090, dafür passen auch große Modelle rein.

    Lohnt sich lokal überhaupt?

    Für viele Aufgaben sind Cloud-Modelle stärker und bequemer. Lokal lohnt sich vor allem aus drei Gründen:

    • Datenschutz: Die Daten verlassen den eigenen Rechner nicht.
    • Kosten: Bei Massenverarbeitung fallen keine laufenden API-Kosten an.
    • Freiheit: Man kann ohne Limits experimentieren.

    Fragen gern hier in den Thread. Einen Erfahrungsbericht zum Betrieb mit zwei Grafikkarten reiche ich nach, sobald ich genug damit gearbeitet habe.

    Auch könnt ihr gerne eure Setups posten :)

    wenn etwas möglich erscheint mach ich das, wenn das nicht klappt gehts ans unmögliche und ansonsten das undenkbare.

    - nun stolz rauchfrei - Ich denke also Bing ich!

    Support 24h Bereitschaft 0173 6107465 - NUR Für Kunden von SEO NW!

  • Nee. Also Videospur steht schon länger. Bin damit (auch noch) nicht zufrieden.. allerdings Audio bin ich grade zusätzlich daran.. Der "Erzähler" hörte sich noch Mist an. Nun weiss ich allerdings (wieder was gelernt) worans liegt/lag. Bei der Temperatur sollte auf keinen Fall "1" stehen. Dann hörts sichs komisch an, nicht natürlich.

    Gleich wirds dann noch zusammengewürfelt.

    wenn etwas möglich erscheint mach ich das, wenn das nicht klappt gehts ans unmögliche und ansonsten das undenkbare.

    - nun stolz rauchfrei - Ich denke also Bing ich!

    Support 24h Bereitschaft 0173 6107465 - NUR Für Kunden von SEO NW!

  • Moin Alex – cooles Setup, gerade die zweite Karte nur für lokale Modelle ist schlau. Ich hab das gerade auch am überlegen – bei mir läuft noch alles auf nem Ryzen ohne dedizierte GPU, die TTS-Etappen dauern entsprechend ewig. Deine Temperatur-Sache beim Erzähler ist mir übrigens noch nicht klar geworden: Meinst du mit Temperatur den Sample-Typ der Stimm-Cloning-Engine oder die Samplerate? Bei mir hat beides mal komisch geklungen, aber ich weiß leider noch ned genau, wo es hingehört.

    Zwei Fragen dazu: Hast du mit der 5060 Ti 16 GB die Modelle tatsächlich in die GPU reinbekommen, oder läuft bei 27B schon wieder der CPU-RAM mit? Und welches Modell nutzt du für die Sprachausgabe local – da hat mich neulich jemand gefragt, ob es sich lohnt, oder ob man da besser bei ner fertigen Engine bleiben sollte.