Beiträge von Frank-L

    Was kann ich denn in der Suche für Anreize geben, eine ansprechende Meta Description? Was anderes wüsste ich nicht. :/

    Ich würde ihn gerne überarbeiten, aber traue mich nicht ^^

    zu 1) Ist generell gegenwärtig die Frage aller Fragen. Ich würde denken, dass du in deinen Texten die Gemeinschaft hervorhebst und eben die Kommunikation. Explizit wissen tue ich es leider nicht.

    zu 2) Regel Nr. 1 - Niemals - NIIIiiiemals - die URL ändern. Inhaltlich bist du ja optimal aufgestellt, da würde ich mir nicht so viele Sorgen machen.

    Ich habe tatsächlich ein Seite die ähnlich in den Impressionen über diesen Zeitraum aussieht, mit 2,5 CTR 0,9% weniger als bei Dir, deine Zielgruppe ist viel motivierter. :)

    Die hohen Impressionen kommen vor allem durch KI-Antworten. Wenn deine Seite dort als Quelle aufgeführt wird und jemand sich die Antwort ansieht, zählt das als Impression. Ist der Nutzer mit der KI-Antwort zufrieden, beendet er seine Suche, und der Klick auf deine Seite bleibt aus.

    Deshalb brauchst du Anreize, die den Nutzer auf deine Seite führen. Wie diese aussehen, hängt vom Angebot ab. Kaufentscheidungen funktionieren auf dieser Basis nach wie vor gut. Reine Wissensvermittlung funktioniert dagegen deutlich schlechter, weil die KI sie meist schon vollständig liefert. Für dich liegt der stärkste Anreiz daher vermutlich im Austausch mit echten Menschen: Beratung, Rückfragen, Community oder persönlicher Kontakt. Das kann dir eine KI-Antwort noch nicht abnehmen.

    https://www.cyberport.de/apple-und-zube…0c-gpu-bto.html

    Habsch mal auch so geguckt.. was das kostet. Also ich finde... wenn damit alles läuft, ist das sehr günstig.

    Frage ist nur, wo ist der Haken?

    Ich muss nochmal von vorn anfangen.
    Heute hat es mal einer mit Daten untersetzt, was ich für mich nur so zusammengesucht hatte.

    Externer Inhalt www.youtube.com
    Inhalte von externen Seiten werden ohne deine Zustimmung nicht automatisch geladen und angezeigt.
    Durch die Aktivierung der externen Inhalte erklärst du dich damit einverstanden, dass personenbezogene Daten an Drittplattformen übermittelt werden. Mehr Informationen dazu haben wir in unserer Datenschutzerklärung zur Verfügung gestellt.


    Ich vergleiche das hier bewusst aus meiner Praxis-Perspektive: Unraid-Server, lokale LLMs, Agenten mit großem Kontext, 24/7-Betrieb, Stromkosten im Blick.

    Geschwindigkeit im Alltag

    • Token-Generation (Antworten)
      • Eine einzelne RTX 4090 liegt bei kleinen 7B-Modellen (Q4) bei ca. 180–200 Tokens/s, bei 27B-Modellen eher 60–80 Tokens/s.
      • Der M3 Ultra kommt bei 27B-Modellen nur auf ca. 40–70 Tokens/s – für mich im direkten Vergleich spürbar zu träge.
      • Der M5 Ultra ist mit ca. 55–80 Tokens/s bei 27B-Modellen näher an der 4090, bleibt aber meist trotzdem leicht dahinter.
    • Prefill / Time-to-First-Token (lange Prompts lesen)
      • Die 4090 frisst lange Dokumente schnell: mehrere tausend Tokens/s beim Prefill, erste Antwort kommt zügig.
      • Der M3 Ultra ist hier deutlich langsamer, besonders bei langen Kontexten merke ich die Wartezeit bis zum ersten Token stark.
      • Der M5 Ultra ist besser als M3, aber in vielen Szenarien immer noch langsamer als eine 4090, vor allem bei sehr langen Dokumenten.

    Speicher: VRAM vs. unified memory

    • RTX 4090 (24 GB)
      • Passt gut für Modelle bis ~27B (Q4) mit moderatem Kontext.
      • Für meine Agenten mit großem Kontext (≥100k Token) ist 24 GB oft zu knapp; hier sind 2× 3090 (48 GB) für mich interessanter.
    • M3 Ultra (bis 256 GB)
      • Ermöglicht deutlich größere Modelle und viel mehr Kontext auf einer Maschine.
      • Bandbreite ca. 819 GB/s – für die Speichermenge eher niedrig, deshalb die moderate Token-Rate.
    • M5 Ultra (bis 512 GB)
      • Ideal für sehr große Modelle (70B+, MoE, teils 200B+ mit starker Quantisierung).
      • Bandbreite ca. 1.228 GB/s – besser als M3, aber pro GB immer noch weniger Durchsatz als eine 4090.

    Preis / Wertigkeit aus meiner Sicht

    • RTX 4090
      • Hohe Anschaffungskosten für die Karte, aber gutes Preis/Performance-Verhältnis für reine Inferenz.
      • Einfacher Upgrade-Pfad: einfach weitere GPU dazu, Rest des Systems bleibt.
    • M3/M5 Ultra Mac Studio
      • Sehr hohe Gesamtkosten, besonders in großen Speicher-Konfigurationen.
      • Kein modularer GPU-Upgrade-Pfad; bei mehr Leistung/Speicher muss das ganze System getauscht werden.
      • Ich kaufe mir hier vor allem Kapazität (große Modelle, großer Kontext), zahle aber pro Token/s oft mehr als bei einer 4090-Lösung.

    Software & Ökosystem

    • RTX 4090
      • CUDA ist für mich De-facto-Standard: vLLM, TGI, TensorRT-LLM, viele Optimierungen, fertige Docker-Images.
      • Passt perfekt in meine Unraid/Docker-Welt, sehr breite Tool-Unterstützung.
    • M3/M5 Ultra
      • Beste Performance meist mit Apple-spezifischen Stacks (MLX, Metal-Backends).
      • Viele Community-Tools sind primär auf Nvidia optimiert; manche Features oder Engines laufen auf dem Mac schlechter oder gar nicht.
      • Bekanntes Problem: MLX macht vollständiges Prefill vor dem ersten Token → bei langen Prompts fühlt sich das System für mich zu träge an.

    Stromverbrauch & Betrieb

    • RTX 4090
      • Hoher Spitzenverbrauch unter Last, lässt sich aber per Power-Limit stark drosseln, fast ohne großen Verlust bei der Token-Generation.
      • In meinem Unraid-Server gut integrierbar, passt in meine bestehende Infrastruktur.
    • M3/M5 Ultra
      • Sehr effizient im Leerlauf und unter moderater Last.
      • Unter Volllast (große Modelle, viele parallele Requests) steigt der Verbrauch, bleibt aber oft unter einem High-End-PC mit 4090.
      • Als kompaktes All-in-One-System einfacher im Büro, aber weniger flexibel im Server-Rack oder als reiner Inferenz-Knoten.

    Mein Fazit

    • Wenn es mir um maximale Tokens/s, niedrige Latenz und breite Software-Unterstützung geht (viele Nutzer, viele Agenten, viel Experimentieren mit verschiedenen Engines):
      → RTX 4090 (oder 2× 3090 für mehr VRAM) ist für mich die sinnvollere Wahl.
    • Wenn ich vor allem extrem große Modelle und sehr große Kontexte auf einer einzigen Maschine laufen lassen will und dafür etwas langsamere Antworten akzeptiere:
      → M5 Ultra (ggf. M3 Ultra) mit viel unified memory macht Sinn, ist aber pro Token/s teurer und im Ökosystem eingeschränkter.

    Reddit war noch nie wirklich eine sinnvolle Datenquelle für mich. Was sie gemacht hat, waren die Verweise auf Lösungen zu geben.
    Indirekt ist das RSS abschalten nur eine kurzfristige Lösung, dann wird Reddit halt komplett überwacht und wiederholt ausgelesen. Da müssen sie wieder Schutzmaßnahmen vorschalten, die dann auch abermals geknackt werden. Schon etwas lustig (sofern man nicht betroffen ist), dieses Katz und Maus Spiel.

    Ja, wie wird etwas gelöst, ist der größtmögliche Hebel um User zu halten und generell erst mal auf sich aufmerksam zu machen. Problem ist ja, in der KI sind diese Inhalte ja letztlich gestohlen und entwickelt haben diese Lösungen Menschen, die jetzt nicht mehr gesehen werden.
    Zum Einen gut, weil man die Lösungen teilweise als Normalsterblicher nicht findet. Was habe ich mir manchmal einen Wolf gesucht. Zum Anderen, wenn du eben jemand bist, der solche Lösungen anbietet, um Traffic zu generieren, ist dein Geschäftsmodell gestorben. Man muss selbst zun Löser werden, was wieder "Wer macht das?" entspricht und weniger relevant ist.

    https://www.cyberport.de/apple-und-zube…0c-gpu-bto.html

    Habsch mal auch so geguckt.. was das kostet. Also ich finde... wenn damit alles läuft, ist das sehr günstig.

    Frage ist nur, wo ist der Haken?

    Läuft so schnell wie meine GPUs. Mit mehr RAM und weniger Strombedarf. Wird dann bei großen Modellen schon langsam, bei 27b bin ich bei 30-40 Token/s. 70b bist du schon bei 15 Token/s.

    SSD nicht so schnell, soll nach 2h Dauerbetrieb die GPU um 20% drosseln, kein CUDA also hast du dort primär nur TTS LLM.

    1. Wenn Google top ist und Bing flop – ab wann würdet ihr das als echtes Alarmsignal nehmen und nicht nur als kurzfristiges Umsehen?
    2. Prüft ihr das händisch, oder habt ihr ein Tool, das bei euch beide Rankingwerte nebeneinander anzeigt?

    Tatsächlich ist der Ablauf seit Jahren immer der gleiche und dadurch rankt es, wenn es rankt, immer zuerst bei Bing und nach einem halben bis einem Jahr zieht es bei Google nach.
    Geprüft wieder über die Google Search Console.

    Das Forum ist jetzt gut 1 Jahr Online. An. den Links hat sich nichts geändert meines Wissens.

    Erst nach einem Jahr werden meist einige Filter gelockert, um Spammer davon abzuhalten permanent neue Projekte nachzuschieben. Gerade bei neuen Projekten die keine supertollen Links zu Beginn erhalten, man aber dennoch kontinuierlich Links setzt, spiegeln so eine Bild wieder. Bing ist am Anfang immer ein guter Indikator dafür, ob es bei Google ein Jahr später funktioniert, oder eben nicht.

    Mit ging es um 220 Token/s. Wenn es, sagen wir unter 500 Token/s bei einer Bandbreite von min. 800-900 GB/s fällt, dann ist es nicht mehr im GPU RAM, sondern im System RAM. Dort ist eben nochmal eine Optimierungsmöglichkeit, je nach Modell, weil nicht jede Anwendung benötigt groß Context, andere wiederum richtig viel. Und ob man nun mit 600 Token/s oder 200 Token/s unterwegs ist bedeutet letztlich 3fache Geschwindigkeit für den Einleseprozess.

    hab ich mir angeschaut.... aber wirklich gruselig was der alles kann.. Gruselig von den Funktionen her. Ich werde es auf jeden Fall die Tage jetzt schon testen. Entweder auf meinem Linux Setup, oder... auf Windows. Da bin ich grade neu am Partitionieren und knappse was von Mint ab.

    Theoretisch kannst du es auch auf einem Raspberry laufen lassen, du brauchst die API von dem jeweiligen Ollama/Lama.cpp etc..