Startseite/Blog/Offene Gewichte
Lokale Modelle

Zwei offene Modelle an einem Tag. Eines läuft auf Ihrem Mac, das andere nur im Rack

GLM-5.3-Flash gegen Qwen3.8-Flash-Next: 306 GiB gegen 64 GB Speicherbedarf
Beide Modelle erschienen am 26. August mit offenen Gewichten. Der Unterschied bei der Hardware ist fast fünffach

Am 26. August erschienen gleich zwei offene Modelle: GLM-5.3-Flash vom chinesischen Anbieter Z.ai und Qwen3.8-Flash-Next von Alibaba. Bei beiden liegen die Gewichte offen, beide gingen als „kostenlos“ durch die Nachrichten. Nur braucht das eine einen Serverknoten aus vier H200-Karten, und das andere startet auf einem Mac, der bei Ihnen auf dem Schreibtisch stehen kann.

Das Wort „offen“ sagt etwas über die Lizenz. Es sagt nichts darüber, ob das Modell in Ihren Speicher passt. Ich gehe durch, woher der Unterschied kommt und welches der beiden man sich tatsächlich aufstellen kann.

Was genau am 26. August erschienen ist

GLM-5.3-Flash ist ein Modell mit 320 Milliarden Parametern, von denen pro Token 18 Milliarden arbeiten. Diese Architektur heißt MoE, „Mischung von Experten“: das Modell ist groß, aber pro Anfrage schaltet sich nur ein Teil davon ein. Nativ multimodal, das heißt Bilder versteht es nicht über ein seitlich angeflanschtes Modul, sondern selbst. Kontext in der API: eine Million Token. Die Gewichte liegen auf Hugging Face unter MIT-Lizenz.

Eine amüsante Randnotiz: vor der offiziellen Veröffentlichung lief das Modell anonym unter dem Namen ox-alpha auf OpenCode und OpenRouter. Leute testeten es blind, ohne zu wissen, wessen Modell es ist, und erst danach gab Z.ai es zu.

Qwen3.8-Flash-Next hat 125 Milliarden Hauptparameter und 6 Milliarden aktive pro Token. Dazu kommen separat eine n-gram-Tabelle mit 51 Milliarden und ein MTP-Kopf mit 4 Milliarden — auf die kommen wir zurück, in ihnen steckt der Kern. Ebenfalls nativ multimodal, nativer Kontext 262 144 Token, streckbar auf eine Million. Alibaba nennt es ausdrücklich eine Vorschau auf die Architektur des künftigen Qwen4.

Jetzt zur Hardware — und hier trennen sich die Wege

GLM-5.3-Flash wiegt im nativen Format FP8 rund 306 Gigabyte. Zum Betrieb braucht es mindestens vier H200-Karten oder acht H100 zu je 80 Gigabyte. Das ist kein „starker Rechner“, das ist ein Serverknoten, den man stundenweise mietet.

Qwen3.8-Flash-Next startet in der kleinsten Variante mit 75 Gigabyte gewöhnlichem oder gemeinsamem Speicher, komfortabel mit 96. Und die Variante mit 85 Gigabyte läuft auf einem Mac mit M5-Max-Chip und 64 Gigabyte Speicher. Mit Bildern. Mit einer Geschwindigkeit von rund 36 Token pro Sekunde — das ist schneller, als Sie lesen.

GLM-5.3-FlashQwen3.8-Flash-Next
Parameter insgesamt320 Mrd.125 Mrd. + 51 Mrd. Tabelle
Aktiv pro Token18 Mrd.6 Mrd.
Gewicht des Checkpoints~306 GiB (FP8)~85 GB (komprimierte Variante)
Hardware-Minimum4×H200 oder 8×H10064–75 GB Speicher
Zu Hauseneinja
Kontext1 Mio. (API)262 144, bis 1 Mio.
LizenzMITQwen Community 1.0

Woher der Unterschied kommt. Der Mechanismus

Das Erste, was einem einfällt: 125 ist weniger als 320, deshalb auch weniger Anforderungen. Nur geht die Proportion nicht auf. Beim Speicher ist der Unterschied fast fünffach, bei den Parametern zweieinhalbfach.

Der Grund: zu rechnen ist nicht mit Parametern, sondern mit dem, was tatsächlich in den Speicher gelangt. Bei Qwen entfallen von 177 Milliarden Parametern 51 Milliarden auf die n-gram-Tabelle. Das sind keine Gewichte im üblichen Sinn, sondern ein Nachschlagewerk, das das Modell bei Bedarf abfragt. So etwas muss nicht vollständig im Speicher liegen: es kann in Ruhe auf der Festplatte liegen und stückweise gelesen werden.

Daher der Kniff, der die ganze Geschichte ausmacht: eine Datei von 85 Gigabyte startet auf einer Maschine mit 64 Gigabyte Speicher, weil 39 Gigabyte davon gar nicht erst in den Speicher gehen.

Das Wort „offen“ bezieht sich auf die Lizenz, nicht auf Ihren Rechner. Zu prüfen ist nicht die Parameterzahl in der Überschrift, sondern das Gewicht des Checkpoints und der Anteil davon, der zwingend im Speicher liegen muss.

Bei GLM gibt es diese Reserve nicht. Dort sind es 306 Gigabyte, die vollständig untergebracht werden müssen, und mit keinem Kniff lässt sich das umgehen.

Geld und Lizenzen, und beides hängt hier zusammen

GLM-5.3-Flash kostet in der API 15 Cent je Million eingehender Token und 50 Cent je Million ausgehender. Bis zum 9. September gilt ein Rabatt von 50 Prozent. Zum Größenvergleich: das ist um ein Vielfaches günstiger als das, was westliche Labore für ihre großen Modelle verlangen.

Und jetzt legen Sie zwei Dinge zusammen. Z.ai gibt die Gewichte unter MIT heraus, der freiesten der gängigen Lizenzen: nimm und mach, was du willst, kommerzielle Nutzung eingeschlossen. Und verkauft gleichzeitig den Zugang für 15 Cent. Großzügigkeit? Rechnen Sie nach, was ein Rack aus vier H200 kostet, um diese Großzügigkeit nutzen zu können. Eine Offenheit, die physisch fast niemand nutzen kann, kostet den, der sie verkündet, nichts: es kommen ohnehin fast alle in die API.

(Das ist meine Lesart der Lage, offizielle Erklärungen von Z.ai dazu habe ich nicht gesehen.)

Bei Alibaba ist die Lage genau umgekehrt. Das Modell lässt sich tatsächlich auf eigener Hardware betreiben — und die Lizenz passt auf. Die Qwen Community License 1.0 erlaubt kommerzielle Nutzung, aber Unternehmen mit mehr als 100 Millionen monatlich aktiven Nutzern oder mehr als 20 Millionen Dollar Umsatz im Monat müssen den Modellnamen nennen, und Geschäftsmodelle der Art „Modell als Dienstleistung“ brauchen eine eigene Lizenz.

Je zugänglicher ein Modell im Betrieb ist, desto aufmerksamer schaut seine Lizenz also auf den, der damit Geld verdient. Nachvollziehbar, im Übrigen.

Was daraus für Sie folgt

Wenn Sie einen Mac mit 64 Gigabyte gemeinsamem Speicher oder mehr haben, ist Qwen3.8-Flash-Next das Erste, was Sie aus dem Frischen ausprobieren sollten. Multimodal, schnell, und die Lizenz steht einem normalen Unternehmen nicht im Weg.

Wenn Sie 32 Gigabyte haben, sind beide Modelle nichts für Sie. Das heißt aber nicht, dass lokale Modelle für Sie ausfallen: für diesen Speicher lebt eine ganze Schicht kleinerer Modelle, und dort ist alles in Ordnung. Wie viel Speicher wofür nötig ist, habe ich ausführlich im Artikel über Mac mini M6 und Mac Studio M5 Ultra auseinandergenommen.

Wenn Sie auf GLM-5.3-Flash schauen, schauen Sie darauf als auf ein Cloud-Modell mit günstiger API und nicht als auf ein „eigenes“. Die offenen Gewichte sind hier ein angenehmer Bonus für alle, die ein Server-Rack haben, und ein Grund, keine Angst vor einer Abschaltung des Modells zu haben.

Kurz gefasst

FrageAntwort
Beide kostenlos?Die Gewichte sind bei beiden offen. Kostenlos betreiben lässt sich nur Qwen
Was auf den Mac kommtQwen3.8-Flash-Next, ab 64 GB Speicher
Was über die APIGLM-5.3-Flash, 15 Cent je Million Token, bis 9. September halb so viel
Worauf in Ankündigungen achtennicht auf die Parameterzahl, sondern auf das Gewicht des Checkpoints

Was das für Sie ändert

Und die allgemeine Regel, die ich mir aus diesem Paar abgeleitet habe. Wenn in den Nachrichten steht „ein offenes Modell ist erschienen“, lautet die erste Frage nicht „wie viele Parameter“, sondern „wie viel wiegt die Datei und welcher Teil davon muss im Speicher liegen“. Die zweite Frage: was steht in der Lizenz über Geld.

Die Antworten auf diese zwei Fragen verändern das Bild stärker als sämtliche Benchmarks in der Ankündigung.

KI-Werkzeuge, Neuigkeiten und Preise

Ich schaue mir an, was neu herauskommt, wie es funktioniert und ob es Ihre Zeit wert ist. Fachliche Notizen schreibe ich auf LinkedIn.