Skip to content

GLM auf Deutsch nutzen: Installation, Kosten und Vergleich (2026)

GLM ist die Open-Source-KI-Modellfamilie des chinesischen Herstellers Zhipu AI, international seit 2025 unter dem Namen Z.ai bekannt. Du nutzt GLM kostenlos online über chat.z.ai oder installierst es komplett lokal auf deinem eigenen Rechner, wenn du unabhängig von einem einzelnen Anbieter bleiben willst. Beide Wege stehen unter der freien MIT-Lizenz, auch für die kommerzielle Nutzung. Für die lokale Installation eignet sich nicht das große Flaggschiff GLM-5.2, das läuft nur auf Server-Hardware. Interessant für Consumer-Rechner ist stattdessen GLM-4.7-Flash, eine kompakte 30-Milliarden-Parameter-Version mit überraschend starker Coding-Leistung.

⚡ Schnellstart: GLM in 2 Minuten testen
  1. Ohne Installation: chat.z.ai öffnen, kostenlos chatten
  2. Für lokale Nutzung: Ollama installieren (curl -fsSL https://ollama.ai/install.sh | sh)
  3. Modell laden: ollama pull glm-4.7-flash
  4. Starten: ollama run glm-4.7-flash

Was ist GLM und wer steckt hinter Zhipu AI?

GLM steht für General Language Model und ist die KI-Modellreihe des chinesischen Unternehmens Zhipu AI, seit 2025 international unter der Marke Z.ai aufgetreten. Entwickelt wurde die Architektur ursprünglich am NLP-Labor der Tsinghua-Universität in Peking, das erste GLM-Modell erschien bereits im März 2021. Als Chatbot ging ChatGLM im März 2023 an den Start, lange bevor GLM außerhalb Chinas bekannt wurde.

Technisch setzt das aktuelle Flaggschiff GLM-5.2 auf eine Mixture-of-Experts-Architektur mit 753 Milliarden Parametern insgesamt, von denen pro Anfrage nur rund 40 Milliarden aktiv sind. Das spart Rechenleistung, ohne die Modellqualität stark einzuschränken. Release war am 13. Juni 2026, nur wenige Wochen nach dem Vorgänger GLM-5.1. Das Modell steht unter MIT-Lizenz offen zur Verfügung, auch für kommerzielle Zwecke, die Modellgewichte (Weights) liegen frei zugänglich auf Hugging Face.

13.6.26
GLM-5.2-Release
MIT
Lizenz, kommerziell nutzbar
753 Mrd.
Parameter, 40 Mrd. aktiv

Der eigentliche Clou für Nutzer mit Souveränitäts-Fokus: GLM-5.2 wurde komplett auf Huawei-Ascend-Chips trainiert, ganz ohne Nvidia-Hardware. Kein anderer deutscher Artikel zu GLM ordnet bisher ein, was das für dich als Nutzer praktisch bedeutet, dazu mehr im FAQ-Abschnitt weiter unten. Was GLM nicht ist: ein Ersatz für jede Anwendung. Native Bildgenerierung fehlt, dafür bringt Zhipu AI mit GLM-Image ein separates Modell.

GLM zählt neben DeepSeek und Qwen zu den drei bekanntesten offenen chinesischen Modellfamilien. Alle drei tauchen regelmäßig in unabhängigen Coding-Benchmarks weit vorn auf, ein Beleg dafür, dass die chinesische Open-Source-Szene mittlerweile auf Augenhöhe mit US-Anbietern mitspielt. Der Unterschied zu ChatGPT oder Claude: Du kannst GLM per Self-Hosting komplett selbst betreiben, statt dich auf die Verfügbarkeit eines einzelnen Cloud-Anbieters zu verlassen.

Wie nutze ich GLM online?

Für den schnellen Test reicht die offizielle Website. Auf chat.z.ai chattest du sofort und ohne Anmeldung, allerdings nicht mit dem großen Flaggschiff: Im anonymen Schnelltest zeigt die Oberfläche GLM-5.1, das Vorgängermodell. Für GLM-5.2 selbst ist bisher keine Modellauswahl im kostenlosen Chat sichtbar, das Flaggschiff scheint für den API-Zugang und die Coding-Tools reserviert zu sein. Die Oberfläche funktioniert auch auf Deutsch, zusätzlich bietet Z.ai eine automatische Folienerstellung direkt im Chat an.

chat.z.ai Oberfläche im anonymen Chat mit GLM-5.1: Prompt für eine Zahlungserinnerung und Antwortbeginn
Der Haken an der Online-Variante: Deine Anfragen laufen über Zhipu AIs Server. Das Unternehmen steht seit 2025 auf der US-Exportkontrollliste, begründet mit dem Beitrag zur chinesischen KI-Militärforschung. Für Kundendaten oder Geschäftsgeheimnisse ist die Cloud-Version deshalb keine gute Wahl. Mehr dazu im DSGVO-Abschnitt.

Welche GLM-Version passt auf meinen Rechner?

Drei GLM-Varianten kommen für unterschiedliche Zwecke infrage. Genau hier liegt die Lücke in den meisten deutschen Artikeln zum Thema: Sie behandeln nur das große GLM-5.2 für Unternehmen, aber nicht den Weg für Privatanwender und Solo-Selbstständige.

GLM-5.2 mit 753 Milliarden Parametern ist ausschließlich für Cloud- und Enterprise-Einsatz gedacht. Bei voller Präzision braucht das Modell weit über 1.500 Gigabyte Arbeitsspeicher, kein Consumer-Rechner schafft das. GLM-4.7-Flash dagegen ist explizit für lokale Nutzung gebaut: eine 30-Milliarden-Parameter-MoE-Version, von der nur 3 Milliarden pro Anfrage aktiv sind, in der Fachsprache „30B-A3B“ genannt. Zhipu AI selbst nennt es das stärkste Modell seiner Größenklasse, mit vollem Context-Window für lange Chats und Codebasen. Wer noch schwächere Hardware hat, findet mit GLM-4-9B eine ältere, aber sehr leichte Variante aus dem Jahr 2024, mit nur 9 Milliarden Parametern.

GLM-4-9B
6 GB
GLM-4.7-Flash
19 GB
GLM-5.2
>1.500 GB

Balkenlänge auf den Speicherbedarf von GLM-5.2 skaliert. GLM-4-9B und GLM-4.7-Flash sind auf dieser Skala kaum sichtbar, genau das ist der Punkt.

ModellParameterRAM/VRAM (Q4)Lokal nutzbar?
GLM-4-9B9 Mrd.~6 GB✓ Ja, auch schwache Hardware
GLM-4.7-Flash30 Mrd. (3 Mrd. aktiv)~19-20 GB✓ Ja, empfohlener Einstieg
GLM-5.2753 Mrd. (40 Mrd. aktiv)>1.500 GB✗ Nein, nur Cloud/Enterprise
Rechner: Welche GLM-Version passt zu deinem RAM?
Zahl eingeben und auf „Modell finden“ klicken.
Cloud-Umweg für GLM-5.2? Auch mit wenig eigenem Speicher lässt sich GLM-5.2 testen, dann läuft es über Ollamas Cloud-Tag statt auf deinem eigenen Rechner. Details dazu im Abschnitt zum Programmieren mit GLM weiter unten.

Wie installiere ich GLM-4.7-Flash lokal mit Ollama?

Ollama ist auch für GLM-4.7-Flash das gängigste Tool. Seit Version 0.14.3 unterstützt es das Modell nativ, in aktuellen Ollama-Versionen ist das längst Standard.

Ollama installieren und GLM-4.7-Flash laden

1
Ollama installieren. macOS und Linux per Terminal: curl -fsSL https://ollama.ai/install.sh | sh. Windows: Installer von ollama.ai herunterladen.
2
Modell laden. ollama pull glm-4.7-flash im Terminal ausführen, lädt in der Standard-Quantisierung Q4_K_M rund 19 GB herunter.
3
Starten und chatten. ollama run glm-4.7-flash, danach direkt im Terminal tippen.
Terminal-Ausgabe von ollama pull glm-4.7-flash nach Abschluss des Downloads: 19 GB, verifiziert, success

GLM-4.7-Flash antwortet auf Deutsch zuverlässig und deutlich schneller, als die Parameterzahl vermuten lässt. Dank der MoE-Architektur mit nur 3 Milliarden aktiven Parametern erreichst du auf einer aktuellen Consumer-GPU rund 60 bis 100 Token Output pro Sekunde, spürbar flotter als bei klassisch dichten Modellen gleicher Größenklasse. Für agentisches Programmieren, also mehrstufige Aufgaben, bei denen die KI selbstständig Dateien liest und ändert, reicht das gut aus.

GLM-4.7-Flash beantwortet eine deutsche Coding-Frage mit einer funktionierenden Python-Funktion zum Einlesen einer CSV-Datei

Ohne Terminal: Ollamas Desktop-App

Wer das Terminal nicht mag: Ollama bringt inzwischen eine eigene offizielle Desktop-App für macOS und Windows mit, eine schlichte Chat-Oberfläche ganz ohne Kommandozeile. GLM-4.7-Flash lässt sich dort genauso auswählen wie im Terminal.

Zu wenig VRAM? Reicht die Grafikkarte nicht für die vollen 19 GB, lädt Ollama automatisch einen Teil des Modells in den normalen Arbeitsspeicher aus (CPU-Offloading). Das funktioniert, kostet aber Geschwindigkeit. Für flüssiges Arbeiten lohnt sich dann eher der Griff zur kleineren GLM-4-9B-Variante aus der Tabelle oben.

Wie gut ist GLM beim Programmieren?

GLM-5.2 erreicht 62,1 Prozent auf SWE-bench Pro, dem aktuell aussagekräftigsten Coding-Benchmark für eigenständiges Arbeiten an echten Software-Aufgaben. Das ist der beste Wert unter allen offenen Modellen. Claude Opus 4.8 liegt mit 69,2 Prozent trotzdem vorn, auch Claude Sonnet 5 übertrifft GLM mit 63,2 Prozent knapp. Googles Gemini 3.1 Pro dagegen liegt mit 54,2 Prozent klar dahinter, GLM schlägt hier also ein aktuelles Closed-Source-Flaggschiff aus den USA. Für viele Alltagsaufgaben reicht GLM locker, bei komplexen Multi-Datei-Refactorings zeigt sich der Abstand zu Claude aber deutlich.

Fortgeschrittene Option: Wer GLM-5.2 nutzen will, ohne lokal Terabytes an Speicher vorzuhalten, startet es über Ollamas Cloud-Tag mit ollama run glm-5.2:cloud. Die Anfrage läuft dann über Ollamas Server statt auf deinem Rechner, praktisch für den Test des großen Modells ohne eigene GPU-Farm. Wer die KI direkt im Terminal einsetzen will, kennt das Prinzip vielleicht schon von Claude Code, Anthropics eigenem CLI-Tool. Ollama funktioniert ähnlich, nur eben mit einem offenen statt einem geschlossenen Modell. Als API-Aggregator listet auch OpenRouter GLM neben Dutzenden anderen Modellen. Wie du GLM anschließend in eigene Automatisierungen einbindest, zeigt der Artikel n8n + Ollama: Kostenlose KI-Workflows lokal betreiben.

Für regelmäßige Coding-Nutzung bietet Zhipu zusätzlich den GLM Coding Plan an: ein Abo mit festem Prompt-Kontingent statt Pay-per-Token-Abrechnung, direkt nutzbar in gängigen Coding-Agents und IDEs. Die Einstiegsstufe liegt bei rund 10 US-Dollar im Monat, die Pro-Stufe mit Zugriff auf GLM-5.2 bei etwa 30 US-Dollar. Für Vielnutzer oft günstiger als die reine API-Abrechnung, für Gelegenheitsnutzer bleibt der kostenlose Cloud-Tag über Ollama oder chat.z.ai die einfachere Wahl.

Was GLM gut kann
  • Bestes Coding-Ergebnis unter offenen Modellen (SWE-bench Pro: 62,1%)
  • GLM-4.7-Flash läuft auf normaler Consumer-Hardware, nicht nur auf Server-GPUs
  • Bis zu 1 Million Token Kontext bei GLM-5.2, nützlich für lange Codebasen oder Dokumente
Was GLM (noch) nicht kann
  • Bei komplexen Multi-Datei-Refactorings bleibt Claude Opus spürbar vorn
  • Keine native Bildgenerierung, dafür ist ein separates Modell (GLM-Image) nötig
  • Kleinere Nutzer-Community als DeepSeek oder Qwen, weniger deutschsprachiger Foren-Support

Wie schneidet GLM im Vergleich zu DeepSeek und Qwen ab?

Alle drei chinesischen Modellfamilien setzen auf offene Lizenzen, unterscheiden sich aber in Details, die für deine Wahl wichtig sind.

KriteriumGLMDeepSeek R1Qwen3
LizenzMITMITApache 2.0
Kontextbis 1 Mio. Token (GLM-5.2)128.000 Tokenbis 1,01 Mio. Token
Lokal auf Consumer-Hardware✓ mit GLM-4.7-Flash✓ mit R1-Distill✓ mit kleineren Varianten
TrainingKomplett auf Huawei-Ascend-ChipsStandard-GPU-TrainingStandard-GPU-Training
Coding-FokusSehr stark (SWE-bench Pro: 62,1%)Stark bei Mathematik/ReasoningSehr stark (SWE-bench Verified, andere Skala)

SWE-bench Pro und SWE-bench Verified sind unterschiedliche Benchmarks mit unterschiedlichem Schwierigkeitsgrad, die Prozentwerte sind nicht direkt vergleichbar.

Für dich als Solo-Selbstständiger heißt das konkret: DeepSeek R1 punktet bei mathematischem Denken und hat mit den R1-Distill-Varianten die größte Auswahl an Modellgrößen, von 1,5 bis 70 Milliarden Parametern. Qwen3 bietet die freizügigste Lizenz und den größten Kontext. GLM ist aktuell die stärkste Wahl, wenn Programmieren im Vordergrund steht und du bereit bist, dich auf eine neuere, noch kleinere Community einzulassen. Neben diesen drei Modellfamilien tauchen in Benchmarks regelmäßig auch Kimi K2 und Googles Gemini auf, für die lokale Installation auf Consumer-Hardware bleiben GLM, DeepSeek und Qwen aber die praktikabelsten offenen Optionen. Mehr zu DeepSeek liest du im Artikel DeepSeek auf Deutsch nutzen: Online oder lokal installieren.

Ist GLM DSGVO-konform nutzbar?

Bei lokaler Installation über Ollama verlässt keine Anfrage deinen Rechner, ein Auftragsverarbeitungsvertrag ist dafür nicht nötig. Das gilt für GLM-4.7-Flash genauso wie für GLM-4-9B.

Anders sieht es bei der Cloud-Nutzung aus, egal ob über chat.z.ai oder die API. Zhipu AI, international als Z.ai aufgetreten, ist ein chinesisches Unternehmen und steht seit 2025 auf der US-Exportkontrollliste. Für die DSGVO ist vor allem relevant: Es gibt keinen öffentlich bekannten Auftragsverarbeitungsvertrag nach EU-Standard, Daten werden auf Servern außerhalb der EU verarbeitet. Für Tests und private Nutzung unproblematisch, für Kundendaten oder interne Geschäftsunterlagen ist davon abzuraten.

Faustregel: Lokal installiert ist GLM datenschutzrechtlich unkritisch. Über chat.z.ai oder die API verarbeitet gehören sensible Geschäftsdaten nicht hinein.

Für Solo-Selbstständige, die GLM produktiv einsetzen wollen, bedeutet das in der Praxis: Interne Dokumente, Kundendaten oder unveröffentlichten Code lokal mit GLM-4.7-Flash bearbeiten. Für unkritische Aufgaben wie erste Recherche oder Textentwürfe ohne Personenbezug spricht wenig gegen die kostenlose Cloud-Version über chat.z.ai.

Fazit: Lohnt sich GLM?

GLM lohnt sich am meisten für Solo-Selbstständige mit Coding-Fokus, die lokal und unabhängig von einem einzelnen US-Anbieter arbeiten wollen. Für den ersten Test reicht chat.z.ai. Sobald es um sensible Daten oder dauerhafte Nutzung geht, ist GLM-4.7-Flash der richtige Einstieg: aktuelle Generation, starke Coding-Leistung, und ab rund 19 GB RAM oder VRAM auf normaler Consumer-Hardware lauffähig. Das kaum bekannte Detail dabei: GLM-5.2 ist eines der ersten Flaggschiff-Modelle, das komplett ohne Nvidia-Chips trainiert wurde, ein Vorbote für mehr technologische Unabhängigkeit made in China.

Wer GLM in eigene Automatisierungen einbinden will, findet die Anleitung dafür im Artikel n8n + Ollama: Kostenlose KI-Workflows lokal betreiben. Für den Einstieg ohne Terminal eignet sich auch Jan AI.

Häufige Fragen zu GLM

Ist GLM kostenlos?

Ja, sowohl online über chat.z.ai als auch lokal. Bei lokaler Installation fallen nur Hardware- und Stromkosten an, keine Lizenzgebühren.

Kann ich GLM auf Deutsch nutzen?

Ja. Sowohl chat.z.ai als auch die lokal installierten Modelle beantworten deutsche Eingaben zuverlässig, auch wenn Englisch und Chinesisch die Haupttrainingssprachen sind.

Was ist der Unterschied zwischen GLM-5.2 und GLM-4.7-Flash?

GLM-5.2 ist das 753-Milliarden-Parameter-Flaggschiff für Cloud und Enterprise, GLM-4.7-Flash eine kompakte 30-Milliarden-Parameter-Version speziell für lokale Nutzung auf Consumer-Hardware.

Wie viel RAM brauche ich für GLM-4.7-Flash?

In der Standard-Quantisierung Q4_K_M rund 19 bis 20 GB RAM oder VRAM. Für volle Präzision (bf16) sind es etwa 60 GB.

Ist GLM besser als DeepSeek?

Bei Coding-Benchmarks liegt GLM-5.2 aktuell vorn, DeepSeek R1 punktet dafür bei mathematischem Denken. Für die lokale Nutzung ist vor allem entscheidend, welche Modellgröße auf deine Hardware passt.

Was bedeutet die Huawei-Ascend-Chip-Sache für mich als Nutzer?

Praktisch nichts an der Funktion des Modells, das lokal installierte GLM-4.7-Flash läuft unabhängig davon auf deiner eigenen Hardware. Politisch zeigt es, dass chinesische KI-Entwicklung nicht mehr auf Nvidia angewiesen ist, ein Signal für mehr technologische Unabhängigkeit von US-Exportkontrollen.

Läuft GLM auch ohne dedizierte Grafikkarte?

Für GLM-4-9B reicht in der Praxis auch reine CPU-Nutzung, nur spürbar langsamer. Für GLM-4.7-Flash empfiehlt sich eine GPU mit rund 19 bis 20 GB VRAM, bei weniger übernimmt Ollama automatisch CPU-Offloading, dann aber merklich langsamer.

Hinterlasse deinen Kommentar

Auch für dich interessant...

Gratis für Selbständige

48 Prompts für bessere Marketing-Bilder

Jedes Wort mit Beispielbild. Beleuchtung, Stil, Kamerawinkel, Stimmung.

Kostenlos herunterladen → Kein Spam · Jederzeit abmeldbar

Newsletter

Einmal pro Woche.

Kein Spam. Jederzeit abbestellbar.