Inhaltsverzeichnis

12.08.2026 · 2 Min. Lesezeit

Lokale Sprachmodelle: die Grundlagen, bevor du das Radar liest

Was ein lokales Sprachmodell ist, warum wir sie testen, und was Parameter, Quantisierung und Token pro Sekunde bedeuten — kurz erklärt, bevor du weiterliest.

Polygon-Portrait von Dr. Matthias Klinger mit Brille und blauem Hemd vor einem grünen geometrischen Hintergrund.

REDAKTIONELL GEPRÜFT VON

MatthiasPolygon-Portrait von Dr. Matthias Klinger mit Brille und blauem Hemd vor einem grünen geometrischen Hintergrund.MatthiasVorsitzender, Quandes Projects e.V.„Ideas to Impact“ – Matthias glaubt an die Kraft der Digitalisierung, um echte Veränderungen zu schaffen. Als Gründer von Quandes und Vorsitzender des Quandes Projects e.V. nutzt er Technologie als Katalysator für gesellschaftlichen Wandel – für besseren Bildungszugang und innovative Lösungen für Umwelt und Gesellschaft.

2 Min. Lesezeit

Eine dicht gefaltete Stoffbahn liegt kompakt auf einer Tischplatte, eine ihrer Falten ist farblich markiert. Ein lokales Sprachmodell liegt als Datei auf dem eigenen Gerät, nicht in einer fremden Cloud.

Jemand liest den ersten Werkstattbericht aus unserem Modell-Radar und bleibt bei einem Wort hängen: Quantisierung. Das Wort taucht dort nicht zum letzten Mal auf, und ohne eine kurze Erklärung bleibt der ganze Bericht schwer zugänglich.

Das Wichtigste in Kürze

  • Ein lokales Sprachmodell rechnet auf deinem eigenen Gerät. Ohne Cloud, ohne laufende Verbindung nach außen.
  • Drei Gründe tragen den Test im Camp. Kostenlos, offen und ohne Bindung an einen Anbieter.
  • Vier Begriffe reichen für den Einstieg. Parameter, Quantisierung, Kontextlänge, Token pro Sekunde.
  • Die Beispiele stammen aus einer eigenen Messung. Vier Modelle, ein Laptop ohne Grafikkarte, echte Werte.

Was ein lokales Sprachmodell ist

Ein Cloud-Dienst wie ein Chatfenster im Browser schickt jede Anfrage an einen fremden Server, der die Antwort berechnet und zurückschickt. Ein lokales Sprachmodell dreht das um: Die Modelldatei liegt auf deiner eigenen Festplatte, und dein eigener Rechner übernimmt die Berechnung. Es geht keine Anfrage nach außen, und ohne Internetverbindung funktioniert es trotzdem.

Diese eine Verschiebung erklärt fast alles, was danach an Begriffen folgt. Wenn die Berechnung bei dir passiert, entscheidet dein Gerät über Tempo und Größe, und diese Entscheidung nennen wir im Radar immer wieder.

Warum wir das im Camp testen

Drei Gründe tragen die Testreihen, die im Modell-Radar entstehen. Kostenlos, weil ein lokales Modell kein Abo und keine laufende Rechnung verlangt, nur das Gerät, das ohnehin da ist. Offen, weil sich die Modellgewichte herunterladen, kopieren und weitergeben lassen, ohne dass ein Anbieter den Zugang verwaltet. Und unabhängig, weil ein Cloud-Anbieter mit geänderten Preisen oder Bedingungen ein lokales Modell nicht berührt.

Für ein Camp ohne Budget ist das kein Nebenaspekt, sondern die Voraussetzung dafür, dass Testreihen überhaupt stattfinden können.

Die vier Wörter, die im Radar ständig fallen

Vier Begriffe, kurz erklärt

Parameter. Die trainierten Werte im Modell, meist in Milliarden gezählt. Mehr Parameter bedeuten in der Regel mehr Fähigkeit, aber auch mehr Rechenaufwand.

Quantisierung. Eine Verkleinerung der Modelldatei, die Genauigkeit gegen Größe tauscht. Ein auf 4 Bit quantisiertes Modell braucht deutlich weniger Speicher als die volle Fassung, bei geringem Qualitätsverlust.

Kontextlänge. Wie viel Text ein Modell gleichzeitig im Blick behält, vom aktuellen Auftrag bis zum bisherigen Gespräch.

Token pro Sekunde. Das Lesetempo des Modells, gemessen in Textbausteinen pro Sekunde. Der Wert entscheidet, ob eine Antwort flüssig kommt oder zäh.

Vier Stoffbahnen liegen nebeneinander, von dünn bis dick gestaffelt, die dünnste ist farblich markiert. Auf demselben Gerät antwortet das kleinste Modell am schnellsten.
Vier Größen, ein Gerät: mehr Parameter heißen spürbar weniger Tempo.

Auf einem Bürolaptop ohne Grafikkarte haben wir das an vier Modellen gemessen. 1,5 Milliarden Parameter lieferten 27 Token pro Sekunde, 8 Milliarden nur noch 4,6.[1] Alle vier liefen auf 4-Bit-Quantisierung. Die Zahlen zeigen in einem Blick, was die Begriffe oben nur beschreiben — mehr Parameter heißen auf demselben Gerät spürbar langsamer.

Für den Einstieg reicht dieser eine Vergleich.

Montags im Camp

Wenn du das an einem eigenen Gerät ausprobieren willst

Im Social Impact Camp arbeiten wir jeden Montagabend an gemeinnützigen Vorhaben, und lokale Modelle gehören zum festen Werkzeugkasten. Du kannst dazukommen, ohne Vorerfahrung und ohne Kosten.

Beim Camp mitmachen

Was du dir davon merken musst

Die vier Begriffe reichen, um die folgenden Radar-Ausgaben zu lesen, ohne bei jedem Wort nachzuschlagen. Welcher Beitrag zu welcher Frage passt, zeigt diese Übersicht:

Deine FrageWohin

Welches Modell läuft auf meiner Hardware?

Passung von Modellgröße und Gerät, mit gemessenen Werten

Welches Werkzeug installiere ich dafür?

Vergleich zweier Werkzeuge für den täglichen Einsatz

Reicht mein alter Rechner ohne Grafikkarte?

Werkstattbericht zu vier Modellen ohne GPU

Jede dieser drei Fragen bekommt einen eigenen Beitrag, sobald er läuft. Diese Seite bleibt der Einstieg, zu dem du zurückkommen kannst, wenn ein Begriff wieder auftaucht.

Quandes Projects e. V.

Wenn du wissen willst, woran wir gerade arbeiten

Das Social Impact Camp ist ein offenes, kostenloses Format von Quandes Projects e. V. Auf der Camp-Seite steht, was montags passiert und wie ein Abend abläuft.

Das Camp ansehen

Häufige Fragen

Häufige Fragen zu lokalen Sprachmodellen

Brauche ich eine Grafikkarte, um ein lokales Modell zu nutzen?

Nein. Auch ohne Grafikkarte läuft ein kleineres Modell auf einem gewöhnlichen Laptop, nur langsamer als mit einer.

Ist ein kleineres Modell automatisch schlechter?

Nicht für jede Aufgabe. Ein kleineres Modell antwortet schneller und reicht für viele Alltagsaufgaben; ob es genügt, hängt davon ab, was du damit machen willst.

Was bedeutet Quantisierung in einem Satz?

Die Modelldatei wird verkleinert, indem sie mit weniger Genauigkeit gespeichert wird, wodurch sie weniger Speicherplatz braucht und schneller läuft.

Welcher Radar-Beitrag passt zu meiner Frage?

Zur Hardware-Passung gehört ein Beitrag mit gemessenen Werten, zur Werkzeugwahl ein Vergleich zweier Programme, und zum Betrieb ohne Grafikkarte ein eigener Werkstattbericht.

Quellen

  1. [1]Eigene Messreihe auf einem Laptop ohne dedizierte Grafikkarte (Intel i5-13500H, 16 Threads, 15 GB RAM), vier Modelle von 1,5 bis 8 Milliarden Parametern, 4-Bit-Quantisierung (Q4_K_M), Ollama 0.13.0, gemessen am 30.07.2026
KI-Unterstützung
Text
Claude Opus 5
Bilder
OpenAI Codex ImageGen 2

Redaktionell geprüft von Quandes Projects e. V.

Mehr erfahren

Textentwurf, Struktur und Recherchezusammenfassung entstanden mit Claude Opus 5 (Recherche: Claude Opus 5 mit Websuche) und wurden von Quandes Projects e. V. redaktionell geprüft und freigegeben. Bilder wurden mit OpenAI Codex ImageGen 2 erzeugt und redaktionell ausgewählt. Die inhaltliche Verantwortung liegt bei Quandes Projects e. V.

Unsere KI-Transparenz-Erklärung
Lokale Sprachmodelle: die Grundlagen, bevor du das Radar liest | Quandes Projects