Jemand liest den ersten Werkstattbericht aus unserem Modell-Radar und bleibt bei einem Wort hängen: Quantisierung. Das Wort taucht dort nicht zum letzten Mal auf, und ohne eine kurze Erklärung bleibt der ganze Bericht schwer zugänglich.
Das Wichtigste in Kürze
- Ein lokales Sprachmodell rechnet auf deinem eigenen Gerät. Ohne Cloud, ohne laufende Verbindung nach außen.
- Drei Gründe tragen den Test im Camp. Kostenlos, offen und ohne Bindung an einen Anbieter.
- Vier Begriffe reichen für den Einstieg. Parameter, Quantisierung, Kontextlänge, Token pro Sekunde.
- Die Beispiele stammen aus einer eigenen Messung. Vier Modelle, ein Laptop ohne Grafikkarte, echte Werte.
Was ein lokales Sprachmodell ist
Ein Cloud-Dienst wie ein Chatfenster im Browser schickt jede Anfrage an einen fremden Server, der die Antwort berechnet und zurückschickt. Ein lokales Sprachmodell dreht das um: Die Modelldatei liegt auf deiner eigenen Festplatte, und dein eigener Rechner übernimmt die Berechnung. Es geht keine Anfrage nach außen, und ohne Internetverbindung funktioniert es trotzdem.
Diese eine Verschiebung erklärt fast alles, was danach an Begriffen folgt. Wenn die Berechnung bei dir passiert, entscheidet dein Gerät über Tempo und Größe, und diese Entscheidung nennen wir im Radar immer wieder.
Warum wir das im Camp testen
Drei Gründe tragen die Testreihen, die im Modell-Radar entstehen. Kostenlos, weil ein lokales Modell kein Abo und keine laufende Rechnung verlangt, nur das Gerät, das ohnehin da ist. Offen, weil sich die Modellgewichte herunterladen, kopieren und weitergeben lassen, ohne dass ein Anbieter den Zugang verwaltet. Und unabhängig, weil ein Cloud-Anbieter mit geänderten Preisen oder Bedingungen ein lokales Modell nicht berührt.
Für ein Camp ohne Budget ist das kein Nebenaspekt, sondern die Voraussetzung dafür, dass Testreihen überhaupt stattfinden können.
Die vier Wörter, die im Radar ständig fallen
Parameter. Die trainierten Werte im Modell, meist in Milliarden gezählt. Mehr Parameter bedeuten in der Regel mehr Fähigkeit, aber auch mehr Rechenaufwand.
Quantisierung. Eine Verkleinerung der Modelldatei, die Genauigkeit gegen Größe tauscht. Ein auf 4 Bit quantisiertes Modell braucht deutlich weniger Speicher als die volle Fassung, bei geringem Qualitätsverlust.
Kontextlänge. Wie viel Text ein Modell gleichzeitig im Blick behält, vom aktuellen Auftrag bis zum bisherigen Gespräch.
Token pro Sekunde. Das Lesetempo des Modells, gemessen in Textbausteinen pro Sekunde. Der Wert entscheidet, ob eine Antwort flüssig kommt oder zäh.

Auf einem Bürolaptop ohne Grafikkarte haben wir das an vier Modellen gemessen. 1,5 Milliarden Parameter lieferten 27 Token pro Sekunde, 8 Milliarden nur noch 4,6.[1] Alle vier liefen auf 4-Bit-Quantisierung. Die Zahlen zeigen in einem Blick, was die Begriffe oben nur beschreiben — mehr Parameter heißen auf demselben Gerät spürbar langsamer.
Für den Einstieg reicht dieser eine Vergleich.
Montags im Camp
Wenn du das an einem eigenen Gerät ausprobieren willst
Im Social Impact Camp arbeiten wir jeden Montagabend an gemeinnützigen Vorhaben, und lokale Modelle gehören zum festen Werkzeugkasten. Du kannst dazukommen, ohne Vorerfahrung und ohne Kosten.
Beim Camp mitmachenWas du dir davon merken musst
Die vier Begriffe reichen, um die folgenden Radar-Ausgaben zu lesen, ohne bei jedem Wort nachzuschlagen. Welcher Beitrag zu welcher Frage passt, zeigt diese Übersicht:
| Deine Frage | Wohin |
|---|---|
Welches Modell läuft auf meiner Hardware? | Passung von Modellgröße und Gerät, mit gemessenen Werten |
Welches Werkzeug installiere ich dafür? | Vergleich zweier Werkzeuge für den täglichen Einsatz |
Reicht mein alter Rechner ohne Grafikkarte? | Werkstattbericht zu vier Modellen ohne GPU |
Jede dieser drei Fragen bekommt einen eigenen Beitrag, sobald er läuft. Diese Seite bleibt der Einstieg, zu dem du zurückkommen kannst, wenn ein Begriff wieder auftaucht.
Quandes Projects e. V.
Wenn du wissen willst, woran wir gerade arbeiten
Das Social Impact Camp ist ein offenes, kostenloses Format von Quandes Projects e. V. Auf der Camp-Seite steht, was montags passiert und wie ein Abend abläuft.
Das Camp ansehenHäufige Fragen
Häufige Fragen zu lokalen Sprachmodellen
Brauche ich eine Grafikkarte, um ein lokales Modell zu nutzen?
Nein. Auch ohne Grafikkarte läuft ein kleineres Modell auf einem gewöhnlichen Laptop, nur langsamer als mit einer.
Ist ein kleineres Modell automatisch schlechter?
Nicht für jede Aufgabe. Ein kleineres Modell antwortet schneller und reicht für viele Alltagsaufgaben; ob es genügt, hängt davon ab, was du damit machen willst.
Was bedeutet Quantisierung in einem Satz?
Die Modelldatei wird verkleinert, indem sie mit weniger Genauigkeit gespeichert wird, wodurch sie weniger Speicherplatz braucht und schneller läuft.
Welcher Radar-Beitrag passt zu meiner Frage?
Zur Hardware-Passung gehört ein Beitrag mit gemessenen Werten, zur Werkzeugwahl ein Vergleich zweier Programme, und zum Betrieb ohne Grafikkarte ein eigener Werkstattbericht.

