
Was zählt die Zahl?
Gewichte sind eine Art von Parametern. Wenn von LLMs die Rede ist, werden die beiden Begriffe aber meist gleichbedeutend verwendet. Die Zahl im Modellnamen ist eine Größenangabe, keine Zahl von Antworten oder eingebauten Prüfregeln.
Schon bei Qwen3.8-27B lohnt sich die Frage, was mitgezählt wird. Die offizielle Modellkarte bezieht die 27B auf das Sprachmodell. Qwen kann auch Bilder und Videos verarbeiten und besitzt dafür einen weiteren Modellbestandteil. Die Zahl im Namen beschreibt also nicht unbedingt jeden Teil des Modells. [1]
DeepSeek gibt für V4-Pro insgesamt 1,6 Billionen Parameter an. Welche Modellbestandteile dabei mitgezählt werden, erläutert die Ankündigung nicht. Die Zahl allein sagt deshalb weder, wie sich diese Größe zusammensetzt, noch ob das Modell eine bestimmte Aufgabe besser löst als Qwen. [2]
Als reines Gedankenexperiment könnte ein Modell einen Sprachmodellteil mit 80 Milliarden Parametern und weitere, auf andere Aufgaben spezialisierte Bestandteile enthalten. Die Gesamtzahl würde dann alle mitgezählten Teile zusammenfassen. Das ist ein Beispiel, keine Aussage über den Aufbau eines bestimmten Modells. Ob ein Modell so aufgebaut ist, lässt sich aus seiner Gesamtzahl allein nicht ablesen.
Das Titelbild macht aus den beiden Modellen Gewichtheber. Beide stemmen eine Hantel, obwohl sie sehr unterschiedlich groß dargestellt sind. Das ist eine Illustration, kein Leistungstest und kein Beleg dafür, dass sie dieselben Aufgaben gleich gut lösen.
Warum bringt ein kleineres Modell trotzdem etwas zustande?
Qwen3.8-27B ist ein vollständiges Modell. Es verarbeitet eine Eingabe mit seinen trainierten Gewichten und berechnet daraus eine Fortsetzung. Die Zahl 27B schränkt diese Berechnung nicht auf wenige Wörter oder einfache Antworten ein. Eine lokal quantisierte Variante speichert viele Gewichte nur angenähert und braucht dadurch weniger Platz. Es bleiben aber ungefähr gleich viele Parameter. Ob die Variante auf einem bestimmten Rechner läuft und wie gut sie antwortet, muss man getrennt beurteilen. [3]
Mehr Parameter können einem Modell mehr Kapazität geben. Sie garantieren nicht, dass es diese Kapazität für die gerade gestellte Aufgabe besser nutzt. Welche Daten zum Training verwendet wurden, wie das Modell trainiert und später auf Anweisungen abgestimmt wurde, macht ebenfalls einen Unterschied. Ein Modell kann für eine Aufgabe gut geeignet sein, obwohl ein anderes sehr viel größer ist.
Ein historisches Beispiel zeigt, warum Größe allein nicht genügt. In einer Forschungsarbeit über den Einsatz eines festen Trainingsbudgets übertraf ein Modell mit 70 Milliarden Parametern ein Modell mit 280 Milliarden auf den dort geprüften Aufgaben. Das kleinere wurde mit deutlich mehr Daten trainiert. Die Studie belegt keine allgemeine Überlegenheit kleinerer Modelle; sie zeigt den Einfluss des Trainings unter ihren Testbedingungen. [4]
Was gehört zum Modell – und was nicht?
Ein Modell kann Fähigkeiten bereits mitbringen. Qwen3.8-27B kann beispielsweise Bilder und Videos als Eingabe verarbeiten; dafür hat es neben dem Sprachmodell einen Bildencoder. Übersetzen oder mehrere Sprachen verwenden zu können, muss dagegen nicht auf einem eigenen Übersetzungsmodul beruhen. Solche Fähigkeiten können beim Training entstehen. Die Parameterzahl sagt uns allein nicht, wie gut sie funktionieren. [1]
Andere Funktionen stecken häufig in der Software um das Modell herum. Sie kann passende Dokumente suchen und als zusätzlichen Text bereitstellen, ein Rechenwerkzeug aufrufen oder eine Antwort nachträglich prüfen. Diese Vorgänge erhöhen nicht die Parameterzahl des Modells. Ein kleines Modell kann mit solcher Unterstützung nützlicher werden; ein großes kann dieselbe Unterstützung ebenfalls verwenden. Und kein Werkzeug macht eine unzuverlässige Antwort von selbst richtig.
Mit dem richtigen Tooling komme ich auch mit einem kleinen Modell deutlich weiter, als ich ihm allein aufgrund seiner Größe zugetraut hätte.
Darum ist „27B gegen 1,6 Billionen“ keine Ergebnistabelle. Die Zahlen helfen, Modelle und ihren möglichen Ressourcenbedarf einzuordnen. Ob eines beim Programmieren, Übersetzen oder bei einer konkreten Frage besser ist, muss für diese Aufgabe geprüft werden. Training, Architektur und Tooling gehören zu diesem Vergleich – nicht nur die Größe.
Deeper into the Rabbit Hole
Wenn du genauer verstehen möchtest, wie Parameter und Training zusammenhängen, führen diese Texte weiter:
- 3Blue1Brown – How might LLMs store facts? – eine bebilderte, technischere Lektion mit offengelegten Vereinfachungen und Textfassung.
- Hoffmann et al. – Training Compute-Optimal Large Language Models – die Forschungsarbeit zum Zusammenspiel von Modellgröße, Trainingsdaten und Rechenaufwand. Forschungs-Preprint.
- Touvron et al. – LLaMA: Open and Efficient Foundation Language Models – ein historischer Vergleich unterschiedlicher Modellgrößen auf den dort geprüften Aufgaben. Forschungs-Preprint.
Quellen
- Qwen – Qwen3.8-27B – Model Overview.
- DeepSeek – DeepSeek V4 Preview Release. Herstellerangabe zur Parameterzahl; seine Leistungsbehauptungen werden hier nicht übernommen.
- Hugging Face Transformers – Optimizing LLMs for Speed and Memory.
- Hoffmann et al. – Training Compute-Optimal Large Language Models. Forschungs-Preprint; der Vergleich bezieht sich auf die dort berichteten Aufgaben.