Alle Artikel
Xiaomi

MiMo-V2.6 Pro öffnet seine Gewichte. Der Betrieb bleibt eine Infrastrukturentscheidung

LLM Rumors··8 Min. Lesezeit·...
XiaomiMiMo-V2.6 ProOffene ModellgewichteKI-InfrastrukturMixture of ExpertsKI-AgentenModellbetriebReinforcement Learning

Deutsche Übersetzung: . Englisches Original

Konzeptioneller redaktioneller Kupferstich einer offenen Kiste mit Computerteilen neben einem leeren Serverschrank und einer Werkbank; er zeigt keine Xiaomi-Hardware.

Kurzfassung: Xiaomi veröffentlichte MiMo-V2.6 Pro am 22. September mit MIT-lizenzierten Gewichten. Laut Modellkarte besitzt es 1,02 Billionen Parameter insgesamt, 42 Milliarden pro Token aktivierte Parameter und eine Kontextkonfiguration für eine Million Token.[1][2] Xiaomis SGLang-Beispiel verteilt den Betrieb auf zwei Knoten mit 16-facher Tensorparallelisierung; das vLLM-Beispiel arbeitet mit achtfacher Tensorparallelisierung. Das sind Betriebsanleitungen, kein Versprechen für günstiges oder müheloses Self-Hosting.[2]

MiMo-V2.6 Pro ist eine bemerkenswerte Veröffentlichung, weil Xiaomi seinen Flaggschiff-Checkpoint zum Herunterladen und Prüfen bereitstellt. Dazu kommen Gewichte für Flash, eine Destillation mit neun Milliarden Parametern, ein technischer Bericht, Trainingsumgebungen und Code für Reinforcement Learning.[1][3] Das ist mehr als die Ankündigung einer API.

Die eigentliche Geschichte ist keine Platzierung in einer Benchmark-Tabelle. Entscheidend ist der Unterschied zwischen dem Besitz eines Modellartefakts und dem Betrieb eines Dienstes. Ein Unternehmen kann diese Gewichte untersuchen und anpassen. Es benötigt trotzdem Speicher, schnelle Verbindungen, Serving-Software, Sicherheitskontrollen und einen Evaluierungsprozess. Xiaomis Dokumentation macht diesen Unterschied ungewöhnlich deutlich.

HINWEIS

Warum das jetzt zählt

Die Veröffentlichung vom 22. September schafft erstmals für diesen Checkpoint eine Beschaffungsentscheidung: Xiaomis gehostete API nutzen oder die öffentlichen Pro-Gewichte unter MIT selbst betreiben. Laut Xiaomi gelten für V2.6 dieselben API-Preise wie für V2.5. Vor der Budgetplanung sollten Region, Cache-Status und Echtzeit- oder Batch-Tarif auf der aktuellen Preisseite geprüft werden.[1][4]

Titelbild: konzeptioneller redaktioneller Kupferstich einer Kiste mit Computerteilen neben einem leeren Serverschrank und einer Werkbank. Er steht für eine Betriebsentscheidung und zeigt weder einen echten Xiaomi-Server noch eine gemessene Hardwarekonfiguration.

Das Modell: Sparsame Berechnung, großer physischer Platzbedarf

Xiaomis Pro-Modellkarte beschreibt ein sparsames Mixture-of-Experts-Modell mit 1,02 Billionen Gesamtparametern und 42 Milliarden aktivierten Parametern. Die zweite Zahl beschreibt, wie viel Modellkapazität bei der Erzeugung eines Tokens mitarbeitet. Sie bedeutet nicht, dass das Serving-System nur 42 Milliarden Parameter speichern muss.[2] Die Angabe „1T“ auf Hugging Face ist gerundet; die Modellkarte ist hier die genauere Quelle.

Das Modell verarbeitet Text, Bilder, Video und Audio und nennt eine Kontextlänge von einer Million Token. Diese Obergrenze ist eine Modellspezifikation. Sie garantiert nicht, dass jeder Betreiber Sitzungen dieser Länge mit nützlicher Parallelität oder zu einem tragbaren Preis bedienen kann. Längere Eingaben benötigen zudem mehr Speicher und Rechenleistung für die Vorverarbeitung. Ein Pilot muss eigene Dokumentlängen, Medienarten, gleichzeitige Nutzer und Antwortfristen messen.[2]

Zum Lesen aller Spalten seitlich scrollen.

Veröffentlichte EigenschaftWertEinordnung
Gesamtparameter1,02 BillionenXiaomi-Angabe; die Gewichte müssen im System gespeichert und bereitgestellt werden
Pro Token aktiviert42 MilliardenXiaomi-Angabe; sparsame Berechnung verkleinert den gespeicherten Checkpoint nicht auf 42 Milliarden Parameter
Kontextkonfiguration1 Million TokenPraktische Grenzen hängen von Speicher, Eingabelänge und Parallelität ab
Lizenz der GewichteMITGilt für veröffentlichte Artefakte, nicht für unveröffentlichte Trainingsdaten

Die Modellkarte nennt außerdem einen Bildencoder mit 681 Millionen Parametern, Audioencoder und einen spekulativen Decoder mit fünf Schichten. Deren Vorhandensein belegt keine allgemeingültige Geschwindigkeitszahl.[2]

Die Betriebsanleitung: Offen heißt nicht eine einzige GPU

Der offizielle SGLang-Befehl für Pro sieht zwei Knoten, 16-fache Tensorparallelisierung, Expertenparallelisierung und einen Pfad für spekulatives Decoding vor. Das vLLM-Rezept für V2.6 dokumentiert einen 566 GB großen Checkpoint auf dem Datenträger und für seine Beispiele mindestens 680 GB aggregierten GPU-Speicher: acht H200 oder vier MI355X. Für das gemischte MXFP4-Speicherformat sei ein spezielles Image oder ein nächtlicher vLLM-Build nötig, statt der damals aktuellen stabilen Version.[2][5] Das sind konkrete Konfigurationen, keine vergleichbaren Geschwindigkeitstests oder eine universelle Hardwareuntergrenze.

Genau darin liegt der Wert der gemeinsamen Veröffentlichung von Gewichten und Rezepten: Käufer können prüfen, ob für ihren tatsächlichen Workload ein eigener Cluster, ein Drittanbieter oder Xiaomis API sinnvoller ist. Eigener Betrieb kann Kontrolle über Daten und Zeitplanung sowie Anpassungen ermöglichen. Zu seinen Kosten zählen aber ungenutzte Kapazität, Betrieb, Upgrades, Beobachtbarkeit und Ausfälle. Ein gehosteter Tokenpreis erspart viel dieser festen Arbeit, wirft jedoch eigene Fragen zur Abhängigkeit vom Anbieter und zum Umgang mit Daten auf.

Xiaomi bewirbt für die API einen UltraSpeed-Modus mit „bis zu 20-facher“ Inferenzgeschwindigkeit.[1] Das ist eine Herstellerangabe für einen gesonderten gehosteten Modus. Auf der Startseite fehlen Angaben zu identischem Modellstand, Hardware, Präzision, Eingabe- und Ausgabelängen, Batchgröße, Akzeptanzrate beim spekulativen Decoding, Zeit bis zum ersten Token, Latenz am langsamen Ende der Verteilung und Testumgebung, die einen Vergleich mit den offenen Gewichten erlauben würden. Daraus lässt sich keine Geschwindigkeit für Self-Hosting ableiten.

Das Veröffentlichungspaket: Ein Forschungsprozess statt nur eines Checkpoints

Nach eigenen Angaben hat Xiaomi mit den Modellen mehr als 7.000 RL-Aufgabenumgebungen und ein durchgängiges Trainingsframework veröffentlicht. Beschrieben werden Aufgaben aus Softwareentwicklung, Nachstellung von Schwachstellen, wissensintensiver Arbeit und Webdesign. Das System für Ausführungsprotokolle und Belohnungsbewertung baut auf bestehenden offenen Frameworks auf.[1] Das öffentliche Repository mimoagent dokumentiert kombinierbare Agenten, Modellprotokolle, Umgebungen, Datensätze und Bewertungsverfahren.[6]

Das zählt, weil die Qualität eines Agenten teilweise vom System um den Checkpoint abhängt. Verändern sich Werkzeuge, Zeitbudget, Wiederholungsregeln oder Bewertungsverfahren, kann sich das Ergebnis selbst bei identischen Gewichten ändern. Xiaomis technischer Bericht erläutert den gemischten RL-Ansatz und nennt 1.568 Prompts mit jeweils 16 Durchläufen pro Trainingsschritt.[7] Das ist eine nützliche Offenlegung des Trainingsdesigns, aber keine vollständige Reproduktion von Xiaomis Daten, Rechenressourcen und interner Validierung.

Die unbequeme Wahrheit: „Open Source“ kann mehr nahelegen, als die Artefakte belegen. Der MIT-Checkpoint und das öffentliche Framework ermöglichen Prüfung, Anpassung und unabhängige Experimente. Sie veröffentlichen weder jedes Token des Vortrainings noch beweisen sie, dass ein externes Team das Flaggschiff zu Xiaomis berichteten Kosten von Grund auf reproduzieren kann.

Benchmarks und Produktion: Fehlermuster gezielt prüfen

Xiaomis Modellkarte veröffentlicht Ergebnisse von Agenten- und Coding-Benchmarks. Diese Tests klären jedoch weder die Zuverlässigkeit von Werkzeugaufrufen noch die Stabilität langer Sitzungen, multimodale Genauigkeit, Latenz oder Gesamtkosten in der Testumgebung eines Kunden.[2] Käufer sollten bei den Aufgaben beginnen, die sie tatsächlich erledigen müssen, einschließlich Fehlern und Wiederholungen. Ein Gegenbeispiel, bei dem zunächst die lokale Ausführbarkeit eines sehr kleinen Modells zählt, bietet unsere Analyse zu Bonsai 2. Die beiden Modelle gehören nicht in eine gemeinsame Rangliste der Aufgabenleistung.

Frühe öffentliche Fehlermeldungen zeigen, weshalb ein Betriebspilot auch schwierige Sitzungen enthalten sollte. Ein Nutzer beschreibt eine Flut von Werkzeugaufrufen und wiederholte ungültige Aufrufe bei der Untersuchung von Code. Ein anderer meldet einen Bildverlauf, dessen Anfrage mit einem wenig aussagekräftigen HTTP-Fehler 400 scheitert.[8][9] Das sind Berichte einzelner Nutzer mit bestimmten Umgebungen, keine gemessene Fehlerquote und kein Beleg für identisches Verhalten bei allen Anbietern. Für Käufer sind es konkrete Regressionstests.

Oft übersehen wird der Abnahmetest: Ein Modell sollte nützliche Arbeit innerhalb eines festgelegten Kosten- und Zeitbudgets abschließen, sich von Werkzeugfehlern erholen und eine überprüfbare Spur hinterlassen. Die veröffentlichten Gewichte sollten auf der vorgesehenen Serving-Software getestet und dieselbe Aufgabe anschließend über die API wiederholt werden. Festzuhalten sind Modellrevision, Hardware, Präzision, Eingabe- und Ausgabelängen, Batch und Parallelität, Einstellungen und Akzeptanz beim spekulativen Decoding, Zeit bis zum ersten Token, langsame Latenzen und Testumgebung. Erst dann ist ein Preis- oder Geschwindigkeitsvergleich aussagekräftig.

Die Entscheidung: Unabhängigkeit muss ihre Betriebskosten rechtfertigen

MiMo-V2.6 Pro eröffnet ernsthaften Käufern eine echte Option. Die MIT-Lizenz macht den Checkpoint portabel; die offiziellen Betriebsbefehle machen den Aufwand sichtbar; die Trainingsartefakte laden zu externen Experimenten ein. Nichts davon macht lokale Inferenz automatisch günstiger als eine API.

Klar gesagt: Das stärkste geschäftliche Argument für eigenen Betrieb kann die Kontrolle über Daten, Zeitplanung, Anpassung oder Dienstkontinuität sein statt eines reinen Vergleichs der Tokenkosten. Xiaomi hat eine wertvolle Maschine geöffnet. Der Vorteil entsteht für Teams, die nachweisen können, was ihr Betrieb tatsächlich verändert.

ACHTUNG

Diese Betriebsaussage trägt nicht

Aus Xiaomis Werbeaussage „bis zu 20-fach“ für UltraSpeed, einem Benchmark auf der Modellkarte und einem Rezept für offene Gewichte darf keine gemeinsame Geschwindigkeitstabelle werden. Die Betriebsbedingungen sind nicht angeglichen. Jeder Weg braucht ein eigenes Budget und einen eigenen Test.[1][2]

Quellen und Belege

Zum Lesen aller Spalten seitlich scrollen.

Nr.QuelleRelevanz
1Xiaomi: MiMo-V2.6, Skalierung des Reinforcement Learning, 22. September 2026Startdatum, Modellpaket, API, RL-Ressourcen und Herstellerangabe zu UltraSpeed
2Xiaomi: Modellkarte MiMo-V2.6-Pro-RL, abgerufen am 26. September 2026MIT-Lizenz, Architektur, Modalitäten, Kontext, Evaluationen und Betriebsbeispiele
3Xiaomi: offizielle MiMo-V2.6-Modellsammlung, abgerufen am 26. September 2026Öffentliche Checkpoints für Pro, Flash und das 9B-Destillat
4Xiaomi: MiMo-API-Preise, abgerufen am 26. September 2026Aktuelle Preisübersicht nach Region und Token-Kategorie
5vLLM: Betriebsrezept für MiMo-V2.6 Pro, 23. September 2026566 GB Checkpoint, mindestens 680 GB GPU-Speicher für die Beispiele, H200 und MI355X, Versionsanforderungen
6Xiaomi: mimoagent-Framework, abgerufen am 26. September 2026Öffentliche Dokumentation zu Agenten, Umgebungen, Datensätzen und Bewertungen
7Xiaomi: technischer MiMo-V2.6-Bericht, September 2026Primärquelle zu gemischtem RL, Trainingsumfang, Architektur und Evaluierung
8GitHub: Bericht über fehlerhafte Werkzeugaufrufe, 22. September 2026Bericht eines Nutzers über eine mehrstufige Code-Aufgabe; keine Häufigkeitsschätzung
9GitHub: Bericht über HTTP 400 bei langem Bildverlauf, 24. September 2026Einzelner Fehlerbericht mit Angaben zur Umgebung; geeignet als Regressionstest

Zuletzt aktualisiert: 26. September 2026