Es ist 01:40 Uhr, und der Worker für die Rechnungsextraktion läuft einwandfrei. Das Problem ist die Kostenzeile im Job-Log: ein paar hundert PDFs, an jedem hängt ein eingescannter Lieferschein, und jeder Aufruf geht an das eine Modell, das irgendwer vor achtzehn Monaten im Sprint Planning ausgesucht hat. Niemand hat die Wahl je hinterfragt, denn der Modellname steht an sechs Stellen, zwei davon in einem Prompt-Builder, der nebenbei auch Datumsangaben formatiert. An genau diese Codebasis muss ich diese Woche ständig denken, während Mistral Large 4 veröffentlicht. Meine Position: Das Modell selbst ist eine respektable Arbeit, aber am nützlichsten ist der Release für uns als Argument, PHP-Apps so zu bauen, dass ein Modellwechsel eine Zeile in der Config ist und kein Refactoring.

Schau dir zuerst die Zahlen an, denn sie sprechen dagegen, Large 4 aus allgemeinen Gründen zu wählen. Im Artificial Analysis Intelligence Index landet es bei 38. Xiaomis MiMo-V2.6-Pro steht bei 46, GLM-5.3 Max bei 45, und Anthropics Sonnet 5.5 und Opus 5.5 erreichen bei maximalem Effort 56 und 58. Der härteste Vergleich ist GPT-6 Luna Max: ebenfalls 38 Punkte, aber rund 0,07 $ pro Index-Aufgabe gegenüber etwa 1,13 $ bei Large 4, bei ungefähr 140 Millionen Output-Tokens, während Mistrals Modell fast 200 Millionen verbrennt. Gleicher Score, etwa die sechzehnfache standardisierte Rechnung. Wenn deine einzige Frage ist, welcher Endpoint dir am meisten Reasoning pro Euro liefert, dann liegt die Antwort woanders, und da mache ich dir nichts vor.

Das ist der stärkste Einwand, und er verdient volles Gewicht. Die meisten von uns, die SaaS auf Laravel oder Symfony bauen, haben keine Souveränitätsklausel im Vertrag. Wir haben ein Budget, ein Latenzziel und einen Product Owner, der will, dass das Zusammenfassungs-Feature endlich aufhört, Kundennamen zu halluzinieren. Für so ein Team ist ein 38-Punkte-Modell zum höheren Preis ein schlechter Deal, und Treue zu einem europäischen Lab bezahlt die Rechnung nicht. Fairer Vorbehalt zum Vorbehalt: Der Index rechnet mit Mistrals Listenpreisen von 1,36 $ pro Million Input- und 4,18 $ pro Million Output-Tokens, während die öffentliche Preview gerade zum halben Preis läuft, also 0,68 $ und 2,09 $. Günstiger, aber immer noch weit weg von Luna.

Und hier komme ich zu einem anderen Schluss. Der Gesamtscore ist ein Durchschnitt über zehn Evaluierungen, und deine Anwendung ist kein Durchschnitt. Large 4 erreicht auf AutomationBench, also mehrstufigen Workflows rund um E-Mails und Tabellen, etwa 59,9 %. Damit liegt es wenige Punkte hinter GLM-5.3 Max mit 62 % und ungefähr gleichauf mit MiMo bei 59 %. In der Dokument-Evaluierung GDP.pdf von Artificial Analysis kommt es auf 19 %, wo GLM-5.3 Max nur 11 % schafft. Bilder verarbeitet es nativ über einen Vision-Encoder mit 1,6 Milliarden Parametern, während das GLM-5.3, das Mistral hostet, reiner Text ist. Mein Lieferschein-Job interessiert sich genau für diesen Ausschnitt und kein bisschen für Wettbewerbsmathematik. Ein Modell kann das Leaderboard verlieren und trotzdem die richtige Wahl für eine Queue sein.

Achte außerdem darauf, was Mistral selbst macht. Die eigene Plattform bietet bereits Z.ai's GLM-5.3 unverändert neben dem hauseigenen Flaggschiff an. Der Anbieter sagt dir also in Produktform, dass das richtige Modell vom Job und vom Monat abhängt. Wenn die Firma, die ein Modell mit 1,05 Billionen Parametern, davon 49 Milliarden aktiv pro Schritt, auf etwa 4.000 Grace-Blackwell-GPUs trainiert hat, kein Problem damit hat, Kunden zu den Gewichten eines Konkurrenten zu schicken, dann können unsere Apps den Modellnamen auch ganz entspannt als Umgebungsvariable behandeln. Das heißt: ein Interface für den Aufruf, ein Mapping pro Aufgabe in der Config und eine Eval-Fixture mit zwanzig oder dreißig echten Inputs, die du bei jedem neuen Release erneut laufen lässt. Langweiliges PHP. Genau die Sorte, die wir gut können.

Dann gibt es noch den Kunden, der die Klausel tatsächlich hat. Öffentlicher Sektor, Gesundheitswesen, ein Industriezulieferer, der kein Diagnose-Log aus der EU lässt. Für die sind die offenen Gewichte, die laut Mistral noch diesen Monat folgen sollen, die eigentliche Nachricht, denn ein Modell, das du auf eigener Infrastruktur betreiben kannst, verändert das Gespräch mit dem Einkauf stärker als jeder Index-Score. Erst der Sprung von Medium 3.5, das im selben Index auf 14 kam, auf 38 macht diese Option für Agent-Workloads überhaupt brauchbar. Vor einem Jahr hätte ich so einem Kunden gesagt: Nimm entweder ein deutlich schwächeres Modell oder eine ausländische API. Heute ist der Abstand ein Abwägen zwischen Kosten und Qualität, das du an deinen eigenen Fixtures messen kannst.

Ich sage dir also nicht, dass du auf Large 4 umsteigen sollst, und auch nicht, dass du es ignorieren sollst. Ich sage dir, dass der Release offenlegt, wie viele unserer Integrationen die Frage nicht einmal billig stellen können. Wenn du für den Test eines neuen Modells einen Prompt-Builder, ein DTO und drei Service-Klassen anfassen musst, wirst du es nie benchmarken, und du zahlst für diese Entscheidung aus dem Sprint Planning bis in alle Ewigkeit. Mach das Modell zu einem Wert, den du ändern kannst, halte ein kleines, ehrliches Testset bereit und lass jeden Job seinen Gewinner selbst finden. In manchen Monaten wird das Mistral sein, in vielen anderen nicht.

Wo ziehst du in deinem eigenen Stack die Grenze: Routest du pro Aufgabe mit einer Mapping-Tabelle und nimmst den zusätzlichen Pflegeaufwand für die Prompts in Kauf, oder standardisierst du auf einen Anbieter und schluckst die Kostendifferenz zugunsten einer einfacheren Codebasis?