Ein Reddit-Nutzer hat frühe Produktionszahlen für Qwen3.8-Flash-Next auf einer Dell Precision 7960 Rack Workstation mit zwei Xeon Platinum 8562Y+ CPUs, 512 GB DDR5 ECC RAM und zwei RTX PRO 6000 Blackwell Max-Q GPUs mit je 96 GB VRAM geteilt. Das FP8-Modell läuft unter vLLM mit Tensor-Parallelismus 2 und einem 262K-Kontextfenster.
VLLM_PLE_CPU_OFFLOAD=1 vllm serve Qwen/Qwen3.8-Flash-Next-FP8 --tensor-parallel-size 2Das Modell enthält eine PLE-/n-Gram-Embedding-Tabelle mit 51B Parametern, die per VLLM_PLE_CPU_OFFLOAD=1 in den Systemspeicher ausgelagert wird. Die GPU-seitige Modelllast lag bei etwa 67,5 GiB pro GPU, was Raum für den KV-Cache lässt.
Die Konfiguration des Speculative Decoding erwies sich als entscheidend. Mit MTP3 fiel die Generierungsgeschwindigkeit auf 40-48 tok/s und die Akzeptanzraten brachen über alle Positionen ein. Der Wechsel zu MTP1 brachte rund 123-126 tok/s Generierung und Prompt-Verarbeitung mit Spitzen um 2.185 tok/s. Die Akzeptanz lag bei 99-100%, bei einer mittleren Akzeptanzlänge von etwa 2,0.
Der Autor merkt an, dass die Geschwindigkeit nahe an Qwen3.5-122B-A10B auf derselben Hardware liegt, trotz der anderen Architektur. Weitere Tests sind geplant: MTP1 gegen kein Speculative Decoding, Tuning der fehlenden MoE-Kernel-Konfiguration für E=512 / N=320 / FP8, höhere GPU-Speicherauslastung, NUMA-Effekte durch die CPU-residente PLE-Tabelle, Langkontext-Performance, Durchsatz bei parallelen Nutzern und ein Qualitätsvergleich mit Qwen3.5-122B-A10B.
Kommentare
Noch keine Kommentare — schreib den ersten.
Starte die Diskussion
Kein Konto, kein Passwort nötig — gib einfach deine E-Mail-Adresse ein, wir senden dir einen einmaligen Anmelde-Link. Beim ersten Mal bist du damit automatisch angemeldet.
Deine Bewertung wird nach der Anmeldung automatisch übernommen.
Schau in dein Postfach
Wir haben einen Anmelde-Link an … gesendet. Öffne ihn auf diesem Gerät — dieser Tab meldet dich automatisch an.
Nichts angekommen? Wirf einen Blick in den Spam-Ordner — und markiere die Mail dort als „Kein Spam“, dann landet sie künftig direkt im Postfach.