Alibabas Qwen3.8-Omni-Flash senkt audiovisuelle KI-Kosten um über 90%

Alibabas Qwen-Team veröffentlichte am 18. September Qwen3.8-Omni-Flash, ein natives omni-modales Modell, das Text, Bilder, Audio und Video in einem einzigen einheitlichen Arbeitsablauf verarbeitet, anstatt verschiedene Medientypen durch separate Spezialmodelle zu leiten. Die Veröffentlichung ist sofort über Qwen Chat, QwenCloud und die Model Studio API verfügbar.
Was "natives Omni-Modal" tatsächlich ändert
Viele multimodale KI-Systeme funktionieren, indem sie separate Modelle verketten: Ein Vision-Modell beschreibt ein Bild, ein Transkriptionsmodell wandelt Audio in Text um, und ein Sprachmodell schlussfolgert über die kombinierte Ausgabe. Qwen3.8-Omni-Flash verarbeitet stattdessen all diese Eingabetypen in einem einzigen Modelldurchgang.
Das Modell unterstützt ein Kontextfenster von 1 Million Token, was es in dieselbe Kategorie wie die derzeit verfügbaren Modelle mit dem längsten Kontext einordnet, und fügt Denkmodus, Tool-Aufrufe und Websuche als native Fähigkeiten hinzu.
Die Benchmark- und Preiszahlen
Alibaba gibt an, dass das Modell seinen Durchschnittswert in 30 Bewertungen im Vergleich zu seinem Vorgänger Qwen3.5-Omni-Plus um mehr als 26% verbessert hat, wobei die größten Gewinne bei Audio-Video-Agentenaufgaben, Codierung, Langzeitkontext-Handling und Echtzeit-multimodaler Interaktion konzentriert sind. Preislich listet QwenCloud Qwen3.8-Omni-Flash mit 0,15 $ pro Million Eingabe-Token und 0,47 $ pro Million Ausgabe-Token.
Regionale Verfügbarkeit und die Lücke bei offenen Gewichten
Das Modell ist in den Rechenzentrumsregionen Peking, Singapur, Hongkong, Tokio, Frankfurt und Virginia verfügbar. Bemerkenswerterweise hat Alibaba für dieses Modell zum Start keine offenen Gewichte veröffentlicht, was bedeutet, dass Self-Hosting keine Option ist — eine Abkehr von der Open-Weight-Strategie, die mehreren früheren Qwen-Modellen von Alibaba zu Akzeptanz unter Entwicklern verholfen hat.
Ursprünglich berichtet von TechNode. Lesen Sie den Originalartikel für weitere Details.
Originalquelle ansehen