In Kürze

  • Alibabas Qwen-Team veröffentlichte am 23. September 2026 mit Qwen-Audio 3.1 eine neue Modellfamilie aus fünf Sprachmodellen: aktualisierte ASR-, TTS- und Realtime-Modelle sowie die neuen Modelle ASR-Next und TTS-Next.
  • Gleichzeitig senkte Alibaba Cloud die Preise für die Spracherkennung (ASR) um bis zu 95 Prozent, für Sprachsynthese (TTS) um rund 70 Prozent und für das Echtzeit-Sprachmodell um rund 85 Prozent, wirksam ab Mitternacht Pekinger Zeit am 22. September 2026.
  • ASR-Next erkennt einzelne Sprechende mit Zeitstempeln sowie Emotionen und Hintergrundgeräusche, während TTS-Next Sprache, Klangeffekte und Umgebungsgeräusche in einem einzigen Durchgang aus Text, Zeitstempeln und bis zu drei Referenzclips erzeugt.

Was ist passiert?

Alibabas Qwen-Team hat am 23. September 2026 mit Qwen-Audio 3.1 eine neue Generation von Sprachmodellen vorgestellt. Das Fünfer-Paket umfasst überarbeitete Modelle für Spracherkennung (ASR), Sprachsynthese (TTS) und Echtzeit-Sprachverarbeitung sowie zwei neue Varianten: ASR-Next, das einzelne Sprechende mit Zeitstempeln unterscheidet und zusätzlich Emotionen sowie Hintergrund- und Maschinengeräusche erkennt, und TTS-Next, das ein Sprachmodell mit einem Diffusionsverfahren kombiniert und so Stimme, Klangeffekte und Umgebungsgeräusche in einem einzigen Durchgang aus Text, Zeitstempeln und bis zu drei Referenzclips erzeugt.

Parallel dazu senkte Alibaba Cloud gemäss GuruFocus die Gebühren für bestimmte Sprachmodelle auf seiner Plattform Bailian deutlich: Die Preise für Spracherkennung sanken um bis zu 95 Prozent, für Sprachsynthese um rund 70 Prozent und für das Echtzeit-Sprachmodell um rund 85 Prozent. Die neuen Tarife gelten laut den Berichten seit Mitternacht Pekinger Zeit am 22. September 2026.

Warum ist das wichtig?

Der Schritt reiht sich in eine Serie aggressiver Preissenkungen chinesischer KI-Anbieter ein, mit denen Alibaba westliche Anbieter wie OpenAI oder Google unter Druck setzt und gleichzeitig Entwicklerinnen und Entwickler stärker an die eigene Modell-Plattform bindet. Für Anwendungen wie Callcenter-Automatisierung, Diktiersoftware oder mehrsprachige Voicebots senkt eine derart drastische Preisreduktion die Einstiegshürde für neue, sprachbasierte KI-Produkte erheblich.

Gleichzeitig zeigt die technische Weiterentwicklung – insbesondere die Sprecherunterscheidung mit Zeitstempeln und die kombinierte Erzeugung von Stimme und Umgebungsgeräuschen – dass sich Sprach-KI von reiner Texterkennung hin zu realistischeren, kontextreicheren Audioanwendungen entwickelt. Das eröffnet neue Einsatzfelder etwa in der automatisierten Protokollierung von Meetings oder in der Content-Produktion.

Was bedeutet das für die Schweiz?

Redaktionelle Einordnung: Die folgenden Schlussfolgerungen beziehen sich auf die genannten Quellen. Sie sind keine zusätzlichen Meldungen der Originalquelle.

  • Für Schweizer KMU, die Sprach-KI etwa in Kundenservice, Telefonzentralen oder Diktierfunktionen einsetzen wollen, senkt der drastische Preisrückgang bei Alibaba die Kosten für Pilotprojekte erheblich und erhöht den Druck auf westliche Anbieter, ihre eigenen Sprach-APIs ebenfalls günstiger anzubieten.
  • Da Schweizer Unternehmen bei Cloud-KI-Diensten aus Datenschutzgründen oft zurückhaltend sind, dürfte der Preisvorteil chinesischer Anbieter vor allem dort zum Tragen kommen, wo keine besonders schützenswerten Personendaten verarbeitet werden – etwa bei mehrsprachigen Voicebots für allgemeine Anfragen.
  • Die Mehrsprachigkeit der neuen Modelle ist für die viersprachige Schweiz von besonderem Interesse, sofern Deutsch, Französisch und Italienisch mit ausreichender Qualität unterstützt werden – ein Punkt, den Schweizer Anbieter vor einem produktiven Einsatz sorgfältig prüfen müssten.

Verwendete Quellen

AI Weekly berichtete am 23. September 2026 über die Lancierung von Qwen-Audio 3.1 und die gesenkten API-Preise; ergänzende technische Details lieferte ein Bericht von Gurufocus zur Preisanpassung von Alibaba Cloud.

Quellenstatus: 2 verlinkte Quellen · 0 von 2 Originaldaten verifiziert. Prüfregeln ansehen

Häufige Fragen

Was ist die Kernaussage zu Alibaba senkt Preise für Qwen-Sprach-APIs um bis zu 95 Prozent?

Alibabas Qwen-Team veröffentlichte am 23. September 2026 mit Qwen-Audio 3.1 eine neue Modellfamilie aus fünf Sprachmodellen: aktualisierte ASR-, TTS- und Realtime-Modelle sowie die neuen Modelle ASR-Next und TTS-Next.

Warum ist diese KI-Meldung für die Schweiz relevant?

Für Schweizer KMU, die Sprach-KI etwa in Kundenservice, Telefonzentralen oder Diktierfunktionen einsetzen wollen, senkt der drastische Preisrückgang bei Alibaba die Kosten für Pilotprojekte erheblich und erhöht den Druck auf westliche Anbieter, ihre eigenen Sprach-APIs ebenfalls günstiger anzubieten.

Welche Quelle nutzt KI News Schweiz für diese Einordnung?

AI Weekly berichtete am 23. September 2026 über die Lancierung von Qwen-Audio 3.1 und die gesenkten API-Preise; ergänzende technische Details lieferte ein Bericht von Gurufocus zur Preisanpassung von Alibaba Cloud.