Kürzlich, im Zeichen der zunehmenden Entwicklung der Spracherkennungstechnologie weltweit, hat Qwen heute offiziell sein neuestes Spracherkennungsmodell – Qwen3-ASR-Flash – vorgestellt. Das Modell basiert auf dem Qwen3-Grundmodell und wurde mit einer riesigen Menge an multimodalen Daten sowie mit mehreren Millionen Stunden automatischer Spracherkennungsdaten trainiert, um Benutzern eine präzise und robuste Spracherkennungslösung anzubieten.

QQ20250909-085515.png

Die zentralen Merkmale von Qwen3-ASR-Flash sind führende Erkennungsgenauigkeit und beeindruckende Fähigkeit zur Erkennung von Gesang. Das Modell schneidet in verschiedenen Benchmarks für chinesisch, englisch und mehrsprachige Umgebungen gut ab, insbesondere bei der Erkennung von Gesang, wobei die gemessene Fehlerquote unter 8 % liegt. Das bedeutet, dass Qwen3-ASR-Flash sowohl beim Rein- als auch beim Begleitmusik-Singen effektiv erkennen und transkribieren kann.

Eine weitere bemerkenswerte Eigenschaft ist seine Anpassungsfähigkeit. Benutzer können beliebige Textkontexte in beliebigem Format bereitstellen, das Modell kann diese intelligent erkennen und passende Namen und Schlüsselbegriffe identifizieren, um personalisierte Erkennungsergebnisse zu liefern. Diese Funktion ermöglicht es Qwen3-ASR-Flash, sich flexibler und anpassungsfähiger in komplexen Kontexten zu verhalten.

Zudem unterstützt Qwen3-ASR-Flash bis zu 11 Sprachen sowie verschiedene Dialekte und Akzente und ermöglicht präzise Transkriptionen. Die Sprachunterstützung umfasst Mandarin und Hauptdialekte (wie Sichuan-Dialekt, Kantonisch usw.), britisches und amerikanisches Englisch sowie auch Französisch, Deutsch, Russisch, Italienisch, Spanisch, Japanisch, Koreanisch und Arabisch. Dies bietet den Nutzern eine breitere Auswahl und erfüllt die Bedürfnisse verschiedener Regionen und Sprachnutzer.

QQ20250909-085525.png

Qwen3-ASR-Flash verfügt auch über eine starke Robustheit und behält eine hohe Genauigkeit bei langen und schwierigen Sätzen, bei Sprachwechseln innerhalb eines Satzes und in komplexen akustischen Umgebungen. Es kann nicht-sprachliche Abschnitte wie Stille und Hintergrundgeräusche effektiv filtern und stellt sicher, dass die Benutzer das beste Spracherkennungserlebnis erhalten.

Um den Benutzern die Möglichkeit zu geben, die leistungsstarken Funktionen von Qwen3-ASR-Flash zu erleben, bietet Qwen auf verschiedenen Plattformen Zugangsmöglichkeiten, darunter ModelScope, HuggingFace und die Alibaba Cloud BaiLian API, sodass Benutzer das Modell bequem testen können.

In Zukunft wird Qwen angeben, dass Qwen3-ASR-Flash kontinuierlich weiterentwickelt und verbessert werden wird, um die Erkennungsgenauigkeit weiter zu erhöhen und mehr Funktionen zu entwickeln. Qwen möchte mit dieser technologischen Innovation eine noch weitreichendere Zukunft in der Spracherkennung schaffen.