Récemment, dans le contexte d'un développement croissant de la technologie de reconnaissance vocale à l'échelle mondiale, Qwen a officiellement lancé aujourd'hui son dernier modèle de reconnaissance vocale - Qwen3-ASR-Flash. Ce modèle repose sur le modèle de base Qwen3 et a été entraîné sur une quantité énorme de données multimodales et sur des millions d'heures de données de reconnaissance automatique de la parole (ASR), afin d'offrir aux utilisateurs des solutions de reconnaissance vocale précises et robustes.

Les caractéristiques principales de Qwen3-ASR-Flash comprennent une précision de reconnaissance avancée et une capacité impressionnante à reconnaître les chansons. Le modèle se distingue dans plusieurs tests de référence en chinois, en anglais et en plusieurs langues, notamment en ce qui concerne la reconnaissance des chants, avec un taux d'erreur mesuré inférieur à 8 %. Cela signifie que qu'il s'agisse de chansons sans accompagnement ou accompagnées de musique de fond, Qwen3-ASR-Flash est capable de les identifier et de les transcrire efficacement.
Un autre point important est sa capacité à personnaliser la reconnaissance. Les utilisateurs peuvent fournir un contexte textuel sous n'importe quel format, et le modèle est capable de reconnaître intelligemment et de correspondre aux entités nommées et aux termes clés, produisant ainsi des résultats de reconnaissance personnalisés. Cette fonctionnalité permet à Qwen3-ASR-Flash d'être plus flexible et adaptatif lorsqu'il traite des contextes complexes.
En outre, Qwen3-ASR-Flash prend en charge jusqu'à 11 langues, ainsi que divers dialectes et accents, permettant une transcription précise. La prise en charge des langues inclut le mandarin et les principaux dialectes (comme le sichuanais, le cantonais, etc.), l'anglais britannique et américain, ainsi que des langues telles que le français, l'allemand, le russe, l'italien, l'espagnol, le japonais, le coréen et l'arabe. Cela offre aux utilisateurs un choix plus large, répondant aux besoins des utilisateurs provenant de différentes régions et langues.

Qwen3-ASR-Flash possède également une robustesse puissante, pouvant maintenir une haute précision même dans des phrases longues, des changements de langues au milieu des phrases et des environnements acoustiques complexes, en filtrant efficacement les fragments non vocaux tels que le silence et le bruit ambiant, garantissant ainsi aux utilisateurs une expérience optimale de reconnaissance vocale.
Pour permettre aux utilisateurs d'expérimenter les fonctionnalités puissantes de Qwen3-ASR-Flash, Qwen propose des modes d'expérience sur plusieurs plateformes, y compris ModelScope, HuggingFace et l'API Aliyun BaiLian, permettant aux utilisateurs d'essayer facilement ce modèle.
Dans le futur, Qwen déclare que Qwen3-ASR-Flash continuera à évoluer et à s'améliorer, augmentant constamment la précision de la reconnaissance et développant davantage de fonctionnalités, visant à offrir aux utilisateurs des services de conversion voix-en-texte plus intelligents et plus efficaces. Grâce à cette innovation technologique, Qwen espère ouvrir un avenir encore plus vaste dans le domaine de la reconnaissance vocale.