Alibaba Tongyi presenta oficialmente la nueva generación de modelo de reconocimiento de voz de extremo a extremo Fun-ASR. Este modelo logra un avance significativo en la precisión del reconocimiento de voz, superando el 15% en escenarios de industrias verticales como la decoración del hogar y el seguro, gracias a su capacidad reforzada para percibir el contexto y su alta precisión en la transcripción. Los datos de prueba muestran que la precisión en el sector del seguro ha mejorado un 18% en comparación con la generación anterior, mientras que en sectores como la decoración del hogar y la ganadería, el aumento oscila entre el 15% y el 20%.

Como algoritmo de reconocimiento de voz impulsado por modelos de lenguaje grandes, Fun-ASR utiliza algoritmos de voz propios y tecnología de ajuste fino supervisado con Qwen3, combinando arquitecturas de modelos avanzados y tecnologías de alineación de modalidades de texto. Mantiene así sus ventajas en el procesamiento del lenguaje, integrando simultáneamente una solución de recuperación basada en RAG, lo que permite importar más de 1000 términos calientes personalizados. Esta función puede emparejar automáticamente términos calientes de dominio, documentos históricos y registros de contexto en audio, optimizando significativamente el reconocimiento de palabras clave en escenarios específicos.

La nueva generación del modelo de voz de Alibaba Tongyi Fun-ASR se evoluciona aún más, con un aumento superior al 15% en la precisión de reconocimiento en campos verticales

En cuanto a los problemas comunes en el reconocimiento de voz como interferencias de ruido, confusión de idiomas y falsas generaciones, el equipo de investigación ha introducido de forma innovadora la tecnología de aprendizaje por refuerzo (RL), reduciendo así los errores de reconocimiento mediante estrategias de optimización dinámica. La estabilidad y fiabilidad del sistema han mejorado sustancialmente. Destaca especialmente el rendimiento del modelo en el reconocimiento de dialectos como el sichuano, cantonés y minnan, superando a productos similares, y también es capaz de adaptarse a entornos acústicos complejos como captación a distancia y reducción de ruido cercana, cubriendo escenarios diversos como reuniones, puestos de trabajo, supermercados y exteriores.

En cuanto a los datos de entrenamiento, Fun-ASR se basa en cientos de millones de horas de datos de audio, integrando profundamente bibliotecas de términos técnicos de más de diez áreas como internet, tecnología, ganadería y automóviles. Esta ventaja en los datos le permite mostrar una ventaja significativa en el reconocimiento en industrias verticales, por ejemplo, en el sector ganadero, puede identificar con precisión las voces de los animales y las instrucciones clave en el ruido ambiental.

El equipo técnico de Alibaba Tongyi afirma que la evolución de Fun-ASR marca un hito en la transición de la tecnología de reconocimiento de voz de escenarios generales hacia una especialización y contextualización profunda. A medida que el modelo se implemente en más industrias, su capacidad para actualizar términos calientes dinámicamente y su interacción multimodal seguirán impulsando una revolución en la eficiencia de la interacción de voz.