A Alibaba Tongyi lançou oficialmente a nova geração de modelo de reconhecimento de voz de ponta a ponta Fun-ASR. Esse modelo, ao reforçar a percepção contextual e a capacidade de transcrição de alta precisão, alcançou um aumento revolucionário de mais de 15% na taxa de acerto no cenário de indústrias verticais como decoração de interiores e seguros. Dados de teste mostram que a taxa de acerto no setor de seguros subiu 18% em comparação com a versão anterior, enquanto em áreas como decoração de interiores e pecuária, o aumento varia entre 15% e 20%.
Como algoritmo de reconhecimento de voz impulsionado por modelos de linguagem grandes, o Fun-ASR utiliza algoritmos de áudio desenvolvidos internamente e tecnologia de ajuste supervisionado Qwen3, combinando arquiteturas de modelo avançadas e tecnologia de alinhamento multimodal, mantendo assim as vantagens no processamento de linguagem, ao mesmo tempo que integra uma solução de recuperação com RAG (Recuperação com Aumento de Dados), suportando a importação de mais de 1.000 termos quentes personalizados. Essa função pode automaticamente corresponder aos termos quentes da área, documentos históricos e registros contextuais nos áudios, otimizando significativamente a eficácia da identificação de palavras-chave em cenas específicas.

Em relação aos desafios comuns no reconhecimento de voz, como interferência de ruído, confusão de idiomas e ilusões de geração, a equipe de desenvolvimento inovou ao introduzir tecnologia de aprendizado por reforço (RL), reduzindo assim os erros de reconhecimento por meio de estratégias de otimização dinâmica, melhorando substancialmente a estabilidade e a confiabilidade do sistema. Vale destacar que o modelo se sai melhor do que produtos concorrentes na identificação de dialetos como o dialeto de Sichuan, cantonês e mandarim sulista, além de adaptar-se a ambientes acústicos complexos, como captação de longa distância e redução de ruído em curta distância, cobrindo cenários diversos, como salas de reunião, escritórios, supermercados e ambientes externos.
No aspecto dos dados de treinamento, o Fun-ASR foi construído com bilhões de horas de dados de áudio, integrando profundamente bibliotecas de termos técnicos de mais de dez áreas, como internet, tecnologia, pecuária e automobilismo. Essa vantagem de dados permite que ele demonstre vantagens significativas no reconhecimento em indústrias verticais, como, por exemplo, identificar com precisão comandos-chave nas chamadas de animais e ruídos ambientais na indústria pecuária.
A equipe técnica da Alibaba Tongyi afirmou que a evolução do Fun-ASR marca um marco na passagem da tecnologia de reconhecimento de voz das situações gerais para uma especialização e personalização mais profunda. À medida que o modelo é implementado em mais indústrias, sua capacidade de atualização dinâmica de termos quentes e interação multimodal continuará a impulsionar a inovação na eficiência da interação por voz.



