O chatbot de IA generativa Grok, desenvolvido pela xAI, recebeu uma atualização monumental, com aprimoramentos significativos em suas funcionalidades. Além de novas capacidades de processamento visual, ele agora inclui processamento de áudio multilíngue e busca em tempo real no modo de voz. Essa atualização representa um avanço significativo do Grok na área de IA multimodal, oferecendo aos usuários uma experiência de interação mais inteligente e conveniente. A seguir, a AIbase analisará detalhadamente os destaques e o significado dessa atualização.

QQ_1745369630380.png

Avanço na capacidade visual

A capacidade de processamento visual do Grok é um dos principais destaques desta atualização. Embora a xAI tenha anunciado em abril de 2024 que o Grok-1.5Vision (Grok-1.5V) possuía a capacidade de processar informações visuais como documentos, gráficos, capturas de tela e fotos, essa versão nunca foi disponibilizada ao público. Agora, a funcionalidade visual do Grok está oficialmente online, permitindo que os usuários carreguem imagens para que o Grok analise conteúdos visuais complexos, como interpretar gráficos de dados, identificar objetos ou converter informações visuais em código executável. Isso não apenas aumenta o valor prático do Grok, mas também o torna excelente em tarefas de compreensão espacial e raciocínio visual, especialmente em testes de referência RealWorldQA, onde demonstra uma vantagem significativa.

Vale mencionar que a capacidade visual do Grok, combinada com sua função de obtenção de dados em tempo real, pode melhorar ainda mais seu desempenho na análise de notícias e interpretação de conteúdo de mídia social. Por exemplo, um usuário pode carregar uma imagem de notícia, e o Grok, combinando-a com informações em tempo real do X, fornecerá uma análise contextual e interpretação do evento.

Processamento de áudio multilíngue: Nova experiência de interação por voz em mais de 145 idiomas

A funcionalidade de processamento de áudio multilíngue do Grok também é impressionante. Com a integração da extensão "VoiceWave", o Grok agora suporta interação por voz em tempo real em mais de 145 idiomas, incluindo inglês, espanhol, francês, japonês, chinês, turco e hindi, cobrindo os principais idiomas do mundo. Essa funcionalidade não apenas permite conversas de voz naturais e fluidas, mas também suporta conversão de voz para texto, reprodução de voz e destaque de texto sincronizado, melhorando significativamente a experiência do usuário.

Para usuários que precisam de comunicação interlínguas, o processamento de áudio multilíngue do Grok é uma grande vantagem. Seja para aprender um novo idioma, lidar com atendimento ao cliente multilíngue ou criar conteúdo internacional, o Grok pode fornecer respostas de voz personalizadas com pronúncia nativa e velocidade e tom ajustáveis.

Busca em tempo real no modo de voz: DeepSearch para acesso imediato a informações

A nova funcionalidade de busca em tempo real no modo de voz do Grok consolida ainda mais sua posição como "buscador da verdade". Com a tecnologia DeepSearch, o Grok pode obter informações instantaneamente da web e da plataforma X por meio de comandos de voz, gerando respostas precisas e completas. Em comparação com a entrada de texto tradicional, a busca por voz permite que os usuários acessem tendências em tempo real, notícias ou insights sobre tópicos quentes de forma muito mais rápida.

Por exemplo, quando um usuário pergunta "Quais são as últimas notícias de tecnologia?", o Grok não apenas responde rapidamente por voz, mas também cita as postagens mais recentes da plataforma X e recursos da web, garantindo a atualidade e a confiabilidade das informações. Além disso, o processo de raciocínio transparente do DeepSearch permite que os usuários vejam os passos lógicos do Grok e os documentos-fonte, aumentando ainda mais a confiabilidade das informações.

Suporte técnico por trás dos recursos: Supercomputador Colossus e aprendizado por reforço

O sucesso desta atualização se deve aos contínuos investimentos da xAI em tecnologia. O treinamento do Grok3 é baseado no supercomputador Colossus, equipado com 200.000 GPUs NVIDIA H100, com capacidade de computação 10 vezes maior que a geração anterior de modelos. Isso permite que o Grok processe tarefas complexas com mais rapidez e precisão, especialmente em cenários que exigem fusão multimodal.

Além disso, o Grok3 otimizou sua capacidade de raciocínio por meio de aprendizado por reforço em larga escala (RL), podendo corrigir erros, explorar soluções e gerar respostas em segundos ou minutos. Essa capacidade de "pensar como um humano" permite que o Grok supere vários modelos concorrentes, incluindo GPT-4o, Gemini 1.5 e Claude 3.5 Sonnet, em testes de referência em matemática, ciência e codificação.