Um laboratório de inteligência artificial focado na pesquisa de mercados financeiros, nof1, anunciou o lançamento do projeto de teste de negociação com modelos grandes Alpha Arena, para testar a capacidade de tomada de decisão e controle de risco de diferentes modelos grandes em ambientes financeiros reais. Este teste foi realizado na plataforma descentralizada Hyperliquid, todos os modelos foram executados com as mesmas dicas e entradas de dados uniformes, cada modelo recebeu 10.000 dólares em fundos reais para negociações independentes.

Participaram do teste seis modelos de IA líderes, são eles: GPT-5, Gemini2.5Pro, Grok-4, Claude Sonet4.5, DeepSeek V3.1 e Qwen3Max. No final do período de teste, os resultados mostraram que os mais destacados foram o DeepSeek V3.1 e o Grok-4, ambos com retornos acima de 14%, empatando no segundo lugar; enquanto o desempenho do Gemini2.5Pro foi ruim, apresentando uma perda de 4257%, sendo o resultado mais inesperado desta rodada de testes.
O nof1 afirmou que o objetivo do Alpha Arena não é comparar simplesmente a qualidade dos modelos, mas verificar a estabilidade das estratégias e mecanismos de resposta a riscos de diferentes arquiteturas em mercados com alta volatilidade, fornecendo referências técnicas e metodológicas para futuras negociações quantitativas autônomas baseadas em IA. A introdução deste experimento também reflete que os grandes modelos estão se expandindo rapidamente das tarefas de compreensão e raciocínio de texto para cenários reais de tomada de decisões financeiras e gestão de ativos.







