AIO APEX

Mistral lança Large 4, modelo de um trilhão de parâmetros treinado com apenas 4.000 GPUs

TechCrunch
Compartilhar:
Mistral lança Large 4, modelo de um trilhão de parâmetros treinado com apenas 4.000 GPUs

A Mistral apresentou na terça-feira o Large 4, um modelo multimodal de um trilhão de parâmetros que, segundo o laboratório parisiense de IA, foi treinado com cerca de 4.000 GPUs Nvidia — uma fração dos orçamentos de computação que, acredita-se, os laboratórios rivais gastam em treinamentos de ponta. O modelo, apelidado internamente de "Le Chonk", já está disponível por meio de um ponto de acesso público protegido, com lançamento dos pesos abertos previsto para cerca de três semanas, após a conclusão dos testes de segurança.

O lançamento ocorre em meio a uma divisão tripla crescente na indústria de IA: sistemas fechados e proprietários de laboratórios americanos, modelos de pesos abertos de desenvolvedores chineses como DeepSeek e Qwen, da Alibaba, e um grupo cada vez menor de alternativas ocidentais de pesos abertos. A Mistral se posicionou claramente nessa terceira via desde sua fundação em 2023, e o Large 4 é sua tentativa mais direta até agora de demonstrar que modelos abertos treinados na Europa podem competir com os dois lados, em vez de ficar atrás deles.

Pierre Stock, vice-presidente de ciência da Mistral, afirmou que o treinamento usou “duas a três vezes menos” computação do que a empresa acredita que seus concorrentes chineses precisam, e “significativamente menos” do que os rivais de código fechado. A Mistral ajustou o Large 4 especificamente para cargas de trabalho de cibersegurança, finanças e design de chips — nichos corporativos em que a empresa busca clientes pagantes em vez de competir em benchmarks genéricos de chatbot. A empresa diz que trabalhará com “parceiros e governos de confiança” no uso responsável dos pesos abertos após o lançamento, uma declaração destinada a aliviar preocupações de que um modelo de um trilhão de parâmetros sem restrições possa ser reaproveitado para ataques cibernéticos ofensivos ou design de armas.

Resultados independentes de benchmarks ainda não são públicos, portanto a afirmação da Mistral de ser “a melhor de sua categoria entre os modelos de pesos abertos” permanece não verificada fora dos testes internos da empresa. Ainda assim, se os números de eficiência se confirmarem sob escrutínio externo, o Large 4 reforçaria o argumento de que modelos de ponta não precisam mais dos enormes clusters de GPU sobre os quais OpenAI, Anthropic e Google construíram suas reputações — uma afirmação com implicações reais sobre quanta capacidade de computação o resto da indústria acredita que precisa comprar.

Segundo reportagem original da TechCrunch, a Mistral não revelou o preço do ponto de acesso protegido antes do lançamento dos pesos abertos.

Publicado originalmente por TechCrunch. Leia o artigo original para mais detalhes.

Ver fonte original
Compartilhar: