ByteDance está pré-treinando um modelo de 10 trilhões de parâmetros para desafiar a IA de fronteira

A ByteDance está pré-treinando um modelo de IA com até 10 trilhões de parâmetros, segundo o Financial Times, que cita três pessoas com conhecimento do projeto. A escala colocaria a empresa-mãe do TikTok a um passo dos sistemas de IA mais capazes do mundo, muito à frente de qualquer modelo chinês conhecido.
O modelo seria aproximadamente três vezes maior que o Kimi K3 da Moonshot AI, com 2,8 trilhões de parâmetros — atualmente o maior modelo chinês conhecido. Também está na mesma faixa do Mythos 5 da Anthropic, que estimativas do setor colocam em cerca de 8 trilhões de parâmetros. A Anthropic nunca confirmou esse número publicamente.
O pré-treinamento já está em andamento
O modelo está atualmente na fase de pré-treinamento, um processo que normalmente leva de três a seis meses nessa escala. A ByteDance não divulgou publicamente um nome ou cronograma de lançamento. O tamanho por si só indica que esta é uma aposta de longo prazo na fronteira, não uma atualização incremental de produto.
Um detalhe notável: a ByteDance evitou a destilação — treinar com saídas de modelos de outras empresas — por mais de um ano. A destilação é um atalho comum para recuperar terreno rapidamente, mas limita a originalidade e cria exposição à propriedade intelectual. Evitá-la implica que a ByteDance está investindo em pré-treinamento original completo do zero, muito mais caro mas que produz resultados mais capazes e defensáveis.
O CEO reconhece o gap
A ambição da rodada de treinamento contrasta com uma admissão interna franca. Em uma assembleia de meio do ano em 6 de agosto de 2026, o CEO da ByteDance Liang Rubo disse aos funcionários que os grandes modelos de linguagem da empresa estão atualmente atrás dos concorrentes estrangeiros líderes, enfatizando o compromisso de longo prazo com P&D interno.
O fundador da ByteDance Zhang Yiming supostamente disse à equipe Seed de 2.000 pessoas — a divisão responsável por este modelo — para mirar capacidades líderes mundiais no longo prazo. A empresa está aumentando significativamente o investimento em IA em 2026, com uma parcela substancial destinada a gastos com semicondutores.
Não é a única nessa escala
A ByteDance não está sozinha em perseguir a escala de trilhões de parâmetros. A xAI de Elon Musk estaria treinando variantes do Grok com 6 e 10 trilhões de parâmetros em seu cluster Colossus 2. OpenAI e Google não divulgaram contagens de parâmetros para seus sistemas atuais, mas a competição na escala de múltiplos trilhões tornou-se o benchmark silencioso da próxima geração de laboratórios de IA.
A contagem de parâmetros não é a única variável — qualidade dos dados, métodos de treinamento e arquitetura importam igualmente — mas o sinal do relatório do Financial Times é claro: a ByteDance não está mais satisfeita em seguir a fronteira de longe.
Publicado originalmente por The Decoder / Financial Times. Leia o artigo original para mais detalhes.
Ver fonte original