AIO APEX

ByteDance pré-entraîne un modèle à 10 billions de paramètres pour défier les IA de pointe

The Decoder / Financial Times
Partager:
ByteDance pré-entraîne un modèle à 10 billions de paramètres pour défier les IA de pointe

ByteDance pré-entraîne un modèle IA pouvant atteindre 10 billions de paramètres, selon le Financial Times qui cite trois personnes au courant du projet. Cette ampleur placerait la maison mère de TikTok à portée des systèmes IA les plus puissants au monde, loin devant tout modèle chinois connu.

Le modèle serait environ trois fois plus grand que Kimi K3 de Moonshot AI avec 2,8 billions de paramètres — actuellement le plus grand modèle chinois connu. Il se situe également dans le même ordre de grandeur que Mythos 5 d'Anthropic, que les estimations du secteur placent à environ 8 billions de paramètres. Anthropic n'a jamais confirmé ce chiffre officiellement.

Le pré-entraînement est déjà en cours

Le modèle est actuellement en phase de pré-entraînement, un processus qui prend généralement trois à six mois à cette échelle. ByteDance n'a pas divulgué publiquement de nom ni de calendrier de lancement. La taille seule signale qu'il s'agit d'un pari de long terme sur la frontière, pas d'une mise à jour incrémentale de produit.

Un détail notable : ByteDance a évité la distillation — s'entraîner sur les sorties des modèles d'autres entreprises — depuis plus d'un an. La distillation est un raccourci courant pour rattraper rapidement le retard, mais elle limite l'originalité et crée des risques de propriété intellectuelle. L'éviter implique que ByteDance investit dans un pré-entraînement original complet à partir de zéro, beaucoup plus coûteux mais produisant des résultats plus capables et défendables.

Le PDG reconnaît le retard

L'ambition de cette session d'entraînement contraste avec un aveu interne candide. Lors d'une réunion de mi-année le 6 août 2026, le PDG de ByteDance Liang Rubo a dit au personnel que les grands modèles de langage de l'entreprise sont actuellement à la traîne des concurrents étrangers de pointe, soulignant l'engagement à long terme envers la R&D interne.

Le fondateur de ByteDance Zhang Yiming aurait dit à l'équipe Seed de 2 000 personnes — la division responsable de ce modèle — de viser des capacités de pointe mondiale à long terme. L'entreprise augmente significativement ses investissements en IA en 2026, avec une part substantielle allouée aux dépenses en semi-conducteurs.

Pas seule à cette échelle

ByteDance n'est pas seule à poursuivre l'échelle des billions de paramètres. xAI d'Elon Musk entraînerait des variantes de Grok à 6 et 10 billions de paramètres sur son cluster Colossus 2. OpenAI et Google n'ont pas divulgué les comptages de paramètres de leurs systèmes actuels, mais la concurrence à l'échelle des billions est devenue l'étalon silencieux de la prochaine génération de laboratoires IA.

Le nombre de paramètres n'est pas la seule variable — la qualité des données, les méthodes d'entraînement et l'architecture comptent tout autant — mais le signal du rapport du Financial Times est clair : ByteDance n'est plus satisfaite de suivre la frontière à distance.

Initialement rapporté par The Decoder / Financial Times. Lisez l'article original pour plus de détails.

Voir la source originale
Partager: