ByteDance está pre-entrenando un modelo de 10 billones de parámetros para desafiar a la IA de frontera

ByteDance está pre-entrenando un modelo de IA con hasta 10 billones de parámetros, según el Financial Times, que cita a tres personas con conocimiento del proyecto. La escala situaría a la empresa matriz de TikTok a un paso de los sistemas de IA más capaces del mundo y muy por delante de cualquier modelo chino conocido.
El modelo sería aproximadamente tres veces más grande que Kimi K3 de Moonshot AI, con 2,8 billones de parámetros — actualmente el modelo chino más grande conocido. También se sitúa en el mismo rango que el Mythos 5 de Anthropic, que las estimaciones de la industria ubican en alrededor de 8 billones de parámetros. Anthropic jamás ha confirmado ese número públicamente.
El pre-entrenamiento ya está en marcha
El modelo está actualmente en la fase de pre-entrenamiento, un proceso que típicamente lleva de tres a seis meses a esta escala. ByteDance no ha revelado públicamente un nombre ni un calendario de lanzamiento. El tamaño por sí solo indica que se trata de una apuesta de largo plazo en la frontera, no de una actualización incremental del producto.
Un detalle notable: ByteDance ha evitado la destilación — entrenar con los resultados de modelos de otras empresas — durante más de un año. La destilación es un atajo común para ponerse al día rápidamente, pero limita la originalidad y crea exposición a la propiedad intelectual. Evitarla implica que ByteDance está invirtiendo en un pre-entrenamiento original completo desde cero, mucho más costoso pero que produce resultados más capaces y defendibles.
El CEO reconoce la brecha
La ambición del proceso de entrenamiento contrasta con una admisión interna candorosa. En una asamblea de mediados de año el 6 de agosto de 2026, el CEO de ByteDance, Liang Rubo, dijo al personal que los modelos de lenguaje de la empresa están actualmente rezagados respecto a los competidores extranjeros líderes, subrayando el compromiso a largo plazo con la I+D interna.
El fundador de ByteDance, Zhang Yiming, supuestamente le dijo al equipo Seed de 2.000 personas — la división responsable de este modelo — que apuntaran a capacidades de liderazgo mundial a largo plazo. La empresa está aumentando significativamente la inversión en IA en 2026, con una parte sustancial destinada a gasto en semiconductores.
No es la única en esta escala
ByteDance no está sola en perseguir la escala de billones de parámetros. Se informa que xAI de Elon Musk está entrenando variantes de Grok con 6 y 10 billones de parámetros en su clúster Colossus 2. OpenAI y Google no han revelado los recuentos de parámetros de sus sistemas actuales, pero la competencia a escala de billones se ha convertido en el benchmark silencioso de la próxima generación de laboratorios de IA.
El número de parámetros no es la única variable — la calidad de los datos, los métodos de entrenamiento y la arquitectura importan igual — pero la señal del informe del Financial Times es clara: ByteDance ya no está satisfecha con seguir la frontera desde la distancia.
Publicado originalmente por The Decoder / Financial Times. Lee el artículo original para más detalles.
Ver fuente original