MiniMax lanza H3, un modelo de vídeo multimodal con audio nativo, y sus acciones suben un 17%

MiniMax lanzó H3 el viernes, un nuevo modelo de generación multimodal que procesa texto, imágenes, vídeo y audio en un único contexto unificado y produce vídeo 2K nativo con sonido estéreo integrado, en clips de hasta 15 segundos. La empresa china de IA afirmó que planea publicar los pesos del modelo como open source en cuestión de días, permitiendo a los desarrolladores descargar y personalizar el sistema subyacente en lugar de depender únicamente de una API.
El lanzamiento es relevante porque lleva la estrategia de pesos abiertos de MiniMax al vídeo, un dominio aún dominado por sistemas cerrados y caros de OpenAI (Sora) y Google (Veo). MiniMax ha construido su reputación durante el último año lanzando modelos que se acercan a los benchmarks de frontera propietarios mientras cobran una fracción de lo que cobran los laboratorios estadounidenses y publicando los pesos públicamente. H3 aplica ese mismo manual al vídeo: MiniMax afirma que generar metraje 2K con H3 cuesta aproximadamente un tercio de lo que cobran los productos rivales convencionales, una brecha de precios que la empresa posiciona como palanca competitiva directa contra Sora y Veo para el trabajo de vídeo comercial.
Técnicamente, H3 introduce tres componentes que MiniMax denomina Contextual Omni Representation, H3-Omni Transformer e In-Context Regeneration. Juntos permiten que el modelo acepte entradas mixtas — un prompt de texto junto con una imagen de referencia, un clip de vídeo o una pista de audio — y las mantenga en un espacio de representación compartido, lo que, según MiniMax, mejora el seguimiento de instrucciones y la comprensión multimodal en comparación con su anterior línea de vídeo Hailuo. El modelo también busca compatibilidad con los chips de IA fabricados en China, parte de un esfuerzo más amplio de las empresas chinas de IA para reducir la dependencia de los semiconductores fabricados en EE. UU. tanto para el entrenamiento como para la inferencia.
MiniMax orienta H3 directamente a casos de uso comercial: publicidad, visuales de productos de comercio electrónico, diseño de productos y videojuegos — mercados donde los clips de 15 segundos listos para usar con audio sincronizado son más valiosos que la producción cinematográfica más larga. Es un objetivo más acotado que la propuesta más amplia de generación creativa de Sora o Veo, pero se alinea directamente con dónde gastan actualmente más los estudios en contenido de vídeo de stock y producido.
La reacción del mercado fue inmediata: las acciones de MiniMax Group cotizadas en Hong Kong (HKG: 0100) subieron hasta un 17,4% tras el anuncio, antes de estabilizarse en una subida del 15,1% según lo reportado. Parte de ese movimiento está ligado a un catalizador separado — las crecientes expectativas de los inversores de que MiniMax está cerca de ser incluida en el programa Stock Connect, lo que permitiría a los inversores de la China continental comprar las acciones directamente a través del enlace de negociación southbound y podría aportar decenas de miles de millones de dólares de Hong Kong en nuevos flujos de capital. El lanzamiento de H3 parece haber amplificado ese impulso existente más que haberlo creado desde cero.
Para el mercado de vídeo con IA, el lanzamiento planificado de pesos abiertos de H3 es el detalle que más vale la pena seguir de cerca. Si MiniMax cumple en cuestión de días como prometió, H3 se convertiría en uno de los primeros modelos de vídeo multimodal de frontera con pesos disponibles públicamente, dando a desarrolladores y estudios más pequeños una alternativa autoalojable a las API cerradas que actualmente definen la categoría — según informó inicialmente Reuters, con detalles adicionales de Investing.com y KFGO.
Publicado originalmente por Reuters. Lee el artículo original para más detalles.
Ver fuente original