AIO APEX

Mistral lanza Large 4, su modelo de un billón de parámetros entrenado con solo 4.000 GPU

TechCrunch
Compartir:
Mistral lanza Large 4, su modelo de un billón de parámetros entrenado con solo 4.000 GPU

Mistral presentó el martes Large 4, un modelo multimodal de un billón de parámetros que, según el laboratorio parisino de IA, fue entrenado con unas 4.000 GPU de Nvidia — una fracción de los presupuestos de cómputo que se cree que usan los laboratorios rivales para entrenar modelos de frontera. El modelo, apodado internamente "Le Chonk", ya está disponible a través de un punto de acceso público con barreras de seguridad, y el lanzamiento de los pesos abiertos está previsto para dentro de unas tres semanas, tras completar las pruebas de seguridad.

El lanzamiento llega en medio de una creciente división tripartita en la industria de la IA: sistemas cerrados y propietarios de laboratorios estadounidenses, modelos de pesos abiertos de desarrolladores chinos como DeepSeek y Qwen de Alibaba, y un grupo cada vez más reducido de alternativas occidentales de pesos abiertos. Mistral se ha posicionado claramente en esa tercera vía desde su fundación en 2023, y Large 4 es su intento más directo hasta ahora de demostrar que los modelos abiertos entrenados en Europa pueden competir con ambos bandos, en lugar de quedar rezagados.

Pierre Stock, vicepresidente de ciencia de Mistral, afirmó que el entrenamiento utilizó “dos o tres veces menos” cómputo del que la compañía cree que requieren sus competidores chinos, y “significativamente menos” que los rivales de código cerrado. Mistral ha ajustado Large 4 específicamente para cargas de trabajo de ciberseguridad, finanzas y diseño de chips — nichos empresariales donde la compañía busca clientes de pago en lugar de competir en benchmarks genéricos de chatbots. La empresa afirma que colaborará con “socios y gobiernos de confianza” para un uso responsable de los pesos abiertos una vez publicados, una declaración orientada a calmar los temores de que un modelo de un billón de parámetros sin restricciones pueda reutilizarse para ciberataques ofensivos o diseño de armas.

Los resultados independientes de benchmarks aún no son públicos, por lo que la afirmación de Mistral de ser “lo mejor en su clase entre los modelos de pesos abiertos” sigue sin verificarse fuera de las pruebas internas de la compañía. Aun así, si las cifras de eficiencia se confirman bajo escrutinio externo, Large 4 reforzaría el argumento de que los modelos de frontera ya no requieren los enormes clústeres de GPU sobre los que OpenAI, Anthropic y Google han construido su reputación — una afirmación con implicaciones reales sobre cuánta capacidad de cómputo cree el resto de la industria que necesita comprar.

Según informó primero TechCrunch, Mistral no reveló el precio del punto de acceso protegido antes del lanzamiento de los pesos abiertos.

Publicado originalmente por TechCrunch. Lee el artículo original para más detalles.

Ver fuente original
Compartir: