AIO APEX

Mistral lance Large 4, son modèle à mille milliards de paramètres entraîné sur seulement 4 000 GPU

TechCrunch
Partager:
Mistral lance Large 4, son modèle à mille milliards de paramètres entraîné sur seulement 4 000 GPU

Mistral a dévoilé mardi Large 4, un modèle multimodal à mille milliards de paramètres que le laboratoire parisien affirme avoir entraîné avec environ 4 000 GPU Nvidia — une fraction des budgets de calcul que les laboratoires rivaux consacreraient à l'entraînement de modèles de pointe. Le modèle, surnommé en interne "Le Chonk", est désormais accessible via un point d'accès public protégé par des garde-fous, la publication des poids ouverts étant prévue dans environ trois semaines, après l'achèvement des tests de sécurité.

Ce lancement intervient alors que l'industrie de l'IA se divise de plus en plus en trois camps : les systèmes fermés et propriétaires des laboratoires américains, les modèles à poids ouverts de développeurs chinois comme DeepSeek et Qwen d'Alibaba, et un groupe occidental d'alternatives ouvertes de plus en plus restreint. Mistral s'est positionnée clairement dans cette troisième voie depuis sa création en 2023, et Large 4 constitue sa tentative la plus directe à ce jour de démontrer que des modèles ouverts entraînés en Europe peuvent rivaliser avec les deux camps plutôt que de se laisser distancer.

Pierre Stock, vice-président science de Mistral, a déclaré que l'entraînement avait mobilisé “deux à trois fois moins” de calcul que ce que l'entreprise estime nécessaire à ses concurrents chinois, et “nettement moins” que les rivaux à code fermé. Mistral a spécifiquement optimisé Large 4 pour des charges de travail en cybersécurité, finance et conception de puces — des niches professionnelles où l'entreprise cherche des clients payants plutôt que de viser les benchmarks génériques de chatbots. L'entreprise indique qu'elle collaborera avec “des partenaires et des gouvernements de confiance” sur un usage responsable des poids ouverts une fois publiés, une précaution destinée à apaiser les craintes qu'un modèle à mille milliards de paramètres sans restriction ne soit réutilisé pour des opérations cyberoffensives ou la conception d'armes.

Les résultats de benchmarks indépendants ne sont pas encore publics, si bien que l'affirmation de Mistral d'être “la meilleure de sa catégorie parmi les modèles à poids ouverts” reste invérifiée hors des tests internes de l'entreprise. Si les chiffres d'efficacité se confirment sous examen externe, Large 4 renforcerait néanmoins l'idée que les modèles de pointe n'ont plus besoin des immenses clusters de GPU sur lesquels OpenAI, Anthropic et Google ont construit leur réputation — une affirmation aux implications bien réelles sur la capacité de calcul que le reste de l'industrie estime devoir acheter.

Selon les informations initialement révélées par TechCrunch, Mistral n'a pas communiqué le tarif du point d'accès protégé avant la publication des poids ouverts.

Initialement rapporté par TechCrunch. Lisez l'article original pour plus de détails.

Voir la source originale
Partager: