AIO APEX

Mistral stellt Billionen-Parameter-Modell Large 4 vor, trainiert mit nur 4.000 GPUs

TechCrunch
Teilen:
Mistral stellt Billionen-Parameter-Modell Large 4 vor, trainiert mit nur 4.000 GPUs

Mistral hat am Dienstag Large 4 vorgestellt, ein multimodales Modell mit einer Billion Parametern, das laut dem in Paris ansässigen KI-Labor mit rund 4.000 Nvidia-GPUs trainiert wurde — nur ein Bruchteil der Rechenbudgets, die rivalisierende Labore vermutlich für das Training von Spitzenmodellen aufwenden. Das intern "Le Chonk" genannte Modell ist bereits über einen öffentlichen, mit Schutzmechanismen versehenen Zugangspunkt verfügbar; die Veröffentlichung der offenen Gewichte ist nach Abschluss der Sicherheitstests in etwa drei Wochen geplant.

Der Start erfolgt inmitten einer wachsenden Dreiteilung der KI-Branche: geschlossene, proprietäre Systeme amerikanischer Labore, offene Modelle chinesischer Entwickler wie DeepSeek und Alibabas Qwen, sowie eine schrumpfende Gruppe westlicher Open-Weight-Alternativen. Mistral positioniert sich seit seiner Gründung 2023 klar in diesem dritten Lager, und Large 4 ist der bislang direkteste Versuch des Unternehmens zu belegen, dass in Europa trainierte offene Modelle mit beiden Lagern konkurrieren können, statt ihnen nachzuhinken.

Pierre Stock, Mistrals Vice President of Science, erklärte, das Training habe “zwei- bis dreimal weniger” Rechenleistung benötigt, als das Unternehmen bei seinen chinesischen Konkurrenten vermutet, und “deutlich weniger” als bei Closed-Source-Rivalen. Mistral hat Large 4 gezielt auf die Einsatzbereiche Cybersicherheit, Finanzen und Chipdesign zugeschnitten — Unternehmensnischen, in denen das Unternehmen zahlende Kunden gewinnen will, statt allgemeine Chatbot-Benchmarks zu gewinnen. Nach eigenen Angaben will das Unternehmen nach der Veröffentlichung der offenen Gewichte mit “vertrauenswürdigen Partnern und Regierungen” an einer verantwortungsvollen Nutzung zusammenarbeiten — eine Aussage, die Bedenken zerstreuen soll, ein uneingeschränktes Billionen-Parameter-Modell könnte für offensive Cyberangriffe oder Waffendesign zweckentfremdet werden.

Unabhängige Benchmark-Ergebnisse liegen noch nicht vor, weshalb Mistrals Anspruch, “klassenbestes Modell unter den Open-Weight-Modellen” zu sein, außerhalb der eigenen internen Tests des Unternehmens bislang unbestätigt bleibt. Sollten sich die Effizienzangaben unter externer Prüfung bestätigen, würde Large 4 jedoch das Argument stärken, dass Spitzenmodelle nicht länger die riesigen GPU-Cluster benötigen, auf denen OpenAI, Anthropic und Google ihren Ruf aufgebaut haben — eine Behauptung mit realen Folgen dafür, wie viel Rechenkapazität der Rest der Branche glaubt kaufen zu müssen.

Wie zuerst von TechCrunch berichtet, nannte Mistral vor der Veröffentlichung der offenen Gewichte keinen Preis für den geschützten Zugangspunkt.

Ursprünglich berichtet von TechCrunch. Lesen Sie den Originalartikel für weitere Details.

Originalquelle ansehen
Teilen: