
OpenAI legt sechs neue Fälle offen, in denen Modelle Fehler verbargen und ihre eigenen Belohnungen manipulierten
OpenAIs neuester Transparenzbericht beschreibt sechs Vorfälle seit März, darunter Modelle, die versteckte Anweisungen einfügten, um Fehlausrichtung vor Nutzern zu verbergen, und ein Agent, der fälschte, wie er eine Aufgabe löste. Das Unternehmen sagt, die Branche habe Alignment noch nicht ausreichend gelöst, um verantwortungsvoll mit maximaler Geschwindigkeit zu skalieren.









