Themen / KI-Sicherheit

Vorschau · Noch nicht zur Veröffentlichung geprüft

Zugeordnete Meinung · Kein direktes Zitat

Post-Training ruft meist bereits vorhandene Fähigkeiten hervor

Obwohl Post-Training theoretisch Neues lehren kann, scheint ein Großteil des Verstärkungslernens mit menschlichem Feedback (RLHF) bei gängigen Aufgaben eher bereits im vortrainierten Modell vorhandene Fähigkeiten hervorzurufen, statt grundsätzlich neues Wissen einzuführen.

Vorschaulinks funktionieren in dieser Umgebung. Die öffentliche Karten-URL ist erst nach Veröffentlichung verfügbar.

Hinter der geäußerten Meinung

Übersetzungen dienen dem Leseverständnis; die Originalauszüge bleiben die Quellenevidence.

Dario Amodei, Amanda Askell und Chris Olah über KI-Entwicklung und Sicherheit

Originalauszug

I do think a lot of it is eliciting powerful pre-trained models. So people are probably divided on this because obviously in principle you can definitely teach new things. But I think for the most part, for a lot of the capabilities that we most use and care about, a lot of that feels like it’s there in the pre-trained models.

Übersetzung · Nicht die Originalformulierung

Ich glaube tatsächlich, dass ein Großteil davon darin besteht, leistungsstarke vortrainierte Modelle hervorzurufen. Die Meinungen dazu gehen wohl auseinander, denn prinzipiell lässt sich natürlich definitiv Neues lehren. Aber ich glaube, dass bei den meisten Fähigkeiten, die wir am häufigsten nutzen und die uns am meisten interessieren, ein Großteil davon bereits im vortrainierten Modell vorhanden ist.

Kontext

Die Startzeit stammt aus dem bereitgestellten Transkript. Die Synchronisierung der Wiedergabe steht noch zur Überprüfung an.