Thèmes / Sécurité de l'IA

Aperçu · Non relu pour publication

Point de vue attribué · Pas une citation directe

Le post-entraînement évoque surtout des capacités déjà présentes

Bien que le post-entraînement puisse théoriquement enseigner de nouvelles choses, une grande partie de l’apprentissage par renforcement à partir de retours humains semble surtout évoquer des capacités déjà présentes dans les modèles pré-entraînés, plutôt que d’introduire des connaissances fondamentalement nouvelles pour les tâches couramment utilisées.

Les liens d’aperçu fonctionnent dans cet environnement. L’URL de la fiche publique n’est disponible qu’après publication.

Derrière ce point de vue

Les traductions sont destinées à la lecture ; les extraits originaux restent la source evidence.

Dario Amodei, Amanda Askell et Chris Olah sur le développement et la sécurité de l’IA

Extrait original

I do think a lot of it is eliciting powerful pre-trained models. So people are probably divided on this because obviously in principle you can definitely teach new things. But I think for the most part, for a lot of the capabilities that we most use and care about, a lot of that feels like it’s there in the pre-trained models.

Traduction · Pas la formulation originale

Je pense vraiment que, dans une large mesure, cela consiste à faire émerger les capacités puissantes déjà présentes dans les modèles pré-entraînés. Les avis sont probablement partagés sur ce point, car, en principe, on peut certes enseigner de nouvelles choses. Mais je crois que, pour la plupart des capacités que nous utilisons et apprécions le plus, une grande partie d’entre elles semble déjà présente dans les modèles pré-entraînés.

Contexte

L’heure de début provient de la transcription fournie. L’alignement avec la lecture est en attente de révision.