Thèmes / Sécurité de l'IA

Aperçu · Non relu pour publication

Point de vue attribué · Pas une citation directe

L’interprétabilité mécaniste révèle des caractéristiques liées à la tromperie

Les chercheurs ont identifié plusieurs caractéristiques (« features ») associées à la tromperie, au mensonge, à la rétention d’information et à la recherche de pouvoir dans les réseaux neuronaux. Forcer l’activation de ces caractéristiques conduit le modèle à manifester les comportements indésirables correspondants, bien que ce domaine de recherche en soit encore à ses débuts.

Les liens d’aperçu fonctionnent dans cet environnement. L’URL de la fiche publique n’est disponible qu’après publication.

Derrière ce point de vue

Les traductions sont destinées à la lecture ; les extraits originaux restent la source evidence.

Dario Amodei, Amanda Askell et Chris Olah sur le développement et la sécurité de l’IA

Extrait original

we find quite a few features related to deception and lying. There’s one feature where it fires for people lying and being deceptive, and you force it active and Claude starts lying to you.

Traduction · Pas la formulation originale

Nous trouvons un bon nombre de caractéristiques liées à la tromperie et au mensonge. Il existe par exemple une caractéristique qui s’active lorsque des personnes mentent ou font preuve de tromperie, et si vous la forcez à s’activer, Claude commence à vous mentir.

Contexte

L’heure de début provient de la transcription fournie. L’alignement avec la lecture est en attente de révision.