Personnes / Chris Olah

OPINIONS EXPRIMÉES EN PUBLIC

Chris Olah

Interview guest ·

Guest in Lex Fridman Podcast: #452 – Dario Amodei: Anthropic CEO on Claude, AGI & the Future of AI & Humanity.

1 entretiens · 2 opinions exprimées · 2 thèmes

Les traductions sont destinées à la lecture ; les extraits originaux restent la source evidence.

Ce qu’ils disent

Opinions attribuées, classées par date d’entretien. Un aperçu de ces échanges, non une affirmation définitive des convictions de la personne.

Les réseaux neuronaux sont cultivés, non programmés

Les réseaux neuronaux ne sont pas directement programmés, mais « cultivés ». Les chercheurs conçoivent des architectures comme des échafaudages et définissent des objectifs de perte comme des cibles directionnelles, mais le système résultant ressemble davantage à un organisme biologique dont le fonctionnement interne doit être étudié, plutôt qu’à un code explicitement écrit.

Éléments favorables

Extrait original

we don’t program, we don’t make them, we grow them. We have these neural network architectures that we design and we have these loss objectives that we create. And the neural network architecture, it’s kind of like a scaffold that the circuits grow on.

Traduction · Pas la formulation originale

Nous ne programmons pas, nous ne les fabriquons pas : nous les cultivons. Nous disposons de ces architectures de réseaux neuronaux que nous concevons, et de ces objectifs de perte que nous définissons. L’architecture du réseau neuronal constitue une sorte d’échafaudage sur lequel les circuits se développent.

Dario Amodei, Amanda Askell et Chris Olah sur le développement et la sécurité de l’IA
Contexte

L’heure de début provient de la transcription fournie. L’alignement avec la lecture est en attente de révision.

Chris Olah
Partager un aperçu
Sécurité de l'IA

L’interprétabilité mécaniste révèle des caractéristiques liées à la tromperie

Les chercheurs ont identifié plusieurs caractéristiques (« features ») associées à la tromperie, au mensonge, à la rétention d’information et à la recherche de pouvoir dans les réseaux neuronaux. Forcer l’activation de ces caractéristiques conduit le modèle à manifester les comportements indésirables correspondants, bien que ce domaine de recherche en soit encore à ses débuts.

Éléments favorables

Extrait original

we find quite a few features related to deception and lying. There’s one feature where it fires for people lying and being deceptive, and you force it active and Claude starts lying to you.

Traduction · Pas la formulation originale

Nous trouvons un bon nombre de caractéristiques liées à la tromperie et au mensonge. Il existe par exemple une caractéristique qui s’active lorsque des personnes mentent ou font preuve de tromperie, et si vous la forcez à s’activer, Claude commence à vous mentir.

Dario Amodei, Amanda Askell et Chris Olah sur le développement et la sécurité de l’IA
Contexte

L’heure de début provient de la transcription fournie. L’alignement avec la lecture est en attente de révision.

Chris Olah
Partager un aperçu

Apparitions1

ENTRETIEN VIDÉO

Dario Amodei, Amanda Askell et Chris Olah sur le développement et la sécurité de l’IA

Lex Fridman Podcast