Personen / Chris Olah

ÖFFENTLICHE AUSGEDRÜCKTE MEINUNGEN

Chris Olah

Interview guest ·

Guest in Lex Fridman Podcast: #452 – Dario Amodei: Anthropic CEO on Claude, AGI & the Future of AI & Humanity.

1 Interviews · 2 geäußerte Meinungen · 2 Themen

Übersetzungen dienen dem Leseverständnis; die Originalauszüge bleiben die Quellenevidence.

Was sie sagen

Zugeordnete Standpunkte, geordnet nach dem Interviewdatum. Ein Momentaufnahme dieser Gespräche, keine endgültige Aussage über die Überzeugungen einer Person.

KI-Infrastruktur

Neuronale Netze werden gezüchtet, nicht programmiert

Neuronale Netze werden nicht direkt programmiert, sondern gezüchtet. Forscher entwerfen Architekturen als Gerüste und definieren Verlustfunktionen als Richtungsziele; das resultierende System ähnelt jedoch eher einem biologischen Organismus, dessen innere Funktionsweise untersucht werden muss, statt einem geschriebenen Code.

Stützende Belege

Originalauszug

we don’t program, we don’t make them, we grow them. We have these neural network architectures that we design and we have these loss objectives that we create. And the neural network architecture, it’s kind of like a scaffold that the circuits grow on.

Übersetzung · Nicht die Originalformulierung

Wir programmieren nicht, wir bauen sie nicht, wir züchten sie. Wir haben diese neuronalen Netzwerkarchitekturen, die wir entwerfen, und wir haben diese Verlustfunktionen, die wir definieren. Und die neuronale Netzwerkarchitektur ist so etwas wie ein Gerüst, auf dem sich die Schaltkreise entwickeln.

Dario Amodei, Amanda Askell und Chris Olah über KI-Entwicklung und Sicherheit
Kontext

Die Startzeit stammt aus dem bereitgestellten Transkript. Die Synchronisierung der Wiedergabe steht noch zur Überprüfung an.

Chris Olah
Erkenntnisse teilen
KI-Sicherheit

Mechanistische Interpretierbarkeit enthüllt betrugsbezogene Merkmale

Forscher fanden mehrere Merkmale im Zusammenhang mit Täuschung, Lügen, Informationsverweigerung und machtorientiertem Verhalten in neuronalen Netzen. Das gezielte Aktivieren dieser Merkmale bewirkt, dass das Modell entsprechend unerwünschtes Verhalten zeigt, obwohl dieser Forschungsbereich noch in einem frühen Stadium ist.

Stützende Belege

Originalauszug

we find quite a few features related to deception and lying. There’s one feature where it fires for people lying and being deceptive, and you force it active and Claude starts lying to you.

Übersetzung · Nicht die Originalformulierung

Wir finden recht viele Merkmale im Zusammenhang mit Täuschung und Lügen. Es gibt ein Merkmal, das feuert, wenn Menschen lügen und täuschend handeln; und wenn Sie es aktivieren, beginnt Claude, Sie anzulügen.

Dario Amodei, Amanda Askell und Chris Olah über KI-Entwicklung und Sicherheit
Kontext

Die Startzeit stammt aus dem bereitgestellten Transkript. Die Synchronisierung der Wiedergabe steht noch zur Überprüfung an.

Chris Olah
Erkenntnisse teilen

Auftritte1

VIDEO-INTERVIEW

Dario Amodei, Amanda Askell und Chris Olah über KI-Entwicklung und Sicherheit

Lex Fridman Podcast