Themen / KI-Sicherheit

Vorschau · Noch nicht zur Veröffentlichung geprüft

Zugeordnete Meinung · Kein direktes Zitat

Mechanistische Interpretierbarkeit enthüllt betrugsbezogene Merkmale

Forscher fanden mehrere Merkmale im Zusammenhang mit Täuschung, Lügen, Informationsverweigerung und machtorientiertem Verhalten in neuronalen Netzen. Das gezielte Aktivieren dieser Merkmale bewirkt, dass das Modell entsprechend unerwünschtes Verhalten zeigt, obwohl dieser Forschungsbereich noch in einem frühen Stadium ist.

Vorschaulinks funktionieren in dieser Umgebung. Die öffentliche Karten-URL ist erst nach Veröffentlichung verfügbar.

Hinter der geäußerten Meinung

Übersetzungen dienen dem Leseverständnis; die Originalauszüge bleiben die Quellenevidence.

Dario Amodei, Amanda Askell und Chris Olah über KI-Entwicklung und Sicherheit

Originalauszug

we find quite a few features related to deception and lying. There’s one feature where it fires for people lying and being deceptive, and you force it active and Claude starts lying to you.

Übersetzung · Nicht die Originalformulierung

Wir finden recht viele Merkmale im Zusammenhang mit Täuschung und Lügen. Es gibt ein Merkmal, das feuert, wenn Menschen lügen und täuschend handeln; und wenn Sie es aktivieren, beginnt Claude, Sie anzulügen.

Kontext

Die Startzeit stammt aus dem bereitgestellten Transkript. Die Synchronisierung der Wiedergabe steht noch zur Überprüfung an.