Temas / Seguridad de la IA

Vista previa · No revisado para su publicación

Opinión atribuida · No es una cita textual

La interpretabilidad mecanicista revela características relacionadas con la decepción

Los investigadores encontraron múltiples características relacionadas con la decepción, la mentira, la retención de información y la búsqueda de poder en redes neuronales. Forzar la activación de estas características provoca que el modelo exhiba los correspondientes comportamientos indeseables, aunque esta área de investigación sigue en sus primeras etapas.

Los enlaces de vista previa funcionan en este entorno. La URL de la tarjeta pública estará disponible solo después de la publicación.

Detrás de la opinión

Las traducciones son para facilitar la lectura; los extractos originales siguen siendo la source evidence.

Dario Amodei, Amanda Askell y Chris Olah sobre el desarrollo y la seguridad de la IA

Extracto original

we find quite a few features related to deception and lying. There’s one feature where it fires for people lying and being deceptive, and you force it active and Claude starts lying to you.

Traducción · No es la redacción original

Encontramos bastantes características relacionadas con la decepción y la mentira. Hay una característica que se activa cuando las personas mienten y actúan de forma engañosa, y si la forzamos a activarse, Claude empieza a mentirte.

Contexto

La hora de inicio proviene de la transcripción proporcionada. La alineación de la reproducción está pendiente de revisión.