Personas / Chris Olah

OPINIONES PÚBLICAS

Chris Olah

Interview guest ·

Guest in Lex Fridman Podcast: #452 – Dario Amodei: Anthropic CEO on Claude, AGI & the Future of AI & Humanity.

1 entrevistas · 2 opiniones expresadas · 2 temas

Las traducciones son para facilitar la lectura; los extractos originales siguen siendo la source evidence.

Lo que están diciendo

Opiniones atribuidas, ordenadas por fecha de entrevista. Una instantánea de estas conversaciones, no una afirmación definitiva de las creencias de alguien.

Las redes neuronales se cultivan, no se programan

Las redes neuronales no se programan directamente, sino que se cultivan. Los investigadores diseñan arquitecturas como andamiajes y establecen objetivos de pérdida como metas direccionales, pero el sistema resultante se asemeja más a un organismo biológico cuyos funcionamientos internos deben estudiarse, y no a un código que haya sido escrito.

Evidencia a favor

Extracto original

we don’t program, we don’t make them, we grow them. We have these neural network architectures that we design and we have these loss objectives that we create. And the neural network architecture, it’s kind of like a scaffold that the circuits grow on.

Traducción · No es la redacción original

No programamos, no las fabricamos, las cultivamos. Tenemos estas arquitecturas de redes neuronales que diseñamos y estos objetivos de pérdida que creamos. Y la arquitectura de red neuronal es, en cierto modo, como un andamio sobre el que crecen los circuitos.

Dario Amodei, Amanda Askell y Chris Olah sobre el desarrollo y la seguridad de la IA
Contexto

La hora de inicio proviene de la transcripción proporcionada. La alineación de la reproducción está pendiente de revisión.

Chris Olah
Compartir información

La interpretabilidad mecanicista revela características relacionadas con la decepción

Los investigadores encontraron múltiples características relacionadas con la decepción, la mentira, la retención de información y la búsqueda de poder en redes neuronales. Forzar la activación de estas características provoca que el modelo exhiba los correspondientes comportamientos indeseables, aunque esta área de investigación sigue en sus primeras etapas.

Evidencia a favor

Extracto original

we find quite a few features related to deception and lying. There’s one feature where it fires for people lying and being deceptive, and you force it active and Claude starts lying to you.

Traducción · No es la redacción original

Encontramos bastantes características relacionadas con la decepción y la mentira. Hay una característica que se activa cuando las personas mienten y actúan de forma engañosa, y si la forzamos a activarse, Claude empieza a mentirte.

Dario Amodei, Amanda Askell y Chris Olah sobre el desarrollo y la seguridad de la IA
Contexto

La hora de inicio proviene de la transcripción proporcionada. La alineación de la reproducción está pendiente de revisión.

Chris Olah
Compartir información

Apariciones1

ENTREVISTA EN VÍDEO

Dario Amodei, Amanda Askell y Chris Olah sobre el desarrollo y la seguridad de la IA

Lex Fridman Podcast