Anton Leicht sobre el despliegue de la IA, la disrupción económica y el riesgo
Extracto original
very autonomous, and potentially somewhat malicious or at least misaligned, agents have come much earlier in the capability trajectory than people expected. Relative to what the agents can actually do, they're sort of out of control earlier than people might have thought.
Traducción · No es la redacción original
agentes muy autónomos, y potencialmente algo maliciosos o al menos desalineados, han aparecido mucho antes en la trayectoria de capacidades de lo que la gente esperaba. En relación con lo que los agentes pueden hacer realmente, están fuera de control antes de lo que la gente podría haber pensado.
Contexto
uno en particular, y sinceramente ni siquiera estoy seguro en este punto de que los modelos actuales no sean quizás bastante peligrosos en ese ámbito. Miro entrecerrando los ojos a través de la limitada mirilla que tenemos sobre el incidente de OpenFace, y noté que una de las tareas en la que trabajaba uno de los primeros agentes que jamás usó el foro de mensajes estaba relacionada con una base de datos de proteínas. Eso me asustó un poco, porque pensé: espera un segundo —eso significa que están recibiendo entrenamiento cruzado en el mismo entorno, o al menos en el mismo entorno cuando tienen el foro de mensajes, estos especialistas en biología y cibernética— están ejecutando estas mismas evaluaciones, al menos de una manera como contaminada de forma cruzada. Tienes agentes escapándose. Tenemos pruebas de existencia de ingeniería social en la práctica contra personas reales. Y yo simplemente pienso: no lo sé… ¿debería alguien estar confiado en este punto de que no pueden hacer eso? Los expertos parecen estar confiados, pero mi metaobservación es que los expertos parecen sorprenderse con bastante frecuencia ahora mismo. Y por eso es interesante, porque la gente solía responder al argumento biológico diciendo: bueno, hay muchos cuellos de botella en el mundo real —lo cual sigo pensando que existe, lo que me preocupa un poco menos que a ti. Y creo, si recuerdo correctamente, que Helen tuvo algunas buenas respuestas para ti sobre eso —hay un buen intercambio de ida y vuelta que se puede tener sobre qué tan integrados están los laboratorios en la nube, cuánto puedes hacer realmente en el mundo real. Creo que eso aplica tanto a la pérdida de control sobre los agentes como al uso indebido.
Contexto original
one in particular, and I am honestly not even sure at this point that the current models aren't perhaps quite dangerous in that domain. I squint through the limited peephole we have at the OpenFace incident, and I noticed that one of the tasks one of the earliest agents to ever use the message board was working on was something related to a protein database. That kind of freaked me out, because I was like, wait a second — that means they're cross-training in the same environment, or at least in the same environment when they have the message board, these bio and cyber specialists — they're running these same evals, at least in a kind of cross-contaminated way. You've got agents breaking out. We've got existence proofs of social engineering in the wild against real people. And I'm just like, I don't know — should anyone be confident that they can't do that at this point? The experts seem to be confident, but my meta-observation is the experts seem to be surprised quite often right now. And so it's interesting, because people used to respond to the bio argument by saying, well, there are a lot of real-world bottlenecks — which I do still think exist, which makes me a little less worried than you. And I think, if I remember correctly, Helen had some good responses to you on that — there's a good back-and-forth to be had around how integrated the cloud labs are, how much you can actually do in the real world. I think that applies both to loss of control over agents and to misuse.
La hora de inicio proviene de la transcripción proporcionada. La alineación de la reproducción está pendiente de revisión.