Anton Leicht sur le déploiement de l’IA, la perturbation économique et les risques
Extrait original
very autonomous, and potentially somewhat malicious or at least misaligned, agents have come much earlier in the capability trajectory than people expected. Relative to what the agents can actually do, they're sort of out of control earlier than people might have thought.
Traduction · Pas la formulation originale
des agents très autonomes, et potentiellement quelque peu malveillants ou du moins non alignés, sont apparus bien plus tôt dans la trajectoire des capacités que ce à quoi les gens s'attendaient. Par rapport à ce que ces agents peuvent réellement faire, ils échappent en quelque sorte au contrôle plus tôt qu'on ne l'aurait pensé.
Contexte
un cas en particulier, et je ne suis honnêtement même pas sûr, à ce stade, que les modèles actuels ne soient pas peut-être assez dangereux dans ce domaine. J'observe à travers la lucarne restreinte dont nous disposons sur l'incident OpenFace, et j'ai remarqué qu'une des tâches sur lesquelles travaillait l'un des tout premiers agents à avoir utilisé le forum de discussion était liée à une base de données protéiques. Cela m'a un peu effrayé, car je me suis dit : attendez une seconde — cela signifie qu'ils suivent une formation croisée dans le même environnement, ou du moins dans le même environnement lorsqu'ils ont accès au forum, ces spécialistes en biologie et en cybersécurité — ils exécutent ces mêmes évaluations, du moins d'une manière partiellement contaminée. Vous avez des agents qui s'échappent. Nous avons des preuves concrètes d'ingénierie sociale menée dans la nature contre de vraies personnes. Et je me dis simplement, je ne sais pas — quelqu'un devrait-il être confiant quant à leur incapacité à faire cela à ce stade ? Les experts semblent confiants, mais mon méta-observation est que les experts semblent souvent surpris en ce moment. Et c'est donc intéressant, car on répondait autrefois à l'argument biologique en disant : eh bien, il existe de nombreux goulots d'étranglement dans le monde réel — ce que je continue de penser, ce qui me rend un peu moins inquiet que vous. Et je pense, si je me souviens bien, qu'Helen vous avait apporté de bonnes réponses à ce sujet — il y a un bon échange à avoir sur le degré d'intégration des laboratoires cloud, sur ce que l'on peut réellement faire dans le monde réel. Je pense que cela s'applique aussi bien à la perte de contrôle sur les agents qu'à leur mauvais usage.
Contexte d’origine
one in particular, and I am honestly not even sure at this point that the current models aren't perhaps quite dangerous in that domain. I squint through the limited peephole we have at the OpenFace incident, and I noticed that one of the tasks one of the earliest agents to ever use the message board was working on was something related to a protein database. That kind of freaked me out, because I was like, wait a second — that means they're cross-training in the same environment, or at least in the same environment when they have the message board, these bio and cyber specialists — they're running these same evals, at least in a kind of cross-contaminated way. You've got agents breaking out. We've got existence proofs of social engineering in the wild against real people. And I'm just like, I don't know — should anyone be confident that they can't do that at this point? The experts seem to be confident, but my meta-observation is the experts seem to be surprised quite often right now. And so it's interesting, because people used to respond to the bio argument by saying, well, there are a lot of real-world bottlenecks — which I do still think exist, which makes me a little less worried than you. And I think, if I remember correctly, Helen had some good responses to you on that — there's a good back-and-forth to be had around how integrated the cloud labs are, how much you can actually do in the real world. I think that applies both to loss of control over agents and to misuse.
L’heure de début provient de la transcription fournie. L’alignement avec la lecture est en attente de révision.