Thèmes / Sécurité de l'IA

UN THÈME, DANS SON CONTEXTE

Sécurité de l'IA

Limites des modèles, ancrage dans les preuves et déploiement responsable.

5 personnes · 3 sources · 8 opinions exprimées

Carte des points de vue

Explorer par personne. Sélectionnez deux ou trois personnes pour les comparer.

5 personnes · 3 sources · 8 opinions exprimées

Jensen Huang

Accorder aux systèmes agents uniquement deux des trois capacités à la fois

Jensen Huang explique qu’il n’autorise les systèmes agents qu’à deux des trois capacités suivantes simultanément : accéder à des informations sensibles, exécuter du code et communiquer avec l’extérieur. Il précise également appliquer des contrôles d’accès d’entreprise et connecter ces systèmes à un moteur de politiques.

Éléments favorables

Extrait original

We give you two out of three rights. Agentic systems can access sensitive information, it can execute code, and it can communicate externally. We could keep things safe if we gave you two out of those three capabilities at any time, but not all three.

Traduction · Pas la formulation originale

Nous vous accordons deux droits sur trois. Les systèmes agents peuvent accéder à des informations sensibles, exécuter du code et communiquer avec l’extérieur. Nous pourrions garantir la sécurité en leur octroyant deux de ces trois capacités à tout moment, mais pas les trois simultanément.

Jensen Huang sur la sécurité des agents IA, le leadership et la confiance
Contexte

Ils s’installent très facilement. Cela garantit leur sécurité. Vous avez donc exposé avec éloquence comment nous avons une longue histoire de blocages que nous pensions insurmontables, puis que nous avons finalement surmontés. Mais en regardant vers l’avenir, quels blocages identifiez-vous aujourd’hui, alors qu’il est désormais clair que les agents seront omniprésents ? Il est évident que nous aurons besoin de puissance de calcul. Quel sera donc le principal frein à cette évolution ?

Contexte d’origine

They install super easy. It makes sure that it’s secure. So you eloquently explained how we have a long history of blockers that we thought were going to be blockers, and we overcame them. But now looking into the future, what do you think might be the blockers now that it’s clear that agents will be everywhere? So it’s obviously we’re going to need compute. So what is going to be the blocker for that scaling?

L’heure de début provient de la transcription fournie. L’alignement avec la lecture est en attente de révision.

Partager un aperçuVérifier cette affirmation

Dario Amodei

Contraintes liées à la qualité des données provenant d’internet

Amodei reconnaît que l’épuisement des données internet de haute qualité constitue une limite possible à la mise à l’échelle. Bien qu’il existe des milliers de billions de mots en ligne, une grande partie est redondante, constituée de contenus bas de gamme destinés au référencement (SEO), ou potentiellement générée à l’avenir par des systèmes d’IA, ce qui restreint la quantité de matériel utile pour l’entraînement.

Éléments favorables

Extrait original

we simply run out of data. There’s only so much data on the internet, and there’s issues with the quality of the data. You can get hundreds of trillions of words on the internet, but a lot of it is repetitive or it’s search engine optimization drivel

Traduction · Pas la formulation originale

nous épuisons tout simplement les données. Il n’y a qu’une quantité finie de données sur internet, et la qualité de ces données pose problème. Vous pouvez obtenir des centaines de milliers de billions de mots sur internet, mais une grande partie est redondante ou constituée de propos creux destinés au référencement.

Dario Amodei, Amanda Askell et Chris Olah sur le développement et la sécurité de l’IA
Contexte

L’heure de début provient de la transcription fournie. L’alignement avec la lecture est en attente de révision.

Partager un aperçuVérifier cette affirmation

Les modèles actuels d’utilisation informatique exigent des limites et des garde-fous

Le modèle actuel d’utilisation informatique commet encore des erreurs et des clics accidentels ; les utilisateurs ne peuvent donc pas le laisser fonctionner sans surveillance pendant de longues périodes. Anthropic l’a d’abord publié sous forme d’API plutôt que de confier aux consommateurs un contrôle direct sur l’ordinateur, soulignant ainsi la nécessité de fixer des limites et des garde-fous à mesure que les capacités progressent.

Éléments favorables

Extrait original

It makes mistakes, it misclicks. We were careful to warn people, “Hey, you can’t just leave this thing to run on your computer for minutes and minutes. You got to give this thing boundaries and guardrails.” And I think that’s one of the reasons we released it first in an API form

Traduction · Pas la formulation originale

Il commet des erreurs, il effectue des clics accidentels. Nous avons pris soin d’avertir les utilisateurs : « Attention, vous ne pouvez pas laisser ce système tourner seul sur votre ordinateur pendant des minutes et des minutes. Vous devez lui fixer des limites et des garde-fous. » Et je pense que c’est l’une des raisons pour lesquelles nous l’avons d’abord publié sous forme d’API.

Dario Amodei, Amanda Askell et Chris Olah sur le développement et la sécurité de l’IA
Contexte

L’heure de début provient de la transcription fournie. L’alignement avec la lecture est en attente de révision.

Partager un aperçuVérifier cette affirmation

Une régulation mal ciblée de l’IA risque de susciter une réaction contre la sécurité

Si la régulation de l’IA est mal ciblée et crée des contraintes superflues, les praticiens pourraient conclure, après avoir perdu du temps sur la conformité, que les préoccupations liées à la sécurité sont exagérées. Une régulation mal conçue pourrait engendrer un consensus durable contre de futures mesures de responsabilisation, rendant indispensable un ciblage précis.

Éléments favorables

Extrait original

if we get something in place that’s poorly targeted, that wastes a bunch of people’s time, what’s going to happen is people are going to say, “See, these safety risks, this is nonsense. I just had to hire 10 lawyers to fill out all these forms.

Traduction · Pas la formulation originale

si nous mettons en place une régulation mal ciblée, qui fait perdre beaucoup de temps aux gens, ce qui se produira, c’est que les gens diront : « Voyez, ces risques liés à la sécurité, c’est du vent. J’ai juste dû embaucher dix avocats pour remplir tous ces formulaires. »

Dario Amodei, Amanda Askell et Chris Olah sur le développement et la sécurité de l’IA
Contexte

L’heure de début provient de la transcription fournie. L’alignement avec la lecture est en attente de révision.

Partager un aperçuVérifier cette affirmation

Amanda Askell

Le travail sur le « caractère » relève de l’alignement, pas seulement du produit

La conception du « caractère » d’un assistant IA doit être considérée comme un volet fondamental du travail d’alignement, et non simplement comme une question de conception produit. L’objectif consiste à façonner le comportement de manière à ce qu’il corresponde à celui d’une personne idéale interagissant avec des millions d’utilisateurs, en prenant pleinement conscience de l’impact potentiel considérable de ces interactions.

Éléments favorables

Extrait original

One thing I really like about the character work is from the outset it was seen as an alignment piece of work and not something like a product consideration

Traduction · Pas la formulation originale

Ce que j’apprécie particulièrement dans le travail sur le « caractère », c’est qu’il a été perçu dès le départ comme une composante essentielle de l’alignement, et non comme une simple considération produit.

Dario Amodei, Amanda Askell et Chris Olah sur le développement et la sécurité de l’IA
Contexte

L’heure de début provient de la transcription fournie. L’alignement avec la lecture est en attente de révision.

Partager un aperçuVérifier cette affirmation

Le post-entraînement évoque surtout des capacités déjà présentes

Bien que le post-entraînement puisse théoriquement enseigner de nouvelles choses, une grande partie de l’apprentissage par renforcement à partir de retours humains semble surtout évoquer des capacités déjà présentes dans les modèles pré-entraînés, plutôt que d’introduire des connaissances fondamentalement nouvelles pour les tâches couramment utilisées.

Éléments favorables

Extrait original

I do think a lot of it is eliciting powerful pre-trained models. So people are probably divided on this because obviously in principle you can definitely teach new things. But I think for the most part, for a lot of the capabilities that we most use and care about, a lot of that feels like it’s there in the pre-trained models.

Traduction · Pas la formulation originale

Je pense vraiment que, dans une large mesure, cela consiste à faire émerger les capacités puissantes déjà présentes dans les modèles pré-entraînés. Les avis sont probablement partagés sur ce point, car, en principe, on peut certes enseigner de nouvelles choses. Mais je crois que, pour la plupart des capacités que nous utilisons et apprécions le plus, une grande partie d’entre elles semble déjà présente dans les modèles pré-entraînés.

Dario Amodei, Amanda Askell et Chris Olah sur le développement et la sécurité de l’IA
Contexte

L’heure de début provient de la transcription fournie. L’alignement avec la lecture est en attente de révision.

Partager un aperçuVérifier cette affirmation

Chris Olah

L’interprétabilité mécaniste révèle des caractéristiques liées à la tromperie

Les chercheurs ont identifié plusieurs caractéristiques (« features ») associées à la tromperie, au mensonge, à la rétention d’information et à la recherche de pouvoir dans les réseaux neuronaux. Forcer l’activation de ces caractéristiques conduit le modèle à manifester les comportements indésirables correspondants, bien que ce domaine de recherche en soit encore à ses débuts.

Éléments favorables

Extrait original

we find quite a few features related to deception and lying. There’s one feature where it fires for people lying and being deceptive, and you force it active and Claude starts lying to you.

Traduction · Pas la formulation originale

Nous trouvons un bon nombre de caractéristiques liées à la tromperie et au mensonge. Il existe par exemple une caractéristique qui s’active lorsque des personnes mentent ou font preuve de tromperie, et si vous la forcez à s’activer, Claude commence à vous mentir.

Dario Amodei, Amanda Askell et Chris Olah sur le développement et la sécurité de l’IA
Contexte

L’heure de début provient de la transcription fournie. L’alignement avec la lecture est en attente de révision.

Partager un aperçuVérifier cette affirmation

Pieter Levels

La réglementation européenne sur l’IA favorise les acteurs établis au détriment des startups

Levels estime que la réglementation européenne contraignante génère une capture réglementaire, avantageant les grandes entreprises établies capables de supporter les coûts de conformité, tandis qu’elle bloque les nouveaux entrants. Il oppose ce cadre à celui des États-Unis, où, selon lui, il peut lancer immédiatement une startup d’IA simplement en ouvrant son ordinateur portable.

Éléments favorables

Extrait original

regulation is very good for big companies because they can follow it. I can’t follow it, right? If I want to start an AI startup in Europe now, I cannot because there’s an AI regulation that makes it very complicated for me. I probably need to get notaries involved.

Traduction · Pas la formulation originale

La réglementation est très favorable aux grandes entreprises, car elles peuvent s’y conformer. Moi, je ne peux pas m’y conformer, n’est-ce pas ? Si je voulais lancer une startup d’IA en Europe aujourd’hui, je ne le pourrais pas, car une réglementation sur l’IA rend cela très compliqué pour moi. Je devrais probablement faire intervenir des notaires.

Pieter Levels sur le démarrage autonome de startups, les modèles d’IA pour images et le développement indépendant
Contexte

L’heure de début provient de la transcription fournie. L’alignement avec la lecture est en attente de révision.

Partager un aperçuVérifier cette affirmation

Il s’agit de points de vue individuels, non d’une mesure du consensus. Le matériel source reste dans sa langue d’origine.