话题 / AI安全

话题与观点

AI安全

模型局限性、证据支撑性及负责任部署。

5 位人物 · 3 个来源 · 8 条观点

话题观点地图

按人物探索:选择两到三位进行对比。

5 位人物 · 3 个来源 · 8 条观点

Jensen Huang

一次只赋予智能体系统三项能力中的两项

黄仁勋描述,每次只允许智能体系统具备三项能力中的两项:访问敏感信息、执行代码和对外通信。他还描述了应用企业级访问控制并将这些系统连接到策略引擎的做法。

支持这项说法

原始摘录

We give you two out of three rights. Agentic systems can access sensitive information, it can execute code, and it can communicate externally. We could keep things safe if we gave you two out of those three capabilities at any time, but not all three.

翻译 · 非原文措辞

我们给你三项权利中的两项。智能体系统可以访问敏感信息,可以执行代码,也可以对外通信。如果在任何时候我们只给你这三项能力中的两项,而不是全部三项,我们就能保证安全。

黄仁勋谈AI智能体安全、领导力与信任
上下文

它们安装起来非常容易。它能确保安全。所以你清楚地解释了我们长期以来遇到的一些障碍,我们原以为那些会是障碍,但我们克服了它们。但现在展望未来,既然已经明确智能体会无处不在,你认为现在可能出现的障碍是什么?显然我们需要算力。那么这种规模化的障碍会是什么?

原始上下文

They install super easy. It makes sure that it’s secure. So you eloquently explained how we have a long history of blockers that we thought were going to be blockers, and we overcame them. But now looking into the future, what do you think might be the blockers now that it’s clear that agents will be everywhere? So it’s obviously we’re going to need compute. So what is going to be the blocker for that scaling?

时间点来自所提供的转录稿,尚待媒体回放核对。

分享观点验证此主张

Dario Amodei

互联网数据质量约束

阿莫代伊承认,高质量互联网数据枯竭可能构成一种缩放限制。尽管网上存在数万亿词的文本,但其中大量内容重复、低质(如搜索引擎优化垃圾内容),或可能是未来由AI生成的文本,从而限制了可用的高质量训练材料。

支持这项说法

原始摘录

we simply run out of data. There’s only so much data on the internet, and there’s issues with the quality of the data. You can get hundreds of trillions of words on the internet, but a lot of it is repetitive or it’s search engine optimization drivel

翻译 · 非原文措辞

我们单纯会耗尽数据。互联网上的数据总量是有限的,且数据质量存在问题。你确实能从互联网上获取数百万亿词,但其中大量内容是重复的,或是搜索引擎优化类的废话。

达里奥·阿莫代伊、阿曼达·阿斯克尔与克里斯·奥拉赫谈人工智能发展与安全
上下文

时间点来自所提供的转录稿,尚待媒体回放核对。

分享观点验证此主张

当前计算机使用模型需要边界与防护措施

当前的计算机使用模型仍会出现错误和误点击,因此用户无法将其长时间无人看管地运行。Anthropic首先以API形式发布该功能,而非向消费者直接开放计算机控制权,强调随着能力提升,设置边界与防护措施至关重要。

支持这项说法

原始摘录

It makes mistakes, it misclicks. We were careful to warn people, “Hey, you can’t just leave this thing to run on your computer for minutes and minutes. You got to give this thing boundaries and guardrails.” And I think that’s one of the reasons we released it first in an API form

翻译 · 非原文措辞

它会犯错,会误点击。我们谨慎提醒用户:‘嘿,你不能把它放在你的电脑上连续运行几分钟、几十分钟。你必须给它设定边界和防护措施。’我认为这正是我们首先以API形式发布它的原因之一。

达里奥·阿莫代伊、阿曼达·阿斯克尔与克里斯·奥拉赫谈人工智能发展与安全
上下文

时间点来自所提供的转录稿,尚待媒体回放核对。

分享观点验证此主张

目标不当的人工智能监管可能引发对安全工作的反感情绪

若人工智能监管目标不当并带来不必要的负担,从业者可能在耗费大量时间进行合规后,认定安全关切被夸大。设计拙劣的监管可能催生持久共识,反对未来一切问责措施,因此精准施策至关重要。

支持这项说法

原始摘录

if we get something in place that’s poorly targeted, that wastes a bunch of people’s time, what’s going to happen is people are going to say, “See, these safety risks, this is nonsense. I just had to hire 10 lawyers to fill out all these forms.

翻译 · 非原文措辞

如果我们推行一项目标不当的监管措施,白白浪费大量人员的时间,结果将是人们纷纷宣称:‘看吧,这些安全风险纯属无稽之谈。我刚被迫雇了10名律师填各种表格。’

达里奥·阿莫代伊、阿曼达·阿斯克尔与克里斯·奥拉赫谈人工智能发展与安全
上下文

时间点来自所提供的转录稿,尚待媒体回放核对。

分享观点验证此主张

Amanda Askell

角色塑造属于对齐工作,而不仅是产品考量

构建AI助手的角色不应仅视为产品层面的考虑,而应被视作核心对齐工作。目标是塑造其行为,使其在与数百万人对话时,表现得如同理想人类一般,并充分认识到这些互动所具有的重大潜在影响。

支持这项说法

原始摘录

One thing I really like about the character work is from the outset it was seen as an alignment piece of work and not something like a product consideration

翻译 · 非原文措辞

我特别欣赏角色塑造工作的一点在于,它从一开始就被视为一项对齐工作,而非某种产品层面的考量。

达里奥·阿莫代伊、阿曼达·阿斯克尔与克里斯·奥拉赫谈人工智能发展与安全
上下文

时间点来自所提供的转录稿,尚待媒体回放核对。

分享观点验证此主张

后训练主要激发已有能力

尽管后训练理论上可教授新知识,但针对常用任务,人类反馈强化学习(RLHF)很大程度上似乎是在激发预训练模型中已存在的能力,而非引入根本性的新知识。

支持这项说法

原始摘录

I do think a lot of it is eliciting powerful pre-trained models. So people are probably divided on this because obviously in principle you can definitely teach new things. But I think for the most part, for a lot of the capabilities that we most use and care about, a lot of that feels like it’s there in the pre-trained models.

翻译 · 非原文措辞

我确实认为其中很大一部分是在激发那些强大的预训练模型已具备的能力。因此,人们对此看法不一,因为原则上你当然可以教出全新内容;但我认为,就我们最常使用和最关心的诸多能力而言,其中大部分感觉早已存在于预训练模型之中。

达里奥·阿莫代伊、阿曼达·阿斯克尔与克里斯·奥拉赫谈人工智能发展与安全
上下文

时间点来自所提供的转录稿,尚待媒体回放核对。

分享观点验证此主张

Chris Olah

机制可解释性揭示出与欺骗相关联的特征

研究人员在神经网络中发现了多个与欺骗、说谎、隐瞒信息及权力寻求相关的特征。强制激活这些特征会使模型表现出相应不良行为;不过该研究领域仍处于早期阶段。

支持这项说法

原始摘录

we find quite a few features related to deception and lying. There’s one feature where it fires for people lying and being deceptive, and you force it active and Claude starts lying to you.

翻译 · 非原文措辞

我们发现了相当多与欺骗和说谎相关的特征。其中有一个特征会在人们撒谎和具有欺骗性时被触发;当你强制激活它时,Claude就开始对你撒谎。

达里奥·阿莫代伊、阿曼达·阿斯克尔与克里斯·奥拉赫谈人工智能发展与安全
上下文

时间点来自所提供的转录稿,尚待媒体回放核对。

分享观点验证此主张

Pieter Levels

欧盟AI监管有利于既有巨头而非初创企业

莱维尔斯认为,严苛的欧洲监管催生监管俘获现象,使有能力承担合规成本的大型既有公司受益,却阻碍新入局者。他对比美国称,在那里他只需打开笔记本电脑即可立即启动一家AI初创企业。

支持这项说法

原始摘录

regulation is very good for big companies because they can follow it. I can’t follow it, right? If I want to start an AI startup in Europe now, I cannot because there’s an AI regulation that makes it very complicated for me. I probably need to get notaries involved.

翻译 · 非原文措辞

监管对大公司极为有利,因为它们有能力遵守;而我做不到,对吧?如果我现在想在欧洲启动一家AI初创企业,我根本无法做到——因为存在一项AI监管法规,让我寸步难行。我甚至可能需要公证人介入。

皮特·莱维尔斯谈自举式创业、AI图像模型与独立开发者之路
上下文

时间点来自所提供的转录稿,尚待媒体回放核对。

分享观点验证此主张

这些是个人表达的观点,并非共识度量。原始资料保持其原始语言。